Agent Skills
› lattifai/EdgeSpeak-Skills
lattifai/EdgeSpeak-Skills
GitHub在本地将音视频与已知文本强制对齐,生成词级时间戳。支持卡拉OK字幕、SRT及剪辑提取,全程离线运行,保护隐私。
安装全部 Skills
npx skills add lattifai/EdgeSpeak-Skills --all -g -y
集合内 Skills (8)
在本地将音视频与已知文本强制对齐,生成词级时间戳。支持卡拉OK字幕、SRT及剪辑提取,全程离线运行,保护隐私。
用户已有转录文本需获取精确时间点
制作带时间码的字幕或歌词同步内容
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-align -g -y
提供完全本地化的文本转语音服务,支持官方、克隆及自定义声音生成WAV音频,管理本地语音库。
用户需要将文本转换为语音
用户需要获取文本的音频版本
用户需要列出、添加或删除EdgeSpeak语音
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-broadcast -g -y
基于 EdgeSpeak 语音识别与词级对齐,自动生成带逐字高亮的 ASS 字幕或硬字幕视频。支持多风格预览选择、双语叠加及 FFmpeg 渲染,提供从转录到成品输出的端到端卡拉OK字幕制作能力。
需要生成卡拉OK字幕
要求逐词高亮效果
请求生成 ASS 格式文件
需要双语/多语言字幕
希望将字幕烧录进视频
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-karaoke -g -y
将带匿名标签的语音转写文本,结合参与者名单或元数据,通过证据分析识别并替换为真实姓名,保留原始聚类ID,用于会议、播客等场景的身份丰富。
用户要求将匿名说话人标记解析为具体姓名
提供参与者名单、节目单或视频链接以辅助身份确认
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-name-speakers -g -y
使用yt-dlp下载授权的YouTube视频、字幕及元数据,支持保守请求策略与安全文件处理。适用于本地转录或分析前的资源获取,依赖ffmpeg进行媒体处理。
用户需要提供YouTube视频的音频或视频文件
用户需要提取YouTube视频的字幕
用户需要获取YouTube视频标题、描述等公开元数据
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-yt-download -g -y
使用 EdgeSpeak 本地语义模型,对无标点 ASR 文本或带时间戳的转录文件进行智能句子切分与重新分段。支持自定义长度约束及多种输出格式,适用于字幕生成、翻译预处理等场景。
需要对无标点语音识别文本进行句子切分
需要基于时间戳重新划分字幕或文本边界
需要将长文本分割为适合阅读或翻译的片段
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-segment -g -y
在本地设备上将音视频转录为文本、JSON或SRT字幕,支持词级时间戳和说话人分离。强调隐私安全,音频不上传云端。适用于会议记录、播客及私密语音备忘场景。
用户需要将本地音视频文件转换为文字稿
用户需要带说话人标签的采访或会议录音转写
用户要求生成带时间轴的字幕文件
用户强调数据隐私,禁止上传云端
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-transcribe -g -y
将带时间轴的语音转录文本(EdgeSpeak JSON或SRT)翻译为目标语言,严格保持1:1片段映射和时间戳不变。适用于字幕、配音脚本及双语字幕生成,确保本地化处理与术语一致性。
用户要求翻译字幕或转录文本
提及翻译字幕
需要双语字幕
为EdgeSpeak Broadcast准备配音脚本
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-translate -g -y


