Agent Skills
› lattifai/EdgeSpeak-Skills
lattifai/EdgeSpeak-Skills
GitHub将已有文本与音视频强制对齐,生成词级时间戳。支持卡拉OK字幕、SRT及片段提取,全程本地运行保障隐私。
Install All Skills
npx skills add lattifai/EdgeSpeak-Skills --all -g -y
Skills in Collection (6)
将已有文本与音视频强制对齐,生成词级时间戳。支持卡拉OK字幕、SRT及片段提取,全程本地运行保障隐私。
用户有脚本/歌词需生成带时间戳的字幕
需要提取音视频中特定词语的精确起止时间
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-align -g -y
提供完全在设备端运行的文本转语音服务,支持本地合成WAV音频、自定义音色、克隆声音及本地音库管理。适用于需要隐私保护或离线使用的TTS场景。
需要将文本转换为语音输出
请求创建或管理本地AI音色
需要离线或私密的文本转语音功能
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-broadcast -g -y
利用 EdgeSpeak 转录与词级对齐生成 ASS 卡拉字幕,支持双语、样式预览及 FFmpeg 硬字幕烧录。
请求卡拉 OK 字幕或逐词高亮
需要生成 ASS 文件或双语字幕
要求将字幕硬烧入本地视频
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-karaoke -g -y
在本地设备上通过 EdgeSpeak CLI 将音视频转录为文本、JSON 或 SRT,支持说话人分离、词级时间及字幕参数配置。适用于隐私保护场景下的会议、播客等音频视频内容转写。
用户需要将本地音视频文件转换为文本或字幕
用户需要进行说话人分离以区分不同发言人
用户希望获取带时间戳的逐字稿或结构化数据
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-transcribe -g -y
使用 EdgeSpeak 本地模型对无标点 ASR 文本或带时间戳的转录稿进行语义分句,支持自定义输出格式与长度约束,适用于字幕、翻译等场景。
处理无标点的语音识别结果
重新分割带时间戳的字幕文件
需要本地离线自然语言分句
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-segment -g -y
将带时间轴的转录文本(EdgeSpeak JSON或SRT)翻译为目标语言,严格保持1:1片段映射与时间戳不变。适用于字幕、配音脚本及本地化术语处理,支持分段并行翻译以确保质量。
翻译字幕
翻译转录本
生成双语字幕
为配音准备翻译脚本
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-translate -g -y


