Agent Skills
› lattifai/EdgeSpeak-Skills
lattifai/EdgeSpeak-Skills
GitHub在本地强制对齐音视频与已知文本,生成词级时间戳,用于卡拉OK字幕、SRT或配音。需确认媒体路径、参考文本及输出格式,支持代理或独立模式运行。
安装全部 Skills
npx skills add lattifai/EdgeSpeak-Skills --all -g -y
集合内 Skills (6)
在本地强制对齐音视频与已知文本,生成词级时间戳,用于卡拉OK字幕、SRT或配音。需确认媒体路径、参考文本及输出格式,支持代理或独立模式运行。
用户拥有转录文本并需要获取精确的时间戳
需要为视频生成卡拉OK歌词或字卡
需要基于已有文本进行音频剪辑提取
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-align -g -y
提供完全本地化的文本转语音功能,支持通过CLI合成WAV音频、管理本地声音库及克隆声音。适用于需要隐私保护、离线运行或自定义语音合成的场景。
用户需要将文本转换为语音
用户需要管理或克隆本地声音
用户希望进行离线的私密语音合成
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-broadcast -g -y
利用EdgeSpeak转录与词级对齐,自动生成带逐字高亮的ASS字幕或硬字幕视频。支持多风格预览选择、双语叠加及FFmpeg渲染,实现卡拉OK效果。
生成卡拉OK字幕
创建逐字高亮ASS文件
制作双语字幕
硬烧录字幕到视频
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-karaoke -g -y
在本地设备上将音视频转录为文本、JSON或SRT,支持说话人分离和字幕格式化。需确认媒体路径及输出格式,检查CLI状态与版本,优先确定是否启用说话人标签以优化流程。
用户需要将本地音视频文件转换为文字记录
用户需要生成带有说话人标识的会议或采访转录内容
用户希望进行隐私保护且无需上传数据的语音识别
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-transcribe -g -y
将无标点ASR文本或带时间戳的转录内容分割为自然句子,支持本地运行及重新划分字幕边界,适用于翻译、阅读等场景。
用户需要将无标点的语音识别结果转换为自然句子
用户需要调整现有带时间戳字幕的句子切分长度
用户希望清理原始转录文本以用于后续处理
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-segment -g -y
将带时间轴的语音转录文本(EdgeSpeak JSON或SRT)翻译为目标语言,严格保持1:1分段映射与时间戳不变。支持字幕、配音脚本生成,强调术语一致性与本地化,确保译文与音频同步。
用户要求翻译字幕或转录本
提及翻译字幕
需要双语字幕
为EdgeSpeak广播准备配音脚本
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-translate -g -y


