Agent Skills
› lattifai/EdgeSpeak-Skills
lattifai/EdgeSpeak-Skills
GitHub在本地对音视频与已知文本进行强制对齐,生成词级时间戳。支持卡拉OK字幕、精确SRT、配音及片段提取。需确认媒体路径、参考文本及输出格式,处理环境依赖与许可证验证。
Install All Skills
npx skills add lattifai/EdgeSpeak-Skills --all -g -y
Skills in Collection (8)
在本地对音视频与已知文本进行强制对齐,生成词级时间戳。支持卡拉OK字幕、精确SRT、配音及片段提取。需确认媒体路径、参考文本及输出格式,处理环境依赖与许可证验证。
用户拥有转录文本并需要获取单词级时间戳
生成卡拉OK字幕或精确SRT文件
为配音或剪辑提取提供时间标记
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-align -g -y
提供完全本地化的文本转语音服务,支持官方声音、克隆声音及自定义设计声音,具备隐私保护特性。
需要将文本转换为音频文件
需要管理或克隆本地语音库
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-broadcast -g -y
基于 EdgeSpeak 语音识别与强制对齐,自动生成带逐词高亮的 ASS 字幕或硬字幕视频。支持多风格预览选择、双语叠加及 FFmpeg 渲染,适用于卡拉 OK 字幕制作场景。
用户需要卡拉OK字幕
请求逐词高亮效果
要求生成ASS文件
需要双语字幕
指定字幕样式或预览
要求烧录硬字幕视频
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-karaoke -g -y
将EdgeSpeak语音转写中的匿名说话人标签映射为真实姓名,基于参与者名单和转录证据进行身份解析,保留原始聚类ID并处理不确定性。
用户提供包含说话人姓名的参与者名单或来源URL
用户明确要求对已分音的转录文本进行命名
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-name-speakers -g -y
使用yt-dlp安全下载YouTube视频、字幕及元数据,支持保守请求策略与防覆盖,为后续转录或分析提供本地素材。
用户需要下载YouTube视频或音频文件
用户需要从YouTube获取字幕或公开元数据
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-yt-download -g -y
EdgeSpeak本地语义分句技能,处理无标点ASR文本或重切带时间戳的字幕。支持按长度约束拆分及重新映射词级时间,适用于字幕生成、翻译分块等场景。
用户需要清理无标点的语音识别文本以生成自然句子
用户希望基于特定长度限制重新分割带时间戳的字幕文件
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-segment -g -y
将本地音视频文件转换为文本、JSON或SRT字幕,支持词级时间戳、说话人分离及隐私保护。适用于会议记录、播客转录及语音备忘等场景。
用户需要将音频或视频文件转录为文字
用户需要生成带时间戳的字幕或JSON格式数据
用户要求进行说话人分离(Diarization)
用户强调数据隐私要求本地处理
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-transcribe -g -y
将带时间轴的转录文本翻译为目标语言,保持严格1:1映射和时间戳不变。适用于字幕、配音脚本及双语字幕生成,支持术语一致性与口语长度预算控制。
用户请求翻译字幕或转录文本
提及“翻译字幕”或“bilingual subtitles”
需要为 EdgeSpeak Broadcast 准备配音脚本
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-translate -g -y


