Agent Skills
› lattifai/EdgeSpeak-Skills
lattifai/EdgeSpeak-Skills
GitHub将已有文本与音视频强制对齐,生成词级时间戳,用于卡拉OK字幕、精确SRT及配音剪辑。全程本地运行,支持CLI状态检查、许可证验证及多种输出格式,确保音频隐私安全。
Install All Skills
npx skills add lattifai/EdgeSpeak-Skills --all -g -y
Skills in Collection (8)
将已有文本与音视频强制对齐,生成词级时间戳,用于卡拉OK字幕、精确SRT及配音剪辑。全程本地运行,支持CLI状态检查、许可证验证及多种输出格式,确保音频隐私安全。
用户有转录文本需获取精确时间点
制作卡拉OK歌词或字卡
生成带时间轴的SRT字幕
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-align -g -y
在本地设备将文本转换为自然语音,支持官方、克隆及设计声音,管理本地语音库,全程离线保障隐私。
需要将文本转换为音频
需要本地私密文字转语音
需要管理EdgeSpeak语音库
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-broadcast -g -y
基于 EdgeSpeak 语音识别与词级对齐,生成带高亮的 ASS 字幕或硬字幕视频。支持多风格预览、双语及自动样式选择,实现从转录到渲染的一体化流程。
需要制作卡拉OK字幕
请求逐词高亮效果
要求生成 ASS 格式文件
需要双语或多语言字幕
指定字幕样式或预览
请求将字幕烧录进视频
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-karaoke -g -y
将带匿名说话人标签的转写文本,基于参与者名单或元数据证据,还原为真实姓名。用于访谈、播客等场景的身份增强,不覆盖原始文件。
用户希望将匿名转写中的 speaker_N 替换为真实姓名
提供参与者名单或视频链接以进行身份匹配
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-name-speakers -g -y
使用yt-dlp安全下载YouTube视频、字幕及元数据,支持保守请求策略与本地文件管理,为后续转录或说话人识别提供素材。
用户需要下载YouTube视频或音频
用户需要获取YouTube视频的元数据或字幕
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-yt-download -g -y
在本地使用 EdgeSpeak 对无标点或标点错误的 ASR 文本进行语义句子分割,支持重新分割带时间戳的字幕并映射词级时间,适用于字幕、翻译等场景。
用户需要将长文本拆分为自然句子
处理无标点的语音识别输出
重新分割带时间戳的字幕文件
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-segment -g -y
本地音频视频转录技能,支持文本、JSON或SRT输出及说话人分离。强调数据隐私,无需上传。提供字幕格式化参数配置,并可衔接后续命名步骤。
用户需要将本地音视频文件转换为文字记录
需要生成带时间戳的字幕或会议纪要
要求数据完全在本地处理以保护隐私
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-transcribe -g -y
将带时间轴的转录文本(EdgeSpeak JSON或SRT)翻译为目标语言,严格保持1:1片段映射和时间戳不变,确保字幕对齐、术语一致及口播长度合规。
用户要求翻译字幕或转录文本
提及翻译字幕、bilingual subtitles
需要为 EdgeSpeak Broadcast 生成配音脚本
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-translate -g -y


