Agent Skills
› lattifai/EdgeSpeak-Skills
lattifai/EdgeSpeak-Skills
GitHub在本地将音视频与已知文本强制对齐,生成词级时间戳,用于卡拉OK字幕、SRT或配音剪辑。支持CLI检查、许可证激活及多种输出格式,确保数据不出设备。
Install All Skills
npx skills add lattifai/EdgeSpeak-Skills --all -g -y
Skills in Collection (8)
在本地将音视频与已知文本强制对齐,生成词级时间戳,用于卡拉OK字幕、SRT或配音剪辑。支持CLI检查、许可证激活及多种输出格式,确保数据不出设备。
用户拥有音视频和对应文本,需要精确的时间戳
生成逐字同步的字幕或歌词文件
进行音频剪辑提取或配音准备
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-align -g -y
本地私有文本转语音技能,支持合成WAV、克隆及设计声音,管理本地语音库。
需要本地隐私保护的文本转语音
生成音频版本
管理EdgeSpeak语音
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-broadcast -g -y
基于EdgeSpeak语音识别与词级对齐,自动生成带逐字高亮的ASS卡拉OK字幕或硬烧录视频。支持多风格预览选择、双语对照及自动样式适配,提供确定性的字幕渲染体验。
需要生成卡拉OK字幕
请求逐词高亮效果
要求输出ASS格式文件
需要双语/多语言字幕
要求将字幕硬烧录到视频中
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-karaoke -g -y
将 EdgeSpeak 说话人分离后的匿名转录文本,结合参与者名单或来源元数据,通过证据分析将匿名标签映射为真实姓名。
用户需要对已分离的音频转录进行命名
用户提供参与者名单或视频链接以增强身份识别
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-name-speakers -g -y
基于yt-dlp安全下载YouTube视频、字幕及元数据,支持保守请求策略与稳定文件名生成。适用于转录或说话人识别前的本地素材获取,严禁绕过DRM或访问限制。
用户提供YouTube链接需要下载音频/视频
需要提取YouTube视频的字幕文件
需要获取YouTube视频的标题、描述等公开元数据
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-yt-download -g -y
利用 EdgeSpeak 本地语义模型,对无标点 ASR 文本或带时间戳的转录文件进行自然句子切分与重新分段,支持多种输出格式。
用户需要清理无标点的语音识别文本以生成字幕
用户希望调整现有带时间戳字幕的句子边界长度
需要将长文本拆分为适合翻译或阅读的短句块
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-segment -g -y
在本地设备上将音视频转录为文本、JSON或SRT,支持词级时间戳和说话人分离。适用于隐私保护场景,无需上传数据,可结合后续技能识别具体说话人姓名。
用户需要将本地音视频文件转换为文字稿
用户需要带时间戳的逐字稿或字幕文件
用户需要进行匿名说话人分离以区分不同发言者
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-transcribe -g -y
将带时间轴的语音转录文本(EdgeSpeak JSON或SRT)翻译为目标语言,严格保持1:1分段映射和原始时间戳不变。支持字幕、配音脚本及本地化术语处理,确保译文与音频对齐且符合发音时长预算。
用户请求翻译带时间轴的转录文本
提及翻译字幕或制作双语字幕
需要为 EdgeSpeak Broadcast 生成配音脚本
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-translate -g -y


