Agent Skills
› lattifai/EdgeSpeak-Skills
lattifai/EdgeSpeak-Skills
GitHub在本地对音视频与已有文本进行强制对齐,生成词级时间戳,支持卡拉OK字幕、SRT及剪辑提取。
Install All Skills
npx skills add lattifai/EdgeSpeak-Skills --all -g -y
Skills in Collection (8)
在本地对音视频与已有文本进行强制对齐,生成词级时间戳,支持卡拉OK字幕、SRT及剪辑提取。
用户有音视频和对应文本,需要精确到词的时间戳
需要制作带时间轴的歌词或字幕文件
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-align -g -y
本地隐私文本转语音技能,支持通过EdgeSpeak CLI生成WAV音频、克隆或设计声音及管理本地语音库。
将文本转换为语音
需要本地私有TTS处理
获取音频版本
管理EdgeSpeak语音
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-broadcast -g -y
基于EdgeSpeak转录生成带逐词高亮的卡拉OK ASS字幕,支持双语、样式预览及硬字幕烧录至视频。
用户请求卡拉OK字幕或逐词高亮
需要ASS文件或硬字幕视频
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-karaoke -g -y
将边缘说话人分离后的匿名转写文本中的 speaker_N 标签解析为真实姓名,保留原始聚类ID并处理不确定性。需结合参与者名单或元数据进行证据匹配,不覆盖原始文件。
用户希望将匿名转写结果中的说话人标识替换为具体人名
提供参与者名单、节目简介或视频URL以辅助身份识别
在 edgespeak-transcribe --diarize 之后需要生成带名字的转录本
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-name-speakers -g -y
基于 yt-dlp 下载 YouTube 视频、字幕及元数据,支持保守请求策略与稳定文件命名。用于为后续转录或说话人识别准备本地媒体素材,仅限授权内容。
用户提供 YouTube URL 并需要下载音视频
需要获取 YouTube 视频的公开元数据或字幕
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-yt-download -g -y
使用 EdgeSpeak 本地模型对无标点 ASR 文本或带时间戳转录本进行语义分句,支持多种输出格式及长度约束,适用于字幕生成、翻译分块等场景。
处理无标点语音识别文本
重新分割带时间戳的转录内容
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-segment -g -y
在本地设备上将音频/视频转录为文本、JSON或SRT,支持说话人分离和字幕参数调整,确保隐私安全。
需要将本地音视频文件转为文字
需要带时间戳的单词级转录
需要匿名说话人分离结果
生成会议记录或播客字幕
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-transcribe -g -y
将带时间轴的转录文本翻译为目标语言,严格保持1:1片段映射和时间戳不变。适用于字幕、配音脚本及双语字幕生成,支持本地化术语与字数预算控制。
翻译字幕或转录本
提及 translate the transcript 或 翻译字幕
需要双语字幕
为 EdgeSpeak Broadcast 准备配音脚本
npx skills add lattifai/EdgeSpeak-Skills --skill edgespeak-translate -g -y


