类库
› TLive-Omni
TaoLiveAIGC/TLive-Omni
TLive-Omni是专为电商直播设计的多模态理解模型,基于Qwen3.5构建。它能将图像、视频、音频和文本统一映射为文本输出,支持256K长上下文。通过三阶段SFT和强化微调,实现对直播内容的细粒度时序对齐与深度理解,适用于电商场景的智能分析。
标签
技术栈
environments python
查看全部依赖 (13)
依赖
NumPy
Pillow
accelerate
audioread
av
flash-linear-attention
https
librosa
safetensors
soundfile
torch
torchaudio
torchvision
截图