类库
› turboquant-gpu
DevTechJr/turboquant-gpu
TurboQuant-GPU通过随机正交旋转和Lloyd-Max量化实现LLM KV缓存压缩,提供5.02倍压缩比。基于Python,支持NVIDIA GPU,兼容PyTorch及cuTile内核,适用于提升大模型推理效率。
TurboQuant-GPU通过随机正交旋转和Lloyd-Max量化实现LLM KV缓存压缩,提供5.02倍压缩比。基于Python,支持NVIDIA GPU,兼容PyTorch及cuTile内核,适用于提升大模型推理效率。
Accueil
-
Wiki
Copyright © 2011-2026 iteam.
Current version is 2.155.2.
UTC+08:00, 2026-08-15 06:36
浙ICP备14020137号-1
$Carte des visiteurs$