类库 › turboquant-gpu
DevTechJr

DevTechJr/turboquant-gpu

TurboQuant-GPU通过随机正交旋转和Lloyd-Max量化实现LLM KV缓存压缩,提供5.02倍压缩比。基于Python,支持NVIDIA GPU,兼容PyTorch及cuTile内核,适用于提升大模型推理效率。

评论

- 위키
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-08-22 17:56
浙ICP备14020137号-1 $방문자$