类库
› turboquant-gpu
DevTechJr/turboquant-gpu
TurboQuant-GPU通过随机正交旋转和Lloyd-Max量化实现LLM KV缓存压缩,提供5.02倍压缩比。基于Python,支持NVIDIA GPU,兼容PyTorch及cuTile内核,适用于提升大模型推理效率。
TurboQuant-GPU通过随机正交旋转和Lloyd-Max量化实现LLM KV缓存压缩,提供5.02倍压缩比。基于Python,支持NVIDIA GPU,兼容PyTorch及cuTile内核,适用于提升大模型推理效率。