Agent Skills
› aiming-lab/AutoResearchClaw
› mixed-precision
mixed-precision
GitHub指导使用torch.cuda.amp进行混合精度训练,通过FP16/BF16加速模型训练并降低显存占用。涵盖autocast、GradScaler及BF16适用场景,旨在优化GPU性能并处理NaN梯度等常见问题。
Trigger Scenarios
优化GPU训练性能
降低模型训练显存占用
配置自动混合精度
Install
npx skills add aiming-lab/AutoResearchClaw --skill mixed-precision -g -y
SKILL.md
Frontmatter
{
"name": "mixed-precision",
"metadata": {
"author": "researchclaw",
"version": "1.0",
"category": "tooling",
"priority": "5",
"references": "Micikevicius et al., Mixed Precision Training, ICLR 2018",
"code-template": "scaler = torch.cuda.amp.GradScaler()\nfor batch in dataloader:\n optimizer.zero_grad()\n with torch.cuda.amp.autocast():\n output = model(batch)\n loss = criterion(output, target)\n scaler.scale(loss).backward()\n scaler.step(optimizer)\n scaler.update()",
"trigger-keywords": "training,gpu,memory,speed,precision,fp16,bf16",
"applicable-stages": "10,12"
},
"description": "Use FP16\/BF16 mixed precision to accelerate training and reduce memory. Use when optimizing GPU performance."
}
Mixed Precision Training Best Practice
Use torch.cuda.amp for automatic mixed precision:
- Wrap forward pass in torch.cuda.amp.autocast()
- Use GradScaler for loss scaling
- BF16 preferred over FP16 on Ampere+ GPUs (RTX 3xxx, A100, RTX 4xxx)
- Watch for NaN gradients — reduce learning rate if needed
- Do NOT use amp with custom CUDA kernels unless tested
Version History
- e2e23c9 Current 2026-07-25 07:48


