AI训练:PPO
关联话题: Proximal Policy Optimization、近端策略优化
微调之后还能做什么?大模型后训练全链路技术解析
后训练在预训练模型基础上,通过微调和对齐提升特定任务表现。随着模型规模扩大,后训练扩展律成为突破点,强化学习在推理能力提升中发挥关键作用。常见方法包括全量与部分微调、对齐技术及强化学习策略优化。推理阶段通过慢思考与CoT等策略优化模型表现。后训练结合SFT与RL,推动模型性能持续提升。
OpenAI-o4mini-RFT 技术调研及实践
OpenAI推出强化微调(RFT)功能,支持o4-mini模型,整合监督微调、奖励模型和强化学习,显著减少对大规模标注数据的依赖。RFT通过奖励驱动优化模型,适用于编程、数学、法律、医疗等领域,帮助模型成为特定领域专家。技术核心为策略梯度算法和近端策略优化(PPO),提升模型在特定任务上的性能。
From Weak to Strong——OpenAI和DeepSeek基于强化学习的大模型训练微调技术解析
基于强化学习的大模型训练微调技术正推动AI推理能力的显著提升。OpenAI和DeepSeek通过模仿人类慢思考过程,结合RLHF、DPO等方法,优化模型策略与奖励设计,增强复杂问题解决能力。未来,自我训练、高级推理与安全性的结合将进一步突破技术边界,推动AI向AGI迈进。
- «
- 1
- »