AI训练:GRPO
How to Beat GRPO Without Touching Model Weights
GEPA通过自然语言反思优化提示,而非更新模型权重,在复合AI系统上比GRPO更高效。它利用反馈函数提供详细诊断,结合帕累托选择策略,避免局部最优。在HotpotQA任务中,仅修改一个模块提示,得分从38%提升至69%,且无需GPU训练。
Fine-tuning LFM2.5-1.2B-Instruct with GRPO
这篇教程手把手教你用GRPO算法和Unsloth工具微调LFM2.5模型,实现从混乱的OCR文本中精准提取结构化发票数据。通过设计三重奖励机制(JSON格式校验、字段完整性、数值准确性),让AI学会自动生成标准发票JSON。教程包含完整实操步骤:环境配置、数据预处理、模型训练到效果评估,最终微调后的模型在提取日期和金额时,准确率显著提升。特别适合处理可程序化验证的结构化数据任务。
多模态大模型结合强化学习的模式探讨
多模态大模型与强化学习的融合正掀起AI新浪潮!从视觉推理到复杂数学计算,通过规则奖励微调、分阶段训练等创新方法,模型在精准定位、逻辑推理等任务上表现惊艳。GRPO等策略让模型学会"思考",而自适应推理、分层评估等方向将推动技术更智能、更可靠。这场"看懂世界+做出决策"的智能革命,正在重新定义AI的边界。
I trained a Language Model to schedule events with GRPO!
2025年,随着DeepSeek的爆火,GRPO成为训练推理模型的新宠。作者尝试用GRPO训练模型,解决事件调度问题。通过定义任务、生成数据集、设计奖励函数,作者成功训练出一个7B模型,性能甚至超越14B模型。尽管模型在避免事件重叠上仍有不足,但GRPO在可验证任务上展现了巨大潜力,简化了RL流程,凸显了基础模型和奖励函数设计的重要性。
Fine-tuning a reasoning model with GRPO for passport data extraction
本文探讨了如何通过GRPO技术优化护照信息提取模型。传统OCR方法在处理格式多样性和多语言文本时存在局限,而GRPO通过强化学习提升模型的推理能力,显著提高了提取准确性。实验表明,结合SFT和GRPO的模型在结构化字段提取上表现优异,尤其改善了MRZ数据的准确性。该方法为复杂文档处理提供了新思路,但仍有优化空间。
- «
- 1
- »