AI训练:GSPO
关联话题: Group Sequence Policy Optimization
自动化评测的九九归一——评测agent
阿里推出统一评测Agent架构,实现AI评测全链路自动化。该架构让Agent自主学习业务标准,自动完成评测集生成、打分、验收与Badcase分析,覆盖商家、租赁、回收等多场景。通过识图-推理解耦技术抑制多模态幻觉,结合强化训练提升模型推理能力,机审率突破97%,年省千万标注成本,高效支撑业务快速迭代。
模型训练篇|多阶段ToolRL打造更可靠的AI导购助手
阿里芝麻租赁团队推出AI导购助手"租赁小不懂",通过架构革新与强化学习突破传统电商导购模式。针对租赁场景的复杂决策链,团队将多Agent架构升级为统一模型动态调用原子工具,响应速度提升4倍;创新两阶段RL训练法,使工具调用准确率提升3.23%。结合MoE模型优化,最终实现推荐成功率提升14.93%,推理显存降低40.6%,打造出更精准可靠的租赁顾问体验。
高德发布STAgent:专为复杂时空规划而生的智能体
高德推出STAgent智能体,专注复杂时空推理任务。该模型在多重约束下优化行程规划,集成10种专业工具,结合SFT-Guided RL训练策略提升性能。实验显示,STAgent在TravelBench上表现优异,30B参数规模媲美235B级模型,兼具专业性与通用能力,为智能体规划领域提供了高效解决方案。
- «
- 1
- »