AI训练:DAPO
VeraRetouch:多任务推理式照片修图框架
VeraRetouch是一个轻量、可微分、可部署在手机上的修图框架,能自动修图、按风格描述或参数调整。它用0.6B视觉语言模型作为“大脑”,配合可微分的Retouch Renderer执行像素级调整,在保持细节的同时优化色调和色彩。
自动化评测的九九归一——评测agent
阿里推出统一评测Agent架构,实现AI评测全链路自动化。该架构让Agent自主学习业务标准,自动完成评测集生成、打分、验收与Badcase分析,覆盖商家、租赁、回收等多场景。通过识图-推理解耦技术抑制多模态幻觉,结合强化训练提升模型推理能力,机审率突破97%,年省千万标注成本,高效支撑业务快速迭代。
淘宝搜索算法:推理型相关性LLM探索实践
电商搜索中,Query与商品相关性判别技术至关重要,直接影响用户体验和商家效率。传统BERT模型虽能处理大部分搜索需求,但在长尾复杂query上表现不足。本文提出基于大模型的优化框架,通过CoT微调、Pass@N-based DPO和动态采样GRPO,显著提升模型推理能力,解决了在线部署和错误累积问题,最终在难query评测集上取得显著效果。
OpenAI-o4mini-RFT 技术调研及实践
OpenAI推出强化微调(RFT)功能,支持o4-mini模型,整合监督微调、奖励模型和强化学习,显著减少对大规模标注数据的依赖。RFT通过奖励驱动优化模型,适用于编程、数学、法律、医疗等领域,帮助模型成为特定领域专家。技术核心为策略梯度算法和近端策略优化(PPO),提升模型在特定任务上的性能。
马蜂窝自研旅游行业大模型
马蜂窝推出自主研发的旅行大模型mfw-32B,已成功部署至APP。该模型在行程规划能力上与DeepSeek-R1持平,但在响应速度、资源占用及降低幻觉等方面表现更优。通过SFT微调和强化学习,mfw-32B在个性化需求提取、时间窗管理、预算优化及行程生成上均有显著提升,为用户提供更智能、高效的旅行体验。
- «
- 1
- »