话题AI训练 › DPO

AI训练:DPO

关联话题: Direct Preference Optimization、直接偏好优化

OxygenSearch 之生成式检索偏好对齐 RAD-DPO 技术解析

RAD-DPO方案解决生成式检索在电商搜索中的偏好对齐难题。它通过Session级多标签全局对比、Token级梯度阻断与动态奖励加权,缓解了多正例概率挤压、公共前缀误伤和伪负例噪声问题,提升了主站搜索的检索效果与鲁棒性。

微调之后还能做什么?大模型后训练全链路技术解析

后训练在预训练模型基础上,通过微调和对齐提升特定任务表现。随着模型规模扩大,后训练扩展律成为突破点,强化学习在推理能力提升中发挥关键作用。常见方法包括全量与部分微调、对齐技术及强化学习策略优化。推理阶段通过慢思考与CoT等策略优化模型表现。后训练结合SFT与RL,推动模型性能持续提升。

京东联盟广告生成式推荐探索与实践-DPO多目标优化

生成式推荐大模型在京东联盟广告业务中优化UCTR与UCVR指标,通过DPO对齐范式实现多目标优化。商品离散化和行为序列建模简化了推荐流程,提升了模型泛化能力。Softmax-DPO和β-DPO方法分别处理多负例和参数敏感问题,线上实验显示转化率显著提升。未来探索方向包括多目标优化和多场景建模。

  • «
  • 1
  • »

Accueil - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-08-06 14:18
浙ICP备14020137号-1 $Carte des visiteurs$