AI训练:DPO
关联话题: Direct Preference Optimization、直接偏好优化
OxygenSearch 之生成式检索偏好对齐 RAD-DPO 技术解析
RAD-DPO方案解决生成式检索在电商搜索中的偏好对齐难题。它通过Session级多标签全局对比、Token级梯度阻断与动态奖励加权,缓解了多正例概率挤压、公共前缀误伤和伪负例噪声问题,提升了主站搜索的检索效果与鲁棒性。
微调之后还能做什么?大模型后训练全链路技术解析
后训练在预训练模型基础上,通过微调和对齐提升特定任务表现。随着模型规模扩大,后训练扩展律成为突破点,强化学习在推理能力提升中发挥关键作用。常见方法包括全量与部分微调、对齐技术及强化学习策略优化。推理阶段通过慢思考与CoT等策略优化模型表现。后训练结合SFT与RL,推动模型性能持续提升。
京东联盟广告生成式推荐探索与实践-DPO多目标优化
生成式推荐大模型在京东联盟广告业务中优化UCTR与UCVR指标,通过DPO对齐范式实现多目标优化。商品离散化和行为序列建模简化了推荐流程,提升了模型泛化能力。Softmax-DPO和β-DPO方法分别处理多负例和参数敏感问题,线上实验显示转化率显著提升。未来探索方向包括多目标优化和多场景建模。
- «
- 1
- »