Agent Skills › thinkwee/AgentsMeetRL

thinkwee/AgentsMeetRL

GitHub

面向LLM智能体强化学习训练的故障排查与实验设计指南。针对PPO、GRPO等算法训练中的奖励停滞、评估平坦、KL爆炸及工具调用失败等症状,提供基于语料库的根因分析与修复建议,辅助框架选择与基准测试。

1 skills 1,800

Install All Skills

npx skills add thinkwee/AgentsMeetRL --all -g -y
More Options

List skills in collection

npx skills add thinkwee/AgentsMeetRL --list

Skills in Collection (1)

面向LLM智能体强化学习训练的故障排查与实验设计指南。针对PPO、GRPO等算法训练中的奖励停滞、评估平坦、KL爆炸及工具调用失败等症状,提供基于语料库的根因分析与修复建议,辅助框架选择与基准测试。
用户报告RL训练症状(如奖励不移动、评估平坦、KL/熵爆炸) 询问特定RL算法或框架(如GRPO, PPO, OpenRLHF)的选择与应用 涉及智能体实验设计、消融实验或数据策展问题
skills/agents-meet-rl/SKILL.md
npx skills add thinkwee/AgentsMeetRL --skill agents-meet-rl -g -y

Accueil - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-08-28 05:11
浙ICP备14020137号-1 $Carte des visiteurs$