Agent Skills
› thinkwee/AgentsMeetRL
thinkwee/AgentsMeetRL
GitHub面向LLM智能体强化学习训练的故障排查与实验设计指南。针对PPO、GRPO等算法训练中的奖励停滞、评估平坦、KL爆炸及工具调用失败等症状,提供基于语料库的根因分析与修复建议,辅助框架选择与基准测试。
Install All Skills
npx skills add thinkwee/AgentsMeetRL --all -g -y
Skills in Collection (1)
面向LLM智能体强化学习训练的故障排查与实验设计指南。针对PPO、GRPO等算法训练中的奖励停滞、评估平坦、KL爆炸及工具调用失败等症状,提供基于语料库的根因分析与修复建议,辅助框架选择与基准测试。
用户报告RL训练症状(如奖励不移动、评估平坦、KL/熵爆炸)
询问特定RL算法或框架(如GRPO, PPO, OpenRLHF)的选择与应用
涉及智能体实验设计、消融实验或数据策展问题
npx skills add thinkwee/AgentsMeetRL --skill agents-meet-rl -g -y


