Agent Skills
› thinkwee/AgentsMeetRL
thinkwee/AgentsMeetRL
GitHub针对LLM智能体强化学习训练、评估及实验设计的排障技能。通过匹配症状(如奖励不收敛、KL爆炸等)提供基于知识库的根因分析与修复建议,支持GRPO/PPO等算法及框架选型,但不执行实际训练或日志分析。
安装全部 Skills
npx skills add thinkwee/AgentsMeetRL --all -g -y
集合内 Skills (1)
针对LLM智能体强化学习训练、评估及实验设计的排障技能。通过匹配症状(如奖励不收敛、KL爆炸等)提供基于知识库的根因分析与修复建议,支持GRPO/PPO等算法及框架选型,但不执行实际训练或日志分析。
用户询问LLM智能体强化学习训练的故障排除
涉及RL训练指标异常(如reward停滞、KL/熵爆炸)的诊断
需要选择RL算法、框架或基准测试时的决策支持
提及GRPO, PPO, DAPO等特定RL算法名称
npx skills add thinkwee/AgentsMeetRL --skill agents-meet-rl -g -y


