Agent Skills › thinkwee/AgentsMeetRL

thinkwee/AgentsMeetRL

GitHub

针对LLM智能体强化学习训练、评估及实验设计的排障技能。通过匹配症状(如奖励不收敛、KL爆炸等)提供基于知识库的根因分析与修复建议,支持GRPO/PPO等算法及框架选型,但不执行实际训练或日志分析。

1 个 Skill 1,744

安装全部 Skills

npx skills add thinkwee/AgentsMeetRL --all -g -y
更多选项

预览集合内 Skills

npx skills add thinkwee/AgentsMeetRL --list

集合内 Skills (1)

针对LLM智能体强化学习训练、评估及实验设计的排障技能。通过匹配症状(如奖励不收敛、KL爆炸等)提供基于知识库的根因分析与修复建议,支持GRPO/PPO等算法及框架选型,但不执行实际训练或日志分析。
用户询问LLM智能体强化学习训练的故障排除 涉及RL训练指标异常(如reward停滞、KL/熵爆炸)的诊断 需要选择RL算法、框架或基准测试时的决策支持 提及GRPO, PPO, DAPO等特定RL算法名称
skills/agents-meet-rl/SKILL.md
npx skills add thinkwee/AgentsMeetRL --skill agents-meet-rl -g -y

首页 - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-08-02 13:34
浙ICP备14020137号-1 $访客地图$