Agent Skills
› aiming-lab/AutoResearchClaw
› rl-policy-optimization
rl-policy-optimization
GitHub强化学习策略优化最佳实践,涵盖PPO、SAC等算法选择、训练配方及评估标准。
Trigger Scenarios
设计RL智能体
调整PPO或SAC超参数
进行奖励函数设计
Install
npx skills add aiming-lab/AutoResearchClaw --skill rl-policy-optimization -g -y
SKILL.md
Frontmatter
{
"name": "rl-policy-optimization",
"metadata": {
"author": "researchclaw",
"version": "1.0",
"category": "domain",
"priority": "3",
"references": "Schulman et al., Proximal Policy Optimization, 2017; Haarnoja et al., Soft Actor-Critic, ICML 2018",
"trigger-keywords": "reinforcement learning,rl,policy,reward,agent,environment,ppo,sac",
"applicable-stages": "9,10"
},
"description": "Best practices for reinforcement learning policy optimization. Use when working on RL agents, PPO, SAC, or reward design."
}
RL Policy Optimization Best Practice
Algorithm selection:
- Discrete actions: PPO, DQN, A2C
- Continuous actions: SAC, TD3, PPO
- Multi-agent: MAPPO, QMIX
- Offline: CQL, IQL, Decision Transformer
Training recipe:
- PPO: clip=0.2, lr=3e-4, gamma=0.99, GAE lambda=0.95
- SAC: lr=3e-4, tau=0.005, auto-tune alpha
- Use vectorized environments (e.g., gymnasium.vector)
- Normalize observations and rewards
- Log episode return, episode length, value loss, policy entropy
Evaluation:
- Report mean +/- std over 10+ evaluation episodes
- Use deterministic policy for evaluation
- Compare against random policy and simple baselines
- Report sample efficiency (return vs. env steps)
Common pitfalls:
- Reward shaping can introduce bias
- Seed sensitivity is HIGH — use 5+ seeds
- Hyperparameter sensitivity — do a small sweep
Version History
- e2e23c9 Current 2026-07-25 07:48


