Agent Skillsgoogle-gemini/gemini-cli › behavioral-evals

behavioral-evals

GitHub

指导创建、运行和修复 Agent 行为评估测试,用于验证决策逻辑、调试提示词偏移及防止回归。

.gemini/skills/behavioral-evals/SKILL.md google-gemini/gemini-cli

Trigger Scenarios

验证 Agent 决策逻辑 调试提示词引导问题 添加工作区回归测试

Install

npx skills add google-gemini/gemini-cli --skill behavioral-evals -g -y
More Options

Non-standard path

npx skills add https://github.com/google-gemini/gemini-cli/tree/main/.gemini/skills/behavioral-evals -g -y

Use without installing

npx skills use google-gemini/gemini-cli@behavioral-evals

指定 Agent (Claude Code)

npx skills add google-gemini/gemini-cli --skill behavioral-evals -a claude-code -g -y

安装 repo 全部 skill

npx skills add google-gemini/gemini-cli --all -g -y

预览 repo 内 skill

npx skills add google-gemini/gemini-cli --list

SKILL.md

Frontmatter
{
    "name": "behavioral-evals",
    "description": "Guidance for creating, running, fixing, and promoting behavioral evaluations. Use when verifying agent decision logic, debugging failures, debugging prompt steering, or adding workspace regression tests."
}

Behavioral Evals

Overview

Behavioral evaluations (evals) are tests that validate the agent's decision-making (e.g., tool choice) rather than pure functionality. They are critical for verifying prompt changes, debugging steerability, and preventing regressions.

[!NOTE] Single Source of Truth: For core concepts, policies, running tests, and general best practices, always refer to evals/README.md.


🔄 Workflow Decision Tree

  1. Does a prompt/tool change need validation?
    • No -> Normal integration tests.
    • Yes -> Continue below.
  2. Is it UI/Interaction heavy?
  3. Is it a new test?
    • Yes -> Set policy to USUALLY_PASSES.
    • No -> ALWAYS_PASSES (locks in regression).
  4. Are you fixing a failure or promoting a test?

📋 Quick Checklist

1. Setup Workspace

Seed the workspace with necessary files using the files object to simulate a realistic scenario (e.g., NodeJS project with package.json).

2. Write Assertions

Audit agent decisions using rig.setBreakpoint() (AppRig only) or index verification on rig.readToolLogs().

3. Verify

Run single tests locally with Vitest. Confirm stability locally before relying on CI workflows.


📦 Bundled Resources

Detailed procedural guides:

  • creating.md: Assertion strategies, Rig selection, Mock MCPs.
  • fixing.md: Step-by-step automated investigation, architecture diagnosis guidelines.
  • promoting.md: Candidate identification criteria and threshold guidelines.

Version History

  • e90c63f Current 2026-08-20 16:53

Same Skill Collection

.gemini/skills/agent-tui/SKILL.md
.gemini/skills/async-pr-review/SKILL.md
.gemini/skills/ci/SKILL.md
.gemini/skills/code-reviewer/SKILL.md
.gemini/skills/docs-changelog/SKILL.md
.gemini/skills/docs-writer/SKILL.md
.gemini/skills/github-issue-creator/SKILL.md
.gemini/skills/pr-address-comments/SKILL.md
.gemini/skills/pr-creator/SKILL.md
.gemini/skills/review-duplication/SKILL.md
.gemini/skills/string-reviewer/SKILL.md
.gemini/skills/tui-tester/SKILL.md
tools/gemini-cli-bot/.gemini/skills/critique/SKILL.md
tools/gemini-cli-bot/.gemini/skills/memory/SKILL.md
tools/gemini-cli-bot/.gemini/skills/metrics/SKILL.md
tools/gemini-cli-bot/.gemini/skills/prs/SKILL.md
packages/sdk/test-data/skills/pirate-skill/SKILL.md

Metadata

Files
0
Version
3c311be
Hash
c1ab849b
Indexed
2026-08-20 16:53

trang chủ - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-09-02 00:00
浙ICP备14020137号-1 $bản đồ khách truy cập$