Agent Skillsaiming-lab/AutoResearchClaw › stat-result-validator

stat-result-validator

GitHub

用于验证统计研究结果的完整性与一致性,检查从问题定义、方法、理论到实验证据及最终结论的完整链条质量。

external/agents/stat_research_agent/skills/stat-result-validator/SKILL.md aiming-lab/AutoResearchClaw

Trigger Scenarios

需要评估统计研究论文或报告的质量时 完成实验评估和结果综合后需进行审计时

Install

npx skills add aiming-lab/AutoResearchClaw --skill stat-result-validator -g -y
More Options

Non-standard path

npx skills add https://github.com/aiming-lab/AutoResearchClaw/tree/main/external/agents/stat_research_agent/skills/stat-result-validator -g -y

Use without installing

npx skills use aiming-lab/AutoResearchClaw@stat-result-validator

指定 Agent (Claude Code)

npx skills add aiming-lab/AutoResearchClaw --skill stat-result-validator -a claude-code -g -y

安装 repo 全部 skill

npx skills add aiming-lab/AutoResearchClaw --all -g -y

预览 repo 内 skill

npx skills add aiming-lab/AutoResearchClaw --list

SKILL.md

Frontmatter
{
    "name": "stat-result-validator",
    "metadata": {
        "category": "domain",
        "priority": "1",
        "trigger-keywords": "validation,audit,formulation,theory,comparison,claims,statistical sanity,quality gate",
        "applicable-stages": "10,11,12,13,14,15,16,17,20"
    },
    "description": "Validate statistical research outputs for formulation quality, method-to- problem alignment, theory presence, experimental evidence, fair comparison, artifact completeness, and final-claim consistency.\n"
}

Stat Result Validator

Overview

Use this skill after formulation, method proposal, theory, experimental evaluation, comparison, and result synthesis. It checks whether the final result is supported by a coherent statistical research chain.

Artifact Checks

Required for all topics:

progress/<TOPIC_ID>/step0_problem_formulation.md
progress/<TOPIC_ID>/step1_method_proposal.md
progress/<TOPIC_ID>/step2_theory_analysis.md
progress/<TOPIC_ID>/step3_experimental_evaluation.md
progress/<TOPIC_ID>/step4_comparison.md
progress/<TOPIC_ID>/step5_result_synthesis.md
progress/<TOPIC_ID>/step6_quality_audit.md
experiments/<TOPIC_ID>/config.yaml
experiments/<TOPIC_ID>/results/metrics.json
experiments/<TOPIC_ID>/results/run_manifest.json
experiments/<TOPIC_ID>/results/comparison_summary.md
experiments/<TOPIC_ID>/results/claim_verdicts.json
experiments/<TOPIC_ID>/report/paper.md
experiments/<TOPIC_ID>/README.md

Analysis-specific source files and raw outputs are determined by the experiment plan and should live under experiments/<TOPIC_ID>/src/ and experiments/<TOPIC_ID>/results/.

Formulation Checks

The formulation must define:

  • Observed data and sampling regime
  • Data model or data source
  • Target parameter, decision, prediction, or risk
  • Assumptions
  • Claims or hypotheses
  • Evaluation criteria
  • Theory targets

Blocking failures:

  • No target or estimand.
  • Claims cannot be measured.
  • Assumptions are absent or incompatible with the proposed method.
  • Evaluation criteria do not answer the research question.

Method Checks

Verify that:

  • The proposed method addresses the formulated target.
  • Baselines are meaningful.
  • Ablations isolate important design choices.
  • Diagnostics are specified for likely failure modes.
  • Method outputs match the metrics and theory targets.

Theory Checks

Theory may be rigorous or partial, but it must be explicit.

Check for:

  • Definitions and assumptions.
  • Proposition, theorem, derivation, counterexample, or clearly labeled heuristic analysis.
  • Predicted empirical patterns.
  • Limitations and regimes not covered.

Blocking failures:

  • No theory section at all.
  • Theory analyzes a different target than the formulation.
  • Final claims are stronger than the theory supports.

Experimental Evidence Checks

Check that:

  • Experiments test the formulated claims.
  • Conditions are aligned with assumptions and stress tests.
  • Proposed method, baselines, and ablations are run on comparable conditions.
  • Failure counts are recorded.
  • Runtime reductions are recorded in run_manifest.json.
  • Metrics are grouped at the right level.

Comparison Checks

Verify that:

  • Comparisons include proposed method vs baseline.
  • Ablations are interpreted.
  • Experimental patterns are compared with theoretical predictions.
  • Disagreements between theory and experiments are discussed.
  • Claim verdicts cite both theoretical and empirical support when available.

Final Claim Checks

Every final claim must be traceable to:

formulation -> method -> theory -> experiment -> comparison

Use:

  • PASS: formulation, theory, experiments, and comparisons support the claims.
  • WARN: usable but has limitations that must be disclosed.
  • FAIL: missing formulation, theory, evidence, or fair comparison prevents a valid conclusion.

Version History

  • e2e23c9 Current 2026-07-25 07:47

Same Skill Collection

.claude/skills/a-evolve/SKILL.md
.claude/skills/biology-biopython/SKILL.md
.claude/skills/chemistry-rdkit/SKILL.md
.claude/skills/hypothesis-formulation/SKILL.md
.claude/skills/literature-search/SKILL.md
.claude/skills/researchclaw/SKILL.md
.claude/skills/scientific-visualization/SKILL.md
.claude/skills/scientific-writing/SKILL.md
.claude/skills/statistical-reporting/SKILL.md
external/agents/Biology-Agent/skills/fba-simulator/SKILL.md
external/agents/Biology-Agent/skills/flux-analyzer/SKILL.md
external/agents/Biology-Agent/skills/gsmm-builder/SKILL.md
external/agents/Biology-Agent/skills/gsmm-validator/SKILL.md
external/agents/Biology-Agent/skills/metabolic-study-planner/SKILL.md
external/agents/Biology-Agent/skills/mfa-pipeline-orchestrator/SKILL.md
external/agents/stat_research_agent/skills/stat-research-orchestrator/SKILL.md
external/agents/stat_research_agent/skills/statistical-experimental-evaluation/SKILL.md
external/agents/stat_research_agent/skills/statistical-method-design/SKILL.md
external/agents/stat_research_agent/skills/statistical-problem-formulation/SKILL.md
external/agents/stat_research_agent/skills/statistical-theory-analysis/SKILL.md
researchclaw/skills/builtin/domain/biology-biopython/SKILL.md
researchclaw/skills/builtin/domain/chemistry-rdkit/SKILL.md
researchclaw/skills/builtin/domain/cv-classification/SKILL.md
researchclaw/skills/builtin/domain/cv-detection/SKILL.md
researchclaw/skills/builtin/domain/nlp-alignment/SKILL.md
researchclaw/skills/builtin/domain/nlp-pretraining/SKILL.md
researchclaw/skills/builtin/domain/quantum-qiskit/SKILL.md
researchclaw/skills/builtin/domain/rl-policy-optimization/SKILL.md
researchclaw/skills/builtin/experiment/experimental-design/SKILL.md
researchclaw/skills/builtin/experiment/hypothesis-formulation/SKILL.md
researchclaw/skills/builtin/experiment/literature-search/SKILL.md
researchclaw/skills/builtin/experiment/meta-analysis/SKILL.md
researchclaw/skills/builtin/experiment/scientific-visualization/SKILL.md
researchclaw/skills/builtin/experiment/scientific-writing/SKILL.md
researchclaw/skills/builtin/experiment/statistical-reporting/SKILL.md
researchclaw/skills/builtin/experiment/systematic-review/SKILL.md
researchclaw/skills/builtin/tooling/data-loading/SKILL.md
researchclaw/skills/builtin/tooling/distributed-training/SKILL.md
researchclaw/skills/builtin/tooling/mixed-precision/SKILL.md
researchclaw/skills/builtin/tooling/pytorch-training/SKILL.md

Metadata

Files
0
Version
be4ba47
Hash
15742a69
Indexed
2026-07-25 07:47

inicio - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-08-20 06:40
浙ICP备14020137号-1 $mapa de visitantes$