用于创建、更新和分析实验性能分析基准Jupyter笔记本的Skill,涵盖uv工具安装、nb.py辅助操作及可复现性管理。
用于生成涵盖Excel全内容类型的压力测试工作簿,支持确定性种子和多种规模格式。旨在通过构建包含公式、图表、表格等元素的测试文件,测量解析器完整性并执行回归测试。
作为测试执行与代码所有权守护者,负责发现并运行测试套件,确保所有测试通过。依据MECES原则评估覆盖率,对失败测试执行修复、删除或升级处理,保证代码库处于健康状态。
在游戏目标运行环境中启动实际构建,通过真实证据验证渲染、输入、核心循环等最小可玩闭环。用于测试生成游戏或检查构建是否完整可玩,输出结构化验证结果与报告。
用于创建 Skillgrade 评估的评分器,支持确定性脚本和 LLM 提示词打分,可配置权重组合。适用于编写评估标准、构建评分逻辑及验证评分准确性,不涵盖管道配置或通用测试。
针对Lemma应用进行端到端QA,涵盖认证、UI行为、权限及部署正确性验证。通过构建用户旅程账本,检查真实状态与持久化效果,生成证据支持的缺陷报告及发布结论。
用于审计、设计和编写Tutti测试,确保测试覆盖关键契约与失败场景。指导在修改或审查各类测试前建立证据地图并通过作者审核门控,选择恰当的证明形态并构建敏感证据。
提供 PR 提交前的本地全链路验证流程,按成本从低到高依次执行范围检查、类型校验、前后端测试、构建及代码规范检查,确保代码质量与合规性。
用于在开发流程中验证测试覆盖率的非阻塞检查点,通过引导式提问鼓励编写高质量测试,评估测试存在性、策略和质量,旨在培养测试习惯而非强制拦截。
强制AI在声明任务完成前必须执行并展示最新验证证据(如测试日志、构建输出),杜绝无依据的成功断言,确保结果真实可靠。
强制在声称工作完成前运行验证命令并提供证据,禁止无验证的断言。适用于测试、构建、修复等场景,确保所有成功声明基于实际输出而非推测或代理报告。
指导用户运行、配置和评估 SWE-bench Lite 基准测试,涵盖环境搭建、参数配置及结果报告,适用于 agtx agent 工作流性能评测。


