提供 CLI 运行时验证方案,通过隔离 DB 和 launcher 脚本确保测试安全。涵盖数据播种、功能流观察及错误路径处理,防止污染真实数据库。
指导采用测试驱动开发(TDD)模式,强调先写失败测试再实现代码。适用于新功能、Bug修复及行为修改场景,通过RED-GREEN-REFACTOR循环确保代码正确性并防止回归。
用于UI、游戏或渲染资产的视觉对比,通过建立目标基准而非依赖旧基线,客观评估图像差异并判定哪个结果更准确。
安全测试前置验证技能,通过7问门禁、4个提交前检查及拒绝列表过滤无效漏洞。确保仅提交具备可复现步骤、影响真实且符合范围的发现,提升报告有效性并降低N/A比例。
用于3D动物资产的新增、修复与发布流程,涵盖合规审查、缺陷检测、自动化校验及人工审核,确保模型质量与版权完整。
指导编写和调试 Pipeline Studio 应用的 Playwright E2E 测试,涵盖环境配置、CLI 快速探测、交互式浏览器检查及元素定位器探索。
指导测试驱动开发流程,强调先写失败测试再实现代码。涵盖红绿重构循环、测试边界选择、Bug修复规范及断言原则,旨在提升代码质量与可维护性。
用于运行、校准和比较基于 Aider Polyglot 语料库的编码 Agent 评估基准测试,支持 Capstan 与 OpenCode 对比及性能测量。
用于执行技术 SEO 审计,涵盖爬取、索引、安全、URL、移动端、核心 Web 指标及结构化数据等。排除内容策略与外链,专注于网站技术层面的合规性与性能优化。
通过RPC桥接驱动Silo桌面应用进行运行时验证,包括启动、操作DOM、截图及工作区管理。强制在沙箱环境中执行以确保安全,并优化Agent轮次以降低成本。
提供代码提交前的全面质量验证,涵盖规范合规、Lint、类型检查、测试及跨层数据流一致性。用于在编码完成后、提交前捕获上下文漂移并修复缺陷。
UnifiedBenchDatasetEvaluator算子,用于在基准数据集上评估模型回答。支持6种评估类型,生成评分并输出结果列,可配置LLM语义判断及多种输入键映射。
强制在声称任务完成前必须提供当前会话中生成的最新验证证据,防止在未实际测试的情况下错误标记完成。
独立验证代码或内容结果,执行真实检查并返回判定。支持审查、行为测试及技术决策模式,确保隔离性与准确性,不修改交付物。


