用于在发布前对PII模型进行基准测试,通过合成数据评估精确跨度召回率和字符召回率,确保满足隐私召回阈值要求。
执行端到端贡献后QA审查,通过范围界定、分发检查清单及领域专家代理进行并行审查,运行确定性构建测试,修复阻断性问题并给出最终就绪结论。
验证PR证据截图和Viewer HTML的质量,确保符合CI标准。检查图片分辨率、大小及空白度,并利用Playwright验证HTML渲染正确性,防止无效证据提交。
指导用户完成GSD第5课,通过文件化规划与构建工作流,演示Expense Splitter应用的验证流程。包含交互式QA测试、问题调试及快速模式使用,确保构建成果符合预期。
强制在声称任务完成前提供最新终端执行证据,禁止使用模糊词汇。通过五步验证流程确保测试、构建、修复等结果真实可靠,防止未经验证的断言,提升交付质量。
会话清理前的只读检查技能,通过执行脚本验证项目状态(如GSD交接、版本控制),依据退出码决定是否可以安全执行/clear命令。
指导如何设计、审查和清理测试用例,以最大化回归信号并降低维护成本。涵盖测试分层策略、质量门禁及验证规范,适用于评估测试价值与优化覆盖率。
用于验证Google移动广告SDK在iOS、Android或Unity项目中的集成合规性,支持全面审计或特定检查。
评估技能是否符合法律设计框架,检查13个设计参数、3种失败模式及依赖关系,输出就绪或关注建议。用于安装社区技能或部署团队技能前的信任审查。
代码与产品质量门禁,执行代码审查、QA测试、性能检查及安全审计。支持多业务类型分支及不同质量层级(快速/标准/发布),确保产品具备上线信心。
用于扫描 React 代码库的安全性、性能、正确性和架构问题,生成健康评分。适用于提交前检查回归或整体代码清理优化,辅助提升代码质量。
用于每日校准分类准确率,通过对比历史决策与实际结果,计算准确率及误判率,识别系统性偏差并建议调整信号权重或阈值,以优化后续分类效果。
用于监控 TulingResearch Plus Race Mode 相关上游公共变更,执行快照差异比对、版本异常检测及生成 Watch 报告。确保在触及相关模块或发布门控时,同步更新代码、测试与文档,并维护状态账本一致性。


