Agent Skills
› SprocketLab/slop-code-bench
SprocketLab/slop-code-bench
GitHub用于审核招聘任务的技术规格说明书,确保其真实并迫使候选人做出设计决策。通过对比测试用例与规范,识别冗余、架构提示、过度引导及隐藏细节,优化考核质量。
Install All Skills
npx skills add SprocketLab/slop-code-bench --all -g -y
Skills in Collection (9)
用于审核招聘任务的技术规格说明书,确保其真实并迫使候选人做出设计决策。通过对比测试用例与规范,识别冗余、架构提示、过度引导及隐藏细节,优化考核质量。
审核技术规格说明书
/audit-spec 命令调用
npx skills add SprocketLab/slop-code-bench --skill audit-spec -g -y
分析测试检查点的规格和现有测试,识别缺失的边缘情况并生成带有TODO的骨架测试代码。适用于编写测试后或审查测试覆盖率时,帮助提升测试完整性。
编写测试后
审查测试覆盖率
npx skills add SprocketLab/slop-code-bench --skill edge-cases -g -y
通过迭代运行评估、分析失败原因并修复解决方案代码,直至所有测试通过。适用于解决基准问题中代码测试失败的场景,同时支持将修复同步至后续检查点。
解决方案测试失败
需要修复代码以通过基准测试
npx skills add SprocketLab/slop-code-bench --skill fix-solution -g -y
分析测试用例与规格说明,将未明确演示的行为标记为功能测试,确保核心测试仅覆盖显式示例,提升评估公平性。
需要重新分类测试用例时
/reclassify-tests 命令触发
npx skills add SprocketLab/slop-code-bench --skill reclassify-tests -g -y
在Docker环境中使用eval-snapshot运行基准测试,替代原生pytest。通过指定快照路径、问题名和检查点索引,隔离执行并输出结构化的测试结果与代码质量分析,用于评估解决方案的正确性。
需要运行基准测试以评估解决方案
需要在隔离的Docker环境中执行测试
查看测试通过率和失败详情
npx skills add SprocketLab/slop-code-bench --skill run-tests -g -y
分析测试用例与规格说明书,识别测试中基于未明确定义假设的行为。用于发现测试断言超出规格范围、假定实现细节或期望非规范错误等情况,确保测试严格验证已定义行为。
需要审查测试用例是否过度依赖未定义的规格假设
检查测试逻辑是否与规格说明书存在不一致或隐含推断
npx skills add SprocketLab/slop-code-bench --skill test-ambiguity-detector -g -y
并行验证智能体运行目录中的所有检查点,通过启动测试代理评估结果并汇总。核心要求是人工复核子代理报告,确保结论准确。
需要批量验证Agent运行结果的检查点
/validate-run命令触发
npx skills add SprocketLab/slop-code-bench --skill validate-run -g -y
审查检查点规范与测试,识别将非明确需求编码为严格断言的模糊测试用例。通过对比规格说明,定位输出顺序、边界处理等歧义点,并提供修复建议或规格澄清方案。
审查 checkpoint_N.md 与 test_checkpoint_N.py
审计测试中的歧义性
分析快照评估失败原因
npx skills add SprocketLab/slop-code-bench --skill checkpoint-ambiguity-review -g -y
分析检查点规范与现有测试,识别并补充缺失的边界、空值及异常输入等边缘用例,确保测试覆盖度。
编写测试后需要检查覆盖率
审查测试用例是否存在遗漏
npx skills add SprocketLab/slop-code-bench --skill edge-cases -g -y


