利用Claude子代理对archestra-bench基准测试运行结果进行Map-Reduce分析,生成Tier-1/Tier-2改进报告。通过Rust工具准备数据,Workflow自动分发Triage任务并汇总建议。
针对Freqtrade在Hyperliquid交易所的策略,提供费用优化、滑点分析及订单类型配置建议,解决回测与实盘差异问题。
用于审计财务模型,检查结构、公式一致性、资产负债表平衡及现金流匹配等问题。触发场景包括调试模型、模型审核、模型无法平衡或逻辑错误排查等任务。
将 Base 链上的原始交易解码为人类可读故事,解析方法调用、代币流向及对手方,并标记可疑授权。通过公共 RPC 和 Etherscan 实现无密钥解码,用于交易分析与安全审查。
总结 Google Cloud Data Lineage 图谱,帮助用户调试数据质量问题并理解 BigQuery/GCS 的数据溯源。通过调用 MCP 服务获取上下游数据流,将复杂的节点和链接信息转化为直观的 Markdown 报告。
提供ClickHouse模式、查询及配置审查的最佳实践规则,涵盖28条具体检查项。用于在Schema设计、SQL优化和数据摄入阶段进行规范性审查与优化建议。
每日校准分类准确率,通过对比近期决策与实际结果,计算指标并识别系统性误差,提出权重或阈值调整建议以优化分类效果。
指导编写和审查基准测试环境中的任务评估器(Judge),通过CRUD模型确保判断逻辑的准确性,避免误判。
处理历史SQL表数据,提取使用证据并生成确定性模式投影。通过读取原始文件、验证标识符准确性及执行SQL探针,最终调用工具输出结构化的表使用叙事和频率信息。
提供ClickHouse最佳实践,涵盖模式设计、查询优化及Agent连接工作流。包含31条规则,用于审查Schema、配置及查询性能,确保利用列存特性提升效率并保障安全性。
用于提议并执行评分标准(rubric)或分桶(bucket)的升级与重校。支持完整公式变更(含多步验证与跨模型审核)及轻量级边界调整,确保评分体系的准确性与一致性。
- «
- 1
- »


