用于准备和检查实验运行证据的技能。通过设计 stdout 指标与摘要,使用 orx logs 读取持久化结果,并在报告前验证日志完整性与有效性,确保实验结论有据可依。
1 skills
GitHub
5,506
UnifiedBenchDatasetEvaluator算子参考文档,支持6种评估类型对模型答案打分并输出结果。用于在基准数据集上评估模型回答质量,支持多种输入键配置及LLM语义判断。
5 skills
GitHub
242
用于生成涵盖Excel各类内容类型的压力测试工作簿,以测量解析器完整性和进行回归测试。支持确定性地构建包含公式、图表、表格等特征的测试文件及清单。
1 skills
GitHub
71
用于通过 Superior Trade Unified API 进行 Lighter 市场发现、Nautilus 回测、部署及执行操作。涵盖账户就绪检查、安全规则及参考文档加载,确保合规交易与资金安全。
2 skills
GitHub
212
用于构建和维护AI代理评估引擎的Skill,涵盖任务规范编写、环境搭建、验证器设计及基准测试维护。
1 skills
GitHub
1,240
用于编写 Skillgrade 评估的评分器,支持确定性验证和 LLM 规则评分。涵盖策略选择、脚本编写、权重配置及结果验证流程,不适用于管道搭建或通用测试。
1 skills
GitHub
713
用于执行简单的上传测试或基础数据检查。通过调用 inspect_schema 和 run_sql_readonly 进行只读查询,并以简洁语言总结结果,适用于验证数据源可用性。
1 skills
GitHub
773
用于审计和调试财务模型(如DCF、LBO),检查公式错误、结构完整性及逻辑合理性,确保资产负债表平衡和现金流匹配。
1 skills
GitHub
1,668
追踪并审计过去30天的代币及预测市场选择,通过对比买入价与当前价格计算盈亏表现,判定胜率。
1 skills
GitHub
749
用于对模型视频进行22项指标、5个维度的自动化评测。涵盖预计算、GPU指标、VLM API指标及报告生成,支持增量运行与单视频调试,输出详细评估结果。
1 skills
GitHub
238
用于在提交EHR前验证FHIR R4资源与US Core/USCDI规范的合规性。通过HL7官方工具检查meta.profile声明、must-support元素及常见数据缺口,将结果转为OperationOutcome,确保符合Epic/Cerner等系统要求。
5 skills
GitHub
5,351
用于定期审查分类决策准确性,计算准确率及误报/漏报率,识别系统性偏差并建议调整信号权重或阈值,以优化分类效果。
1 skills
GitHub
97
维护TulingResearch Plus语义图工作流,包括论文、引用、推荐和作者网络工具。使用假适配器测试,无需API密钥,确保合同、模块和测试的正确性。
1 skills
GitHub
137
为新增的SSIM测试生成并上传参考数据。在Modal L40S上运行测试以获取像素或潜变量文件,经用户验证后上传至HF数据集,解决因缺少引用导致的测试失败问题。
1 skills
GitHub
4,496
用于对牛市看跌价差策略进行历史回测,对比含信号与无信号版本的表现。返回权益曲线、关键绩效指标及交易明细,评估策略在特定标的上的Alpha生成能力。
1 skills
GitHub
3,269

Accueil - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-09-23 01:24
浙ICP备14020137号-1