用于准备和检查实验运行证据的 Skill。指导如何设计 stdout 指标、使用 orx logs 读取持久化结果,并验证基于运行的声明,确保在分析或报告前日志包含完整证据。
1 skills
GitHub
5,793
UnifiedBenchDatasetEvaluator算子,用于在基准数据集上评估模型回答。支持6种评估类型,生成评分并输出结果列,可配置LLM语义判断及多种输入键映射。
4 skills
GitHub
245
用于通过 Superior Trade Unified API 进行 Lighter 市场发现、Nautilus 回测、部署及执行交易。涵盖账户就绪检查、安全规则及与 Robinhood Chain 变体的区分,确保合规操作。
2 skills
GitHub
213
用于在 LangSmith 中迭代创建在线评估器。通过检查追踪数据、访谈用户确定评估标准,并构建 LLM-as-judge 或代码型评估器,实现 AI 应用质量的自动化验证与监控。
1 skills
GitHub
1,251
指导如何编写 Skillgrade 的确定性评分器和 LLM 评分规则。涵盖策略选择、脚本编写、YAML 配置、权重组合及验证方法,用于构建评估打分体系。
1 skills
GitHub
720
用于上传测试和基本数据检查的最小技能。通过检查数据源模式、运行只读SQL查询或预览表,并以通俗语言总结结果,验证数据可用性。
1 skills
GitHub
778
用于审计已构建的财务模型,检查公式准确性、数据完整性及逻辑合理性。通过重新计算和核对检查表,生成可执行的问题日志报告,不修改原文件。
2 skills
GitHub
1,779
用于为注册视频模型批量生成评测视频。支持文本条件及相机/动作模型,按类型筛选用例(如导航案例),提供单例冒烟测试、后台断点续跑及输出验证流程,确保多轮对话视频正确合并与格式合规。
2 skills
GitHub
240
用于在人工审批前对记录、数据集或GMP文档执行ALCOA+数据完整性检查。通过DEGRADED或FULL模式运行确定性Lint工具,输出硬性/软性发现及人工判断清单,绝不自动判定合规,确保事实准确且无臆造。
1 skills
GitHub
210
用于在发布前对PII模型进行基准测试,通过合成数据评估精确跨度召回率和字符召回率,确保满足隐私召回阈值要求。
4 skills
GitHub
5,418
用于每日校准分类准确率,通过对比历史决策与实际结果,计算准确率及误判率,识别系统性偏差并建议调整信号权重或阈值,以优化后续分类效果。
1 skills
GitHub
95
用于维护TulingResearch Plus文献综述工作流,涵盖策略管理、筛选、证据矩阵构建、差距提取及干跑导出。确保相关模块、测试和文档符合发布标准。
1 skills
GitHub
136
为新增的SSIM测试生成并上传参考数据。在Modal L40S上运行测试以获取像素或潜变量文件,经用户验证后上传至HF数据集,解决因缺少引用导致的测试失败问题。
1 skills
GitHub
4,496
用于对牛市看跌价差策略进行历史回测,对比含信号与无信号版本的表现。返回权益曲线、关键绩效指标及交易明细,评估策略在特定标的上的Alpha生成能力。
1 skills
GitHub
3,269
用于规划、顺序执行并分析系列训练实验。通过解析日志提取指标,检测异常,对比不同超参数配置下的运行结果,提供性能评估与后续优化建议。
2 skills
GitHub
1,220

Home - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-09-27 16:54
浙ICP备14020137号-1