用于评估模型在基准数据集上的回答质量,支持多种评测类型和指标。
5 skills
GitHub
235
针对Polymarket临近截止日期的市场概率漂移策略,通过回测历史价格行为分析时间衰减影响,提供谨慎的仓位建议与退出时机。
1 skills
GitHub
209
用于构建和维护AI代理评估引擎的技能,涵盖基准测试设计、任务规范编写、合成数据生成、环境搭建及验证器审计,支持持续校准与基准维护。
1 skills
GitHub
1,209
用于执行简单的上传测试或基础数据检查,通过检查数据库模式并运行只读查询来验证数据可用性。
1 skills
GitHub
758
用于审计和调试财务模型(如DCF、LBO),检查公式错误、结构完整性及逻辑合理性,确保资产负债表平衡和现金流匹配。
1 skills
GitHub
1,668
用于运行 WBench 22项指标评估流水线,对模型视频进行评分并生成报告。支持预计算、GPU指标、VLM API指标及汇总阶段,适用于评测或打分场景。
1 skills
GitHub
231
验证 FHIR R4 资源及 Bundle 是否符合 US Core/USCDI 规范,确保 EHR 兼容。通过官方校验器检查 meta.profile、must-support 等约束,并修复常见合规缺陷。
4 skills
GitHub
5,270
用于定期校验分类准确性,对比实际结果与预测,计算准确率及误判率,识别系统性偏差并生成调整建议报告。
1 skills
GitHub
96
用于维护可证伪假设、研究问题及证据组合,支持FINER检查与操作化定义。涉及Pydantic模型、测试用例及文档更新,确保工作流合规与发布安全。
1 skills
GitHub
138
为新增的 SSIM 测试在 HuggingFace 上生成并上传参考数据(mp4 或 pt)。通过 Modal L40S 运行测试,下载产物供用户验证后上传至指定数据集。
2 skills
GitHub
4,354
提供牛式看跌价差策略的回测能力,支持信号版与无信号控制版的对比分析。通过量化年化收益、最大回撤等指标,验证FearScore入场规则的有效性,辅助期权交易策略评估。
1 skills
GitHub
2,244
用于规划、执行并对比系列训练实验的 Skill。支持参数扫描、顺序运行训练任务、解析日志指标及异常检测,最终生成对比分析以优化超参数。
2 skills
GitHub
1,214
该技能用于执行单变量特征筛选,通过检验或回归分析候选变量与目标变量的关系,报告效应方向、显著性及缺失率等统计指标,辅助构建解释变量清单。
3 skills
GitHub
2,510
该技能用于创建和管理用于测试与开发的小型模型。通过检查配置、缩减参数量、微调及验证,生成架构保留但规模约1B的轻量级模型,支持多模态处理与快速实验。
1 skills
GitHub
3,766
对学术文献参考文献进行多源交叉验证,逐字段对比作者、标题、年份等,标记DOI冲突、作者异常等问题,输出结构化报告并支持批量处理与Zotero同步修正。
1 skills
GitHub
40,145

trang chủ - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-09-15 17:51
浙ICP备14020137号-1 $bản đồ khách truy cập$