用于设计、评估付费广告实验,涵盖假设制定、随机化单位、样本量计算、护栏设置及结果解读。支持A/B测试全流程,确保统计显著性与决策严谨性。
提供PyTorch训练循环的最佳实践,涵盖可复现性、数据加载优化、学习率调度、早停及模型保存等,用于生成或审查ML训练代码。
根据临床病历文档提取并分配CPT及HCPCS II级手术与医疗服务代码,辅助生成符合专业编码标准的索赔数据。
用于估算暗社交流量,提供分享链接UTM规范、自报来源字段设计及GA4直接流量分解方案。
基于RAG技术对预摄入文档进行语义搜索,支持LlamaIndex/ChromaDB或NVIDIA Foundational RAG后端。用于检索内部报告、PDF等技术文档中的领域知识,返回带引用的相关文本块。
自动研究循环迭代技能,用于设计、实现和优化语言模型的Token优化方法。通过基准测试验证新方法的性能,并持续改进以降低损失,最终提交代码和更新日志。
利用MinerU将复杂PDF转换为LLM友好的Markdown或JSON格式,支持提取文本、表格及公式。适用于学术论文解析、RAG数据准备及批量处理,提供命令行与Python API,涵盖多后端模式选择与最佳实践。
DataClaw用于将Claude等编码代理对话导出至Hugging Face数据集。涵盖安装、配置、本地导出、PII隐私审计及发布流程,通过JSON输出next_steps指导操作。
提供本地离线嵌入服务的配置与使用指南,支持通过ONNX Runtime在设备端运行模型,无需API密钥。涵盖源码构建、模型选择及隐私保护场景。
基于Isaac Sim生成移动机器人合成训练数据。通过两阶段管道:无头录制轨迹,回放渲染RGB/深度等传感器数据。适用于随机路径跟随、自定义机器人子类及SDG数据采集。
用于加载CSV/Excel/JSON数据,执行清洗、统计分析及可视化,并生成图表和Markdown报告。适用于数据集分析、趋势发现及数据报告生成场景。


