LLM智能体强化学习训练、评估及实验设计的故障排查助手。基于知识库诊断奖励不收敛、评估停滞等问题,提供根因分析与修复方案,适用于GRPO、PPO等算法场景。
诊断 GKE 上 AI/ML 工作负载 JobSet 的中断、重启和抢占问题,提供系统性排查流程和 MQL/PromQL 查询方案。
LLaVA-OneVision2注意力边界分析指南,解析cu_lengths与patch_positions在ViT和LLM阶段的控制机制及packed序列行为。
通过SSH远程连接Ray集群,执行提交任务、检查日志和分析修复错误的三步调试循环,直至问题 resolved。
用于调试 dbt 编译失败、运行时数据库错误、测试失败及数据异常等问题的技能。通过健康检查、错误分类和隔离诊断,定位并修复环境或 SQL 问题,确保项目构建成功。
用于调查地理编码器数据质量问题,通过查询S3上的Parquet文件排查自动补全、重复或缺失数据等Bug。
针对YOLO26模型训练问题的诊断与优化技能,涵盖mAP提升、过拟合分析、超参数调优及各类任务(检测、分割等)的训练指导。
用于调试 Dataflow 模板在运行完成后出现的数据逻辑错误或差异。通过 Terraform 启动作业,对比源端(如 Cloud SQL)与目标端(如 Spanner)数据以定位问题,不适用于启动崩溃或构建场景。
用于监控prime-rl训练运行状态的技能。包括查找输出目录、检查日志和SLURM作业、分析关键指标(如奖励、稳定性),并在研究人员要求时安全重启任务,同时生成状态报告。
针对NVIDIA DGX Spark(GB10芯片)ML训练中的十种已知故障模式进行预检和诊断,涵盖启动失败、内存溢出、性能下降等问题,提供快速参考与修复方案。
诊断 dbt Cloud 平台作业失败的根本原因,通过日志、API 和代码历史分析定位问题,适用于报错不清或间歇性故障。


