针对AReaL分布式训练(FSDP2/TP等)的调试指南,涵盖死锁、结果错误、OOM及通信故障。提供最小复现策略、环境配置、调用栈分析及具体排查步骤。
面向LLM智能体强化学习训练的故障排查与实验设计指南。针对PPO、GRPO等算法训练中的奖励停滞、评估平坦、KL爆炸及工具调用失败等症状,提供基于语料库的根因分析与修复建议,辅助框架选择与基准测试。
用于诊断和解决 GKE 集群上 AI/ML 训练工作负载的 JobSet 中断、重启及抢占问题。通过自动化查询指标与日志,分析重启循环、Spot VM 预emption 等故障,并提供自主修复建议。
检测并验证 MATLAB GPU 可用性,诊断驱动或设备问题,指导多卡选择与属性查询,辅助用户排查 GPU 计算不可用故障。
用于 Relax 强化学习项目的代码开发与调试。涵盖最小化变更原则的代码修改,以及在 Ray 集群上提交训练任务、监控日志并修复错误的远程验证流程。
用于排查 dbt 编译失败、运行时错误、测试失败及数据异常等问题的调试技能。通过健康检查、错误分类和 SQL 分析定位并修复问题,确保项目构建正常。
通过查询S3上的Parquet文件调查地理编码数据质量问题,用于排查自动补全、重复或缺失等数据Bug。
用于调试Dataflow模板逻辑错误和数据不一致,通过Terraform部署作业并对比源(如Cloud SQL)与目标(如Spanner)数据。仅限作业运行至终态场景,不适用于启动崩溃或构建新模板。
针对NVIDIA DGX Spark统一内存架构,提供训练前内存容量规划、运行时OOM故障排查及长时间任务的热监控指导。
用于诊断 dbt Cloud 平台作业失败的根本原因。通过分析运行日志、查询 Admin API、审查 Git 历史及调查数据问题,解决错误信息不明确或间歇性故障,特别适用于生产环境而非本地开发场景。
专注于AI Agent系统的上下文工程,涵盖架构设计、调试上下文故障、优化Token使用、实现记忆系统及多Agent协调。旨在通过精简高信号Token集,在最小化成本的同时最大化LLM推理质量与性能。
利用 LangWatch CLI 排查实验失败、分数回退及评估器异常。通过定位失败行、检查评估器设置,对比版本变更以识别根因(如模型、提示词或数据问题),并提供修复与预防建议。
分析 ClickHouse 查询的 CPU 性能瓶颈。支持通过 query_id 回溯或执行新查询,利用采样探查器和 trace_log 收集 CPU 堆栈轨迹,识别热点函数和调用路径,辅助性能优化。


