生产事故仪表盘,读取ECS健康、Sentry错误和CI失败状态,识别活跃故障并调度修复代理。
用于调试和优化Android/Gradle构建性能,分析慢速构建、CI/CD瓶颈及编译问题。提供测量基线、生成构建扫描、识别配置与执行阶段瓶颈的方法,并指导应用缓存、并行化等优化策略以提升构建速度。
提供Kubernetes集群、工作负载、网络及存储故障的系统化调试工具包,涵盖Pod状态异常、DNS解析、部署卡死等问题的诊断与修复流程。
用于调试和修复 CI 检查失败的自动化流程。支持识别分支、分析日志、本地复现问题、执行最小化修复及推送代码,确保 CI 状态恢复绿色。
通过Executor MCP查询生产环境的Axiom追踪、Postgres数据及PostHog分析,用于排查错误、延迟、使用情况及验证部署效果。
提供在 Trainium/Inferentia 硬件上调试 NKI 内核编译和执行错误的标准化工作流,涵盖环境配置、平台检测及核心调试步骤。
诊断 KKTerm 中 SSH 连接失败、tmux 恢复异常、主机密钥警告及认证错误等问题。通过只读检查定位原因,区分传输与会话故障,强调安全规范,避免泄露密钥。
从编排日志中提取重复失败模式,生成带置信度的failure-rule.v1提案。仅支持只读分析和建议,禁止自动写入SSOT或执行自动晋升,需人工审核批准。
分析 GitHub Actions 工作流失败原因,通过 CLI 检查日志、历史运行记录以定位具体故障任务、判断偶发性或回归问题,识别引入失败的提交并查找现有修复 PR。
监控和管理GKE TPU动态切片,包括检查生命周期状态、排查配置失败、验证工作负载清单及处理卡住的终态器。
提供主机文件系统排查能力,支持批量查找大文件、统计目录占用及查询文件属性。强调通过数组参数并行调用以提升效率,适用于磁盘空间分析与故障排查场景。
用于调查告警、故障或性能异常的根因分析技能。通过分析链路追踪、日志和指标,确定问题范围与严重程度,为值班工程师提供具体证据和排查建议。
用于诊断和修复 Mac 系统问题的工具集,涵盖健康检查、资源监控及磁盘清理。适用于系统卡顿、发热、磁盘不足等场景,支持主动发现并解决系统异常。


