Agent SkillsNVIDIA/dgx-spark-playbooks › dgx-station-diagnose

dgx-station-diagnose

GitHub

针对NVIDIA DGX Station GB300运行只读诊断套件,关联官方手册分析故障,支持导出脱敏日志包及执行经审批的单一修复操作。

nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station-diagnose/SKILL.md NVIDIA/dgx-spark-playbooks

触发场景

用户报告DGX Station硬件或软件故障 需要排查CUDA、GPU健康、Docker等组件问题 请求生成诊断报告或应用已批准修复

安装

npx skills add NVIDIA/dgx-spark-playbooks --skill dgx-station-diagnose -g -y
更多选项

非标准路径

npx skills add https://github.com/NVIDIA/dgx-spark-playbooks/tree/main/nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station-diagnose -g -y

不安装直接使用

npx skills use NVIDIA/dgx-spark-playbooks@dgx-station-diagnose

指定 Agent (Claude Code)

npx skills add NVIDIA/dgx-spark-playbooks --skill dgx-station-diagnose -a claude-code -g -y

安装 repo 全部 skill

npx skills add NVIDIA/dgx-spark-playbooks --all -g -y

预览 repo 内 skill

npx skills add NVIDIA/dgx-spark-playbooks --list

SKILL.md

Frontmatter
{
    "name": "dgx-station-diagnose",
    "description": "Run and interpret the complete read-only dgx-assist diagnostic suite for NVIDIA DGX Station GB300, correlate findings with pinned NVIDIA playbooks, export a redacted support bundle, and apply one separately approved allowlisted fix. Use when the user reports a Station, CUDA, GPU health, coherency, vsloshd, Docker, CDI, MIG, cache, port, or owned inference-service failure."
}

DGX Station diagnostics

Diagnose first. Do not mutate as part of diagnosis.

Workflow

  1. Run scripts/dgx-assist diagnose run --json.
  2. Report the detected compatibility profile, then findings in severity order with their stable IDs and evidence. Preserve unknown states. On Software 1.0, do not reinterpret intentionally skipped Software 2.0 service checks as faults.
  3. Search the pinned playbooks for each high or critical finding; cite the relevant URL, heading, lines, and commit.
  4. If no passage overlaps, say so and avoid inventing a platform fix.
  5. Offer diagnose bundle --report-id "<id>" when escalation is appropriate.
  6. Offer at most one automatic fix at a time, and only when fix_id is present.
  7. Preview with diagnose fix --report-id "<id>" --finding "<id>" --dry-run.
  8. Explain exact actions, impact, privilege, and reboot state. Obtain explicit approval.
  9. Repeat with --yes only after approval and report the action receipt.

Safety requirements

  • Keep diagnose run read-only.
  • Never install packages, rewrite Docker configuration, change power caps or driver parameters, kill workloads, or modify MIG through a diagnostic fix.
  • Never stop a service without current dgx-assist ownership evidence.
  • Never use Fabric Manager as a routine Station check or remediation.
  • Re-run diagnostics when finding evidence is stale.
  • Never reveal secrets or unredacted home paths in a bundle.
  • Do not execute an unregistered remediation.
  • Treat --yes only as approval already obtained.

Read references/findings.md before proposing a fix or support bundle. Read references/bringup.md when the problem concerns physical deployment, BMC or firmware verification, driver bring-up, power braking, or support escalation.

版本历史

  • 3410c65 当前 2026-09-23 03:07

同 Skill 集合

nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station-mig/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/analysis-methods/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/case-summary/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/clinical-delegation/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/clinical-knowledge/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/cohort-compare/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/fhir-basics/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/molecular-viz/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-diagnose/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-station-diagnose/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-station-mig/SKILL.md
nvidia/station-ai-skills/assets/skills/mig-configure/SKILL.md
nvidia/station-ai-skills/assets/skills/sglang-setup/SKILL.md
nvidia/station-ai-skills/assets/skills/vllm-setup/SKILL.md
nvidia/station-healthcare-agent/assets/skills/analysis-methods/SKILL.md
nvidia/station-healthcare-agent/assets/skills/case-summary/SKILL.md
nvidia/station-healthcare-agent/assets/skills/clinical-delegation/SKILL.md
nvidia/station-healthcare-agent/assets/skills/clinical-knowledge/SKILL.md
nvidia/station-healthcare-agent/assets/skills/cohort-compare/SKILL.md
nvidia/station-healthcare-agent/assets/skills/fhir-basics/SKILL.md
nvidia/station-healthcare-agent/assets/skills/molecular-viz/SKILL.md
nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station-inference/SKILL.md
nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-station-inference/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-station/SKILL.md

元信息

文件数
0
版本
3410c65
Hash
9c8ee0f1
收录时间
2026-09-23 03:07

首页 - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-09-23 11:01
浙ICP备14020137号-1