Agent Skills › NVIDIA/dgx-spark-playbooks › dgx-station-diagnose

dgx-station-diagnose

GitHub

用于诊断 NVIDIA DGX Station GB300 硬件及软件故障,运行只读检测套件,关联官方手册分析结果,生成支持包或在批准后执行单一修复。

nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station-diagnose/SKILL.md NVIDIA/dgx-spark-playbooks

Trigger Scenarios

用户报告 DGX Station、CUDA、GPU 健康状态、Docker 或 MIG 等故障 需要诊断 GPU 一致性、端口或推理服务问题

Install

npx skills add NVIDIA/dgx-spark-playbooks --skill dgx-station-diagnose -g -y
More Options

Non-standard path

npx skills add https://github.com/NVIDIA/dgx-spark-playbooks/tree/main/nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station-diagnose -g -y

Use without installing

npx skills use NVIDIA/dgx-spark-playbooks@dgx-station-diagnose

指定 Agent (Claude Code)

npx skills add NVIDIA/dgx-spark-playbooks --skill dgx-station-diagnose -a claude-code -g -y

安装 repo 全部 skill

npx skills add NVIDIA/dgx-spark-playbooks --all -g -y

预览 repo 内 skill

npx skills add NVIDIA/dgx-spark-playbooks --list

SKILL.md

Frontmatter
{
    "name": "dgx-station-diagnose",
    "description": "Run and interpret the complete read-only dgx-assist diagnostic suite for NVIDIA DGX Station GB300, correlate findings with pinned NVIDIA playbooks, export a redacted support bundle, and apply one separately approved allowlisted fix. Use when the user reports a Station, CUDA, GPU health, coherency, vsloshd, Docker, CDI, MIG, cache, port, or owned inference-service failure."
}

DGX Station diagnostics

Diagnose first. Do not mutate as part of diagnosis.

Workflow

  1. Run scripts/dgx-assist diagnose run --json.
  2. Report the detected compatibility profile, then findings in severity order with their stable IDs and evidence. Preserve unknown states. On Software 1.0, do not reinterpret intentionally skipped Software 2.0 service checks as faults.
  3. Search the pinned playbooks for each high or critical finding; cite the relevant URL, heading, lines, and commit.
  4. If no passage overlaps, say so and avoid inventing a platform fix.
  5. Offer diagnose bundle --report-id "<id>" when escalation is appropriate.
  6. Offer at most one automatic fix at a time, and only when fix_id is present.
  7. Preview with diagnose fix --report-id "<id>" --finding "<id>" --dry-run.
  8. Explain exact actions, impact, privilege, and reboot state. Obtain explicit approval.
  9. Repeat with --yes only after approval and report the action receipt.

Safety requirements

  • Keep diagnose run read-only.
  • Never install packages, rewrite Docker configuration, change power caps or driver parameters, kill workloads, or modify MIG through a diagnostic fix.
  • Never stop a service without current dgx-assist ownership evidence.
  • Never use Fabric Manager as a routine Station check or remediation.
  • Re-run diagnostics when finding evidence is stale.
  • Never reveal secrets or unredacted home paths in a bundle.
  • Do not execute an unregistered remediation.
  • Treat --yes only as approval already obtained.

Read references/findings.md before proposing a fix or support bundle. Read references/bringup.md when the problem concerns physical deployment, BMC or firmware verification, driver bring-up, power braking, or support escalation.

Version History

  • 3410c65 Current 2026-09-23 03:07

Same Skill Collection

nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station-mig/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/analysis-methods/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/case-summary/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/clinical-delegation/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/clinical-knowledge/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/cohort-compare/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/fhir-basics/SKILL.md
nvidia/playbook-healthcare-agent/assets/skills/molecular-viz/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-diagnose/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-station-diagnose/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-station-mig/SKILL.md
nvidia/station-ai-skills/assets/skills/mig-configure/SKILL.md
nvidia/station-ai-skills/assets/skills/sglang-setup/SKILL.md
nvidia/station-ai-skills/assets/skills/vllm-setup/SKILL.md
nvidia/station-healthcare-agent/assets/skills/analysis-methods/SKILL.md
nvidia/station-healthcare-agent/assets/skills/case-summary/SKILL.md
nvidia/station-healthcare-agent/assets/skills/clinical-delegation/SKILL.md
nvidia/station-healthcare-agent/assets/skills/clinical-knowledge/SKILL.md
nvidia/station-healthcare-agent/assets/skills/cohort-compare/SKILL.md
nvidia/station-healthcare-agent/assets/skills/fhir-basics/SKILL.md
nvidia/station-healthcare-agent/assets/skills/molecular-viz/SKILL.md
nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station-inference/SKILL.md
nvidia/playbook-dgx-station-ai-skills/assets/skills/dgx-station/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-station-inference/SKILL.md
nvidia/station-ai-skills/assets/skills/dgx-station/SKILL.md

Metadata

Files
0
Version
3410c65
Hash
9c8ee0f1
Indexed
2026-09-23 03:07

Home - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-10-01 18:20
浙ICP备14020137号-1