{
  "$schema": "../schemas/collection.schema.json",
  "id": "ai-hpc",
  "name": "AI/HPC",
  "status": "draft",
  "summary": "Skills for launching, validating, monitoring, demoing, and troubleshooting distributed AI workloads, CPU thread pools, file descriptor pressure, GPU binding, and accelerator visibility on Slurm-backed HPC systems.",
  "audience": ["AI/HPC users", "machine learning researchers", "research software engineers", "HPC support teams"],
  "skill_ids": [
    "gpu-sanity-check",
    "slurm-gpu-binding-diagnostics",
    "ray-on-slurm",
    "dask-jobqueue-on-slurm",
    "blas-openmp-thread-control",
    "file-descriptor-limit-triage",
    "jax-distributed-on-slurm",
    "huggingface-accelerate-on-slurm",
    "tensorflow-multiworker-on-slurm",
    "pytorch-ddp-on-slurm",
    "deepspeed-on-slurm",
    "nccl-diagnostics",
    "gpu-memory-triage",
    "tensorboard-on-slurm",
    "streamlit-on-slurm",
    "apptainer-run-container",
    "dataset-staging-to-scratch",
    "checkpoint-restart-workflow",
    "reproducible-run-capture",
    "slurm-efficiency-report"
  ],
  "maintainers": [
    {
      "name": "HPC Skill Hub Maintainers"
    }
  ]
}
