Skip to content
 
 

Repository files navigation

agent-gpu-skills

GPU 开发 Agent Skill 集合,适用于 Cursor / Claude Code / Codex / Gemini CLI。

Skill 层级 使用场景
cuda-skill 底层 (PTX/CUDA C++) 查 PTX 指令、CUDA API、Programming Guide,nsys/ncu 分析
cutlass-skill 中间层 (CUTLASS/CuTeDSL) 写 CUTLASS/CuTe kernel,查 CuTeDSL 示例
cutedsl-skill 中间层 (CuTeDSL) CuTeDSL kernel 开发,TMA、SMEM layout、inline PTX 集成、调试技巧
triton-skill 高层 (Python DSL) 写 Triton/Gluon 内核,查教程和示例
ncu-analysis 分析工具 (Nsight Compute) NCU profiling、.ncu-rep 分析、kernel 性能瓶颈定位
sglang-skill 应用层 (LLM Serving) SGLang 推理引擎开发,KV cache、Attention backend
nccl-skill 通信层 (NCCL) NCCL 2.30 文档/源码、集合通信、NCCL_* 调优、多机多卡 hang/性能排查、nccl4py
nvshmem-skill 通信层 (NVSHMEM) NVSHMEM 3.7 文档/源码、OpenSHMEM PGAS、对称内存、GPU 发起的 put/get/atomic/collective、teams、NVSHMEM_* 调优、NVSHMEM4Py

安装

git clone https://github.com/KevinZeng08/agent-gpu-skills.git
cd agent-gpu-skills

# 1. 获取外部源码 repo (sparse checkout, ~130MB)
bash update-repos.sh

# 2. 安装 skill (默认 Cursor,用 --agent claude/codex/gemini 安装到其他工具)
bash install.sh

脚本会创建目录并复制 SKILL.md(Cursor 不识别软链接的 SKILL.md),其余文件软链接回项目目录,自动同步更新。详细安装说明参考 INSTALL.md

其他工具

SKILL.md 格式兼容 Claude Code、Codex、Gemini CLI 等支持 Agent Skills 的工具。安装脚本提供了 --agent 参数将文件复制到对应路径:

工具 安装路径 命令
Cursor ~/.cursor/skills/ bash install.sh (默认)
Claude Code ~/.claude/skills/ bash install.sh --agent claude
Codex ~/.codex/skills/ bash install.sh --agent codex
Gemini CLI ~/.gemini/skills/ bash install.sh --agent gemini

注: 本项目只在 Cursor 下完整验证过。其他工具的 skill 发现和搜索机制可能有差异,如遇问题可以让对应工具的 AI 协助排查。

路径约定说明

不同工具对配置目录和 skill 目录的命名不完全一样,容易混淆。

工具 配置目录 常见 skill 目录 说明
Cursor ~/.cursor/ ~/.cursor/skills/ Cursor 自己的目录约定
Claude Code ~/.claude/ ~/.claude/skills/ Claude Code 自己的目录约定
Codex ~/.codex/ ~/.codex/skills/ 本仓库统一使用 .codex 目录
Gemini CLI ~/.gemini/ ~/.gemini/skills/ Gemini CLI 自己的目录约定

对 Codex 来说要特别区分两件事:

  • ~/.codex/config.toml 是 Codex 的用户级配置文件
  • ~/.codex/skills/ 是本仓库约定的 Codex skill 安装目录

因此本仓库的 install.sh --agent codex 会直接安装到 ~/.codex/skills/

目录结构

agent-gpu-skills/
├── README.md
├── INSTALL.md                       # 详细安装指南
├── install.sh                       # 安装脚本 (支持 --agent/--skill/--target-dir)
├── scripts/validate_cuda_skill.py   # cuda-skill 结构与内容校验
├── update-repos.sh                  # 克隆/更新外部 repo (triton, cutlass, sglang)
├── scrape_docs.py                   # 文档爬虫 (uv script)
├── cuda_skill/
│   ├── SKILL.md
│   ├── references/                  # CUDA 文档库 (~700 files)
│   └── repos/microbench-blackwell/  # 可运行的 Blackwell microbench (~23MB, .gitignore)
├── triton_skill/
│   ├── SKILL.md
│   ├── quick-reference.md
│   └── repos/triton/                # sparse checkout (~8MB, .gitignore)
├── cutlass_skill/
│   ├── SKILL.md
│   └── repos/cutlass/               # sparse checkout (~62MB, .gitignore)
├── cutedsl_skill/
│   ├── SKILL.md
│   └── references/
│       ├── add-inline-ptx.md         # CuTeDSL inline PTX 集成模式
│       ├── debugging-smem-values.md  # SMEM 调试技巧
│       └── tma-guide.md              # TMA 工作流指南
├── ncu-analysis/
│   ├── SKILL.md
│   ├── references/                   # NCU 分析参考文档
│   └── scripts/                      # NCU 分析脚本
├── sglang_skill/
│   ├── SKILL.md
│   └── repos/sglang/                # sparse checkout (~44MB, .gitignore)
├── nccl_skill/
│   ├── SKILL.md
│   ├── README.md
│   ├── build_nccl_skill.sh          # 从 NCCL 仓库文档源重新生成 references/
│   ├── update-nccl.sh               # 拉取匹配版本的 NCCL 源码到 repos/nccl/
│   ├── references/                   # NCCL 2.30 用户指南 Markdown 镜像 (~57 页)
│   └── repos/nccl/                  # NCCL 源码 (~12MB, .gitignore)
└── nvshmem_skill/
    ├── SKILL.md
    ├── README.md
    ├── build_nvshmem_skill.py       # 抓取 NVSHMEM 文档站点重新生成 references/
    ├── update-nvshmem.sh            # 拉取匹配版本的 NVSHMEM 源码到 repos/nvshmem/
    ├── references/                   # NVSHMEM 3.7 文档 Markdown 镜像 (~44 页)
    └── repos/nvshmem/               # NVSHMEM 源码 (.gitignore)

各 skill 的 repos/ 源码目录(含 nccl_skill/repos/nccl/)通过 .gitignore 排除,用 bash update-repos.sh 重建。

cuda-skill

NVIDIA CUDA 全套文档转换为可搜索的 Markdown:

文档 文件数 大小 来源
PTX ISA 9.3 完整规范 489 2.8MB NVIDIA PTX ISA
CUDA Runtime API 13.3.1 106 1.1MB NVIDIA Runtime API
CUDA Driver API 13.3.1 135 2.0MB NVIDIA Driver API
CUDA Programming Guide 13.3 44 1.7MB NVIDIA Programming Guide
CUDA C++ Best Practices Guide 73 581KB NVIDIA Best Practices
Nsight Compute 2026.2.1 9 789KB NVIDIA Nsight Compute
Nsight Systems 2026.3 5 921KB NVIDIA Nsight Systems
清单与查询/工具指南 9 - 本仓库维护

版本、来源和文件清单见 cuda_skill/references/MANIFEST.md。文档通过 scrape_docs.py 管理,先用 --output-dir 抓取到新的暂存目录,比较后再合并。--force 只覆盖同名文件,不删除目录或无关文件。

除文档外,cuda-skill 还包含两份性能分析参考和一套可运行的 microbench:

内容 路径 说明
MMA 指令选择模型 references/mma-instruction-selection.md cycle 级选形状、判断能否打满算力、估算受限 tile 的算力上限
Microbench 使用指南 references/microbenchmarking.md 指令吞吐/访存延迟未知时,如何自己测出来并回填模型
Blackwell microbench 源码 repos/microbench-blackwell/ UMMA 吞吐/延迟、LDGSTS、TMA、DSMEM、elementwise 等

microbench 源码用 bash update-repos.sh microbench 拉取(personal 分支,完整 checkout,约 23MB),不随仓库提交。里面的 kernel 面向 sm_100a,只在 Blackwell 上可跑。

python3 scripts/validate_cuda_skill.py

cutlass-skill

引用 CUTLASS 源码:

内容 路径
CuTeDSL Python 教程 cutlass/python/CuTeDSL/
CuTe Python bindings cutlass/python/pycute/
CUTLASS C++ 示例 cutlass/examples/
CuTe 头文件 cutlass/include/cute/

triton-skill

直接引用 Triton 源码中的教程、示例和内核实现:

内容 路径 说明
Triton 教程 (01-11) triton/python/tutorials/ 从 vector add 到 block-scaled matmul
Gluon 教程 (01-12) triton/python/tutorials/gluon/ layouts, TMA, wgmma, tcgen05, warp spec
Gluon 示例 triton/python/examples/gluon/ Flash Attention (Blackwell)
生产级内核 triton/python/triton_kernels/ matmul, reduce, top-k, SwiGLU, MXFP
语言定义 triton/python/triton/language/ tl.* 操作语义

sglang-skill

引用 SGLang 源码:

内容 路径
SRT 推理引擎 sglang/python/sglang/srt/
JIT 内核 sglang/python/sglang/jit_kernel/
SGL-Kernel (CUDA) sglang/sgl-kernel/

nccl-skill

NVIDIA NCCL 2.30.7 用户指南的离线 Markdown 镜像(已随仓库提交),可选地配合 NCCL 源码一起阅读:

内容 路径
主题索引 + 搜索配方 nccl_skill/references/REFERENCE_INDEX.md
C API 参考 (comms/colls/types/device_*/...) nccl_skill/references/api/
NCCL_* 环境变量 nccl_skill/references/env.md
nccl4py Python 绑定 nccl_skill/references/nccl4py/
排查指南 (gpu/网络/perf/ras/...) nccl_skill/references/troubleshooting/
NCCL 源码 (可选) nccl_skill/repos/nccl/

文档随仓库提交,无需额外拉取。源码用 bash update-repos.sh nccl(或 nccl_skill/update-nccl.sh)拉取到 repos/nccl/。如需从 NCCL 仓库文档源重新生成 references/,运行 nccl_skill/build_nccl_skill.sh(需要 NCCL 仓库的 docs/userguide/source,开销较大,不在 install.sh 中执行)。

nvshmem-skill

NVIDIA NVSHMEM 3.7.0 文档的离线 Markdown 镜像(已随仓库提交),可选地配合 NVSHMEM 源码一起阅读:

内容 路径
主题索引 + 搜索配方 nvshmem_skill/references/INDEX.md
C/C++ API 参考 (rma/amo/signal/collectives/teams/sync/ordering/...) nvshmem_skill/references/api/
NVSHMEM_* 环境变量 nvshmem_skill/references/env.md
NVSHMEM4Py Python 绑定 (host + Numba/CuTe device) nvshmem_skill/references/nvshmem4py/
示例 (C/CUDA + Python) nvshmem_skill/references/examples.md
排查 FAQ nvshmem_skill/references/faq.md
NVSHMEM 源码 (可选) nvshmem_skill/repos/nvshmem/

文档随仓库提交,无需额外拉取。源码用 bash update-repos.sh nvshmem(或 nvshmem_skill/update-nvshmem.sh)拉取到 repos/nvshmem/(固定 tag v3.7.0-0)。如需从 NVIDIA 文档站点重新生成 references/,运行 nvshmem_skill/build_nvshmem_skill.pyuv 脚本,需要联网抓取,不在 install.sh 中执行)。

致谢

cuda-skill 的文档爬取方案受 technillogue/ptx-isa-markdown 启发。

许可

CUDA 文档内容 (c) NVIDIA Corporation. Triton、CUTLASS、SGLang 源码遵循各自原始许可.

About

Personal Extensions for Agentic GPU Programming Skills

Resources

Stars

7 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages