Collected on 2026-06-11. The 100 links below were deduplicated and checked with ranged HTTP requests.
- GPU Mode Lectures / clone URL:
https://github.com/gpu-mode/lectures.git- Material for GPU Mode lectures,覆盖 CUDA、Triton、GPU kernels、性能优化等内容。
- TODO: 后续网络稳定时可加入 submodule:
git submodule add --depth 1 https://github.com/gpu-mode/lectures.git gpu-mode-lectures
- CUDA C++ Programming Guide
- CUDA Runtime API
- CUDA C++ Best Practices Guide
- CUDA Compiler Driver NVCC
- CUDA-GDB
- CUDA Math API
- cuBLAS Library
- cuFFT Library
- cuRAND Library
- cuSOLVER Library
- cuSPARSE Library
- PTX ISA 8.5
- Introduction to CUDA Platform PPTX
- Optimizing Parallel Reduction in CUDA
- CUDA Programming and Optimization
- Pre-course Lectures
- Lecture 1
- Lecture 2
- Lecture 3
- Lecture 4
- Lecture 5
- Lecture 6
- Lecture 7
- Lecture 8
- Lecture 9
- NVIDIA Performance Debugging
- FlashAttention
- CUDA Workshop
- Code Generation
- OP2
- ARC Notes
- Nsight
- Practical 1
- Practical 2
- Practical 3
- Practical 4
- Practical 5
- Practical 6
- Practical 7
- Practical 8
- Practical 9
- Practical 10
- Practical 11
- Practical 12
- Module 1: Overview
- Module 1: Heterogeneous Computing
- Module 1: Portability and Scalability
- Module 1 Intro
- Module 2
- Module 2: CUDA, Thrust, and Libraries
- Module 2: CUDA Data Allocation API
- Module 2: CUDA Parallelism and Threads
- Module 2: CUDA Toolkit
- Module 3
- Module 3: Kernel SPMD Parallelism
- Module 3: Kernel Multidimension
- Module 3: Color to Greyscale Image Processing Example
- Module 3: Blur Kernel
- Module 3: Transparent Scaling
- Module 4: CUDA Memories
- Module 4: Tiled Algorithms
- Module 4: Tiled Matrix Multiplication
- Module 4: Tiled Matrix Multiplication Kernel
- Module 4: Tile Boundary Condition
- Module 4
- Module 5: Warps and SIMD
- Module 5: Control Divergence
- Module 5: Warp Control Divergence
- Module 6: DRAM Bandwidth
- Module 6: Memory Coalescing
- Module 6: Coalescing
- Module 7: Histogram
- Module 9: Reductions
- Module 12: Floating Point
- Module 13: GPU Workload Performance Considerations
- Module 14: Data Transfer
- Module 20: Introduction to OpenCL
- Module 20: OpenCL
- Module 21: OpenACC
- CS 179 2026 Lecture 01
- CS 179 2026 Lecture 02
- CS 179 2026 Lecture 03
- CS 179 2026 Lecture 04
- CS 179 2026 Lecture 05
- CS 179 2026 Lecture 06
- CS 179 2026 Lecture 07
- CS 179 2026 Lecture 08
- CS 179 2026 Lecture 09
- CS 179 2026 Lecture 10
- CS 179 2026 Lecture 11
- CS 179 2026 Lecture 12
- CS 179 2026 Lecture 13
- CS 179 2026 Lecture 14
- CS 179 2026 Lecture 15
- CS 179 2026 Lecture 16
- CS 179 2024 Lecture 17 PPTX
- CS 179 2024 Lecture 17 PDF
- CUDA Tips PPTX
- CUDA Tips PDF
- NVIDIA RTX Blackwell GPU Architecture