GPU Programming with Triton
GPU architecture, memory and writing fast kernels in Triton
25 cards · first 3 free · flip each card to test yourself
04
Threads, Warps, Blocks & SMs
PixelBank Premium
05
The GPU Memory Hierarchy
PixelBank Premium
06
Memory Coalescing
PixelBank Premium
07
Arithmetic Intensity & the Roofline
PixelBank Premium
08
Triton's Block Programming Model
PixelBank Premium
09
program_id & Offsets
PixelBank Premium
10
Masked Loads & Stores
PixelBank Premium
11
Launching the Grid
PixelBank Premium
12
Choosing BLOCK_SIZE
PixelBank Premium
13
Autotuning: num_warps & num_stages
PixelBank Premium
14
Benchmarking Pitfalls
PixelBank Premium
15
Kernel Fusion & DRAM Round-Trips
PixelBank Premium
16
Row-Wise Reductions
PixelBank Premium
17
Numerically Stable Fused Softmax
PixelBank Premium
18
Tiled Matrix Multiplication
PixelBank Premium
19
The Inner-K Loop
PixelBank Premium
20
L2 Cache Super-Grouping
PixelBank Premium
21
Mixed Precision & Tensor Cores
PixelBank Premium
22
Fused Layer Normalization
PixelBank Premium
23
Low-Memory Dropout
PixelBank Premium
24
FlashAttention & the Online Softmax
PixelBank Premium
25
Persistent Kernels
PixelBank Premium