v9.1.0
Menu
All Concept Cards

GPU Programming with Triton

GPU architecture, memory and writing fast kernels in Triton

25 cards · first 3 free · flip each card to test yourself

04

Threads, Warps, Blocks & SMs

PixelBank Premium

05

The GPU Memory Hierarchy

PixelBank Premium

06

Memory Coalescing

PixelBank Premium

07

Arithmetic Intensity & the Roofline

PixelBank Premium

08

Triton's Block Programming Model

PixelBank Premium

09

program_id & Offsets

PixelBank Premium

10

Masked Loads & Stores

PixelBank Premium

11

Launching the Grid

PixelBank Premium

12

Choosing BLOCK_SIZE

PixelBank Premium

13

Autotuning: num_warps & num_stages

PixelBank Premium

14

Benchmarking Pitfalls

PixelBank Premium

15

Kernel Fusion & DRAM Round-Trips

PixelBank Premium

16

Row-Wise Reductions

PixelBank Premium

17

Numerically Stable Fused Softmax

PixelBank Premium

18

Tiled Matrix Multiplication

PixelBank Premium

19

The Inner-K Loop

PixelBank Premium

20

L2 Cache Super-Grouping

PixelBank Premium

21

Mixed Precision & Tensor Cores

PixelBank Premium

22

Fused Layer Normalization

PixelBank Premium

23

Low-Memory Dropout

PixelBank Premium

24

FlashAttention & the Online Softmax

PixelBank Premium

25

Persistent Kernels

PixelBank Premium