CUDA with Numba
Threads, memory and parallel patterns — GPU programming in Python
25 cards · first 3 free · flip each card to test yourself
04
Launch Configuration & Block Size
PixelBank Premium
05
Bounds Checks & Grid-Stride Loops
PixelBank Premium
06
Asynchronous Launches & Timing
PixelBank Premium
07
Host and Device Memory
PixelBank Premium
08
Transfers: to_device, copy_to_host & Hidden Copies
PixelBank Premium
09
Pinned Memory, Streams & Overlap
PixelBank Premium
10
2D Grids for Matrices
PixelBank Premium
11
Coalescing: threadIdx.x on the Contiguous Axis
PixelBank Premium
12
Warps & Warp Divergence
PixelBank Premium
13
Shared Memory & cuda.syncthreads()
PixelBank Premium
14
Shared-Memory Bank Conflicts
PixelBank Premium
15
Device Functions & Compile-Time Constants
PixelBank Premium
16
Occupancy & Register Pressure
PixelBank Premium
17
The Reduction Problem
PixelBank Premium
18
Tree Reduction in Shared Memory
PixelBank Premium
19
Warp Shuffles
PixelBank Premium
20
Atomics & Race Conditions
PixelBank Premium
21
Privatized Histograms
PixelBank Premium
22
Parallel Prefix Scan
PixelBank Premium
23
Tiled Matmul with Shared Memory
PixelBank Premium
24
float32 vs float64 on the GPU
PixelBank Premium
25
Debugging with the CUDA Simulator
PixelBank Premium