v9.1.0
Menu
All Concept Cards

CUDA with Numba

Threads, memory and parallel patterns — GPU programming in Python

25 cards · first 3 free · flip each card to test yourself

04

Launch Configuration & Block Size

PixelBank Premium

05

Bounds Checks & Grid-Stride Loops

PixelBank Premium

06

Asynchronous Launches & Timing

PixelBank Premium

07

Host and Device Memory

PixelBank Premium

08

Transfers: to_device, copy_to_host & Hidden Copies

PixelBank Premium

09

Pinned Memory, Streams & Overlap

PixelBank Premium

10

2D Grids for Matrices

PixelBank Premium

11

Coalescing: threadIdx.x on the Contiguous Axis

PixelBank Premium

12

Warps & Warp Divergence

PixelBank Premium

13

Shared Memory & cuda.syncthreads()

PixelBank Premium

14

Shared-Memory Bank Conflicts

PixelBank Premium

15

Device Functions & Compile-Time Constants

PixelBank Premium

16

Occupancy & Register Pressure

PixelBank Premium

17

The Reduction Problem

PixelBank Premium

18

Tree Reduction in Shared Memory

PixelBank Premium

19

Warp Shuffles

PixelBank Premium

20

Atomics & Race Conditions

PixelBank Premium

21

Privatized Histograms

PixelBank Premium

22

Parallel Prefix Scan

PixelBank Premium

23

Tiled Matmul with Shared Memory

PixelBank Premium

24

float32 vs float64 on the GPU

PixelBank Premium

25

Debugging with the CUDA Simulator

PixelBank Premium