Vision-Language Models
CLIP, bridges, instruction tuning and what makes a VLM actually see
25 cards · first 3 free · flip each card to test yourself
04
CLIP's Visual Encoder
PixelBank Premium
05
Contrastive Learning & InfoNCE
PixelBank Premium
06
Zero-Shot Transfer
PixelBank Premium
07
SigLIP
PixelBank Premium
08
DINOv2 & Self-Supervised Features
PixelBank Premium
09
Choosing a Vision Encoder
PixelBank Premium
10
Linear Projection: the LLaVA Bridge
PixelBank Premium
11
Q-Former
PixelBank Premium
12
Perceiver Resampler
PixelBank Premium
13
Dynamic Resolution
PixelBank Premium
14
Visual Instruction Tuning
PixelBank Premium
15
Two-Stage Training
PixelBank Premium
16
Where Image Tokens Go
PixelBank Premium
17
Pretraining Data at Scale
PixelBank Premium
18
Hallucination in VLMs
PixelBank Premium
19
Preference Tuning for VLMs
PixelBank Premium
20
LoRA for VLMs
PixelBank Premium
21
Visual Grounding
PixelBank Premium
22
Document & Chart Understanding
PixelBank Premium
23
Video Understanding
PixelBank Premium
24
VLM Benchmarks
PixelBank Premium
25
Serving VLMs
PixelBank Premium