PIXELBANKv8.2.0
Menu
All Concept Cards

Vision-Language Models

CLIP, bridges, instruction tuning and what makes a VLM actually see

25 cards · first 3 free · flip each card to test yourself

04

CLIP's Visual Encoder

PixelBank Premium

05

Contrastive Learning & InfoNCE

PixelBank Premium

06

Zero-Shot Transfer

PixelBank Premium

07

SigLIP

PixelBank Premium

08

DINOv2 & Self-Supervised Features

PixelBank Premium

09

Choosing a Vision Encoder

PixelBank Premium

10

Linear Projection: the LLaVA Bridge

PixelBank Premium

11

Q-Former

PixelBank Premium

12

Perceiver Resampler

PixelBank Premium

13

Dynamic Resolution

PixelBank Premium

14

Visual Instruction Tuning

PixelBank Premium

15

Two-Stage Training

PixelBank Premium

16

Where Image Tokens Go

PixelBank Premium

17

Pretraining Data at Scale

PixelBank Premium

18

Hallucination in VLMs

PixelBank Premium

19

Preference Tuning for VLMs

PixelBank Premium

20

LoRA for VLMs

PixelBank Premium

21

Visual Grounding

PixelBank Premium

22

Document & Chart Understanding

PixelBank Premium

23

Video Understanding

PixelBank Premium

24

VLM Benchmarks

PixelBank Premium

25

Serving VLMs

PixelBank Premium