Generativa modeller — översikt
Kunna förklara skillnaden mellan autoregressiva modeller, VAE, GAN och diffusion, och vad de modellerar.
Förkunskaper
Intuition
Alla generativa modeller försöker lära sig datafördelningen p(x) — hur troliga olika bilder eller texter är — så att man kan dra nya exempel ur den. De skiljer sig i hur.
| Familj | Idé | Bra på | Svaghet |
|---|---|---|---|
| Autoregressiv | faktorisera p(x) = Πp(xₜ|x₍₌ₜ₎) och förutsäg en bit i taget | text, kod; exakt likelihood | långsam generering (en token i taget) |
| VAE | koda till en latent fördelning, avkoda tillbaka | strukturerat latent rum, snabb | suddiga bilder |
| GAN | generator mot diskriminator i ett spel | skarpa bilder, snabb sampling | instabil träning, mode collapse |
| Diffusion | lär dig att ta bort brus, steg för steg | bild/ljud/video i toppklass | många steg = långsam |
Språkmodeller är autoregressiva. Bildgeneratorer är i dag nästan alltid diffusion.
Formellt
Autoregressiv: , tränad med maximum likelihood (cross-entropy). Exakt likelihood — därför går perplexitet att beräkna.
VAE: inför en latent variabel och maximerar en undre gräns (ELBO): . Första termen är rekonstruktion, andra drar den latenta fördelningen mot en normalfördelning. Suddigheten kommer av att rekonstruktionstermen ofta är en pixelvis MSE, som belönar medelvärden.
GAN: minimax mellan generator och diskriminator : . Ingen likelihood — därför inga jämförbara perplexitetstal, och därför svårt att veta när träningen går bra.
Diffusion: en framåtprocess lägger till gaussiskt brus i steg tills bilden är rent brus; modellen lär sig den omvända processen genom att förutsäga bruset, med en enkel MSE-loss. Stabil träning, men sampling kräver många avbrusningssteg (accelereras med DDIM, destillering, consistency models).
Behärskning innebär
- Skiljer autoregressiva modeller, VAE, GAN och diffusion
- Anger vad varje familj modellerar och var den passar
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Denoising Diffusion Probabilistic Models — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Auto-Encoding Variational Bayes — arXiv (öppen åtkomst; licens per artikel)
- Dive into Deep Learning (CC BY-SA 4.0) — CC BY-SA 4.0