Hoppa till innehållet
AI-grafen
E· Universitetgenerativa-modeller· ca 60 min· utvecklande· verifierad 2026-09-20

Generativa modeller — översikt

Kunna förklara skillnaden mellan autoregressiva modeller, VAE, GAN och diffusion, och vad de modellerar.

Förkunskaper

Intuition

Alla generativa modeller försöker lära sig datafördelningen p(x) — hur troliga olika bilder eller texter är — så att man kan dra nya exempel ur den. De skiljer sig i hur.

FamiljIdéBra påSvaghet
Autoregressivfaktorisera p(x) = Πp(xₜ|x₍₌ₜ₎) och förutsäg en bit i tagettext, kod; exakt likelihoodlångsam generering (en token i taget)
VAEkoda till en latent fördelning, avkoda tillbakastrukturerat latent rum, snabbsuddiga bilder
GANgenerator mot diskriminator i ett spelskarpa bilder, snabb samplinginstabil träning, mode collapse
Diffusionlär dig att ta bort brus, steg för stegbild/ljud/video i toppklassmånga steg = långsam

Språkmodeller är autoregressiva. Bildgeneratorer är i dag nästan alltid diffusion.

Formellt

Autoregressiv: pθ(x)=∏tpθ(xt∣x<t)p_\theta(x) = \prod_t p_\theta(x_t\mid x_{<t}), tränad med maximum likelihood (cross-entropy). Exakt likelihood — därför går perplexitet att beräkna.

VAE: inför en latent variabel zz och maximerar en undre gräns (ELBO): log⁡p(x)≥Eq(z∣x)[log⁡p(x∣z)]−DKL(q(z∣x) ∥ p(z))\log p(x) \ge \mathbb E_{q(z|x)}[\log p(x|z)] - D_{KL}(q(z|x)\,\|\,p(z)). Första termen är rekonstruktion, andra drar den latenta fördelningen mot en normalfördelning. Suddigheten kommer av att rekonstruktionstermen ofta är en pixelvis MSE, som belönar medelvärden.

GAN: minimax mellan generator GG och diskriminator DD: min⁡Gmax⁡DEx[log⁡D(x)]+Ez[log⁡(1−D(G(z)))]\min_G\max_D \mathbb E_x[\log D(x)] + \mathbb E_z[\log(1 - D(G(z)))]. Ingen likelihood — därför inga jämförbara perplexitetstal, och därför svårt att veta när träningen går bra.

Diffusion: en framåtprocess lägger till gaussiskt brus i TT steg tills bilden är rent brus; modellen lär sig den omvända processen genom att förutsäga bruset, med en enkel MSE-loss. Stabil träning, men sampling kräver många avbrusningssteg (accelereras med DDIM, destillering, consistency models).

Behärskning innebär

  • Skiljer autoregressiva modeller, VAE, GAN och diffusion
  • Anger vad varje familj modellerar och var den passar

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser