Hoppa till innehållet
AI-grafen

Vad är en transformer? Förklarat från attention till språkmodell

En transformer är en arkitektur där varje token får titta på alla andra tokens och vikta dem efter relevans — det är attention. Staplar man block av attention och små neuronnät får man GPT-, Llama- och Qwen-familjerna.

För att förstå den på riktigt behöver du vektorer, matriser, ett neuronnäts forward pass och embeddings. AI-grafen kontrollerar vilka av dem du redan kan och lägger vägen därefter.

I laboratoriet implementerar du scaled dot-product attention i NumPy, tränar en liten GPT på en text och ritar dess attention-kartor.

Kan du redan programmera? Gå direkt till AI för utvecklare, RAG, agenter eller evals. Så vet vi vad du kan.