Vad är en transformer? Förklarat från attention till språkmodell
En transformer är en arkitektur där varje token får titta på alla andra tokens och vikta dem efter relevans — det är attention. Staplar man block av attention och små neuronnät får man GPT-, Llama- och Qwen-familjerna.
För att förstå den på riktigt behöver du vektorer, matriser, ett neuronnäts forward pass och embeddings. AI-grafen kontrollerar vilka av dem du redan kan och lägger vägen därefter.
I laboratoriet implementerar du scaled dot-product attention i NumPy, tränar en liten GPT på en text och ritar dess attention-kartor.
Kan du redan programmera? Gå direkt till AI för utvecklare, RAG, agenter eller evals. Så vet vi vad du kan.