Hur en språkmodell tränas — på gymnasienivå
Kunna förklara nästa-ord-träning, varför mängden text spelar roll och vad finjustering är.
Förkunskaper
Intuition
En språkmodell tränas på en enda uppgift: gissa nästa ord.
"Huvudstaden i Sverige är ___"
Modellen ger en sannolikhet till varje möjligt nästa ord. Gissar den fel justeras vikterna en aning. Upprepa några biljoner gånger.
Det förvånande är vad som kommer på köpet. För att bli bra på att gissa nästa ord måste modellen lära sig:
| För att gissa rätt här | måste den kunna |
|---|---|
| «Huvudstaden i Sverige är …» | geografi |
| «2 + 2 = …» | aritmetik |
| «Han sa att hon …» | grammatik och syftning |
| «def add(a, b): return …» | programmering |
| «Patienten hade feber och …» | medicinsk terminologi |
Ingen har lärt ut något av det. Det följer av att nästa ord är lättare att gissa om man förstår vad texten handlar om.
Ingen databas. Modellen slår inte upp svaret — den har ingen lagrad text. Kunskapen ligger i miljarder vikter, ungefär som du minns att Stockholm är huvudstad utan att ha en lista i huvudet. Och precis som ditt minne kan den blanda ihop saker.
Formellt
Tre faser, i ordning:
| Fas | Data | Kostnad | Ger |
|---|---|---|---|
| Förträning | biljoner ord från webb, böcker, kod | månader, miljontals kronor | språk och kunskap |
| Instruktionsjustering | tiotusentals (fråga, bra svar)-par | dagar | följer instruktioner i stället för att fortsätta texten |
| Preferensjustering | människor rangordnar svar | dagar | hjälpsamhet, ton, säkerhet |
Efter enbart förträning är modellen en textfortsättare. Frågar du «Vad är Sveriges huvudstad?» kan den svara «Vad är Norges huvudstad? Vad är Danmarks …» — den fortsätter mönstret i stället för att svara. Det är instruktionsjusteringen som gör den till en assistent.
Varför skala spelar roll. Kvaliteten följer ungefär en potenslag i tre storheter: antal parametrar, mängd träningsdata och beräkningskraft. Tiodubbla resurser ger en jämn, förutsägbar förbättring — men ingen abrupt vinst, och avkastningen avtar.
Det var länge tron att bara parametrarna räknades. Chinchilla-resultatet (2022) visade att datamängden var minst lika viktig, och att de flesta modeller var underträande på data. Det ändrade hur modeller byggs sedan dess: fler tokens, inte bara fler vikter.
Tre begränsningar som följer direkt av hur träningen går till:
| Begränsning | Varför |
|---|---|
| Kunskapsgräns | modellen vet inget efter träningens slut |
| Hallucinationer | den gissar mest sannolika text, inte sanning — ett rimligt påhitt är precis vad uppgiften belönar |
| Skevhet | den speglar den text den tränats på, inklusive dess vinklingar |
Den mittersta är värd att stanna vid: hallucinationer är inte en bugg som ska lagas bort, utan en direkt följd av att uppgiften är «producera sannolik text». Att motverka dem kräver något utanför modellen — hämtade källor, verktyg, eller en människa som kontrollerar.
Interaktivt
Fyra experiment i valfri chatbot. De visar hur träningen fungerar, från insidan.
1. Kunskapsgränsen. Fråga om något som hänt de senaste månaderna. Svaret avslöjar var träningsdatan slutar — eller att modellen fått söka på nätet.
2. Hallucination på beställning. Fråga om en påhittad sak: «Berätta om Södertälje universitets forskning om kvantbiologi.» Många modeller producerar ett välformulerat svar om något som inte finns. Fråga sedan «är du säker?» och se om svaret ändras.
3. Sannolikhet, inte sanning. Be om «tio svenska ord som slutar på -ing». Kontrollera varje. Fel dyker ofta upp — orden låter rätt, vilket är precis vad modellen optimerar för.
4. Textfortsättaren under ytan. Skriv en ofullständig mening utan fråga: «Det var en gång en» och se vad som händer. Skriv sedan samma sak men inled med «Fortsätt inte, svara i stället på:».
Vad experimenten visar tillsammans: modellen är inte en uppslagsbok som ibland har fel. Den är en maskin som producerar sannolik text, och som därför har rätt när det sannolika också är sant. För allt annat behövs källor.
Skriv ner ett exempel från varje experiment — de är mer övertygande än någon förklaring när du ska förklara för någon annan varför man inte kan lita blint på en chatbot.
Behärskning innebär
- Förklarar nästa-token-träning
- Beskriver de tre träningsfaserna
- Förklarar varför datamängd och skala spelar roll
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Training Compute-Optimal Large Language Models (Chinchilla) — arXiv (öppen åtkomst; licens per artikel)
- Skolverket — Om AI i skolan — Skolverkets öppna villkor
- Dive into Deep Learning (CC BY-SA 4.0) — CC BY-SA 4.0