E· Universitetsprakmodeller· ca 60 min· utvecklande· verifierad 2026-09-20
Flerspråkighet och svenska modeller
Kunna bedöma hur tokenisering och träningsdata påverkar prestanda på svenska.
Förkunskaper
Intuition
En modell tränad mest på engelska presterar sämre på svenska — men på specifika, mätbara sätt:
- Fler tokens per ord. Svenska sammansättningar («kunskapsgraf», «arbetsmarknadsutbildning») delas i många bitar. 1,5–2× fler tokens än motsvarande engelska text betyder högre kostnad och att mindre får plats i kontexten.
- Svagare faktakunskap om svenska förhållanden: lagar, myndigheter, historia, geografi.
- Språkliga glidningar: anglicismer, konstig ordföljd, direktöversatta uttryck.
- Cross-lingual transfer fungerar däremot förvånansvärt bra för resonemang — modellen kan lösa ett problem på svenska med förmågor den lärt sig på engelska.
Slutsats: anta ingenting. Mät på svenska.
Formellt
Utvärdera på svenska — en praktisk plan:
| Vad | Hur |
|---|---|
| Tokeniseringseffektivitet | tokens/ord på en representativ svensk text, jämför modeller |
| Faktakunskap | egna frågor om svenska förhållanden med facit |
| Språkkvalitet | mänsklig bedömning av flyt och idiomatik, blindad |
| Uppgiftsprestanda | din faktiska uppgift, på svenska data |
Alternativ när svenskan inte räcker till:
- Prompta på engelska, svara på svenska — fungerar ibland förvånansvärt bra.
- Finjustera på svensk domändata (LoRA räcker ofta för stil och terminologi).
- Nordiska/svenska modeller (GPT-SW3 från AI Sweden, KB-BERT/KB-Whisper från Kungliga biblioteket) — bättre tokenisering och svenska data, men oftast mindre modeller.
- RAG på svenska källor — löser faktakunskapen utan att röra modellen.
Det sista är oftast den bästa första åtgärden: billigast, mest kontrollerbart och löser det vanligaste problemet (fakta, inte språk).
Kod
from transformers import AutoTokenizer
text_sv = "Arbetsmarknadsutbildningen på Kungliga Tekniska högskolan startade i höstas."
text_en = "The labour market training programme at the Royal Institute of Technology started last autumn."
for namn in ["gpt2", "AI-Sweden-Models/gpt-sw3-356m"]:
tok = AutoTokenizer.from_pretrained(namn)
sv, en = len(tok(text_sv)["input_ids"]), len(tok(text_en)["input_ids"])
print(f"{namn:34s} sv {sv:3d} ({sv/len(text_sv.split()):.2f}/ord) en {en:3d}")
# gpt2 sv 27 (2.70/ord) en 17
# AI-Sweden-Models/gpt-sw3-356m sv 14 (1.40/ord) en 19
Samma mening, nästan dubbla kostnaden i en engelskcentrerad tokenizer. Över miljontals anrop är det pengar — och över ett kontextfönster är det innehåll som inte får plats.
Behärskning innebär
- Bedömer hur tokenisering och träningsdata påverkar svenska
- Utvärderar en modell på svenska i stället för att anta
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- AI Sweden — GPT-SW3 — fri läsning
- Kungliga biblioteket — KB-lab modeller — öppna modeller