Hoppa till innehållet
AI-grafen
E· Universitetsprakmodeller· ca 60 min· utvecklande· verifierad 2026-09-20

Flerspråkighet och svenska modeller

Kunna bedöma hur tokenisering och träningsdata påverkar prestanda på svenska.

Förkunskaper

Intuition

En modell tränad mest på engelska presterar sämre på svenska — men på specifika, mätbara sätt:

  1. Fler tokens per ord. Svenska sammansättningar («kunskapsgraf», «arbetsmarknadsutbildning») delas i många bitar. 1,5–2× fler tokens än motsvarande engelska text betyder högre kostnad och att mindre får plats i kontexten.
  2. Svagare faktakunskap om svenska förhållanden: lagar, myndigheter, historia, geografi.
  3. Språkliga glidningar: anglicismer, konstig ordföljd, direktöversatta uttryck.
  4. Cross-lingual transfer fungerar däremot förvånansvärt bra för resonemang — modellen kan lösa ett problem på svenska med förmågor den lärt sig på engelska.

Slutsats: anta ingenting. Mät på svenska.

Formellt

Utvärdera på svenska — en praktisk plan:

VadHur
Tokeniseringseffektivitettokens/ord på en representativ svensk text, jämför modeller
Faktakunskapegna frågor om svenska förhållanden med facit
Språkkvalitetmänsklig bedömning av flyt och idiomatik, blindad
Uppgiftsprestandadin faktiska uppgift, på svenska data

Alternativ när svenskan inte räcker till:

  • Prompta på engelska, svara på svenska — fungerar ibland förvånansvärt bra.
  • Finjustera på svensk domändata (LoRA räcker ofta för stil och terminologi).
  • Nordiska/svenska modeller (GPT-SW3 från AI Sweden, KB-BERT/KB-Whisper från Kungliga biblioteket) — bättre tokenisering och svenska data, men oftast mindre modeller.
  • RAG på svenska källor — löser faktakunskapen utan att röra modellen.

Det sista är oftast den bästa första åtgärden: billigast, mest kontrollerbart och löser det vanligaste problemet (fakta, inte språk).

Kod

from transformers import AutoTokenizer

text_sv = "Arbetsmarknadsutbildningen på Kungliga Tekniska högskolan startade i höstas."
text_en = "The labour market training programme at the Royal Institute of Technology started last autumn."

for namn in ["gpt2", "AI-Sweden-Models/gpt-sw3-356m"]:
    tok = AutoTokenizer.from_pretrained(namn)
    sv, en = len(tok(text_sv)["input_ids"]), len(tok(text_en)["input_ids"])
    print(f"{namn:34s} sv {sv:3d} ({sv/len(text_sv.split()):.2f}/ord)  en {en:3d}")
# gpt2                               sv  27 (2.70/ord)  en  17
# AI-Sweden-Models/gpt-sw3-356m      sv  14 (1.40/ord)  en  19

Samma mening, nästan dubbla kostnaden i en engelskcentrerad tokenizer. Över miljontals anrop är det pengar — och över ett kontextfönster är det innehåll som inte får plats.

Behärskning innebär

  • Bedömer hur tokenisering och träningsdata påverkar svenska
  • Utvärderar en modell på svenska i stället för att anta

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser