E· Universitetsprakmodeller· ca 60 min· utvecklande· verifierad 2026-09-20
NLP på svenska: resurser och fallgropar
Kunna använda svenska korpusar och modeller och känna till deras begränsningar.
Förkunskaper
Intuition
Svenska resurser att känna till:
| Resurs | Vad | Källa |
|---|---|---|
| KB-BERT, KB-Whisper | encoder och taligenkänning | Kungliga biblioteket |
| GPT-SW3 | generativa modeller för nordiska språk | AI Sweden |
| SUC | balanserad korpus med ordklasser | Språkbanken |
| Talbanken | dependensträdbank | Språkbanken |
| SweDN, SuperLim | benchmark-sviter för svenska | Språkbanken |
| Riksdagens öppna data | anföranden och dokument | Riksdagen |
| Wikipedia sv | ~2,6 miljoner artiklar | CC BY-SA |
Tre svenska särdrag som faktiskt påverkar:
- Sammansättningar. «arbetsmarknadsutbildning» är ett ord. Tokenizern splittrar det i bitar och söksystem missar delarna.
- Rik morfologi. Bestämd form, genitiv, plural — teckenbaserade mått (chrF) och lemmatisering hjälper.
- Liten datamängd jämfört med engelska, både i förträning och i utvärderingssviter.
Formellt
Mät i stället för att anta. Fyra mätningar som avgör om en modell duger för svenska:
- Tokens per ord på representativ svensk text. En engelskcentrerad tokenizer ger 2,0–2,7; en nordisk 1,3–1,6. Det påverkar både kostnad och effektiv kontextlängd direkt.
- Faktakunskap om Sverige — egna frågor med facit (myndigheter, lagar, geografi, historia).
- Språkkvalitet — blindad mänsklig bedömning av flyt och idiomatik. Anglicismer och direktöversatta uttryck är vanliga.
- Din faktiska uppgift på svenska data. Det är det enda som avgör.
Vanliga fel i svenska NLP-projekt:
- Att använda engelska stoppordslistor eller lemmatiserare.
- Att jämföra mot engelska benchmark-siffror och anta att de gäller.
- Att glömma att sammansättningar gör nyckelordssökning opålitlig — här hjälper delordsindexering eller hybrid med embeddings.
- Att behandla «å», «ä», «ö» som specialtecken i normalisering.
När svenskan inte räcker: RAG mot svenska källor löser faktakunskap billigast; finjustering löser stil och terminologi; byte till en nordisk modell löser tokeniseringen.
Behärskning innebär
- Använder svenska korpusar och modeller
- Känner till deras begränsningar
- Utvärderar på svenska i stället för att anta
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- Språkbanken Text — öppna resurser, licens per korpus
- AI Sweden — GPT-SW3 — fri läsning
- Kungliga biblioteket — KB-lab — öppna modeller