Hoppa till innehållet
AI-grafen
E· Universitetsprakmodeller· ca 60 min· utvecklande· verifierad 2026-09-20

NLP på svenska: resurser och fallgropar

Kunna använda svenska korpusar och modeller och känna till deras begränsningar.

Förkunskaper

Intuition

Svenska resurser att känna till:

ResursVadKälla
KB-BERT, KB-Whisperencoder och taligenkänningKungliga biblioteket
GPT-SW3generativa modeller för nordiska språkAI Sweden
SUCbalanserad korpus med ordklasserSpråkbanken
TalbankendependensträdbankSpråkbanken
SweDN, SuperLimbenchmark-sviter för svenskaSpråkbanken
Riksdagens öppna dataanföranden och dokumentRiksdagen
Wikipedia sv~2,6 miljoner artiklarCC BY-SA

Tre svenska särdrag som faktiskt påverkar:

  1. Sammansättningar. «arbetsmarknadsutbildning» är ett ord. Tokenizern splittrar det i bitar och söksystem missar delarna.
  2. Rik morfologi. Bestämd form, genitiv, plural — teckenbaserade mått (chrF) och lemmatisering hjälper.
  3. Liten datamängd jämfört med engelska, både i förträning och i utvärderingssviter.

Formellt

Mät i stället för att anta. Fyra mätningar som avgör om en modell duger för svenska:

  1. Tokens per ord på representativ svensk text. En engelskcentrerad tokenizer ger 2,0–2,7; en nordisk 1,3–1,6. Det påverkar både kostnad och effektiv kontextlängd direkt.
  2. Faktakunskap om Sverige — egna frågor med facit (myndigheter, lagar, geografi, historia).
  3. Språkkvalitet — blindad mänsklig bedömning av flyt och idiomatik. Anglicismer och direktöversatta uttryck är vanliga.
  4. Din faktiska uppgift på svenska data. Det är det enda som avgör.

Vanliga fel i svenska NLP-projekt:

  • Att använda engelska stoppordslistor eller lemmatiserare.
  • Att jämföra mot engelska benchmark-siffror och anta att de gäller.
  • Att glömma att sammansättningar gör nyckelordssökning opålitlig — här hjälper delordsindexering eller hybrid med embeddings.
  • Att behandla «å», «ä», «ö» som specialtecken i normalisering.

När svenskan inte räcker: RAG mot svenska källor löser faktakunskap billigast; finjustering löser stil och terminologi; byte till en nordisk modell löser tokeniseringen.

Behärskning innebär

  • Använder svenska korpusar och modeller
  • Känner till deras begränsningar
  • Utvärderar på svenska i stället för att anta

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser