Urval: vem har vi frågat?
Kunna förklara varför ett skevt urval ger fel svar — och koppla till skev träningsdata.
Förkunskaper
Vardagsförklaring
Du vill veta vad hela skolan tycker om skolmaten. Du kan inte fråga alla — så du frågar några. Det kallas ett urval.
Men vilka du frågar avgör svaret.
| Om du frågar | Får du veta |
|---|---|
| Bara de som står i matkön | vad de som äter maten tycker — inte de som tagit med matlåda |
| Bara din klass | vad din klass tycker |
| Bara de som räcker upp handen | vad de som gillar att svara tycker |
| Bara på fredagar | vad folk tycker om fredagsmaten |
Ett urval som inte speglar helheten kallas skevt. Svaret blir fel — inte för att någon ljugit, utan för att fel personer fick frågan.
Ett bra urval: slumpmässigt valda personer ur hela gruppen. Dra namn ur en hatt. Då blir alla sorter representerade ungefär lika mycket som de finns.
Intuition
Tre sätt ett urval blir skevt:
| Fel | Vad som händer |
|---|---|
| Fel grupp tillfrågad | du frågar dem som är lätta att nå |
| Alla svarar inte | de som svarar skiljer sig från dem som inte gör det |
| Överlevnadsurval | du ser bara dem som är kvar |
Det tredje är det luriga. Ett klassiskt exempel: under andra världskriget undersökte man var flygplan hade flest kulhål för att förstärka rustningen där. Men man kunde bara undersöka planen som kom tillbaka. Kulhålen fanns alltså på de ställen där ett plan kan träffas och ändå överleva — och rustningen skulle sättas på de ställen där det inte fanns hål.
Samma sak gäller AI. En AI lär sig från data — och datan är ett urval.
| Om AI:n tränats på | Fungerar den sämre för |
|---|---|
| Mest engelsk text | svenska, och ännu sämre för minoritetsspråk |
| Mest ljushyade ansikten | mörkhyade ansikten |
| Mest mäns röster | kvinnors och barns röster |
| Data från en stad | landsbygden |
Det här är inte hypotetiskt. Tidiga ansiktsigenkänningssystem hade mycket högre felfrekvens för mörkhyade kvinnor än för ljushyade män — därför att träningsdatan var skev.
Frågan att alltid ställa om ett AI-system: vilka fanns i datan, och vilka fanns inte?
Interaktivt
Uppgift 1 — hitta skevheten.
För varje undersökning: vem missas, och hur påverkar det svaret?
| # | Undersökning | Vem missas? |
|---|---|---|
| 1 | «Hur ofta cyklar du?» — frågat vid cykelstället | |
| 2 | «Vad tycker du om appen?» — enkät i appen | |
| 3 | «Hur mår ni?» — frågat i klassrummet på lektionstid | |
| 4 | «Är kollektivtrafiken bra?» — frågat på bussen | |
| 5 | «Hur nöjd är du?» — mejlenkät till alla kunder |
Facit: 1 de som inte cyklar · 2 de som slutat använda appen (och det är de mest missnöjda) · 3 de som är frånvarande — ofta de som mår sämst · 4 de som slutat åka · 5 de som inte orkar svara, vilket oftast är de likgiltiga och de mest upptagna.
Nummer 2 och 3 är de mest lärorika: i båda fallen saknas systematiskt de som skulle gett det mest kritiska svaret.
Uppgift 2 — gör ett bra urval.
Du ska ta reda på vad skolan tycker om skolmaten. Skriv ner:
- Hur väljer du vilka du frågar?
- Hur många behöver du fråga?
- Vad gör du med dem som inte vill svara?
- Hur kontrollerar du att ditt urval liknar hela skolan? (Jämför till exempel andelen per årskurs.)
Uppgift 3 — koppla till AI.
Tänk dig en AI som ska känna igen svenska ord i tal. Om den mest tränats på vuxna från Stockholm — för vilka kommer den fungera sämre? Skriv tre grupper och motivera.
Behärskning innebär
- Förklarar vad ett representativt urval är
- Känner igen skeva urval
- Kopplar till skev träningsdata i AI
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- Statistiska centralbyrån — myndighetsmaterial
- CS Unplugged (CC BY-SA 4.0) — CC BY-SA 4.0
- Buolamwini & Gebru — Gender Shades — PMLR öppen åtkomst