D· AI-utvecklarevetenskaplig-metod· ca 45 min· grundläggande — ändras sällan· verifierad 2026-09-20
Mät AI:n rättvist
Kunna designa ett rättvist test av två AI-verktyg med samma frågor och facit.
Förkunskaper
Intuition
«Verktyg A är bättre än B» är bara ett påstående tills det mätts rättvist:
- Samma frågor till båda — minst 30, helst 100, blandade svårighetsgrader, skrivna innan du testar.
- Facit skrivet i förväg, av dig, inte av något av verktygen.
- Samma villkor: samma formulering, inga följdfrågor, samma dag.
- Rättning blind: du ska inte veta vilket verktyg som gav svaret när du rättar.
- Redovisa andel rätt och osäkerheten (±) och vilka sorters fel varje verktyg gjorde.
30 frågor ger ±8 procentenheter — skillnader mindre än så är brus.
Interaktivt
Mall:
| # | Fråga | Facit | A | B |
|---|---|---|---|---|
| 1 | … | … | ✔ | ✘ |
Resultat: A 24/30 (80 % ± 7), B 21/30 (70 % ± 8). Överlappar → inte avgjort; men titta på vilka frågor: B missade 5 av 6 räknefrågor, A missade årtal. Det är mer användbart än totalsiffran.
Parad jämförelse: räkna fall där A rätt & B fel (7) mot B rätt & A fel (4). 7 mot 4 av 11 — fortfarande svagt. Det ärliga svaret är ofta «vi behöver fler frågor».
Behärskning innebär
- Designar ett rättvist test av två AI-verktyg med samma frågor och facit
- Redovisar resultat med osäkerhet och felkategorier
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- Skolverket — Om AI i skolan — Skolverkets öppna villkor
- Wikipedia — A/B testing (CC BY-SA 4.0) — CC BY-SA 4.0