Hoppa till innehållet
AI-grafen
D· AI-utvecklarevetenskaplig-metod· ca 45 min· grundläggande — ändras sällan· verifierad 2026-09-20

Mät AI:n rättvist

Kunna designa ett rättvist test av två AI-verktyg med samma frågor och facit.

Förkunskaper

Intuition

«Verktyg A är bättre än B» är bara ett påstående tills det mätts rättvist:

  1. Samma frågor till båda — minst 30, helst 100, blandade svårighetsgrader, skrivna innan du testar.
  2. Facit skrivet i förväg, av dig, inte av något av verktygen.
  3. Samma villkor: samma formulering, inga följdfrågor, samma dag.
  4. Rättning blind: du ska inte veta vilket verktyg som gav svaret när du rättar.
  5. Redovisa andel rätt och osäkerheten (±) och vilka sorters fel varje verktyg gjorde.

30 frågor ger ±8 procentenheter — skillnader mindre än så är brus.

Interaktivt

Mall:

#FrågaFacitAB
1……✔✘

Resultat: A 24/30 (80 % ± 7), B 21/30 (70 % ± 8). Överlappar → inte avgjort; men titta på vilka frågor: B missade 5 av 6 räknefrågor, A missade årtal. Det är mer användbart än totalsiffran.

Parad jämförelse: räkna fall där A rätt & B fel (7) mot B rätt & A fel (4). 7 mot 4 av 11 — fortfarande svagt. Det ärliga svaret är ofta «vi behöver fler frågor».

Behärskning innebär

  • Designar ett rättvist test av två AI-verktyg med samma frågor och facit
  • Redovisar resultat med osäkerhet och felkategorier

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser