E· Universitetevals-benchmarks· ca 60 min· utvecklande· verifierad 2026-09-20
Modellutvärdering
Kunna designa en utvärdering med rätt mått, hålla isär tränings- och testdata, och tolka konfidensintervall.
Förkunskaper
Intuition
En utvärdering svarar på en fråga: är modell A bättre än B för uppgift X, mätt som Y, på data som liknar produktionen? Varje del av meningen är ett designval.
- Uppgift/data: testsetet ska likna det modellen möter — inte det som var lätt att samla.
- Mått: kopplat till nytta (F1 för obalans, MAE i kronor, «löste uppgiften» för agenter). Ett mått räcker sällan; rapportera 2–3 och säg vilket som avgör.
- Osäkerhet: n = 200 ger ±5 procentenheter. Utan intervall är siffran en anekdot.
- Jämförelse: samma testfall för alla modeller → parad jämförelse (vinster/förluster per fall) är mycket känsligare än två separata medelvärden.
Vanliga fel: testdata läckt in i träning; välja bästa av tio körningar; byta mått när det första såg dåligt ut; utvärdera på data från förra året.
Kod
import numpy as np
def bootstrap_ci(x, stat=np.mean, n=2000, alpha=0.05, seed=0):
rng = np.random.default_rng(seed); x = np.asarray(x)
s = [stat(rng.choice(x, len(x), replace=True)) for _ in range(n)]
return stat(x), np.percentile(s, 100 * alpha / 2), np.percentile(s, 100 * (1 - alpha / 2))
ratt_a = np.array([1,1,0,1,1,1,0,1,1,1,0,1,1,1,1,0,1,1,1,1]) # per testfall
ratt_b = np.array([1,0,0,1,1,1,0,1,0,1,0,1,1,1,1,0,1,0,1,1])
print(bootstrap_ci(ratt_a)) # (0.8, 0.6, 0.95)
print(bootstrap_ci(ratt_b)) # (0.7, 0.5, 0.9) — intervallen överlappar
# parad jämförelse: samma fall
diff = ratt_a - ratt_b
print(bootstrap_ci(diff)) # (0.1, -0.05, 0.25) → inte avgjort med n=20
print("A vann", int((diff == 1).sum()), "B vann", int((diff == -1).sum()))
För LLM-utdata utan facit: LLM-som-domare med tydlig rubrik, parvis (A vs B, slumpad ordning), och kontroll av domaren mot mänskliga bedömningar på ett stickprov.
Behärskning innebär
- Designar en utvärdering med rätt mått och separat testdata
- Rapporterar konfidensintervall och jämför modeller parat
- Känner igen vanliga fel: läckage, cherry-picking, fel mått
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- Wikipedia — Bootstrapping (statistics) (CC BY-SA 4.0) — CC BY-SA 4.0
- arXiv — Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena — arXiv (öppen åtkomst; licens per artikel)
Leder till
Del av målen (18)
- AI i produktion
- Finjustera en modell med LoRA
- Bygg ett NLP-system end-to-end
- Generativa modeller i djupet
- Bygg ett RAG-system som går att lita på
- Bygg en agent som går att lita på
- Finjustera och driva egna modeller
- Frontier Lab — självständigt forskningsprojekt
- AI-säkerhet i praktiken
- Evals i praktiken
- Bygg ett minnessystem för en agent
- Ansvarsfull AI i praktiken
- Bygg en AI-tjänst som håller i drift
- AI-tjänst i drift
- Reproducera ett paper
- Djup reinforcement learning
- Statistik för experiment
- Tolka en språkmodell