Hoppa till innehållet
AI-grafen
E· Universitetevals-benchmarks· ca 60 min· utvecklande· verifierad 2026-09-20

Modellutvärdering

Kunna designa en utvärdering med rätt mått, hålla isär tränings- och testdata, och tolka konfidensintervall.

Förkunskaper

Intuition

En utvärdering svarar på en fråga: är modell A bättre än B för uppgift X, mätt som Y, på data som liknar produktionen? Varje del av meningen är ett designval.

  • Uppgift/data: testsetet ska likna det modellen möter — inte det som var lätt att samla.
  • Mått: kopplat till nytta (F1 för obalans, MAE i kronor, «löste uppgiften» för agenter). Ett mått räcker sällan; rapportera 2–3 och säg vilket som avgör.
  • Osäkerhet: n = 200 ger ±5 procentenheter. Utan intervall är siffran en anekdot.
  • Jämförelse: samma testfall för alla modeller → parad jämförelse (vinster/förluster per fall) är mycket känsligare än två separata medelvärden.

Vanliga fel: testdata läckt in i träning; välja bästa av tio körningar; byta mått när det första såg dåligt ut; utvärdera på data från förra året.

Kod

import numpy as np

def bootstrap_ci(x, stat=np.mean, n=2000, alpha=0.05, seed=0):
    rng = np.random.default_rng(seed); x = np.asarray(x)
    s = [stat(rng.choice(x, len(x), replace=True)) for _ in range(n)]
    return stat(x), np.percentile(s, 100 * alpha / 2), np.percentile(s, 100 * (1 - alpha / 2))

ratt_a = np.array([1,1,0,1,1,1,0,1,1,1,0,1,1,1,1,0,1,1,1,1])   # per testfall
ratt_b = np.array([1,0,0,1,1,1,0,1,0,1,0,1,1,1,1,0,1,0,1,1])
print(bootstrap_ci(ratt_a))                  # (0.8, 0.6, 0.95)
print(bootstrap_ci(ratt_b))                  # (0.7, 0.5, 0.9)  — intervallen överlappar

# parad jämförelse: samma fall
diff = ratt_a - ratt_b
print(bootstrap_ci(diff))                    # (0.1, -0.05, 0.25) → inte avgjort med n=20
print("A vann", int((diff == 1).sum()), "B vann", int((diff == -1).sum()))

För LLM-utdata utan facit: LLM-som-domare med tydlig rubrik, parvis (A vs B, slumpad ordning), och kontroll av domaren mot mänskliga bedömningar på ett stickprov.

Behärskning innebär

  • Designar en utvärdering med rätt mått och separat testdata
  • Rapporterar konfidensintervall och jämför modeller parat
  • Känner igen vanliga fel: läckage, cherry-picking, fel mått

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser