Bygg en egen benchmark
Kunna designa, validera och publicera en benchmark med tydlig mätdomän.
Förkunskaper
Intuition
En benchmark är ett mätinstrument. Som alla instrument måste den ha en definierad mätdomän, kalibrering och kända felkällor.
Bygg:
- Mätdomän (en mening): «förmågan att besvara frågor om svensk gymnasiematematik med korrekt slutsvar». Allt utanför är utanför.
- Fallkonstruktion: källa (skrivna av experter / härledda ur läromedel med licens / syntetiska + granskade), mall, svårighetsnivåer, ≥ 300 fall. Facit med annotatörsöverensstämmelse (κ) och adjudicering.
- Mått + skript: deterministisk parse, normalisering, ett kommando som ger siffran.
- Validering: kör slump, majoritet, en enkel modell, två LLM:er. Bra benchmark: spridning mellan modeller, inget tak, inga fall som alla klarar eller ingen klarar (utom avsiktligt).
- Kontamineringsskydd: privat testdel, kanariesträngar, publiceringsdatum, licens som förbjuder träning.
- Publicering: versionsnummer, datakort (källa, licens, bias, avsedd användning), evalskript, leaderboard med konfiguration per rad.
AI-grafen exponerar egna benchmarks (/benchmarks) på just detta sätt: labbarnas evals är fall, körningar i sandlådan är mätningen.
Forskning
Kända fel i publicerade benchmarks: felaktiga facit (MMLU har flera procent fel svar i vissa ämnen), tvetydiga frågor, kontaminering, kulturell/ språklig skevhet, mättnad (HumanEval), och att leaderboard-toppen drivs av prompt-trixande snarare än modellförmåga. Motmedel i litteraturen: dynamiska benchmarks (Dynabench), «living benchmarks» med rotation (LiveBench), privata testset med evalserver (SWE-bench Verified), parvisa arenor (Chatbot Arena) — var och en med egna svagheter (Elo-drift, användarurval).
En svensk benchmark för AI-lärande skulle behöva: fall per nivå A–G, mätdomän «förklara/rätta/handleda utan att ge bort lösningen», mänsklig kalibrering med lärare och elever, och rotation varje termin.
Behärskning innebär
- Definierar mätdomän, fallkonstruktion och facit med annotatörsöverensstämmelse
- Validerar benchmarken: svårighetsspridning, kontamineringsskydd, baslinjer
- Publicerar med licens, versionering och evalskript
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Dynabench: Rethinking Benchmarking in NLP — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Datasheets for Datasets — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Are We Done with MMLU? — arXiv (öppen åtkomst; licens per artikel)