E· Universitetevals-benchmarks· ca 60 min· utvecklande· verifierad 2026-09-20
Benchmarks: vad de mäter och missar
Kunna läsa MMLU-, HumanEval- och liknande resultat kritiskt.
Förkunskaper
- EModellutvärderingkrävs
Intuition
| Benchmark | Mäter | Fallgrop |
|---|---|---|
| MMLU | flerval i 57 akademiska ämnen | memorering, känslig för prompt-format och n-shot |
| GSM8K / MATH | matematiska ordproblem | kontaminering, kedjeresonemang ändrar allt |
| HumanEval / MBPP | Python-funktioner mot tester | små, kända problem — mättade |
| MT-Bench | flervändiga dialoger bedömda av GPT-4 | domarens partiskhet (längd, stil) |
| Chatbot Arena | mänskliga parvisa preferenser (Elo) | mäter «gillas», inte «rätt» |
| SWE-bench | lösa riktiga GitHub-issues | dyrt, agent-scaffold påverkar mer än modellen |
Läs alltid: vilken version, n-shot, prompt, hur svaret parsades, om testdatan var på webben före modellens träningsdata (kontaminering). Två procentenheter på MMLU säger ingenting om er kundtjänst. Den enda benchmark som säkert gäller er uppgift är den ni bygger själva.
Kod
# Rapportera reproducerbart: exakt konfiguration
config = {
"benchmark": "gsm8k", "split": "test", "n": 1319,
"shots": 8, "prompt_style": "chain-of-thought", "answer_parse": "regex r'#### (\\-?\\d+)'",
"model": "qwen2.5-7b-instruct", "temperature": 0, "max_tokens": 512,
"seed": 0, "harness": "lm-eval 0.4.5",
}
# Med en annan parse-regex kan samma modell få 5 pe annorlunda.
# Kontamineringskoll (grov): n-gram-överlapp mellan testfrågor och träningskorpus
def ngram_overlap(test, corpus_ngrams, n=13):
toks = test.split()
grams = {" ".join(toks[i:i+n]) for i in range(len(toks) - n + 1)}
return len(grams & corpus_ngrams) / max(1, len(grams))
Behärskning innebär
- Beskriver vad MMLU, HumanEval, GSM8K, MT-Bench och Arena mäter
- Läser benchmarkresultat kritiskt: kontaminering, prompt-format, n-shot
- Avgör vilken benchmark som är relevant för en given uppgift
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Measuring Massive Multitask Language Understanding — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena — arXiv (öppen åtkomst; licens per artikel)
- Hugging Face Open LLM Leaderboard — fri läsning