Hoppa till innehållet
AI-grafen
E· Universitetevals-benchmarks· ca 60 min· utvecklande· verifierad 2026-09-20

Benchmarks: vad de mäter och missar

Kunna läsa MMLU-, HumanEval- och liknande resultat kritiskt.

Förkunskaper

Intuition

BenchmarkMäterFallgrop
MMLUflerval i 57 akademiska ämnenmemorering, känslig för prompt-format och n-shot
GSM8K / MATHmatematiska ordproblemkontaminering, kedjeresonemang ändrar allt
HumanEval / MBPPPython-funktioner mot testersmå, kända problem — mättade
MT-Benchflervändiga dialoger bedömda av GPT-4domarens partiskhet (längd, stil)
Chatbot Arenamänskliga parvisa preferenser (Elo)mäter «gillas», inte «rätt»
SWE-benchlösa riktiga GitHub-issuesdyrt, agent-scaffold påverkar mer än modellen

Läs alltid: vilken version, n-shot, prompt, hur svaret parsades, om testdatan var på webben före modellens träningsdata (kontaminering). Två procentenheter på MMLU säger ingenting om er kundtjänst. Den enda benchmark som säkert gäller er uppgift är den ni bygger själva.

Kod

# Rapportera reproducerbart: exakt konfiguration
config = {
  "benchmark": "gsm8k", "split": "test", "n": 1319,
  "shots": 8, "prompt_style": "chain-of-thought", "answer_parse": "regex r'#### (\\-?\\d+)'",
  "model": "qwen2.5-7b-instruct", "temperature": 0, "max_tokens": 512,
  "seed": 0, "harness": "lm-eval 0.4.5",
}
# Med en annan parse-regex kan samma modell få 5 pe annorlunda.

# Kontamineringskoll (grov): n-gram-överlapp mellan testfrågor och träningskorpus
def ngram_overlap(test, corpus_ngrams, n=13):
    toks = test.split()
    grams = {" ".join(toks[i:i+n]) for i in range(len(toks) - n + 1)}
    return len(grams & corpus_ngrams) / max(1, len(grams))

Behärskning innebär

  • Beskriver vad MMLU, HumanEval, GSM8K, MT-Bench och Arena mäter
  • Läser benchmarkresultat kritiskt: kontaminering, prompt-format, n-shot
  • Avgör vilken benchmark som är relevant för en given uppgift

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser