F· AI engineeringevals-benchmarks· ca 90 min· volatil — kontrolleras ofta· verifierad 2026-09-20
Mänsklig utvärdering och annotatörsöverensstämmelse
Kunna designa mänsklig utvärdering med rubriker och mäta överensstämmelse.
Förkunskaper
Intuition
Automatiska mått är proxys. Till slut måste människor bedöma om svaren är bra — och den bedömningen måste designas lika noga som ett experiment.
- Vad bedöms: absolut poäng (1–5 per kriterium) eller parvis (A vs B) — parvis är mer tillförlitligt och enklare.
- Rubrik: definitioner per poäng med exempel; pilot; revidera.
- Urval: slumpmässigt ur produktionsfördelningen, stratifierat på svårighet; n ≥ 200 för att se 5 pe.
- Blindning: bedömaren vet inte vilken modell; ordning slumpas.
- Bedömare: ≥ 2 per fall, mät κ/α; domänexperter för domänfrågor.
- Kostnad: 200 fall × 2 bedömare × 3 min ≈ 20 timmar. Planera.
Resultatet används två gånger: som facit nu, och för att kalibrera en LLM-domare så att nästa 10 000 fall kan bedömas automatiskt med känd felmarginal.
Kod
import random, csv
def bygg_bedomningsuppgift(fall, svar_a, svar_b, seed=0):
"""Skapar blindade, slumpade parvisa uppgifter. Nyckeln till vem som var A/B sparas separat."""
rng = random.Random(seed); uppgifter, nyckel = [], []
for i, (f, a, b) in enumerate(zip(fall, svar_a, svar_b)):
flip = rng.random() < 0.5
uppgifter.append({"id": i, "fraga": f, "svar_1": b if flip else a, "svar_2": a if flip else b})
nyckel.append({"id": i, "svar_1_ar": "B" if flip else "A"})
return uppgifter, nyckel
# efter bedömning: avslumpa och räkna
def resultat(bedomningar, nyckel):
k = {n["id"]: n["svar_1_ar"] for n in nyckel}; vinster = {"A": 0, "B": 0, "lika": 0}
for b in bedomningar: # b = {"id", "val": "1"|"2"|"lika"}
if b["val"] == "lika": vinster["lika"] += 1
else: vinster[k[b["id"]] if b["val"] == "1" else ("B" if k[b["id"]] == "A" else "A")] += 1
return vinster
Rapportera: vinstandel med KI, κ mellan bedömare, och andel «lika».
Behärskning innebär
- Designar mänsklig utvärdering med rubrik, urval och blindning
- Mäter annotatörsöverensstämmelse och rapporterar den
- Använder mänsklig data för att kalibrera automatiska domare
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- Wikipedia — Inter-rater reliability (CC BY-SA 4.0) — CC BY-SA 4.0
- arXiv — Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena — arXiv (öppen åtkomst; licens per artikel)