Hoppa till innehållet
AI-grafen
F· AI engineeringevals-benchmarks· ca 90 min· volatil — kontrolleras ofta· verifierad 2026-09-20

Mänsklig utvärdering och annotatörsöverensstämmelse

Kunna designa mänsklig utvärdering med rubriker och mäta överensstämmelse.

Förkunskaper

Intuition

Automatiska mått är proxys. Till slut måste människor bedöma om svaren är bra — och den bedömningen måste designas lika noga som ett experiment.

  • Vad bedöms: absolut poäng (1–5 per kriterium) eller parvis (A vs B) — parvis är mer tillförlitligt och enklare.
  • Rubrik: definitioner per poäng med exempel; pilot; revidera.
  • Urval: slumpmässigt ur produktionsfördelningen, stratifierat på svårighet; n ≥ 200 för att se 5 pe.
  • Blindning: bedömaren vet inte vilken modell; ordning slumpas.
  • Bedömare: ≥ 2 per fall, mät κ/α; domänexperter för domänfrågor.
  • Kostnad: 200 fall × 2 bedömare × 3 min ≈ 20 timmar. Planera.

Resultatet används två gånger: som facit nu, och för att kalibrera en LLM-domare så att nästa 10 000 fall kan bedömas automatiskt med känd felmarginal.

Kod

import random, csv

def bygg_bedomningsuppgift(fall, svar_a, svar_b, seed=0):
    """Skapar blindade, slumpade parvisa uppgifter. Nyckeln till vem som var A/B sparas separat."""
    rng = random.Random(seed); uppgifter, nyckel = [], []
    for i, (f, a, b) in enumerate(zip(fall, svar_a, svar_b)):
        flip = rng.random() < 0.5
        uppgifter.append({"id": i, "fraga": f, "svar_1": b if flip else a, "svar_2": a if flip else b})
        nyckel.append({"id": i, "svar_1_ar": "B" if flip else "A"})
    return uppgifter, nyckel

# efter bedömning: avslumpa och räkna
def resultat(bedomningar, nyckel):
    k = {n["id"]: n["svar_1_ar"] for n in nyckel}; vinster = {"A": 0, "B": 0, "lika": 0}
    for b in bedomningar:                      # b = {"id", "val": "1"|"2"|"lika"}
        if b["val"] == "lika": vinster["lika"] += 1
        else: vinster[k[b["id"]] if b["val"] == "1" else ("B" if k[b["id"]] == "A" else "A")] += 1
    return vinster

Rapportera: vinstandel med KI, κ mellan bedömare, och andel «lika».

Behärskning innebär

  • Designar mänsklig utvärdering med rubrik, urval och blindning
  • Mäter annotatörsöverensstämmelse och rapporterar den
  • Använder mänsklig data för att kalibrera automatiska domare

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser