Hoppa till innehållet
AI-grafen
E· UniversitetLaboration· ca 60 min· container

Labb: bygg en eval-harness

Bygga en harness som kör en modell (här: en regelbaserad funktion) mot testfall med facit, räknar mått, hittar regressioner och skriver en rapport.

Lär ut: eval-harness · Kräver: modellutvarderingtestning

Teori

En eval är en lista fall {input, expected} + ett mått (exakt match, normaliserad match, numerisk tolerans). Harnessen ska vara deterministisk och jämförbar mellan versioner.

Deluppgifter

  1. load_cases — `load_cases(path)` läser JSONL till en lista dicts.
  2. score — `score(pred, expected, kind)` för kind exact|normalized|numeric(tol 1e-6).
  3. run_eval — `run_eval(model_fn, cases)` → {accuracy, n, failures:[…]}; `compare(a, b)` → regressioner (fall som gick från rätt till fel).

Evals: baseline-acc (accuracy >= 0.8)

Logga in för att köra laborationen.

Förväntade resultat

Baslinjemodellen (baseline) får ≥ 0,8 på fallen; compare hittar exakt de fall som regredierat.

Vanliga fel

  • Normaliserar inte whitespace/skiftläge i 'normalized'.
  • Jämför flyttal med ==.
  • Rapporten är inte deterministisk (set-ordning).