E· UniversitetLaboration· ca 60 min· container
Labb: bygg en eval-harness
Bygga en harness som kör en modell (här: en regelbaserad funktion) mot testfall med facit, räknar mått, hittar regressioner och skriver en rapport.
Lär ut: eval-harness · Kräver: modellutvarderingtestning
Teori
En eval är en lista fall {input, expected} + ett mått (exakt match, normaliserad match, numerisk tolerans). Harnessen ska vara deterministisk och jämförbar mellan versioner.
Deluppgifter
- load_cases — `load_cases(path)` läser JSONL till en lista dicts.
- score — `score(pred, expected, kind)` för kind exact|normalized|numeric(tol 1e-6).
- run_eval — `run_eval(model_fn, cases)` → {accuracy, n, failures:[…]}; `compare(a, b)` → regressioner (fall som gick från rätt till fel).
Evals: baseline-acc (accuracy >= 0.8)
Logga in för att köra laborationen.
Förväntade resultat
Baslinjemodellen (baseline) får ≥ 0,8 på fallen; compare hittar exakt de fall som regredierat.
Vanliga fel
- Normaliserar inte whitespace/skiftläge i 'normalized'.
- Jämför flyttal med ==.
- Rapporten är inte deterministisk (set-ordning).