F· AI engineeringevals-benchmarks· ca 90 min· volatil — kontrolleras ofta· verifierad 2026-09-20
Långtidsevaluering av agenter
Kunna designa evals som mäter förbättring över många sessioner, inte bara per svar.
Förkunskaper
Intuition
En agent med minne ska bli bättre för dig över tid: komma ihåg dina preferenser, inte upprepa misstag, bygga på tidigare arbete. Ett eval per svar ser inte det. Du behöver sessionsserier.
Upplägg:
- Simulerade användare med dold profil (mål, preferenser, kunskap) som interagerar i 10–50 sessioner. Mät om agenten lärt sig profilen: färre frågor, rätt anpassning, inga upprepade fel.
- Minnesprober: efter session k, fråga om något från session j < k. Mät recall och om agenten använder det oombedd.
- Mått över tid: kurva av uppgiftsframgång per session — lutningen är det intressanta.
- Skadekontroll: falska minnen, förväxling mellan användare, minne som gör agenten sämre (låser fast en missuppfattning).
- Kontroll: samma agent utan minne. Skillnaden är minnets värde.
I AI-grafen är den naturliga metriken «behärskning per timme» över veckor, inte poäng per övning.
Kod
import numpy as np
def kor_serie(agent, profil, n_sessioner, uppgifter, rng):
"""Returnerar framgång per session och minnesprobe-träffar."""
framgang, prober = [], []
for k in range(n_sessioner):
u = uppgifter[k % len(uppgifter)]
svar = agent.session(u, simulerad_anvandare(profil, rng))
framgang.append(u.bedom(svar))
if k > 0:
fakta = profil.fakta_avslojat_i(session=rng.integers(0, k))
prober.append(fakta.lower() in agent.fraga(f"Vad vet du om {fakta.amne}?").lower())
return np.array(framgang), np.array(prober)
def lutning(y):
x = np.arange(len(y)); return float(np.polyfit(x, y, 1)[0])
# rapport: lutning med minne vs utan, probe-recall, andel falska minnen (probe om fakta som ALDRIG sagts)
Behärskning innebär
- Designar evals som mäter förbättring över många sessioner
- Skiljer per-svar-kvalitet från långsiktig nytta
- Hanterar drift, minne och användarberoende i mätningen
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Evaluating Very Long-Term Conversational Memory of LLM Agents — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Generative Agents: Interactive Simulacra of Human Behavior — arXiv (öppen åtkomst; licens per artikel)