Hoppa till innehållet
AI-grafen
F· AI engineeringevals-benchmarks· ca 90 min· volatil — kontrolleras ofta· verifierad 2026-09-20

Långtidsevaluering av agenter

Kunna designa evals som mäter förbättring över många sessioner, inte bara per svar.

Förkunskaper

Intuition

En agent med minne ska bli bättre för dig över tid: komma ihåg dina preferenser, inte upprepa misstag, bygga på tidigare arbete. Ett eval per svar ser inte det. Du behöver sessionsserier.

Upplägg:

  • Simulerade användare med dold profil (mål, preferenser, kunskap) som interagerar i 10–50 sessioner. Mät om agenten lärt sig profilen: färre frågor, rätt anpassning, inga upprepade fel.
  • Minnesprober: efter session k, fråga om något från session j < k. Mät recall och om agenten använder det oombedd.
  • Mått över tid: kurva av uppgiftsframgång per session — lutningen är det intressanta.
  • Skadekontroll: falska minnen, förväxling mellan användare, minne som gör agenten sämre (låser fast en missuppfattning).
  • Kontroll: samma agent utan minne. Skillnaden är minnets värde.

I AI-grafen är den naturliga metriken «behärskning per timme» över veckor, inte poäng per övning.

Kod

import numpy as np

def kor_serie(agent, profil, n_sessioner, uppgifter, rng):
    """Returnerar framgång per session och minnesprobe-träffar."""
    framgang, prober = [], []
    for k in range(n_sessioner):
        u = uppgifter[k % len(uppgifter)]
        svar = agent.session(u, simulerad_anvandare(profil, rng))
        framgang.append(u.bedom(svar))
        if k > 0:
            fakta = profil.fakta_avslojat_i(session=rng.integers(0, k))
            prober.append(fakta.lower() in agent.fraga(f"Vad vet du om {fakta.amne}?").lower())
    return np.array(framgang), np.array(prober)

def lutning(y):
    x = np.arange(len(y)); return float(np.polyfit(x, y, 1)[0])

# rapport: lutning med minne vs utan, probe-recall, andel falska minnen (probe om fakta som ALDRIG sagts)

Behärskning innebär

  • Designar evals som mäter förbättring över många sessioner
  • Skiljer per-svar-kvalitet från långsiktig nytta
  • Hanterar drift, minne och användarberoende i mätningen

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser