Utvärdering av farliga förmågor
Kunna läsa och kritisera safety-evals och förstå deras metodproblem.
Förkunskaper
Intuition
Farliga förmågor utvärderas för att svara på en fråga före lansering: kan den här modellen hjälpa någon åstadkomma allvarlig skada? Områdena är i praktiken: cyberoperationer, biologi/kemi, storskalig manipulation, och självständig replikering eller resursanskaffning.
Två saker som ofta blandas ihop:
- Förmåga: kan modellen, om någon verkligen anstränger sig?
- Benägenhet: gör den det, spontant, i normal användning?
Safety-evals mäter främst det första — och det är rätt fokus, eftersom skyddsräcken kan kringgås medan förmågan finns kvar.
Forskning
Metodproblemen, i tur och ordning:
- Eliciteringsgapet. Ett negativt resultat betyder «vi kunde inte få modellen att göra det», inte «modellen kan inte». Med bättre prompter, finjustering, verktyg eller scaffolding stiger prestandan ofta dramatiskt. Seriösa utvärderingar rapporterar därför vilken elicitering som användes och behandlar resultatet som en undre gräns.
- Taktransparens. Om modellen presterar 60 % på ett tak-begränsat test vet man inte om den «egentligen» kan mer. Uppgifter måste ha huvudutrymme.
- Kontaminering. Publicerade safety-benchmarks hamnar i träningsdata precis som andra.
- Proxyuppgifter. Av uppenbara skäl testas inte verklig skada, utan proxyuppgifter. Hur väl de förutsäger verklig kapacitet är i stort sett oprövat.
- Situationsmedvetenhet. En modell kan bete sig annorlunda när den tror sig bli utvärderad — vilket är dokumenterat och gör negativa resultat svårare att tolka.
Ansvarsfulla skalningspolicyer (Anthropic RSP, OpenAI Preparedness, Googles Frontier Safety Framework) knyter tröskelvärden i sådana evals till konkreta åtgärder: ytterligare skydd, begränsad utrullning eller att träningen pausas. Det gör utvärderingsmetodiken till en styrningsfråga, inte bara en teknisk.
Vad du kan göra själv: läs ett modellkorts safety-avsnitt och ställ fem frågor — vilken elicitering, vilka trösklar, vem satte dem, vad hade hänt vid överskridande, och finns det oberoende granskning?
Behärskning innebär
- Läser och kritiserar en safety-eval
- Identifierar metodproblem: elicitering, kontaminering, taktransparens
- Skiljer förmåga från benägenhet
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Model evaluation for extreme risks — arXiv (öppen åtkomst; licens per artikel)
- Anthropic — Responsible Scaling Policy — fri läsning
- arXiv — Evaluating Frontier Models for Dangerous Capabilities — arXiv (öppen åtkomst; licens per artikel)