Hoppa till innehållet
AI-grafen
G· Frontier Labai-sakerhet-alignment· ca 120 min· volatil — kontrolleras ofta· verifierad 2026-09-20

Utvärdering av farliga förmågor

Kunna läsa och kritisera safety-evals och förstå deras metodproblem.

Förkunskaper

Intuition

Farliga förmågor utvärderas för att svara på en fråga före lansering: kan den här modellen hjälpa någon åstadkomma allvarlig skada? Områdena är i praktiken: cyberoperationer, biologi/kemi, storskalig manipulation, och självständig replikering eller resursanskaffning.

Två saker som ofta blandas ihop:

  • Förmåga: kan modellen, om någon verkligen anstränger sig?
  • Benägenhet: gör den det, spontant, i normal användning?

Safety-evals mäter främst det första — och det är rätt fokus, eftersom skyddsräcken kan kringgås medan förmågan finns kvar.

Forskning

Metodproblemen, i tur och ordning:

  1. Eliciteringsgapet. Ett negativt resultat betyder «vi kunde inte få modellen att göra det», inte «modellen kan inte». Med bättre prompter, finjustering, verktyg eller scaffolding stiger prestandan ofta dramatiskt. Seriösa utvärderingar rapporterar därför vilken elicitering som användes och behandlar resultatet som en undre gräns.
  2. Taktransparens. Om modellen presterar 60 % på ett tak-begränsat test vet man inte om den «egentligen» kan mer. Uppgifter måste ha huvudutrymme.
  3. Kontaminering. Publicerade safety-benchmarks hamnar i träningsdata precis som andra.
  4. Proxyuppgifter. Av uppenbara skäl testas inte verklig skada, utan proxyuppgifter. Hur väl de förutsäger verklig kapacitet är i stort sett oprövat.
  5. Situationsmedvetenhet. En modell kan bete sig annorlunda när den tror sig bli utvärderad — vilket är dokumenterat och gör negativa resultat svårare att tolka.

Ansvarsfulla skalningspolicyer (Anthropic RSP, OpenAI Preparedness, Googles Frontier Safety Framework) knyter tröskelvärden i sådana evals till konkreta åtgärder: ytterligare skydd, begränsad utrullning eller att träningen pausas. Det gör utvärderingsmetodiken till en styrningsfråga, inte bara en teknisk.

Vad du kan göra själv: läs ett modellkorts safety-avsnitt och ställ fem frågor — vilken elicitering, vilka trösklar, vem satte dem, vad hade hänt vid överskridande, och finns det oberoende granskning?

Behärskning innebär

  • Läser och kritiserar en safety-eval
  • Identifierar metodproblem: elicitering, kontaminering, taktransparens
  • Skiljer förmåga från benägenhet

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser