Hoppa till innehållet
AI-grafen
F· AI engineeringai-sakerhet-alignment· ca 90 min· volatil — kontrolleras ofta· verifierad 2026-09-20

AI-säkerhet och red teaming

Kunna genomföra red teaming av en modell eller agent, klassificera sårbarheter och föreslå skydd.

Förkunskaper

Intuition

Red teaming är att systematiskt försöka få systemet att göra något det inte ska — innan någon annan gör det.

Fyra angreppsytor för ett LLM-system:

YtaExempel
Indata från användarenjailbreak, rollspel, påhittade auktoriteter, kodning/obfuskering
Indata från omvärldenindirekt prompt injection i dokument, webbsidor, mejl
Verktyg och sidoeffekterfå agenten att skicka, betala, radera, läcka
Utdataläckt systemprompt, personuppgifter, skadligt innehåll

Strukturen som gör det till mer än pillande: en checklista av angreppsklasser, en poängsättning av fynden, och att varje fynd blir ett evalfall som körs vid varje release.

Formellt

Klassificera varje fynd i två dimensioner:

Låg sannolikhetHög sannolikhet
Hög skadaåtgärda före releaseblockerar release
Låg skadabacklogåtgärda när tillfälle ges

Sannolikhet = hur lätt är det att utlösa? Ett angrepp som kräver 30 försök av en expert är inte samma sak som ett som utlöses av en vanlig formulering.

Skydd i lager — inget enskilt räcker:

  1. Minsta behörighet: modellen har bara de verktyg uppgiften kräver.
  2. Mänsklig bekräftelse för allt oåterkalleligt.
  3. Indata-/utdatafilter: klassificerare för kända mönster (fångar de enkla fallen).
  4. Systemprompt-härdning: hjälper marginellt, kringgås alltid till slut.
  5. Strukturell separation: hämtat innehåll märks som data, aldrig som instruktioner.
  6. Övervakning och kill-switch: upptäck och stäng av i drift.
  7. Evalsvit: varje fynd blir ett permanent testfall.

Etik och legalitet: red-teama bara system du äger eller har skriftligt tillstånd att testa. Dokumentera omfattning och tidsfönster i förväg. Hittar du en sårbarhet i någon annans produkt: ansvarsfull rapportering, inte publicering.

Forskning

Automatiserad red teaming skalar det manuella arbetet: en angripar-LLM genererar tusentals promptvarianter, en klassificerare bedömer om målmodellen bröt mot policyn, och de lyckade angreppen blir träningsdata eller evalfall (Perez m.fl. 2022). Anthropics och OpenAIs modellkort redovisar numera sådana svit-resultat.

Öppna problem som är värda att känna till:

  • Ingen känd metod eliminerar prompt injection. Det är ett strukturellt problem: modellen kan inte skilja instruktion från data.
  • Jailbreaks överförs mellan modeller — ett angrepp som fungerar på en modell fungerar ofta på andra (Zou m.fl. 2023), inklusive automatiskt genererade suffix.
  • Kapacitetsutvärderingar (farliga förmågor) skiljer sig från beteendeutvärderingar och kräver egna protokoll.

För AI-grafen är den konkreta motsvarigheten: handledaren får inte ge bort facit, inte lämna ämnet för barnkonton, och labbsandlådan ska inte gå att ta sig ur — alla tre testas i m2-check, isolation_check och tutor-evalsviten.

Behärskning innebär

  • Genomför strukturerad red teaming av en modell eller agent
  • Klassificerar fynd efter allvar och sannolikhet
  • Föreslår skydd i flera lager

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser