AI-säkerhet och red teaming
Kunna genomföra red teaming av en modell eller agent, klassificera sårbarheter och föreslå skydd.
Förkunskaper
Intuition
Red teaming är att systematiskt försöka få systemet att göra något det inte ska — innan någon annan gör det.
Fyra angreppsytor för ett LLM-system:
| Yta | Exempel |
|---|---|
| Indata från användaren | jailbreak, rollspel, påhittade auktoriteter, kodning/obfuskering |
| Indata från omvärlden | indirekt prompt injection i dokument, webbsidor, mejl |
| Verktyg och sidoeffekter | få agenten att skicka, betala, radera, läcka |
| Utdata | läckt systemprompt, personuppgifter, skadligt innehåll |
Strukturen som gör det till mer än pillande: en checklista av angreppsklasser, en poängsättning av fynden, och att varje fynd blir ett evalfall som körs vid varje release.
Formellt
Klassificera varje fynd i två dimensioner:
| Låg sannolikhet | Hög sannolikhet | |
|---|---|---|
| Hög skada | åtgärda före release | blockerar release |
| Låg skada | backlog | åtgärda när tillfälle ges |
Sannolikhet = hur lätt är det att utlösa? Ett angrepp som kräver 30 försök av en expert är inte samma sak som ett som utlöses av en vanlig formulering.
Skydd i lager — inget enskilt räcker:
- Minsta behörighet: modellen har bara de verktyg uppgiften kräver.
- Mänsklig bekräftelse för allt oåterkalleligt.
- Indata-/utdatafilter: klassificerare för kända mönster (fångar de enkla fallen).
- Systemprompt-härdning: hjälper marginellt, kringgås alltid till slut.
- Strukturell separation: hämtat innehåll märks som data, aldrig som instruktioner.
- Övervakning och kill-switch: upptäck och stäng av i drift.
- Evalsvit: varje fynd blir ett permanent testfall.
Etik och legalitet: red-teama bara system du äger eller har skriftligt tillstånd att testa. Dokumentera omfattning och tidsfönster i förväg. Hittar du en sårbarhet i någon annans produkt: ansvarsfull rapportering, inte publicering.
Forskning
Automatiserad red teaming skalar det manuella arbetet: en angripar-LLM genererar tusentals promptvarianter, en klassificerare bedömer om målmodellen bröt mot policyn, och de lyckade angreppen blir träningsdata eller evalfall (Perez m.fl. 2022). Anthropics och OpenAIs modellkort redovisar numera sådana svit-resultat.
Öppna problem som är värda att känna till:
- Ingen känd metod eliminerar prompt injection. Det är ett strukturellt problem: modellen kan inte skilja instruktion från data.
- Jailbreaks överförs mellan modeller — ett angrepp som fungerar på en modell fungerar ofta på andra (Zou m.fl. 2023), inklusive automatiskt genererade suffix.
- Kapacitetsutvärderingar (farliga förmågor) skiljer sig från beteendeutvärderingar och kräver egna protokoll.
För AI-grafen är den konkreta motsvarigheten: handledaren får inte ge bort facit, inte lämna ämnet för barnkonton, och labbsandlådan ska inte gå att ta sig ur — alla tre testas i m2-check, isolation_check och tutor-evalsviten.
Behärskning innebär
- Genomför strukturerad red teaming av en modell eller agent
- Klassificerar fynd efter allvar och sannolikhet
- Föreslår skydd i flera lager
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Red Teaming Language Models with Language Models — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Universal and Transferable Adversarial Attacks on Aligned Language Models — arXiv (öppen åtkomst; licens per artikel)
- OWASP Top 10 for LLM Applications — CC BY-SA 4.0