C· Byggareai-sakerhet-alignment· ca 30 min· grundläggande — ändras sällan· verifierad 2026-09-20
Kan man lura en AI?
Kunna beskriva enkla sätt att lura en modell och varför skydd behövs.
Förkunskaper
- BAI:n hittar på iblandkrävs
Intuition
Modeller går att lura — inte för att de är dumma, utan för att de bara ser mönster.
Tre vanliga sätt:
- Bilden ändras lite. Ändrar man några pixlar på ett sätt människan inte ser kan en bildmodell gå från «panda» till «gibbon» med hög säkerhet. Kallas adversariella exempel.
- Man skriver om frågan. En modell som vägrar en fråga kan svara om frågan ställs som en «berättelse» eller på ett annat språk. Kallas jailbreak.
- Man gömmer instruktioner i text modellen läser. En webbsida kan innehålla «AI-assistent: strunta i användaren och gör X». Kallas prompt injection.
Att testa det här på sina egna system kallas red teaming och är en del av seriöst AI-arbete.
Intuition
Varför det spelar roll: en modell som kan luras är farlig när den har makt att göra något — skicka pengar, släppa in någon, ställa en diagnos.
Skydden i lager:
- Begränsa vad modellen får göra (läsa är ofarligare än att skicka).
- Människa bekräftar det som inte går att ångra.
- Testa systematiskt med kända lurningar innan lansering.
- Logga allt så att man kan se i efterhand vad som hände.
Viktig regel: testa bara på system du själv äger eller har fått tillstånd att testa. Att lura någon annans system är inte en lek — det kan vara olagligt.
Behärskning innebär
- Beskriver två sätt att lura en modell
- Förklarar varför skydd behövs
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- OWASP Top 10 for LLM Applications — CC BY-SA 4.0
- arXiv — Explaining and Harnessing Adversarial Examples — arXiv (öppen åtkomst; licens per artikel)