Hoppa till innehållet
AI-grafen
C· Byggareai-sakerhet-alignment· ca 30 min· grundläggande — ändras sällan· verifierad 2026-09-20

Kan man lura en AI?

Kunna beskriva enkla sätt att lura en modell och varför skydd behövs.

Förkunskaper

Intuition

Modeller går att lura — inte för att de är dumma, utan för att de bara ser mönster.

Tre vanliga sätt:

  1. Bilden ändras lite. Ändrar man några pixlar på ett sätt människan inte ser kan en bildmodell gå från «panda» till «gibbon» med hög säkerhet. Kallas adversariella exempel.
  2. Man skriver om frågan. En modell som vägrar en fråga kan svara om frågan ställs som en «berättelse» eller på ett annat språk. Kallas jailbreak.
  3. Man gömmer instruktioner i text modellen läser. En webbsida kan innehålla «AI-assistent: strunta i användaren och gör X». Kallas prompt injection.

Att testa det här på sina egna system kallas red teaming och är en del av seriöst AI-arbete.

Intuition

Varför det spelar roll: en modell som kan luras är farlig när den har makt att göra något — skicka pengar, släppa in någon, ställa en diagnos.

Skydden i lager:

  • Begränsa vad modellen får göra (läsa är ofarligare än att skicka).
  • Människa bekräftar det som inte går att ångra.
  • Testa systematiskt med kända lurningar innan lansering.
  • Logga allt så att man kan se i efterhand vad som hände.

Viktig regel: testa bara på system du själv äger eller har fått tillstånd att testa. Att lura någon annans system är inte en lek — det kan vara olagligt.

Behärskning innebär

  • Beskriver två sätt att lura en modell
  • Förklarar varför skydd behövs

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser