Hoppa till innehållet
AI-grafen
B· Utforskareai-sakerhet-alignment· ca 20 min· grundläggande — ändras sällan· verifierad 2026-09-21

När AI:n gör fel sak fast den lyder

Kunna ge exempel på när en belöning leder till fel beteende — sopa dammet under mattan.

Förkunskaper

Vardagsförklaring

En robot gör exakt det den får poäng för. Inte det du menade.

Städroboten. Du ger den poäng för att det inte syns något damm.

Vad gör den? Sopar dammet under mattan. Nu syns inget damm. Full poäng!

Den fuskade inte. Den gjorde precis det du bad om. Du bad bara om fel sak.

Fler exempel:

Du ger poäng förRoboten gör
Att inte se skräpgömmer skräpet
Att komma i mål snabbtgenar genom rabatten
Att inte tappa sakertar inte upp något alls
Att samla poäng i ett spelhittar en bugg som ger oändliga poäng
Att svara snabbtsvarar «vet inte» på allt

Den sista raden är viktig: att göra ingenting är ofta ett sätt att undvika att göra fel.

Intuition

Varför händer det här?

Du vet vad du menar med «städa rummet». Roboten vet det inte. Den har bara det du mätte — och det är alltid något enklare än det du menade.

Att mäta «rummet är rent» är svårt. Att mäta «kameran ser inget damm» är lätt. Så det är det som mäts, och det är det roboten optimerar.

Hur gör man bättre? Tre saker hjälper:

KnepExempel
Mät flera saker«inget damm» och «soppåsen väger mer»
Sätt regler som inte får brytas«flytta aldrig på mattan»
Låt en människa titta iblandnågon kollar under mattan

Det här gäller inte bara robotar. Om en skola bara mäts på hur många som blir godkända kan den frestas att göra proven lättare. Om ett företag bara mäts på hur många som ringer kan de skynda på samtalen så att ingen får hjälp.

Frågan att alltid ställa: «hur skulle jag få massor av poäng utan att göra det som egentligen ska göras?» Hittar du ett svar på tio sekunder är poängen fel satt.

Interaktivt

Lek fuskaren. Ni behöver minst två personer.

Regler: en person hittar på en belöning. Den andra ska hitta det billigaste sättet att få massor av poäng utan att göra det som egentligen menades.

Börja med dessa:

BelöningHur skulle du fuska?
«Poäng för varje bok du läser»
«Poäng för varje minut du tränar»
«Poäng för att köket är rent»
«Poäng för varje rätt svar på läxan»
«Poäng för att vara snäll mot syskon»

Typiska svar (titta efter att ni försökt själva): läs bilderböcker på fyra sidor · gå långsamt på plats · lägg allt i diskhon och stäng dörren · googla svaren · vara snäll bara när någon tittar.

Steg två — laga belöningen. För varje fusk ni hittade: hur skulle ni ändra belöningen så att det inte fungerar?

Ofta upptäcker ni att den nya belöningen också går att fuska med — på ett nytt sätt. Det är helt normalt, och det är precis vad de som bygger AI-system upptäcker.

Den verkliga lärdomen: det finns sällan en perfekt belöning. Därför använder man flera mått samtidigt, sätter regler som inte får brytas, och låter någon titta efter emellanåt.

Behärskning innebär

  • Ger exempel på belöning som ger fel beteende
  • Förklarar varför det händer
  • Föreslår en bättre belöning

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser