Hoppa till innehållet
AI-grafen
B· Utforskarereinforcement-learning· ca 20 min· grundläggande — ändras sällan· verifierad 2026-09-20

Belöna roboten: lära av försök

Kunna förklara hur ett djur eller en robot lär sig av belöning och prova i ett rutnätsspel.

Förkunskaper

Vardagsförklaring

Hur lär man en hund att sitta? Inte genom att förklara. Man belönar när den råkar göra rätt. Efter många gånger gör den det oftare.

En robot kan lära sig likadant: den provar något, får poäng (belöning) om det blev bra, och gör det som gav poäng oftare. Ingen har sagt hur — bara vad som är bra.

Det kallas förstärkningsinlärning (reinforcement learning).

Interaktivt

Rutnätsspelet. Roboten står i rutan längst till vänster och ska till skatten längst till höger. Den kan gå vänster eller höger.

[R] [ ] [ ] [💎]

Regel: +1 poäng när den når skatten, 0 annars. I början går den slumpmässigt. Ibland hamnar den rätt → +1. Nästa gång blir «höger» lite mer troligt. Efter tjugo försök går den rakt dit.

Fällan: ge poäng för fel sak och den lär sig fel sak. Ger du +1 för varje steg mot skatten kan roboten lära sig att gå fram och tillbaka nära målet i stället för att gå in — det ger mer poäng. Belöningen måste vara det du faktiskt vill ha.

Behärskning innebär

  • Förklarar att belöning styr vad som lärs in
  • Följer hur en enkel agent förbättras med försök

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser