Hoppa till innehållet
AI-grafen
C· Byggarereinforcement-learning· ca 30 min· grundläggande — ändras sällan· verifierad 2026-09-20

Prova nytt eller ta det säkra?

Kunna resonera om avvägningen mellan att prova och att välja det som brukar funka.

Förkunskaper

Vardagsförklaring

Du står i skolmatsalen. Du vet att pastan är okej. Du har aldrig provat gryta.

Tar du pastan igen, eller chansar?

Tar du alltid pastan får du alltid okej mat — men du får aldrig veta om grytan var bättre. Chansar du varje dag äter du dåligt ganska ofta.

Det här är avvägningen mellan att utforska och att utnyttja, och den finns överallt:

SituationUtforskaUtnyttja
Musiklyssna på en ny artistspela favoritlåten igen
Väg till skolantesta en ny genvägta den vanliga vägen
Datorspelprova en ny taktikköra den som brukar funka
Läxortesta ett nytt sätt att pluggagöra som förra gången

En robot som ska lära sig har exakt samma problem — och måste lösa det utan att någon säger vad som är rätt.

Intuition

Varför räcker det inte att bara ta det bästa man vet?

Tänk dig att du provar gryta en enda gång och har otur — den dagen var den bränd. Nu tror du att gryta är dåligt. Tar du alltid det du tror är bäst kommer du aldrig att prova igen, och du kommer aldrig att upptäcka misstaget.

Det kallas att fastna i ett lokalt bra val. Du får något okej, men missar något bättre.

Den enklaste lösningen som faktiskt fungerar heter ε-girig (epsilon-girig):

Slå en tärning innan du väljer. Med liten sannolikhet (t.ex. 10 %) väljer du något slumpmässigt. Annars väljer du det du tror är bäst.

Det är allt. Och det räcker förvånansvärt långt.

En bra idé till: utforska mycket i början, mindre sedan. Första veckan i en ny skolmatsal är det vettigt att prova allt. Efter en termin vet du vad du gillar. Samma sak för en robot — man låter ε krympa över tid.

Interaktivt

Prova själv, med papper och tärning. Du har tre knappar. Varje knapp ger poäng, men du vet inte hur mycket.

Sanningen (titta inte förrän efteråt): knapp A ger i snitt 3 poäng, knapp B ger 7, knapp C ger 5. Varje gång slumpas det lite.

Omgång 1 — bara utnyttja. Tryck varje knapp en gång. Tryck sedan 20 gånger på den som gav mest.

Omgång 2 — ε-girig. Slå en tärning varje gång. Får du en sexa: välj en knapp helt slumpmässigt. Annars: välj den som gett bäst snitt hittills.

Räkna ihop poängen efter 23 tryck i varje omgång.

Vad som brukar hända: omgång 1 vinner ibland — om första trycket på B råkade bli högt. Men ofta fastnar den på A eller C och kommer aldrig loss. Omgång 2 är sämre i början (den slösar tryck på dåliga knappar) men nästan alltid bättre på slutet.

Frågan att fundera på: hur skulle du ändra reglerna om du bara fick 5 tryck totalt? Och om du fick 1 000?

Behärskning innebär

  • Förklarar varför man ibland måste prova något sämre
  • Använder en enkel utforskningsregel
  • Känner igen avvägningen utanför datorn

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser