Träna en agent med belöning
Från banditer till policy gradient: bygg en miljö, låt en agent lära sig av belöning, och förstå varför RL är svårt.
Alla kunskaper som ingår (31) — i beroendeordning
- 1AMönster och kategorier
- 2BData från vardagen
- 3AChans och risk i vardagen
- 4AInstruktioner i rätt ordning
- 5BAlgoritmiskt tänkande
- 6CFunktioner och koordinatsystem
- 7DDerivata och optimering
- 8CProgrammeringslogik — variabler, villkor, loopar
- 9CPython — grunderna
- 10CPython — listor, loopar och dictionaries
- 11DPython — funktioner, scope och undantag
- 12DPython — klasser och objekt
- 13BRegler kontra inlärning
- 14EMiljöer och simulering
- 15AStyra en robot med kommandon
- 16BBelöna roboten: lära av försök
- 17BNär AI:n gör fel sak fast den lyder
- 18BSlump: tärningar, kulor och mynt
- 19CStatistik — medelvärde, median och spridning
- 20CSannolikhet — grunderna
- 21EFlerarmade banditer
- 22DBetingad sannolikhet
- 23BTräningsdata, features och etiketter
- 24BKlassificering — så sorterar en modell
- 25CDin första prediktiva modell — en rät linje
- 26DGradient descent
- 27EReinforcement learning — grunderna
- 28EMarkovbeslutsprocesser
- 29EQ-learning
- 30CProva nytt eller ta det säkra?
- 31DRutnätsvärlden: din första RL-agent