Djup reinforcement learning
Policy gradient och REINFORCE, DQN med replay buffer och målnät, actor–critic och PPO — de metoder som driver allt från Atari till RLHF, och felen som gör att de inte lär sig.
Alla kunskaper som ingår (52) — i beroendeordning
- 1AMönster och kategorier
- 2BData från vardagen
- 3AInstruktioner i rätt ordning
- 4BAlgoritmiskt tänkande
- 5CFunktioner och koordinatsystem
- 6DDerivata och optimering
- 7CProgrammeringslogik — variabler, villkor, loopar
- 8CPython — grunderna
- 9CPython — listor, loopar och dictionaries
- 10BRegler kontra inlärning
- 11BKällkritik och ansvar när AI svarar
- 12CStatistik — medelvärde, median och spridning
- 13CSannolikhet — grunderna
- 14DBetingad sannolikhet
- 15DLoss-funktioner
- 16DTokenisering
- 17BTräningsdata, features och etiketter
- 18BKlassificering — så sorterar en modell
- 19CDin första prediktiva modell — en rät linje
- 20DGradient descent
- 21CNeuronnät — intuitionen
- 22CPromptning — att styra en språkmodell
- 23EReinforcement learning — grunderna
- 24EMarkovbeslutsprocesser
- 25EQ-learning
- 26DVektorer
- 27DMatriser och matrismultiplikation
- 28DLinjär regression med flera features
- 29DNeuronnät — forward pass med matriser
- 30DBackpropagation
- 31FDeep Q-Networks
- 32DEmbeddings — ord som vektorer
- 33DAttention
- 34DOverfitting och generalisering
- 35DPartiella derivator och gradienten
- 36EKedjeregeln i flera variabler
- 37FPolicy gradient och REINFORCE
- 38FActor–critic och PPO
- 39DPyTorch — tensorer och autograd
- 40DRetrieval — hitta rätt text
- 41DTräning, validering och test
- 42DTräna ett neuronnät i PyTorch
- 43DTransformers — arkitekturen
- 44ESpråkmodeller — träning och generering
- 45EModellutvärdering
- 46EFinjustering av språkmodeller
- 47ERAG — retrieval-augmented generation
- 48FEvals för språkmodeller och agenter
- 49FRLHF och preferensinlärning
- 50GAlignment — problem och metoder
- 51FBelöningshackning
- 52FDPO och direkt preferensoptimering