Hoppa till innehållet
AI-grafen

Djup reinforcement learning

Policy gradient och REINFORCE, DQN med replay buffer och målnät, actor–critic och PPO — de metoder som driver allt från Atari till RLHF, och felen som gör att de inte lär sig.

F· AI engineering

Alla kunskaper som ingår (52) — i beroendeordning

  1. 1AMönster och kategorier
  2. 2BData från vardagen
  3. 3AInstruktioner i rätt ordning
  4. 4BAlgoritmiskt tänkande
  5. 5CFunktioner och koordinatsystem
  6. 6DDerivata och optimering
  7. 7CProgrammeringslogik — variabler, villkor, loopar
  8. 8CPython — grunderna
  9. 9CPython — listor, loopar och dictionaries
  10. 10BRegler kontra inlärning
  11. 11BKällkritik och ansvar när AI svarar
  12. 12CStatistik — medelvärde, median och spridning
  13. 13CSannolikhet — grunderna
  14. 14DBetingad sannolikhet
  15. 15DLoss-funktioner
  16. 16DTokenisering
  17. 17BTräningsdata, features och etiketter
  18. 18BKlassificering — så sorterar en modell
  19. 19CDin första prediktiva modell — en rät linje
  20. 20DGradient descent
  21. 21CNeuronnät — intuitionen
  22. 22CPromptning — att styra en språkmodell
  23. 23EReinforcement learning — grunderna
  24. 24EMarkovbeslutsprocesser
  25. 25EQ-learning
  26. 26DVektorer
  27. 27DMatriser och matrismultiplikation
  28. 28DLinjär regression med flera features
  29. 29DNeuronnät — forward pass med matriser
  30. 30DBackpropagation
  31. 31FDeep Q-Networks
  32. 32DEmbeddings — ord som vektorer
  33. 33DAttention
  34. 34DOverfitting och generalisering
  35. 35DPartiella derivator och gradienten
  36. 36EKedjeregeln i flera variabler
  37. 37FPolicy gradient och REINFORCE
  38. 38FActor–critic och PPO
  39. 39DPyTorch — tensorer och autograd
  40. 40DRetrieval — hitta rätt text
  41. 41DTräning, validering och test
  42. 42DTräna ett neuronnät i PyTorch
  43. 43DTransformers — arkitekturen
  44. 44ESpråkmodeller — träning och generering
  45. 45EModellutvärdering
  46. 46EFinjustering av språkmodeller
  47. 47ERAG — retrieval-augmented generation
  48. 48FEvals för språkmodeller och agenter
  49. 49FRLHF och preferensinlärning
  50. 50GAlignment — problem och metoder
  51. 51FBelöningshackning
  52. 52FDPO och direkt preferensoptimering