Bygg en transformer från grunden
Implementera self-attention, multi-head attention och positionell kodning själv, och sätt ihop dem till en fungerande liten transformer.
Alla kunskaper som ingår (49) — i beroendeordning
- 1AMönster och kategorier
- 2BData från vardagen
- 3AInstruktioner i rätt ordning
- 4BAlgoritmiskt tänkande
- 5CFunktioner och koordinatsystem
- 6DDerivata och optimering
- 7CGeometri, avstånd och vinklar
- 8CProgrammeringslogik — variabler, villkor, loopar
- 9CPython — grunderna
- 10CPython — listor, loopar och dictionaries
- 11DTidskomplexitet och ordo-notation
- 12DPython — funktioner, scope och undantag
- 13DPython — klasser och objekt
- 14BRegler kontra inlärning
- 15CStatistik — medelvärde, median och spridning
- 16CSannolikhet — grunderna
- 17DSannolikhetsfördelningar
- 18DNormalfördelningen och standardisering
- 19DTokenisering
- 20BTräningsdata, features och etiketter
- 21BKlassificering — så sorterar en modell
- 22CDin första prediktiva modell — en rät linje
- 23DGradient descent
- 24CNeuronnät — intuitionen
- 25DTrigonometri — grunderna
- 26DVektorer
- 27DMatriser och matrismultiplikation
- 28DNeuronnät — forward pass med matriser
- 29DAktiveringsfunktioner
- 30DBackpropagation
- 31DEmbeddings — ord som vektorer
- 32DAttention
- 33EKontextlängd och kvadratisk kostnad
- 34EParallellism och varför GPU:er
- 35FMinneshierarki och bandbredd
- 36FFlash attention och IO-medveten attention
- 37DPyTorch — tensorer och autograd
- 38EHur autograd fungerar inuti
- 39EBygg en mini-autograd
- 40DTräna ett neuronnät i PyTorch
- 41EBatch- och layernormalisering
- 42DTransformers — arkitekturen
- 43ELayerNorm, RMSNorm och pre-/post-norm
- 44EMLP-blocket: GELU, SwiGLU
- 45FMixture of Experts
- 46EPositionell kodning och RoPE
- 47FRoPE i detalj
- 48EMulti-head attention i detalj
- 49EBygg en liten GPT från grunden