Kör modeller billigare: kvantisering
Krymp en modell till en fjärdedel, mät vad som förloras, och välj rätt format för din körmiljö.
Alla kunskaper som ingår (59) — i beroendeordning
- 1AMönster och kategorier
- 2BData från vardagen
- 3AInstruktioner i rätt ordning
- 4BAlgoritmiskt tänkande
- 5CFunktioner och koordinatsystem
- 6DDerivata och optimering
- 7CProgrammeringslogik — variabler, villkor, loopar
- 8CPython — grunderna
- 9CPython — listor, loopar och dictionaries
- 10DTidskomplexitet och ordo-notation
- 11DPython — funktioner, scope och undantag
- 12DPython — moduler, paket och virtuella miljöer
- 13BRegler kontra inlärning
- 14CStatistik — medelvärde, median och spridning
- 15CSannolikhet — grunderna
- 16DLoss-funktioner
- 17ATal och de fyra räknesätten
- 18AJämföra och sortera tal
- 19BKoordinater: hitta på kartan
- 20DTerminal och shell
- 21EDocker — containrar
- 22DTokenisering
- 23BTräningsdata, features och etiketter
- 24BKlassificering — så sorterar en modell
- 25CDin första prediktiva modell — en rät linje
- 26DGradient descent
- 27CNeuronnät — intuitionen
- 28BVad är generativ AI?
- 29BGissa nästa ord
- 30CVilka ord hör ihop? Uppmärksamhet
- 31COrd som punkter: liknande ord nära varandra
- 32DTransformern — översikt utan formler
- 33DHur en språkmodell tränas — på gymnasienivå
- 34CVarför tar det tid när AI:n svarar?
- 35DVektorer
- 36DMatriser och matrismultiplikation
- 37DNeuronnät — forward pass med matriser
- 38DBackpropagation
- 39DEmbeddings — ord som vektorer
- 40DAttention
- 41EKontextlängd och kvadratisk kostnad
- 42FKvantisering
- 43GBeskärning och gleshet
- 44FKvantisering i praktiken: GPTQ, AWQ, GGUF
- 45EKöra modeller lokalt: llama.cpp, vLLM, Ollama
- 46DPyTorch — tensorer och autograd
- 47DTräna ett neuronnät i PyTorch
- 48DTransformers — arkitekturen
- 49FInferensoptimering
- 50EMulti-head attention i detalj
- 51EKV-cache
- 52FPrompt-caching och prefixdelning
- 53FMulti-query och grouped-query attention
- 54ELatens, throughput och batching vid inferens
- 55EKostnadsmodellering för LLM-system
- 56DLiten modell eller stor?
- 57ESpråkmodeller — träning och generering
- 58ESampling: temperatur, top-k, top-p, beam
- 59FSpekulativ dekodning