Hoppa till innehållet
AI-grafen

Kör modeller billigare: kvantisering

Krymp en modell till en fjärdedel, mät vad som förloras, och välj rätt format för din körmiljö.

F· AI engineering

Alla kunskaper som ingår (59) — i beroendeordning

  1. 1AMönster och kategorier
  2. 2BData från vardagen
  3. 3AInstruktioner i rätt ordning
  4. 4BAlgoritmiskt tänkande
  5. 5CFunktioner och koordinatsystem
  6. 6DDerivata och optimering
  7. 7CProgrammeringslogik — variabler, villkor, loopar
  8. 8CPython — grunderna
  9. 9CPython — listor, loopar och dictionaries
  10. 10DTidskomplexitet och ordo-notation
  11. 11DPython — funktioner, scope och undantag
  12. 12DPython — moduler, paket och virtuella miljöer
  13. 13BRegler kontra inlärning
  14. 14CStatistik — medelvärde, median och spridning
  15. 15CSannolikhet — grunderna
  16. 16DLoss-funktioner
  17. 17ATal och de fyra räknesätten
  18. 18AJämföra och sortera tal
  19. 19BKoordinater: hitta på kartan
  20. 20DTerminal och shell
  21. 21EDocker — containrar
  22. 22DTokenisering
  23. 23BTräningsdata, features och etiketter
  24. 24BKlassificering — så sorterar en modell
  25. 25CDin första prediktiva modell — en rät linje
  26. 26DGradient descent
  27. 27CNeuronnät — intuitionen
  28. 28BVad är generativ AI?
  29. 29BGissa nästa ord
  30. 30CVilka ord hör ihop? Uppmärksamhet
  31. 31COrd som punkter: liknande ord nära varandra
  32. 32DTransformern — översikt utan formler
  33. 33DHur en språkmodell tränas — på gymnasienivå
  34. 34CVarför tar det tid när AI:n svarar?
  35. 35DVektorer
  36. 36DMatriser och matrismultiplikation
  37. 37DNeuronnät — forward pass med matriser
  38. 38DBackpropagation
  39. 39DEmbeddings — ord som vektorer
  40. 40DAttention
  41. 41EKontextlängd och kvadratisk kostnad
  42. 42FKvantisering
  43. 43GBeskärning och gleshet
  44. 44FKvantisering i praktiken: GPTQ, AWQ, GGUF
  45. 45EKöra modeller lokalt: llama.cpp, vLLM, Ollama
  46. 46DPyTorch — tensorer och autograd
  47. 47DTräna ett neuronnät i PyTorch
  48. 48DTransformers — arkitekturen
  49. 49FInferensoptimering
  50. 50EMulti-head attention i detalj
  51. 51EKV-cache
  52. 52FPrompt-caching och prefixdelning
  53. 53FMulti-query och grouped-query attention
  54. 54ELatens, throughput och batching vid inferens
  55. 55EKostnadsmodellering för LLM-system
  56. 56DLiten modell eller stor?
  57. 57ESpråkmodeller — träning och generering
  58. 58ESampling: temperatur, top-k, top-p, beam
  59. 59FSpekulativ dekodning