Multimodala system
Gemensamma vektorrum, vision–language-modeller, dokumentförståelse, multimodal hämtning, video och agenter som ser skärmen — med hallucinations- och säkerhetsmätningar som håller.
Alla kunskaper som ingår (49) — i beroendeordning
- 1AMönster och kategorier
- 2BData från vardagen
- 3AInstruktioner i rätt ordning
- 4BAlgoritmiskt tänkande
- 5CFunktioner och koordinatsystem
- 6DDerivata och optimering
- 7CProgrammeringslogik — variabler, villkor, loopar
- 8CPython — grunderna
- 9CPython — listor, loopar och dictionaries
- 10BRegler kontra inlärning
- 11BKällkritik och ansvar när AI svarar
- 12CStatistik — medelvärde, median och spridning
- 13CSannolikhet — grunderna
- 14DLoss-funktioner
- 15ATal och de fyra räknesätten
- 16BBinära tal och bitar
- 17CHur datorn lagrar text, bilder och ljud
- 18DTokenisering
- 19BTräningsdata, features och etiketter
- 20BKlassificering — så sorterar en modell
- 21CDin första prediktiva modell — en rät linje
- 22DGradient descent
- 23CNeuronnät — intuitionen
- 24CPromptning — att styra en språkmodell
- 25DVektorer
- 26DMatriser och matrismultiplikation
- 27DNeuronnät — forward pass med matriser
- 28DBackpropagation
- 29DEmbeddings — ord som vektorer
- 30DAttention
- 31DNumPy — arrayer och vektorisering
- 32EBildförbehandling och augmentering
- 33DPyTorch — tensorer och autograd
- 34DRetrieval — hitta rätt text
- 35ESekvensmodeller före transformers
- 36DTräna ett neuronnät i PyTorch
- 37DTransformers — arkitekturen
- 38ESpråkmodeller — träning och generering
- 39ERAG — retrieval-augmented generation
- 40EVision Transformer (ViT)
- 41FCLIP och kontrastiv bild–text-inlärning
- 42EMultimodala modeller — grunderna
- 43FBildbeskrivning och visuella frågor
- 44FDokumentförståelse: OCR, layout, tabeller
- 45FMultimodal RAG
- 46EVerktygsanvändning (tool use)
- 47EAgenter — planera, agera, observera
- 48GMultimodala agenter och datorstyrning
- 49GVideoförståelse