Evals i praktiken
LLM som domare, regressionstester, statistisk signifikans och hur man värderar negativa resultat — mätning som håller mellan releaser.
Alla kunskaper som ingår (62) — i beroendeordning
- 1AMönster och kategorier
- 2BData från vardagen
- 3AInstruktioner i rätt ordning
- 4BAlgoritmiskt tänkande
- 5CFunktioner och koordinatsystem
- 6DDerivata och optimering
- 7CProgrammeringslogik — variabler, villkor, loopar
- 8CPython — grunderna
- 9CPython — listor, loopar och dictionaries
- 10DPython — funktioner, scope och undantag
- 11BRegler kontra inlärning
- 12BKällkritik och ansvar när AI svarar
- 13CStatistik — medelvärde, median och spridning
- 14DKorrelation och kausalitet
- 15CSannolikhet — grunderna
- 16DSannolikhetsfördelningar
- 17DLoss-funktioner
- 18DNormalfördelningen och standardisering
- 19DStickprov och osäkerhet
- 20EKonfidensintervall
- 21EHypotesprövning och p-värden
- 22EA/B-test och experimentdesign
- 23FKausal inferens
- 24FMultipla jämförelser
- 25FNegativa resultat och publiceringsbias
- 26DTestning med pytest
- 27DTokenisering
- 28BTräningsdata, features och etiketter
- 29EAnnotering och märkning av data
- 30BKlassificering — så sorterar en modell
- 31CDin första prediktiva modell — en rät linje
- 32DGradient descent
- 33FMänsklig utvärdering och annotatörsöverensstämmelse
- 34CNeuronnät — intuitionen
- 35CPromptning — att styra en språkmodell
- 36DVektorer
- 37DMatriser och matrismultiplikation
- 38DLinjär regression med flera features
- 39DNeuronnät — forward pass med matriser
- 40DBackpropagation
- 41DEmbeddings — ord som vektorer
- 42DAttention
- 43DOverfitting och generalisering
- 44DPyTorch — tensorer och autograd
- 45DRetrieval — hitta rätt text
- 46DTräning, validering och test
- 47DTräna ett neuronnät i PyTorch
- 48DTransformers — arkitekturen
- 49ESpråkmodeller — träning och generering
- 50EModellutvärdering
- 51EBygg en eval-harness
- 52ERAG — retrieval-augmented generation
- 53FEvals för språkmodeller och agenter
- 54FLLM som domare
- 55FRegressionstester för modeller
- 56ESpråkmodeller för kod
- 57FEvals för kodgenerering
- 58FStatistisk signifikans i evals
- 59FUtvärdera en AI-handledare
- 60EVetenskaplig metod i AI
- 61FLäsa och analysera forskningsartiklar
- 62FFölja forskningsfronten