Hoppa till innehållet
AI-grafen

Evals i praktiken

LLM som domare, regressionstester, statistisk signifikans och hur man värderar negativa resultat — mätning som håller mellan releaser.

F· AI engineering

Alla kunskaper som ingår (62) — i beroendeordning

  1. 1AMönster och kategorier
  2. 2BData från vardagen
  3. 3AInstruktioner i rätt ordning
  4. 4BAlgoritmiskt tänkande
  5. 5CFunktioner och koordinatsystem
  6. 6DDerivata och optimering
  7. 7CProgrammeringslogik — variabler, villkor, loopar
  8. 8CPython — grunderna
  9. 9CPython — listor, loopar och dictionaries
  10. 10DPython — funktioner, scope och undantag
  11. 11BRegler kontra inlärning
  12. 12BKällkritik och ansvar när AI svarar
  13. 13CStatistik — medelvärde, median och spridning
  14. 14DKorrelation och kausalitet
  15. 15CSannolikhet — grunderna
  16. 16DSannolikhetsfördelningar
  17. 17DLoss-funktioner
  18. 18DNormalfördelningen och standardisering
  19. 19DStickprov och osäkerhet
  20. 20EKonfidensintervall
  21. 21EHypotesprövning och p-värden
  22. 22EA/B-test och experimentdesign
  23. 23FKausal inferens
  24. 24FMultipla jämförelser
  25. 25FNegativa resultat och publiceringsbias
  26. 26DTestning med pytest
  27. 27DTokenisering
  28. 28BTräningsdata, features och etiketter
  29. 29EAnnotering och märkning av data
  30. 30BKlassificering — så sorterar en modell
  31. 31CDin första prediktiva modell — en rät linje
  32. 32DGradient descent
  33. 33FMänsklig utvärdering och annotatörsöverensstämmelse
  34. 34CNeuronnät — intuitionen
  35. 35CPromptning — att styra en språkmodell
  36. 36DVektorer
  37. 37DMatriser och matrismultiplikation
  38. 38DLinjär regression med flera features
  39. 39DNeuronnät — forward pass med matriser
  40. 40DBackpropagation
  41. 41DEmbeddings — ord som vektorer
  42. 42DAttention
  43. 43DOverfitting och generalisering
  44. 44DPyTorch — tensorer och autograd
  45. 45DRetrieval — hitta rätt text
  46. 46DTräning, validering och test
  47. 47DTräna ett neuronnät i PyTorch
  48. 48DTransformers — arkitekturen
  49. 49ESpråkmodeller — träning och generering
  50. 50EModellutvärdering
  51. 51EBygg en eval-harness
  52. 52ERAG — retrieval-augmented generation
  53. 53FEvals för språkmodeller och agenter
  54. 54FLLM som domare
  55. 55FRegressionstester för modeller
  56. 56ESpråkmodeller för kod
  57. 57FEvals för kodgenerering
  58. 58FStatistisk signifikans i evals
  59. 59FUtvärdera en AI-handledare
  60. 60EVetenskaplig metod i AI
  61. 61FLäsa och analysera forskningsartiklar
  62. 62FFölja forskningsfronten