Hoppa till innehållet
AI-grafen

AI-säkerhet i praktiken

Red teaming, jailbreaks, adversariella exempel, preferensinlärning och belöningshackning — vad som går att skydda och vad som inte gör det.

F· AI engineering

Alla kunskaper som ingår (65) — i beroendeordning

  1. 1AMönster och kategorier
  2. 2BData från vardagen
  3. 3AInstruktioner i rätt ordning
  4. 4BAlgoritmiskt tänkande
  5. 5CFunktioner och koordinatsystem
  6. 6DDerivata och optimering
  7. 7CProgrammeringslogik — variabler, villkor, loopar
  8. 8CPython — grunderna
  9. 9CPython — listor, loopar och dictionaries
  10. 10CPython — strängar och textbehandling
  11. 11CPython — filer, CSV och JSON
  12. 12DAPI:er och HTTP
  13. 13DReguljära uttryck
  14. 14BRegler kontra inlärning
  15. 15BKällkritik och ansvar när AI svarar
  16. 16DLicenser och öppna data
  17. 17CStatistik — medelvärde, median och spridning
  18. 18CSannolikhet — grunderna
  19. 19DLoss-funktioner
  20. 20DTokenisering
  21. 21BTräningsdata, features och etiketter
  22. 22BKlassificering — så sorterar en modell
  23. 23CDin första prediktiva modell — en rät linje
  24. 24DGradient descent
  25. 25CNeuronnät — intuitionen
  26. 26CPromptning — att styra en språkmodell
  27. 27CAnsvarsfull användning av AI
  28. 28DKontextfönster, systemprompt och few-shot
  29. 29EReinforcement learning — grunderna
  30. 30DVektorer
  31. 31DMatriser och matrismultiplikation
  32. 32DLinjär regression med flera features
  33. 33DNeuronnät — forward pass med matriser
  34. 34DBackpropagation
  35. 35EFaltningsnät (CNN)
  36. 36DEmbeddings — ord som vektorer
  37. 37DAttention
  38. 38DOverfitting och generalisering
  39. 39DPartiella derivator och gradienten
  40. 40FAdversariella exempel
  41. 41DPyTorch — tensorer och autograd
  42. 42DRetrieval — hitta rätt text
  43. 43DTräning, validering och test
  44. 44DTräna ett neuronnät i PyTorch
  45. 45DTransformers — arkitekturen
  46. 46ESpråkmodeller — träning och generering
  47. 47EModellutvärdering
  48. 48EFinjustering av språkmodeller
  49. 49FDatasetdesign för finjustering
  50. 50ERAG — retrieval-augmented generation
  51. 51FEvals för språkmodeller och agenter
  52. 52EPrompt injection
  53. 53FRLHF och preferensinlärning
  54. 54GAlignment — problem och metoder
  55. 55FBelöningshackning
  56. 56FDPO och direkt preferensoptimering
  57. 57GKonstitutionell AI och regelbaserad justering
  58. 58FSpecifikationsproblem och proxymål
  59. 59EVerktygsanvändning (tool use)
  60. 60EAgenter — planera, agera, observera
  61. 61FAI-säkerhet och red teaming
  62. 62FJailbreaks och skyddsräcken
  63. 63EWebbskrapning — teknik och regler
  64. 64FTräningsdata för språkmodeller: filtrering och dedup
  65. 65FDataförgiftning och bakdörrar