AI-säkerhet i praktiken
Red teaming, jailbreaks, adversariella exempel, preferensinlärning och belöningshackning — vad som går att skydda och vad som inte gör det.
Alla kunskaper som ingår (65) — i beroendeordning
- 1AMönster och kategorier
- 2BData från vardagen
- 3AInstruktioner i rätt ordning
- 4BAlgoritmiskt tänkande
- 5CFunktioner och koordinatsystem
- 6DDerivata och optimering
- 7CProgrammeringslogik — variabler, villkor, loopar
- 8CPython — grunderna
- 9CPython — listor, loopar och dictionaries
- 10CPython — strängar och textbehandling
- 11CPython — filer, CSV och JSON
- 12DAPI:er och HTTP
- 13DReguljära uttryck
- 14BRegler kontra inlärning
- 15BKällkritik och ansvar när AI svarar
- 16DLicenser och öppna data
- 17CStatistik — medelvärde, median och spridning
- 18CSannolikhet — grunderna
- 19DLoss-funktioner
- 20DTokenisering
- 21BTräningsdata, features och etiketter
- 22BKlassificering — så sorterar en modell
- 23CDin första prediktiva modell — en rät linje
- 24DGradient descent
- 25CNeuronnät — intuitionen
- 26CPromptning — att styra en språkmodell
- 27CAnsvarsfull användning av AI
- 28DKontextfönster, systemprompt och few-shot
- 29EReinforcement learning — grunderna
- 30DVektorer
- 31DMatriser och matrismultiplikation
- 32DLinjär regression med flera features
- 33DNeuronnät — forward pass med matriser
- 34DBackpropagation
- 35EFaltningsnät (CNN)
- 36DEmbeddings — ord som vektorer
- 37DAttention
- 38DOverfitting och generalisering
- 39DPartiella derivator och gradienten
- 40FAdversariella exempel
- 41DPyTorch — tensorer och autograd
- 42DRetrieval — hitta rätt text
- 43DTräning, validering och test
- 44DTräna ett neuronnät i PyTorch
- 45DTransformers — arkitekturen
- 46ESpråkmodeller — träning och generering
- 47EModellutvärdering
- 48EFinjustering av språkmodeller
- 49FDatasetdesign för finjustering
- 50ERAG — retrieval-augmented generation
- 51FEvals för språkmodeller och agenter
- 52EPrompt injection
- 53FRLHF och preferensinlärning
- 54GAlignment — problem och metoder
- 55FBelöningshackning
- 56FDPO och direkt preferensoptimering
- 57GKonstitutionell AI och regelbaserad justering
- 58FSpecifikationsproblem och proxymål
- 59EVerktygsanvändning (tool use)
- 60EAgenter — planera, agera, observera
- 61FAI-säkerhet och red teaming
- 62FJailbreaks och skyddsräcken
- 63EWebbskrapning — teknik och regler
- 64FTräningsdata för språkmodeller: filtrering och dedup
- 65FDataförgiftning och bakdörrar