Data: samla, städa, dokumentera
Från observation till tabell, via konstiga värden, licenser och textförbehandling till ett dokumenterat dataset utan läckage.
Alla kunskaper som ingår (40) — i beroendeordning
- 1AMönster och kategorier
- 2BData från vardagen
- 3BData om mig — vad samlas in?
- 4BKonstiga värden i datan
- 5ASamla in data med en undersökning
- 6AInstruktioner i rätt ordning
- 7BAlgoritmiskt tänkande
- 8CFunktioner och koordinatsystem
- 9CProgrammeringslogik — variabler, villkor, loopar
- 10CPython — grunderna
- 11CPython — listor, loopar och dictionaries
- 12CPython — strängar och textbehandling
- 13CPython — filer, CSV och JSON
- 14DAPI:er och HTTP
- 15DReguljära uttryck
- 16BRegler kontra inlärning
- 17BKällkritik och ansvar när AI svarar
- 18DLicenser och öppna data
- 19EPersonuppgifter och anonymisering
- 20AFrån saker till tabell
- 21CStatistik — medelvärde, median och spridning
- 22DTextförbehandling
- 23BTräningsdata, features och etiketter
- 24EAnnotering och märkning av data
- 25EDatasetdokumentation och datasheets
- 26BKlassificering — så sorterar en modell
- 27CDin första prediktiva modell — en rät linje
- 28CUrval: vem har vi frågat?
- 29DVektorer
- 30DMatriser och matrismultiplikation
- 31DLinjär regression med flera features
- 32DNumPy — arrayer och vektorisering
- 33DOverfitting och generalisering
- 34DPandas — tabeller i Python
- 35DDatakvalitet: saknade värden, dubbletter, fel
- 36DFeature engineering
- 37DObalanserade klasser
- 38DTräning, validering och test
- 39DDataläckage
- 40EWebbskrapning — teknik och regler