Komprimera data
Kunna förklara varför upprepningar kan komprimeras och vad som går förlorat.
Förkunskaper
Intuition
Texten AAAAAAAABBBB är 12 tecken. Men den kan skrivas 8A4B — 4 tecken. Samma information, mindre plats. Det kallas komprimering.
Det fungerar för att datan har ett mönster. Slumpmässig data (A9x2QbZ) går inte att komprimera — det finns inget mönster att utnyttja.
Förlustfri kompression (ZIP, PNG): allt går att återskapa exakt. Förstörande kompression (JPEG, MP3): information kastas bort — sådant ögat eller örat knappt märker. Bilden blir mycket mindre men aldrig exakt densamma igen.
Intuition
Prova själv: komprimera AABBBBCCCCCCCCD med metoden «antal + tecken».
→ 2A4B8C1D = 8 tecken i stället för 15. Nästan hälften.
Men ABCABCABC blir 1A1B1C1A1B1C1A1B1C = 18 tecken — dubbelt så långt! Metoden passar bara data med långa upprepningar. Riktiga komprimeringsprogram väljer metod efter datan.
Koppling till AI: en språkmodell är på sätt och vis en enorm komprimering av text — den har lärt sig mönstren i den, inte texten själv. Ju bättre en modell förutsäger nästa ord, desto mer effektivt har den «komprimerat» språket. Det är därför perplexitet och kompression hänger ihop.
Behärskning innebär
- Förklarar varför upprepningar kan komprimeras
- Skiljer förlustfri från förstörande kompression
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- CS Unplugged (CC BY-SA 4.0) — CC BY-SA 4.0
- Wikipedia — Datakomprimering (CC BY-SA 4.0) — CC BY-SA 4.0