C· Byggaredatavetenskap· ca 30 min· grundläggande — ändras sällan· verifierad 2026-09-20
Hur datorn lagrar text, bilder och ljud
Kunna förklara hur tecken, pixlar och ljudprov blir tal — och därmed indata till en modell.
Förkunskaper
- BBinära tal och bitarkrävs
Intuition
Allt som går in i en modell är tal. Frågan är bara hur.
- Text: varje tecken har ett nummer (Unicode).
A= 65,å= 229,😀= 128512. En text är en lista med tal. (Språkmodeller går ett steg till och klumpar ihop tecken till tokens.) - Bild: ett rutnät av pixlar; varje pixel tre tal 0–255 (rött, grönt, blått). En 1000 × 1000-bild = 3 miljoner tal.
- Ljud: mikrofonen mäter lufttrycket 44 100 gånger per sekund; varje mätning ett tal. En sekund = 44 100 tal.
Modellen bryr sig inte om vad talen betyder — den hittar mönster i dem.
Kod
text = "Hej!"
print([ord(c) for c in text]) # [72, 101, 106, 33]
print(chr(229)) # å
# en 2×2-bild i RGB: rader → pixlar → (r, g, b)
bild = [[(255, 0, 0), (0, 255, 0)],
[(0, 0, 255), (0, 0, 0)]]
print(bild[0][1]) # (0, 255, 0) — grön
# en sekund tyst ljud vid 8 kHz
ljud = [0] * 8000
Storlek: 1000 × 1000 pixlar × 3 byte = 3 MB okomprimerat. Komprimering (JPEG, MP3) kastar bort det ögat/örat inte märker.
Behärskning innebär
- Förklarar hur tecken, pixlar och ljudprov blir tal
- Uppskattar storleken på en fil ur upplösning och bitdjup
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- CS Unplugged (CC BY-SA 4.0) — CC BY-SA 4.0
- Wikipedia — Unicode (CC BY-SA 4.0) — CC BY-SA 4.0