Hoppa till innehållet
AI-grafen
C· Byggaredatavetenskap· ca 30 min· grundläggande — ändras sällan· verifierad 2026-09-20

Hur datorn lagrar text, bilder och ljud

Kunna förklara hur tecken, pixlar och ljudprov blir tal — och därmed indata till en modell.

Förkunskaper

Intuition

Allt som går in i en modell är tal. Frågan är bara hur.

  • Text: varje tecken har ett nummer (Unicode). A = 65, å = 229, 😀 = 128512. En text är en lista med tal. (Språkmodeller går ett steg till och klumpar ihop tecken till tokens.)
  • Bild: ett rutnät av pixlar; varje pixel tre tal 0–255 (rött, grönt, blått). En 1000 × 1000-bild = 3 miljoner tal.
  • Ljud: mikrofonen mäter lufttrycket 44 100 gånger per sekund; varje mätning ett tal. En sekund = 44 100 tal.

Modellen bryr sig inte om vad talen betyder — den hittar mönster i dem.

Kod

text = "Hej!"
print([ord(c) for c in text])        # [72, 101, 106, 33]
print(chr(229))                        # å

# en 2×2-bild i RGB: rader → pixlar → (r, g, b)
bild = [[(255, 0, 0), (0, 255, 0)],
        [(0, 0, 255), (0, 0, 0)]]
print(bild[0][1])                      # (0, 255, 0) — grön

# en sekund tyst ljud vid 8 kHz
ljud = [0] * 8000

Storlek: 1000 × 1000 pixlar × 3 byte = 3 MB okomprimerat. Komprimering (JPEG, MP3) kastar bort det ögat/örat inte märker.

Behärskning innebär

  • Förklarar hur tecken, pixlar och ljudprov blir tal
  • Uppskattar storleken på en fil ur upplösning och bitdjup

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser