Bild och text tillsammans
Kunna förklara hur en AI kan beskriva en bild med ord.
Förkunskaper
Intuition
Om ord kan vara punkter på en karta — kan bilder också? Ja. En modell tränas på miljoner bilder med bildtexter och lär sig lägga bilden och dess text nära varandra på samma karta.
Sedan: ny bild → punkt på kartan → vilka ord ligger nära? «En katt som sover i en korg.» Modellen beskriver bilden genom att hitta närliggande text.
Och tvärtom: skriv text → hitta bilder nära den. Det är så bildsök med ord fungerar.
Interaktivt
Testa en bildbeskrivare (många AI-assistenter kan ta emot bilder): ladda upp en bild du tagit själv och be om en beskrivning.
Kolla:
- Räknade den rätt antal föremål?
- Gissade den något som inte syns (t.ex. «på en strand» när det är en sjö)?
- Missade den något litet men viktigt?
Modellen beskriver det typiska för sådana bilder — inte alltid det som faktiskt finns. Ovanliga bilder (tre ben på en hund, en blå banan) beskrivs ofta fel.
Behärskning innebär
- Förklarar att bild och text kan placeras på samma betydelsekarta
- Beskriver hur en bildbeskrivning kan bli fel
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Learning Transferable Visual Models From Natural Language Supervision (CLIP) — arXiv (öppen åtkomst; licens per artikel)
- Wikipedia — Multimodal learning (CC BY-SA 4.0) — CC BY-SA 4.0