C· Byggareinterpretability· ca 30 min· grundläggande — ändras sällan· verifierad 2026-09-20
Varför svarade den så?
Kunna fråga efter en förklaring och bedöma om den är trovärdig.
Förkunskaper
Intuition
Modellen säger «katt» om din bild. Varför?
Det finns två sorters svar:
- Vad modellen tittade på. Verktyg kan färglägga de pixlar som påverkade beslutet mest. Lyser det på öronen är det rimligt. Lyser det på soffan i bakgrunden har modellen hittat en genväg.
- En förklaring i ord. En språkmodell kan skriva «jag svarade så för att …». Det låter övertygande — men är en efterhandskonstruktion. Modellen har ingen insyn i sina egna beräkningar; den genererar en trolig förklaring.
Skillnaden är viktig: det första är en mätning, det andra är en gissning.
Intuition
Testa om förklaringen håller. Om modellen säger «jag såg de spetsiga öronen»:
- Täck över öronen i bilden och fråga igen. Ändras svaret? Då stämde förklaringen.
- Täck över bakgrunden i stället. Ändras svaret då? Då var det bakgrunden som avgjorde, oavsett vad modellen påstod.
Det här kallas intervention och är enda sättet att veta. En förklaring som inte går att testa är en berättelse.
Samma sak med textmodeller: fråga «varför svarade du så?» och du får ofta en snygg motivering — även för ett svar som var fel. Be i stället om källan och kontrollera den.
Behärskning innebär
- Ber om en förklaring till ett modellsvar
- Bedömer om förklaringen är trovärdig
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Grad-CAM — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Language Models Don't Always Say What They Think — arXiv (öppen åtkomst; licens per artikel)