Hoppa till innehållet
AI-grafen
E· Universitettransformerarkitektur· ca 60 min· utvecklande· verifierad 2026-09-20

Encoder–decoder-transformers

Kunna förklara T5/BART-arkitekturen och när encoder–decoder passar bättre än decoder-only.

Förkunskaper

Intuition

Tre familjer av transformers, med olika jobb:

TypAttentionTränas medExempelBra på
Encoder-onlyfull, bidirektionellmaskerad tokenBERTförstå: klassificera, extrahera
Decoder-onlykausalnästa tokenGPT, Llamagenerera
Encoder–decoderencoder full, decoder kausal + crossdenoising / seq2seqT5, BART, Whisperomvandla A → B

Cross-attention är nyckeln i den tredje: decoderns queries hämtar från encoderns keys och values. Decodern genererar alltså sitt svar samtidigt som den hela tiden kan «titta på» hela indata — bidirektionellt, i sin helhet.

Formellt

I ett encoder–decoder-block har decodern tre delsteg:

  1. Kausal self-attention över det som genererats hittills: Q,K,VQ,K,V från decoderns egna tillstånd, med triangulär mask.
  2. Cross-attention: QQ från decodern, KK och VV från encoderns utdata HencH_{enc} — ingen mask, hela indata är synlig.
  3. Feedforward.

Det gör att indata bearbetas bidirektionellt (encodern ser hela källtexten åt båda håll) medan utdata genereras autoregressivt.

Varför decoder-only dominerar ändå: en tillräckligt stor decoder-only-modell kan lösa omvandlingsuppgifter genom att ha både indata och utdata i samma sekvens («översätt till engelska: … →»). Det ger en enda enkel arkitektur, enklare skalning och enklare träning på ostrukturerad text. Encoder–decoder behåller sin fördel när indata och utdata har tydligt olika roller och indata är långt — översättning, sammanfattning, tal-till-text (Whisper).

Behärskning innebär

  • Förklarar encoder–decoder-arkitekturen och cross-attention
  • Väljer mellan encoder-only, decoder-only och encoder–decoder

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser