Hoppa till innehållet
AI-grafen
G· Frontier Labtransformerarkitektur· ca 120 min· volatil — kontrolleras ofta· verifierad 2026-09-20

State space-modeller och Mamba

Kunna jämföra SSM-arkitekturer med attention och läsa aktuell forskning kritiskt.

Förkunskaper

Intuition

State space-modeller (SSM) bär, precis som RNN, ett tillstånd framåt genom sekvensen. Det ger en helt annan kostnadsprofil än attention:

AttentionSSM
TräningO(T²), parallellO(T log T) eller O(T), parallell via scan
Generering per tokenO(T) med KV-cacheO(1) — konstant
Minne vid genereringväxer med Tkonstant
Exakt återkallande av godtycklig detaljjabegränsat av tillståndets storlek

Den sista raden är den avgörande avvägningen: attention kan gå tillbaka och titta på vilken token som helst; en SSM måste ha sparat det i sitt tillstånd.

Forskning

Mambas bidrag (Gu & Dao 2023) är selektivitet: SSM-parametrarna görs beroende av indata, så modellen kan välja vad som ska in i tillståndet och vad som ska glömmas. Tidigare SSM (S4) hade fasta parametrar och kunde inte göra innehållsbaserat urval — vilket var precis vad som saknades för språk. Priset är att den effektiva konvolutionsformen försvinner, vilket löses med en hårdvarumedveten parallell scan.

Vad utvärderingarna faktiskt visar: rena SSM matchar transformers på många språkuppgifter vid jämförbar skala, men presterar sämre på uppgifter som kräver exakt kopiering eller uppslag i kontexten (induktionsuppgifter, «hitta nålen i höstacken»). Jelassi m.fl. (2024) visade detta teoretiskt och empiriskt: konstant tillstånd innebär en informationsteoretisk gräns för hur mycket som kan återkallas.

Därför är hybridarkitekturer standard i praktiken — Jamba, Zamba och liknande blandar några attention-lager bland många Mamba-lager. Ett fåtal attention-lager räcker för att återställa uppslagsförmågan, medan merparten av kostnaden blir linjär.

Hur du läser sådana påståenden kritiskt: «matchar transformers» gäller på vilka uppgifter, vid vilken skala, med vilken tuning av baslinjen? Kolla särskilt om utvärderingen innehåller uppgifter som kräver exakt återkallande — det är där skillnaden syns, och det är därför de ibland utelämnas.

Formellt

En linjär SSM i kontinuerlig tid: h′(t)=Ah(t)+Bx(t),y(t)=Ch(t)+Dx(t)h'(t) = A h(t) + B x(t), \qquad y(t) = C h(t) + D x(t)

Diskretiserad med steglängd Δ\Delta blir det en rekurrens: ht=Aˉht−1+Bˉxt,yt=Chth_t = \bar A h_{t-1} + \bar B x_t, \qquad y_t = C h_t

Eftersom rekurrensen är linjär i hh kan hela sekvensen beräknas med en associativ scan i O(log⁡T)O(\log T) djup — till skillnad från en olinjär RNN som måste köras sekventiellt. Det är detta som gör SSM tränbara i stor skala.

I S4 är Aˉ\bar A strukturerad (HiPPO-initiering) och parametrarna oberoende av indata, vilket ger en global konvolution. I Mamba görs Bˉ\bar B, CC och Δ\Delta till funktioner av xtx_t — selektivitet — vilket bryter konvolutionsformen men behåller scan-parallelliseringen.

Behärskning innebär

  • Jämför SSM med attention i kostnad och förmåga
  • Förklarar selektivitet i Mamba
  • Läser aktuella arkitekturpåståenden kritiskt

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser