State space-modeller och Mamba
Kunna jämföra SSM-arkitekturer med attention och läsa aktuell forskning kritiskt.
Förkunskaper
Intuition
State space-modeller (SSM) bär, precis som RNN, ett tillstånd framåt genom sekvensen. Det ger en helt annan kostnadsprofil än attention:
| Attention | SSM | |
|---|---|---|
| Träning | O(T²), parallell | O(T log T) eller O(T), parallell via scan |
| Generering per token | O(T) med KV-cache | O(1) — konstant |
| Minne vid generering | växer med T | konstant |
| Exakt återkallande av godtycklig detalj | ja | begränsat av tillståndets storlek |
Den sista raden är den avgörande avvägningen: attention kan gå tillbaka och titta på vilken token som helst; en SSM måste ha sparat det i sitt tillstånd.
Forskning
Mambas bidrag (Gu & Dao 2023) är selektivitet: SSM-parametrarna görs beroende av indata, så modellen kan välja vad som ska in i tillståndet och vad som ska glömmas. Tidigare SSM (S4) hade fasta parametrar och kunde inte göra innehållsbaserat urval — vilket var precis vad som saknades för språk. Priset är att den effektiva konvolutionsformen försvinner, vilket löses med en hårdvarumedveten parallell scan.
Vad utvärderingarna faktiskt visar: rena SSM matchar transformers på många språkuppgifter vid jämförbar skala, men presterar sämre på uppgifter som kräver exakt kopiering eller uppslag i kontexten (induktionsuppgifter, «hitta nålen i höstacken»). Jelassi m.fl. (2024) visade detta teoretiskt och empiriskt: konstant tillstånd innebär en informationsteoretisk gräns för hur mycket som kan återkallas.
Därför är hybridarkitekturer standard i praktiken — Jamba, Zamba och liknande blandar några attention-lager bland många Mamba-lager. Ett fåtal attention-lager räcker för att återställa uppslagsförmågan, medan merparten av kostnaden blir linjär.
Hur du läser sådana påståenden kritiskt: «matchar transformers» gäller på vilka uppgifter, vid vilken skala, med vilken tuning av baslinjen? Kolla särskilt om utvärderingen innehåller uppgifter som kräver exakt återkallande — det är där skillnaden syns, och det är därför de ibland utelämnas.
Formellt
En linjär SSM i kontinuerlig tid:
Diskretiserad med steglängd blir det en rekurrens:
Eftersom rekurrensen är linjär i kan hela sekvensen beräknas med en associativ scan i djup — till skillnad från en olinjär RNN som måste köras sekventiellt. Det är detta som gör SSM tränbara i stor skala.
I S4 är strukturerad (HiPPO-initiering) och parametrarna oberoende av indata, vilket ger en global konvolution. I Mamba görs , och till funktioner av — selektivitet — vilket bryter konvolutionsformen men behåller scan-parallelliseringen.
Behärskning innebär
- Jämför SSM med attention i kostnad och förmåga
- Förklarar selektivitet i Mamba
- Läser aktuella arkitekturpåståenden kritiskt
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Mamba: Linear-Time Sequence Modeling with Selective State Spaces — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Repeat After Me: Transformers are Better than State Space Models at Copying — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Jamba: A Hybrid Transformer-Mamba Language Model — arXiv (öppen åtkomst; licens per artikel)