Varför tar det tid när AI:n svarar?
Kunna förklara att svaret byggs ord för ord och varför långa svar tar längre tid.
Förkunskaper
Vardagsförklaring
Har du märkt att svaret dyker upp bit för bit, som om någon skrev det?
Det är inte en animation. Det är precis vad som händer.
Modellen gör en sak i taget:
"Huvudstaden"
"Huvudstaden i"
"Huvudstaden i Sverige"
"Huvudstaden i Sverige är"
"Huvudstaden i Sverige är Stockholm"
För varje bit körs hela modellen en gång. Ett svar på 200 ord betyder ungefär 300 sådana körningar, en efter en.
Två väntetider, och de känns olika:
| Vad det är | Typiskt | |
|---|---|---|
| Tid till första ordet | modellen läser frågan och startar | 0,3–2 s |
| Tid per ord därefter | en körning per bit | 10–50 ms |
Därför känns strömmande svar snabbare även när de tar lika lång tid totalt — du ser att något händer i stället för att stirra på en tom ruta.
Intuition
Vad som påverkar väntetiden:
| Faktor | Effekt | Varför |
|---|---|---|
| Svarets längd | stor | en körning per ord |
| Modellens storlek | stor | fler beräkningar per ord |
| Frågans längd | på första ordet | hela frågan måste läsas in först |
| Kö hos leverantören | varierande | många använder samtidigt |
| Avstånd till servern | litet | nätverkets restid |
Frågans längd och svarets längd påverkar olika delar. En lång fråga gör att det tar längre innan det första ordet kommer, men sedan går det lika fort. Ett långt svar gör hela svaret längre.
Därför är «svara kort» ett av de effektivaste sätten att göra en AI-funktion snabbare — och det kostar mindre också.
Varför kan den inte göra allt på en gång? Därför att varje ord beror på de föregående. Modellen måste veta att den skrev «Huvudstaden i Sverige är» för att kunna välja «Stockholm». Den kan inte gissa ord 50 innan den bestämt ord 49.
Men den kan hjälpa flera samtidigt. När många frågar på en gång kan servern köra dem parallellt, eftersom de inte beror på varandra. Det är därför tjänsterna klarar miljontals användare trots att varje enskilt svar är sekventiellt.
En sak till som går snabbare: har du redan ställt en fråga med samma inledning kan servern återanvända delar av arbetet. Det kallas cachning och är skälet till att uppföljningsfrågor i ett långt samtal ofta startar snabbare än man tror.
Interaktivt
Mät själv. Ta tid med mobilen i en chatbot.
| # | Prova | Mät |
|---|---|---|
| 1 | «Vad är huvudstaden i Sverige?» | tid till första ordet, och totaltid |
| 2 | «Skriv en uppsats på 500 ord om Sverige» | samma två tider |
| 3 | Klistra in en lång text och fråga «sammanfatta i en mening» | samma |
| 4 | Samma fråga som 1, men ställ den två gånger i samma samtal | jämför |
Vad du bör se:
| Prov | Första ordet | Totalt | Varför |
|---|---|---|---|
| 1 | snabbt | snabbt | kort fråga, kort svar |
| 2 | snabbt | långsamt | svaret är långt — många körningar |
| 3 | långsamt | snabbt totalt | lång fråga att läsa in, kort svar |
| 4 | ofta snabbare | delar av arbetet kan återanvändas |
Prov 2 och 3 tillsammans är poängen. De visar att de två väntetiderna är oberoende: det som gör starten långsam är frågans längd, det som gör helheten långsam är svarets längd.
Praktisk slutsats. Vill du att en AI-funktion ska kännas snabb:
- Be om korta svar.
- Skicka inte med mer text än nödvändigt.
- Visa svaret medan det skrivs, i stället för att vänta tills allt är klart.
Den tredje är den billigaste och gör mest för hur det upplevs.
Behärskning innebär
- Förklarar att svaret byggs token för token
- Vet varför långa svar tar längre tid
- Känner till vad som påverkar väntetiden
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- Internetstiftelsen — Internetkunskap — fri läsning
- Hugging Face — dokumentation (Apache-2.0) — Apache-2.0
- Skolverket — Om AI i skolan — Skolverkets öppna villkor