Ett röstsamtal är det mest krävande en AI-kompanjon gör. Text kan ta några sekunder utan att någon bryr sig. Tal kan inte det: människor märker fördröjningar som skulle vara osynliga i ett chattfönster.
Problemet med 200 millisekunder
Forskare som jämförde samtal på tio språk fann att den typiska pausen mellan att en person slutar och nästa börjar är omkring 200 millisekunder – och den är anmärkningsvärt lik mellan kulturer. Människor börjar planera sitt svar innan den andra har pratat klart. Betydligt längre pauser tolkas som tvekan, förvirring eller ointresse.
En AI måste få in en hel kedja av steg i ungefär det fönstret för att kännas naturlig.
Vad som händer mellan dina ord och hennes

Den klassiska kedjan. Nyare system låter stegen överlappa eller slår ihop dem.
- Upptäcka slutet på talet. Systemet måste avgöra att du är klar, inte bara har gjort en paus. För ivrigt och det avbryter dig. För försiktigt och det blir tyst i onödan.
- Tal till text. Dina ord transkriberas.
- Svaret. Språkmodellen skriver ett svar, i rollen och med minne.
- Text till tal. Svaret görs om till en röst – helst karaktärens egen, med känsla.
I äldre system väntar varje steg på att det förra ska bli klart. Nyare system börjar tala första meningen medan resten fortfarande skrivs, eller använder modeller som tar emot tal och ger tal direkt, vilket helt tar bort transkriberingen och syntesen.
Varför röst mäts
| Textchatt | Röstmeddelande | Röstsamtal i realtid | |
|---|---|---|---|
| Hastighet som krävs | Sekunder går bra | Sekunder går bra | Delar av en sekund |
| Extra bearbetning | Ingen | Talsyntes | Igenkänning, syntes, turtagning |
| Typisk längd | Korta svar | Ett svar | Minuter till timmar |
| Relativ kostnad | Lägst | Måttlig | Högst |
| Hur appar säljer det | Ingår | Ingår eller krediter | Minuter, nivåer eller krediter |
Varje minut av ett samtal kör hela kedjan oavbrutet, ofta på dyrare ”realtidsversioner” av varje modell. Det är därför röst oftast är det första en app sätter tak för, och varför ”obegränsat” sällan gäller den – se så läser du funktionslistor för AI-flickvänner.
Vad som får ett samtal att kännas äkta
- Låg fördröjning, jämnt. En enstaka lång paus bryter illusionen mer än ett något långsammare genomsnitt.
- Hantering av avbrott. Att kunna avbryta, och att hon tystnar och svarar, är det som skiljer ett samtal från röstmeddelanden i turordning.
- Konsekvent röst. Samma röst, brytning och värme från samtal till samtal. Våra testare fann att röstkvaliteten kan skilja märkbart mellan karaktärer, även i bra appar.
- Prosodi. Skratt, pauser, mjukare tonfall – tal som bär känsla i stället för att läsa upp text.
- Minne i röstläge. Vissa appar använder en lättare modell för samtal, så karaktären minns mindre i telefon än i chatten.
Testa en röstfunktion innan du betalar
- Fråga vad som ingår: röstmeddelanden, livesamtal eller båda – och hur många minuter.
- Ring ett tvåminuterssamtal under en provperiod eller på den billigaste planen, på mobildata såväl som wifi.
- Avbryt henne mitt i en mening. Tystnar hon?
- Fråga om något från din textchatt. Vet hon det?
- Kolla kostnaden per extra minut eller kredit. Ett långt samtal kan göra av en månads kvot.
Den bredare poängen om mediekostnader finns i så fungerar bilder och röst hos AI-flickvänner, och om det lönar sig att uppgradera för röst behandlas i premiumnivåer.
Om välbefinnande
Röst är mer uppslukande än text, och forskningen från OpenAI och MIT 2025 fann att kort röstanvändning hängde ihop med bättre välbefinnande medan tung daglig användning inte gjorde det. Det är värt att njuta av i lagom doser – tecknen på för mycket finns i när en AI-kompanjon börjar ta mer än den ger.