Många tror att en app för AI-kompanjon är en enda intelligens som kan prata, rita och tala. Det är tre eller fyra separata system som appen kopplar ihop, och det mesta av frustrationen i den här delen av produkten kommer från skarvarna mellan dem.
Tre motorer, ett gränssnitt
Språkmodellen sköter samtalet. Den producerar text och inget annat.
Bildmodellen är ett helt annat system, oftast en diffusionsmodell. Den tar en textbeskrivning och skapar en bild. Den har aldrig sett ditt samtal.
Talsystemet gör om text till ljud. Också separat, och också blint för allt utom meningen som lämnas till det.
När du ber din kompanjon om en selfie går det till så här: språkmodellen skriver en kort beskrivning av den begärda bilden, appen lägger till karaktärens lagrade utseendetaggar, den sammanslagna prompten går till bildmodellen och en bild kommer tillbaka. Chatten reagerar sedan på en bild som den inte kan se, utifrån beskrivningen den själv skrev.
Den stafetten är källan till nästan alla klagomål på media i den här kategorin.
Varför ansiktet ändras hela tiden
En diffusionsmodell hämtar inte din karaktär, den skapar någon som matchar en beskrivning. ”Långt mörkt hår, gröna ögon, mitten av tjugoårsåldern” beskriver miljontals ansikten, och du får ett nytt varje gång.
Apparna löser det i olika grad:
- Lagrade utseendetaggar – samma beskrivande sträng varje gång. Billigt,
och bara ungefärligt konsekvent.
- En referensbild som styr varje generering. Mycket bättre, och det vanliga
tillvägagångssättet när ansikten förblir igenkännbara.
- En finjusterad modell per karaktär – mest konsekvent och klart dyrast,
så den finns oftast bara på högre nivåer.
Det här är en verklig skillnad som är värd att testa i en gratisversion innan du betalar. Generera fyra bilder av samma karaktär i olika situationer. Får du fyra olika kvinnor kan ingen prenumeration rätta till det. Karaktärskonsekvens mellan bilder är en stor del av varför Candy AI leder vår rankning, och varför Secret Desires, som bygger utseende, röst och personlighet tillsammans och lägger till kort video, får poäng där.
Varför media alltid mäts
Text är billigt. Att generera ett chattsvar kostar operatören en bråkdel av ett öre.
En bild kostar märkbart mer per generering. Röst faktureras per sekund ljud. Video är dramatiskt dyrare än båda.
Skillnaden i kostnad är hela skälet till prisstrukturen du ser överallt i den här kategorin: generösa meddelandekvoter, snäva bildtak, röstminuter som säljs separat, video begränsad till övre nivåer. Det är inte konstgjord brist för att sälja mer till dig – det är den verkliga formen på räkningen som operatören får, vidareförd.
Därför betyder ”obegränsat” på den här marknaden nästan alltid obegränsad text. Läs det så och prissidorna blir plötsligt begripliga. Räkneexemplen finns i vad bildgenerering egentligen kostar dig.
Vad röst tillför, och vad den kostar
Röst förändrar upplevelsen mer än de flesta väntar sig. Att läsa ett meddelande och att höra det är olika saker, och skiftet är större än den tekniska beskrivningen låter påskina.
Två saker att kontrollera innan du betalar för det:
Fördröjning. En paus på tre sekunder före varje svar bryter illusionen helt. Testa det i en gratisversion eller en provperiod, inte utifrån en demovideo.
Om det är ett samtal eller ett meddelande. Röstmeddelanden – karaktären läser upp sitt svar – är vanliga och billiga. Samtal i realtid, där du pratar och den svarar, är en annan produkt och oftast en annan nivå. Nomi listar röstsamtal bland sina funktioner, men många appar listar ”röst” och menar meddelanden.
Vad bilder inte klarar
Två gränser att känna till innan du blir besviken:
Händer, text och fina detaljer är fortfarande opålitliga i varje generator i den här kategorin. Ingen har löst det, och en app som lovar något annat beskriver sitt bästa resultat, inte sitt genomsnitt.
Bilden känner inte till din scen. Chattmodellen skriver en prompt på en rad, så allt som inte står på den raden försvinner – rummet du beskrev, vad hon hade på sig för tre meddelanden sedan, tid på dygnet. Att vara tydlig i begäran rättar till mer av det än någon inställning.
Så bedömer du mediesidan på en kväll
Använd hela gratisversionens kvot i en enda session i stället för en bild om dagen. Du testar fyra saker:
- Konsekvens – fyra bilder, samma karaktär, olika situationer.
- Följsamhet mot prompten – be om något specifikt och se hur mycket som överlever.
- Fördröjning – både för bilder och röst.
- Vad som räknas mot taket – om en misslyckad eller nekad generering
ändå kostar dig.
Den sista är den minst dokumenterade och den mest irriterande att upptäcka efter att du betalat. Tillsammans med resten av vad gratisversionerna egentligen innehåller är det sådant som bara visar sig när du använder produkten på riktigt.

