Vem läser dina chattar med AI-kompanjonen? Så fungerar moderering egentligen

Integritet och säkerhet

Det mesta du skriver till en AI-kompanjon läses inte av någon människa alls. Något läses, och reglerna för när är oftast gömda i en integritetspolicy. Så här hänger lagren ihop.

Vi kan få provision för länkarna på den här sidan. Det påverkar aldrig ett betyg.

"Moderering" låter som en sak. I kompanjonappar är det minst fyra, som arbetar i olika takt och involverar olika människor.

De fyra lagren

Fyra lager av moderering i AI-kompanjonappar: filter på varje meddelande, automatisk flaggning av samtal, mänsklig granskning av flaggat innehåll och rättsliga begäranden

Varje lager ser mindre innehåll, men ser det mer i detalj.

1. Filter i realtid. Varje meddelande du skickar, och varje svar modellen skriver, kan kontrolleras av automatiska klassificerare innan det visas. De fångar förbjudna kategorier - allt som rör minderåriga, visst våldsinnehåll, tecken på självskada - och antingen blockerar meddelandet, mjukar upp svaret eller visar en varning. Det är därifrån vägranden och krishänvisningar kommer; vår artikel om innehållsfilter förklarar varför de ibland slår till mitt i en scen.

2. Flaggning på samtalsnivå. Separat kan system poängsätta hela samtal eller konton efter mönster: upprepade försök att runda ett filter, trakasserier, tecken på att en minderårig använder en vuxenapp. En flagga är inget straff; det är en notering om att en människa kanske tittar.

3. Mänsklig granskning. Personal för förtroende och säkerhet, ofta hos underleverantörer, granskar en bråkdel av de flaggade samtalen, användaranmälningar och överklaganden. Vissa företag tar också stickprov på vanliga samtal för att kontrollera kvalitet eller träna modeller. Det är det här lagret integritetspolicyer beskriver med fraser som "för att förbättra våra tjänster" eller "för att upprätthålla våra villkor".

4. Rättsliga begäranden. Domstolar, polis och tillsynsmyndigheter kan begära uppgifter med rättsliga beslut. Företag svarar enligt sin policy och lokal lag.

Vad som vanligen utlöser att en människa tittar

UtlösareVarför
Innehåll med minderårigaRättslig skyldighet i de flesta länder; anmäls ofta vidare
Signaler om självskada eller självmordKrisprotokoll krävs nu enligt lag i flera amerikanska delstater
Hot mot verkliga personerPotentiell skada i verkliga världen
Din egen anmälan eller ditt supportärendeDu har bett någon titta
Upprepade försök att runda filterTillämpning av användarvillkoren
Slumpmässiga kvalitetsstickprovProduktförbättring, om policyn tillåter det

Vad de nya lagarna tillför

Amerikanska lagar om kompanjonchattbotar, med början i New York 2025 och Kalifornien 2026, kräver att appar upptäcker uttryck för självmordstankar och självskada och hänvisar användare till kristjänster. Kalifornien kräver också att företagen rapporterar om sina protokoll. I praktiken betyder det mer automatisk övervakning av de känsligaste samtalen, inte mindre. Detaljerna finns i lagstiftning om AI-kompanjoner.

Läs policyn med det här i åtanke

Sök i integritetspolicyn och villkoren efter:

  • "granska", "moderera", "människa" (på engelska "review", "moderate", "human") - om människor läser samtal och varför.
  • "underleverantörer" eller "tjänsteleverantörer" ("contractors", "service providers") - om granskarna arbetar för någon annan.
  • "förbättra", "träna" ("improve", "train") - om vanliga chattar tas i stickprov.
  • "brottsbekämpande myndigheter", "rättslig process", "domstolsbeslut" ("law enforcement", "legal process", "court order") - när uppgifter lämnas ut och om ett domstolsbeslut krävs.

En omsorgsfull policy namnger utlösarna och säger att granskare bara ser samtal när det behövs. En vag policy som låter personalen komma åt "allt innehåll för vilket affärsändamål som helst" säger också något. Våra fyra integritetskontroller täcker resten av dokumentet.

Praktiska slutsatser

  • Skriv som om en granskare kan läsa det, för i ett fåtal fall gör någon det.
  • Håll andra människors identifierande uppgifter utanför chattarna, särskilt i explicita scener - en granskare som läser ett flaggat samtal ser dem också.
  • Om ett filter slår fel i fiktion löser en notering utanför rollen det oftast; att argumentera i rollen kan ge fler flaggor.
  • Om du över allt annat bryr dig om vem som kan läsa dina chattar är den enda uppsättning där ingen annan kan det en kompanjon som körs på din egen dator - se köra en AI-kompanjon lokalt.

Moderering är inte detsamma som övervakning. För de allra flesta samtal tittar ingenting och ingen bortom det automatiska filtret. Men policyn, inte appens värme, avgör undantagen - och det är värt att känna till dem innan du behöver dem.

Vanliga frågor

Läser anställda mina chattar med min AI-flickvän?

Oftast inte som rutin, men de flesta appar förbehåller sig rätten. Personalen ser typiskt samtal som flaggats av automatiska system, anmälts, ingått i ett supportärende eller stickprovsvis valts ut för att förbättra produkten. Integritetspolicyn bör säga vilket som gäller.

Vad händer om jag blir flaggad?

De flesta flaggor leder till inget du märker, eller till ett blockerat meddelande eller en varning. Upprepade eller allvarliga överträdelser kan leda till att kontot stängs av. Innehåll med minderåriga eller verkliga hot kan anmälas till myndigheter.

Kan polisen få tag på mina chattar med AI-kompanjonen?

De kan begära ut dem från företaget, och företag följer giltiga rättsliga beslut. Mozillas granskning från 2024 fann att de flesta tillverkare av romantiska chattbotar sa att de kunde dela uppgifter med myndigheter, ibland utan domstolsbeslut. Utgå från att allt som lagras kan lämnas ut.