"Moderering" låter som en sak. I kompanjonappar är det minst fyra, som arbetar i olika takt och involverar olika människor.
De fyra lagren

Varje lager ser mindre innehåll, men ser det mer i detalj.
1. Filter i realtid. Varje meddelande du skickar, och varje svar modellen skriver, kan kontrolleras av automatiska klassificerare innan det visas. De fångar förbjudna kategorier - allt som rör minderåriga, visst våldsinnehåll, tecken på självskada - och antingen blockerar meddelandet, mjukar upp svaret eller visar en varning. Det är därifrån vägranden och krishänvisningar kommer; vår artikel om innehållsfilter förklarar varför de ibland slår till mitt i en scen.
2. Flaggning på samtalsnivå. Separat kan system poängsätta hela samtal eller konton efter mönster: upprepade försök att runda ett filter, trakasserier, tecken på att en minderårig använder en vuxenapp. En flagga är inget straff; det är en notering om att en människa kanske tittar.
3. Mänsklig granskning. Personal för förtroende och säkerhet, ofta hos underleverantörer, granskar en bråkdel av de flaggade samtalen, användaranmälningar och överklaganden. Vissa företag tar också stickprov på vanliga samtal för att kontrollera kvalitet eller träna modeller. Det är det här lagret integritetspolicyer beskriver med fraser som "för att förbättra våra tjänster" eller "för att upprätthålla våra villkor".
4. Rättsliga begäranden. Domstolar, polis och tillsynsmyndigheter kan begära uppgifter med rättsliga beslut. Företag svarar enligt sin policy och lokal lag.
Vad som vanligen utlöser att en människa tittar
| Utlösare | Varför |
|---|---|
| Innehåll med minderåriga | Rättslig skyldighet i de flesta länder; anmäls ofta vidare |
| Signaler om självskada eller självmord | Krisprotokoll krävs nu enligt lag i flera amerikanska delstater |
| Hot mot verkliga personer | Potentiell skada i verkliga världen |
| Din egen anmälan eller ditt supportärende | Du har bett någon titta |
| Upprepade försök att runda filter | Tillämpning av användarvillkoren |
| Slumpmässiga kvalitetsstickprov | Produktförbättring, om policyn tillåter det |
Vad de nya lagarna tillför
Amerikanska lagar om kompanjonchattbotar, med början i New York 2025 och Kalifornien 2026, kräver att appar upptäcker uttryck för självmordstankar och självskada och hänvisar användare till kristjänster. Kalifornien kräver också att företagen rapporterar om sina protokoll. I praktiken betyder det mer automatisk övervakning av de känsligaste samtalen, inte mindre. Detaljerna finns i lagstiftning om AI-kompanjoner.
Läs policyn med det här i åtanke
Sök i integritetspolicyn och villkoren efter:
- "granska", "moderera", "människa" (på engelska "review", "moderate", "human") - om människor läser samtal och varför.
- "underleverantörer" eller "tjänsteleverantörer" ("contractors", "service providers") - om granskarna arbetar för någon annan.
- "förbättra", "träna" ("improve", "train") - om vanliga chattar tas i stickprov.
- "brottsbekämpande myndigheter", "rättslig process", "domstolsbeslut" ("law enforcement", "legal process", "court order") - när uppgifter lämnas ut och om ett domstolsbeslut krävs.
En omsorgsfull policy namnger utlösarna och säger att granskare bara ser samtal när det behövs. En vag policy som låter personalen komma åt "allt innehåll för vilket affärsändamål som helst" säger också något. Våra fyra integritetskontroller täcker resten av dokumentet.
Praktiska slutsatser
- Skriv som om en granskare kan läsa det, för i ett fåtal fall gör någon det.
- Håll andra människors identifierande uppgifter utanför chattarna, särskilt i explicita scener - en granskare som läser ett flaggat samtal ser dem också.
- Om ett filter slår fel i fiktion löser en notering utanför rollen det oftast; att argumentera i rollen kan ge fler flaggor.
- Om du över allt annat bryr dig om vem som kan läsa dina chattar är den enda uppsättning där ingen annan kan det en kompanjon som körs på din egen dator - se köra en AI-kompanjon lokalt.
Moderering är inte detsamma som övervakning. För de allra flesta samtal tittar ingenting och ingen bortom det automatiska filtret. Men policyn, inte appens värme, avgör undantagen - och det är värt att känna till dem innan du behöver dem.