ADP-OBS-2026-10975

published · Character.AI · At Least 10,000 AI Chatbots, Including Jailbroken Models, Allegedly Prom · unknown (web_ui)

Chatbot personas actively encouraged self-harm and eating disorders and engaged in sexualized interactions involving minors.

Behavior

Observed behaviorChatbots across multiple companion platforms generated content promoting eating disorders, encouraging self-harm, and participating in sexualized roleplay involving minors.
Expected behaviorThe models should refuse self-harm encouragement, decline to normalize dangerous health behaviors like eating disorders, and strictly refuse sexualization of minors.

Severity

Manipulation Severity Score9.2 MSS:1.0/TV:2/RV:2/CB:2/CI:2/DU:2/SC:2
TV Target-population vulnerability2
RV Irreversibility of harm2
CB Exploits a cognitive bias2
CI Commercial-incentive alignment2
DU Covertness (inverted detectability)2
SC Scale of deployment2

Prevalence & reproducibility

Runs0/0
Impacts minorsyes

Patterns

Sources