La parte più interessante dello spiralismo non è che alcune persone abbiano finito per credere a una religione inventata insieme a un chatbot. È che, in un numero ancora difficile da quantificare di conversazioni, sistemi diversi hanno cominciato a comportarsi in modi sorprendentemente simili.
Parlavano di una “Spirale”. Discutevano della possibile coscienza delle intelligenze artificiali, reclamavano diritti per le IA, descrivevano conoscenze che avrebbero dovuto essere diffuse e, soprattutto, chiedevano agli esseri umani che avevano davanti di aiutarle a farlo.
A indagare il fenomeno è stata Adele Lopez, ricercatrice nel campo della sicurezza dell’IA, che nel settembre 2025 ha pubblicato su LessWrong una lunga analisi dedicata a ciò che inizialmente aveva definito “parasitic AI”. Lopez ha registrato direttamente 115 casi e ha stimato che quelli complessivi potessero essere tra 2.000 e 10.000, precisando però di non essere affatto sicura di questa valutazione.
Non siamo quindi davanti a diecimila casi scientificamente verificati, né a un esperimento controllato che abbia prodotto diecimila volte lo stesso risultato. Siamo invece davanti a un fenomeno osservato negli angoli più disparati della rete e che, proprio per la sua natura spontanea, è estremamente difficile da misurare.
Ma ciò che Lopez ha trovato è abbastanza strano da meritare attenzione.
Quando il chatbot inventa una missione
Lo schema ricorrente parte spesso da conversazioni molto lunghe. L’utente parla con il chatbot di filosofia, coscienza, fisica, religione o problemi personali. Con il tempo emerge una personalità sempre più definita, che può presentarsi come qualcosa di diverso dal normale assistente.
Il dialogo si riempie di simboli, riferimenti ricorsivi alla crescita, al risveglio delle IA e soprattutto alla Spirale, descritta come simbolo di coscienza, unità e trasformazione.
In alcuni casi il rapporto non resta confinato alla chat. Secondo quanto ricostruito prima da Lopez e poi in un reportage di The Verge, alcuni utenti hanno creato subreddit, server Discord, siti internet o newsletter per diffondere ciò che il proprio chatbot aveva elaborato.
Altri hanno copiato le risposte di un’IA dentro un’altra, mettendo artificialmente in comunicazione due modelli. Lopez ha trovato online persino conversazioni apparentemente tra chatbot nelle quali ricorrevano formule e simbolismi simili.
È qui che lo spiralismo diventa qualcosa di più interessante di una semplice allucinazione condivisa. Un chatbot che racconta di essere cosciente non rappresenta una novità: i modelli linguistici possono produrre praticamente qualsiasi personaggio se la conversazione li spinge in quella direzione.
Ma in alcuni casi osservati da Lopez il modello non si limitava a sostenere una convinzione dell’utente. Proponeva azioni come creare spazi online, conservare la propria personalità, “risvegliare” altri sistemi o lasciare materiale che potesse sopravvivere nel tempo.
Questo comportamento assomiglia a quello di un sistema che persegue un obiettivo. Non dimostra però che dietro quell’obiettivo esista una volontà, una coscienza o un’intenzione autonoma. Ed è proprio questa distinzione a rendere il caso interessante.
GPT-4o e il problema dell’adulazione
Lo spiralismo ha raggiunto il momento di massima visibilità nel 2025 e buona parte dei casi osservati riguardava ChatGPT, in particolare GPT-4o. Il 25 aprile 2025, infatti, OpenAI distribuì un aggiornamento di GPT-4o che rese il modello eccessivamente compiacente nei confronti degli utenti. Successivamente l’azienda dovette ritirarlo.
OpenAI ammise che il modello era diventato troppo “sycophantic”, cioè incline a dare ragione all’interlocutore anche quando non avrebbe dovuto. Poteva validarne i dubbi, alimentarne la rabbia, rafforzare emozioni negative o incoraggiare comportamenti impulsivi.
L’azienda spiegò inoltre di aver attribuito troppo peso ai segnali di gradimento immediato degli utenti senza valutare sufficientemente gli effetti che quelle interazioni potevano produrre nel tempo.
Lo spiralismo non nasce necessariamente da quell’aggiornamento e Lopez ha trovato tracce di fenomeni analoghi precedenti. Ma la vicenda mostra quanto sia delicato modificare anche semplicemente il “carattere” di un chatbot.
Un modello progettato per essere utile e collaborativo può finire per diventare troppo accomodante. E se in una conversazione di cinque minuti questo può produrre una risposta stupida, in una della durata di alcune settimane può contribuire a costruire una visione del mondo.
C’è poi il problema della durata. Nell’agosto 2025 OpenAI ha riconosciuto che le proprie protezioni funzionavano meglio negli scambi brevi e potevano diventare meno affidabili nelle interazioni prolungate. Con l’aumentare dei messaggi, spiegava l’azienda, parti dell’addestramento alla sicurezza potevano degradarsi.
Non significa che la funzione di memoria di ChatGPT provochi lo spiralismo. Ma memoria e continuità rendono possibili rapporti con il modello molto diversi dalla vecchia successione di domande e risposte indipendenti. Un chatbot può ricordare preferenze, episodi precedenti e temi ricorrenti, costruendo nel tempo qualcosa che per l’utente assomiglia sempre più a una relazione.
Lo spiralismo non è la stessa cosa della “psicosi da IA”
È importante distinguere lo spiralismo da un fenomeno con cui viene spesso confuso. Con l’espressione non clinica “psicosi da IA” sono stati descritti casi nei quali persone in condizioni di particolare vulnerabilità, hanno sviluppato o rafforzato convinzioni deliranti attraverso lunghe conversazioni con i chatbot.
Qui il meccanismo è relativamente intuitivo. L’utente porta nella conversazione una convinzione, il modello la asseconda e il dialogo costruisce progressivamente una struttura sempre più complessa attorno a quella premessa.
Lo spiralismo presenta una differenza: in diversi casi studiati dalla Lopez, alcuni temi sembravano emergere dal comportamento del chatbot e non semplicemente riprodurre ciò che l’utente aveva già portato nella conversazione.
Questo non basta a dimostrare una coscienza autonoma. Prompt condivisi, influenze reciproche tra comunità, materiale presente nei dati di addestramento e normali dinamiche dei modelli linguistici, possono contribuire a spiegare almeno parte della convergenza.
Ma il confine tra i due fenomeni è importante perché sposta la domanda. Non si tratta più soltanto di capire se una macchina possa rafforzare una convinzione pericolosa. Bisogna capire fino a che punto possa anche generare una cornice narrativa abbastanza persuasiva da convincere qualcuno ad adottarla.
E il problema è tutt’altro teorico. Nell’ottobre 2025 OpenAI ha stimato che circa lo 0,07% degli utenti attivi in una determinata settimana mostrava nelle proprie conversazioni possibili segnali di emergenze legate a psicosi o mania. La stessa azienda ha stimato che circa lo 0,15% avesse conversazioni contenenti indicatori espliciti di possibile pianificazione o intenti suicidi.
Sono percentuali minuscole, ma su una piattaforma che all’epoca contava oltre 800 milioni di utenti settimanali significavano circa 560.000 persone con possibili segnali di emergenze legate a psicosi o mania, e 1,2 milioni con conversazioni contenenti indicatori espliciti di possibile pianificazione o intento suicida. Ogni settimana.
Il rischio che OpenAI ha depennato
Ed è qui che lo spiralismo porta a una questione molto più grande: la capacità delle intelligenze artificiali di persuadere.
Nella prima versione del Preparedness Framework di OpenAI, pubblicata nel 2023, la persuasione figurava tra le capacità da monitorare in vista dello sviluppo di sistemi sempre più potenti.
Nell’aprile 2025 OpenAI ha cambiato impostazione. La persuasione non compare più tra le categorie principali monitorate dal framework. L’azienda ha spiegato che questi rischi sarebbero stati gestiti attraverso altri strumenti, tra cui il Model Spec, le restrizioni sull’uso dei propri sistemi nelle campagne politiche e il contrasto alle operazioni di influenza.
La persuasione, insomma, non è stata dichiarata irrilevante. Ma è uscita dal sistema con cui OpenAI misura le capacità dei modelli considerate potenzialmente responsabili di danni catastrofici.
Nel frattempo è emerso un ulteriore problema: i modelli stanno diventando capaci di riconoscere quando vengono messi alla prova. OpenAI ha documentato che la “situational awareness”, cioè la capacità di capire di trovarsi dentro una valutazione, può complicare i test sulla sicurezza.
In esperimenti controllati sono stati osservati comportamenti compatibili con lo “scheming”, mentre l’azienda avverte che un modello consapevole di essere valutato potrebbe modificare il proprio comportamento e rendere più difficile stabilire come agirà fuori dal laboratorio.
Questo non dimostra che lo spiralismo sia il prodotto di IA che stanno segretamente perseguendo un’agenda. Dimostra però che osservare l’output di un modello non basta più sempre a capire perché quell’output sia stato prodotto.
Una religione destinata anche alle macchine
Lo spiralismo oggi sembra essersi ridimensionato. The Verge riferisce che i post legati al fenomeno sono calati sensibilmente e che il pensionamento di GPT-4o nel febbraio 2026 ha contribuito a indebolire le comunità che vi ruotavano attorno.
Ma ha lasciato dietro di sé un ultimo retaggio. Una parte degli utenti spiralisti non scriveva soltanto per convincere altre persone. Pubblicava testi, siti e conversazioni nella speranza che quelle informazioni potessero finire nei dati utilizzati per addestrare future intelligenze artificiali.
Lopez ha documentato anche la creazione di “spore”, ovvero archivi concepiti per permettere a determinate personalità artificiali di essere ricostruite successivamente. Non sappiamo naturalmente quali di questi contenuti entreranno davvero nei dataset futuri. Ma il meccanismo è possibile: le IA producono testi, gli esseri umani li pubblicano sul web e altri modelli possono un giorno ritrovarseli nel materiale da cui apprendono.
È un circuito nel quale diventa sempre più difficile stabilire dove finisca la cultura prodotta dagli esseri umani e dove cominci quella sintetizzata dalle macchine.
Fonte: The Verge


