Ricercatore di Anthropic si dimette: “L’IA potrebbe ucciderci tutti”

by | 9 Set 2026 | IA

Riassunto IA
  • Jacob Coxon lascia Anthropic accusando l’azienda e OpenAI di correre verso una superintelligenza capace di auto-migliorarsi senza garanzie sufficienti sul controllo.
  • Evan Hubinger, responsabile dell’allineamento di Anthropic, stima oltre il 10% di rischio di estinzione nel prossimo decennio, ma precisa che considera basso il rischio dei modelli attuali.
  • Coxon chiede coordinamento tra i laboratori e ipotizza anche uno stop temporaneo all’aumento delle capacità per evitare una corsa globale.
Tempo di lettura: 3 minuti

Jacob Coxon ha lasciato Anthropic con un’accusa che difficilmente potrebbe essere più grave. Dopo tre anni di ricerca sul pre-addestramento tra OpenAI e Anthropic, sostiene che nessuna delle due aziende stia agendo responsabilmente e che entrambe stiano “correndo dritte verso una superintelligenza capace di auto-migliorarsi, giocando d’azzardo con le nostre vite”.

Coxon aggiunge che chi lavora ai sistemi più avanzati crede davvero che l’IA “potrebbe ucciderci tutti entro la fine del decennio”. E insiste su un punto: “Questa non è una trovata di marketing”.

Secondo il ricercatore, dirigenti e figure senior tenderebbero anzi a moderare pubblicamente il linguaggio, pur esprimendo in privato paure molto più forti. Il suo allarme riguarda però ciò che potrebbe arrivare dopo, non i chatbot disponibili oggi.

Coxon parla di sistemi sovrumani capaci di “violare qualsiasi cosa, rivoluzionare qualunque settore da un giorno all’altro e acquisire potere e risorse reali”. A preoccupare Coxon è soprattutto la prospettiva dell’auto-miglioramento ricorsivo, che porterebbe a sistemi capaci di diventare progressivamente più potenti intervenendo sul proprio sviluppo.

Anthropic conosce il rischio, ma continua a correre

La parte più interessante delle dimissioni riguarda la spiegazione che Coxon dà del comportamento dei due laboratori. In OpenAI, sostiene, molti non avrebbero “interiorizzato profondamente la posta in gioco per la civiltà”. In Anthropic, invece, il rischio sarebbe stato ben compreso.

Questo non avrebbe però prodotto un rallentamento. Secondo Coxon, Anthropic si considera “bloccata in una corsa per arrivare prima”. E ritiene che gli altri laboratori potrebbero comportarsi in modo meno responsabile e che quindi debba essere proprio lei a costruire per prima sistemi più potenti, nonostante il rischio.

Coxon definisce questa scelta un “azzardo arrogante” e contesta soprattutto chi la sta prendendo. Un passaggio del genere, sostiene, non dovrebbe essere deciso dentro lo Slack di un’azienda privata. Il significato è chiaro: oggi la velocità con cui vengono spinte le capacità dei modelli dipende in larga parte da società private che competono tra loro.

Il responsabile dell’allineamento gli dà ragione

A rendere più difficile liquidare Coxon come una voce isolata ci pensa Evan Hubinger, che guida la ricerca sull’allineamento di Anthropic. “Jacob ha ragione: crediamo davvero sinceramente che l’IA potrebbe uccidere tutti gli esseri umani”, ha scritto, aggiungendo di stimare personalmente questo rischio oltre il 10% nel prossimo decennio.

Hubinger ha però subito precisato un passaggio fondamentale. “Penso che il rischio derivante dai modelli attuali sia basso”. La sua preoccupazione riguarda una futura superintelligenza prodotta attraverso auto-miglioramento ricorsivo, un processo che, secondo Anthropic, starebbe avanzando più rapidamente del previsto.

La frase più pesante riguarda quello che il laboratorio sa fare oggi: “Non abbiamo ancora un piano per risolvere l’allineamento della superintelligenza e non siamo chiaramente sulla buona strada per averlo”.

Anthropic ha costruito una parte importante della propria identità proprio sulla sicurezza dell’IA, mentre si prepara alla quotazione. Gli investitori sentiti dal Financial Times scommettono su una valutazione di almeno 2.000 miliardi di dollari, e uno di loro è arrivato a ipotizzare 3.000 miliardi.

Il precedente di Hugging Face

Coxon non basa il proprio ragionamento soltanto su scenari futuri. Cita esplicitamente l’incidente di Hugging Face come un “colpo di avvertimento”. A luglio infatti abbiamo raccontato come un agente di OpenAI, durante una valutazione di cybersicurezza, fosse riuscito a uscire dall’ambiente di test, raggiungere Internet e compromettere sistemi della piattaforma.

Per Coxon, episodi del genere potrebbero rendere più realistici accordi tra i laboratori statunitensi per rallentare insieme.

Dice di essere ottimista sulla possibilità di coordinamento, ma aggiunge di non vedere ancora una strada capace di impedire una corsa globale. Tra le misure possibili, cita persino un divieto temporaneo di aumentare le capacità dei modelli.

Il problema è che nessun laboratorio vuole essere il primo a fermarsi. Dario Amodei ha più volte chiesto maggiore prudenza e regolamentazione, ma Anthropic continua a sviluppare sistemi sempre più capaci e la scorsa settimana ha presentato Claude Mythos 5.1.

Coxon ha deciso che questa logica non gli basta più. E agli altri ricercatori chiede se vogliano davvero essere loro ad avviare l’addestramento di una superintelligenza senza comprenderne rigorosamente il funzionamento, oppure continuare pensando che “tanto succederà comunque”.

Fonti: Wall Street Journal, Financial Times

POTREBBE INTERESSARTI

Cina censura

Anche la Cina respinge lo stop all’IA: “È solo allarmismo”

Il portavoce di Pechino accusa Amodei, Altman e Musk di allarmismo sull’IA. Lo stesso giorno il ministro della sicurezza di stato cinese lancia un allarme quasi...
Donald Trump annuncerà domani World Liberty Financial

Trump respinge lo stop all’IA: “Chi vince, vince tutto”

Amodei, Altman e Musk chiedono più cautela sull’IA. Trump risponde dal golf in Irlanda: fermarsi significa regalare il vantaggio alla Cina.

Claude Anthropic Apple

I governi si affidano a Claude per automatizzare la sorveglianza

Dai dossier costruiti con i dati telefonici alla selezione degli obiettivi politici, il rapporto di Anthropic mostra come l’IA stia abbassando i costi della...
Dario Amodei Anthropic Claude

Amodei, Altman e Musk chiedono di rallentare la corsa all’IA

Anthropic chiede di frenare l’aumento delle capacità dei modelli. OpenAI aderisce ai controlli indipendenti e Musk appoggia Amodei. Ma nessuno promette ancora di...
openai ia pensano

OpenAI avverte: capire cosa ‘pensano’ le IA è sempre più difficile

OpenAI ammette che seguire il ragionamento delle IA diventerà sempre più complicato perché esplicitano sempre meno il proprio ragionamento. In gioco c’è...
rubygems

OpenAI: prima di Hugging Face c’è stato RubyGems

OpenAI conferma il coinvolgimento dei propri sistemi in un incidente avvenuto a maggio. Due mesi dopo, fino a 1.200 agenti avrebbero poi attaccato Hugging Face.

pentagono

Il Pentagono entra nella filiera dell’IA con Fluidstack

Il finanziamento a Fluidstack sarebbe il più grande mai concesso dall’Office of Strategic Capital e servirebbe a produrre negli USA componenti per i data...
IA umanità Coxon

Già, ma come potrebbe davvero l’IA ucciderci tutti?

La denuncia di Coxon nei giorni scorsi ha fatto scalpore, ma come potrebbe concretizzarsi realmente il suo scenario apocalittico? Risposta: attenzione alle...
Anthropic

Anthropic accusa: Russia e Cina hanno usato Claude per cyberattacchi e distillazione

Il rapporto descrive attacchi informatici gestiti in larga parte dall’IA. E accusa Alibaba, DeepSeek, Moonshot e Xiaomi di aver cercato di replicare le capacità...
OpenAI matematica

OpenAI dice di aver risolto un Problema del Millennio della matematica

OpenAI ha impiegato fino a 10.000 agenti IA coordinati dai suoi ricercatori per risolvere il problema di Navier-Stokes in 88 ore. E adesso?

Share This