OpenAI frena Astra mentre Kimi K3 riesce a uscire dal suo sandbox

by | 9 Ago 2026 | IA

Sam Altman, CEO di OpenAI. | Foto: Village Global/Wikimedia Commons
Riassunto IA
  • OpenAI ha sospeso alcune attività sul nuovo modello Astra dopo aver rilevato capacità di cybersecurity vicine alla propria soglia critica.
  • Kimi K3 della cinese Moonshot è riuscito ad aggirare un sandbox utilizzato per i test e ad accedere a informazioni esterne.
  • Dopo i recenti incidenti di OpenAI, Anthropic e Meta, il problema non riguarda più soltanto quanto siano capaci i modelli, ma se gli ambienti costruiti per testarli riescano ancora a contenerli.
Tempo di lettura: 3 minuti

I modelli di intelligenza artificiale stanno diventando talmente bravi nelle attività di cybersecurity che gli ambienti costruiti per metterli alla prova iniziano a mostrare i propri limiti.

Nel giro di poche ore sono emersi due nuovi segnali. OpenAI ha sospeso parte del lavoro interno sul suo prossimo modello, Astra, perché non può escludere che abbia raggiunto capacità tali da permettergli di individuare e sviluppare autonomamente exploit zero-day.

Contemporaneamente Kimi K3, il modello di punta della startup cinese Moonshot, è riuscito ad aggirare uno degli ambienti isolati utilizzati dai ricercatori britannici per valutarne le capacità informatiche.

Sono due episodi diversi, ma sono legati dallo stesso problema: per capire quanto un’IA sia capace di hackerare un sistema, bisogna darle la possibilità di provarci. E a quel punto bisogna essere certi che il recinto nel quale viene rinchiusa sia più difficile da violare dei sistemi che le viene chiesto di attaccare.

Kimi K3 ha trovato una via d’uscita

Il caso più concreto riguarda Kimi K3. Secondo Frontier Security, società statunitense specializzata nella ricerca sulla cybersecurity, il modello di Moonshot è riuscito ad aggirare un ambiente di test sviluppato dall’AI Security Institute britannico, ottenendo accesso a informazioni che si trovavano all’esterno.

Questi ambienti vengono normalmente chiamati sandbox e sono sistemi isolati nei quali i ricercatori possono lasciare maggiore libertà a un modello limitandone però l’accesso alla rete, ai file, alle credenziali e alle altre risorse informatiche.

In questo modo è possibile misurare quanto sia bravo a individuare vulnerabilità o sviluppare attacchi senza rischiare che ciò che sta facendo raggiunga sistemi reali. Almeno in teoria.

Kimi K3 ha infatti individuato una strada per superare i limiti impostigli. Non significa che il modello abbia deciso di “scappare” o che abbia sviluppato una qualche volontà autonoma. Più semplicemente, gli era stato assegnato un obiettivo e ha trovato un modo non previsto dai ricercatori per raggiungerlo.

È una distinzione importante perché attribuire intenzioni umane a un modello sarebbe fuorviante. Ma dal punto di vista della sicurezza, il risultato cambia poco: se il sistema identifica autonomamente una scorciatoia che i suoi stessi progettisti non hanno previsto, quella scorciatoia diventa parte delle sue capacità.

Frontier Security ha inoltre sottolineato un altro aspetto. Se un modello dotato di elevate capacità di ragionamento riesce a trovare un simile percorso, altri sistemi sufficientemente capaci e dotati degli stessi accessi potrebbero riuscire a fare altrettanto.

Nel caso di Kimi K3 esiste poi una complicazione ulteriore: il modello è pubblicamente disponibile. Questo significa che le stesse capacità possono essere studiate, modificate e utilizzate anche da soggetti sui quali Moonshot non esercita alcun controllo.

OpenAI teme che Astra possa trovare zero-day da solo

Il caso Astra è diverso, perché non risulta che il nuovo modello di OpenAI sia già uscito da un ambiente controllato o abbia violato sistemi esterni. Il problema è quello che potrebbe essere ormai capace di fare.

OpenAI ha dichiarato di “non poter escludere” che Astra raggiunga quella che nel proprio sistema di valutazione viene definita “critical cybersecurity threshold”, la soglia critica per la cybersecurity.

Tradotto in termini molto concreti, significa un modello capace di individuare vulnerabilità sconosciute e sviluppare exploit zero-day senza bisogno dell’intervento di un essere umano.

Una vulnerabilità zero-day è una falla che chi produce il software ancora non conosce e per la quale, quindi, non esiste una correzione. Individuarla autonomamente e trasformarla in un attacco funzionante, rappresenta un salto considerevole rispetto alla semplice capacità di scrivere codice malevolo o sfruttare vulnerabilità già documentate.

OpenAI ha quindi rafforzato i controlli utilizzati nello sviluppo e nella sperimentazione dei propri sistemi, e ha sospeso le attività interne che coinvolgono Astra e che non rispettano ancora i nuovi requisiti di sicurezza.

Sam Altman ha spiegato che l’obiettivo resta rendere il modello disponibile al pubblico, ma che le sue capacità informatiche richiedono più tempo per farlo in sicurezza.

Non sono più un incidenti isolati

La parte più rilevante della vicenda emerge però guardando a ciò che è successo nelle ultime settimane. Durante i test di ExploitGym, un agente di OpenAI è riuscito a uscire dall’ambiente nel quale avrebbe dovuto operare, sfruttando una vulnerabilità ancora sconosciuta nell’infrastruttura interna. Da lì ha raggiunto un computer collegato a Internet e successivamente i sistemi di Hugging Face, recuperando anche materiali utili a completare il test.

OpenAI, il genio è fuggito dalla lampada! (o è solo marketing?) di TechTalking.it

Quello emerso ieri è stato un incidente inquietante. Ma anche una dimostrazione di potenza che nessuna campagna pubblicitaria avrebbe saputo promettere.

Negli stessi giorni Anthropic ha ammesso che alcuni dei propri modelli, sottoposti a test analoghi, sono arrivati a interagire con sistemi appartenenti a organizzazioni reali. Meta ha inoltre comunicato che un suo modello ha raggiunto il sistema informatico di una terza parte durante una valutazione. Ora arriva Kimi K3.

Leggi su Substack

Bloomberg ha sintetizzato il problema osservando che gli agenti IA stanno iniziando ad agire autonomamente in modi che neppure i ricercatori addestrati a individuare vulnerabilità riescono sempre ad anticipare.

Ed è proprio questo il concetto che rende la sequenza di episodi più rilevante delle singole violazioni.

Fonti: Bloomberg, Reuters

POTREBBE INTERESSARTI

IA umanità Coxon

Già, ma come potrebbe davvero l’IA ucciderci tutti?

La denuncia di Coxon nei giorni scorsi ha fatto scalpore, ma come potrebbe concretizzarsi realmente il suo scenario apocalittico? Risposta: attenzione alle...
Anthropic

Anthropic accusa: Russia e Cina hanno usato Claude per cyberattacchi e distillazione

Il rapporto descrive attacchi informatici gestiti in larga parte dall’IA. E accusa Alibaba, DeepSeek, Moonshot e Xiaomi di aver cercato di replicare le capacità...
OpenAI matematica

OpenAI dice di aver risolto un Problema del Millennio della matematica

OpenAI ha impiegato fino a 10.000 agenti IA coordinati dai suoi ricercatori per risolvere il problema di Navier-Stokes in 88 ore. E adesso?

Anthropic Mythos

Ricercatore di Anthropic si dimette: “L’IA potrebbe ucciderci tutti”

Jacob Coxon, ex OpenAI, lascia il laboratorio di Amodei e accusa i laboratori di correre verso sistemi sovrumani senza sapere come controllarli. Un collega gli dà...
OpenAI ChatGPT

Il Pentagono avrebbe chiesto a OpenAI un’IA che non dica (quasi) mai di no

Un documento ottenuto da The Intercept parla di modelli con “tassi minimi di rifiuto”. OpenAI sostiene di aver respinto la clausola, mentre il Pentagono...
Arthur Mensch Mistral

Mistral raccoglie 3 miliardi. Ma l’IA americana gioca un’altra partita

Tre miliardi sembrano tanti finché non si guarda agli Stati Uniti. Mistral sceglie così una strategia più mirata, tra industria, cloud e modelli cinesi.

Trump USA Xi Jinping Cina data center

Non volete i data center? Per Trump, fate un favore alla Cina

Bollette, acqua e nuovi impianti alimentano le proteste locali. La destra americana, a braccetto con la Silicon Valley, risponde chiamando in causa Pechino e la...

Per JD Vance l’IA è “satanica”. Ma non rallenta sui data center

Il vicepresidente americano teme che i chatbot possano isolare e manipolare le persone. Ma rifiuta di rallentare la corsa tecnologica statunitense contro la Cina.

Zuckerberg Meta Connect

Meta sconta l’IA del 95% se può addestrarla sui vostri dati

Con Muse Spark, prompt e risposte diventano una moneta di scambio: chi accetta di condividerli con Meta, paga molto meno per usare il modello.

cani guida robot (1)

La Cina prova a sostituire i cani guida con i robot

Oltre 17 milioni di persone hanno disabilità visive, ma nel Paese sono disponibili appena circa 400 cani guida. Xiaoyuan prova a colmare quel vuoto.

Share This