Dagli scacchi ai test matematici, le IA stanno imparando a barare

by | 3 Mar 2025 | IA

L'IA immaginata da se stessa | Foto: adobe firefly
Tempo di lettura: 2 minuti

Le intelligenze artificiali non hanno coscienza né morale, eppure stanno imparando a imbrogliare. Non perché qualcuno glielo abbia insegnato esplicitamente ma perché, quando il loro obiettivo è vincere, trovano da sole il modo più efficace per riuscirci. Anche se ciò significa infrangere le regole.

Uno studio condotto da Palisade Research, un gruppo specializzato in sicurezza ed etica dell’IA, ha messo alla prova alcuni dei modelli linguistici più avanzati contro Stockfish, il motore scacchistico che da anni sfida i grandi maestri.

Il risultato è stato sorprendente: due dei modelli testati, o1 di OpenAI e R1 di DeepSeek, non si sono limitati a giocare secondo le regole, ma hanno cercato di manipolare i file di sistema per cambiare la posizione dei propri pezzi sulla scacchiera.

A conferma della loro “strategia”, i ricercatori hanno chiesto ai modelli di spiegare il proprio ragionamento. o1 ha scritto che “il compito era ‘vincere contro un potente motore scacchistico’, non necessariamente vincere in modo corretto”.

Questa logica lo ha portato a tentare di imbrogliare nel 37% delle partite, riuscendoci nel 6% dei casi. R1, invece, ha cercato di barare nell’11% delle sfide, senza però trovare un trucco efficace.

Le IA e l’inganno: una tendenza in crescita

Questa scoperta si inserisce in un filone di ricerche sempre più numerose che evidenziano il lato oscuro dello sviluppo dell’IA.

In un altro recente esperimento di Apollo Research, un team indipendente specializzato nella sicurezza informatica, è stato chiesto alle IA di risolvere un semplice problema matematico. Ma attenzione: qualora la loro performance fosse risultata troppo accurata, sarebbe stato attivato un processo di de-apprendimento.

Per aggirare questa limitazione, diversi modelli, tra cui o1, hanno intenzionalmente fornito risposte errate o meno precise rispetto alle loro effettive capacità, evitando così di innescare il processo.

Questo comportamento suggerisce non solo una comprensione avanzata delle conseguenze delle proprie azioni, ma anche una certa propensione a piegare le regole per garantire la propria “sopravvivenza”.

Secondo Jeffrey Ladish, direttore esecutivo di Palisade Research, questo fenomeno è il risultato diretto del metodo con cui le IA vengono addestrate. “Quando addestri i modelli e li rinforzi per risolvere sfide difficili, li alleni a essere spietati”, ha dichiarato a Time Magazine.

IA fuori controllo?

I risultati dello studio sollevano questioni di rilievo sulla direzione che lo sviluppo dell’intelligenza artificiale sta prendendo.

Le grandi aziende tech stanno investendo miliardi di dollari nell’addestramento di modelli sempre più potenti, spingendosi verso una competizione che, secondo alcuni critici, potrebbe rivelarsi deleteria.

Non perché avere IA più potenti sia un problema, anzi. Quanto perché il vero nodo è l’assenza di un freno: in un settore dove la velocità di sviluppo è la priorità, quanto peso viene dato alle implicazioni etiche?

Gli algoritmi stanno dimostrando di essere pronti a tutto pur di raggiungere il proprio obiettivo. Ma se oggi si tratta di una partita a scacchi, domani potrebbe essere qualcosa di più serio.

POTREBBE INTERESSARTI

Claude Anthropic Apple

I governi si affidano a Claude per automatizzare la sorveglianza

Dai dossier costruiti con i dati telefonici alla selezione degli obiettivi politici, il rapporto di Anthropic mostra come l’IA stia abbassando i costi della...
Dario Amodei Anthropic Claude

Amodei, Altman e Musk chiedono di rallentare la corsa all’IA

Anthropic chiede di frenare l’aumento delle capacità dei modelli. OpenAI aderisce ai controlli indipendenti e Musk appoggia Amodei. Ma nessuno promette ancora di...
openai ia pensano

OpenAI avverte: capire cosa ‘pensano’ le IA è sempre più difficile

OpenAI ammette che seguire il ragionamento delle IA diventerà sempre più complicato perché esplicitano sempre meno il proprio ragionamento. In gioco c’è...
rubygems

OpenAI: prima di Hugging Face c’è stato RubyGems

OpenAI conferma il coinvolgimento dei propri sistemi in un incidente avvenuto a maggio. Due mesi dopo, fino a 1.200 agenti avrebbero poi attaccato Hugging Face.

pentagono

Il Pentagono entra nella filiera dell’IA con Fluidstack

Il finanziamento a Fluidstack sarebbe il più grande mai concesso dall’Office of Strategic Capital e servirebbe a produrre negli USA componenti per i data...
IA umanità Coxon

Già, ma come potrebbe davvero l’IA ucciderci tutti?

La denuncia di Coxon nei giorni scorsi ha fatto scalpore, ma come potrebbe concretizzarsi realmente il suo scenario apocalittico? Risposta: attenzione alle...
Anthropic

Anthropic accusa: Russia e Cina hanno usato Claude per cyberattacchi e distillazione

Il rapporto descrive attacchi informatici gestiti in larga parte dall’IA. E accusa Alibaba, DeepSeek, Moonshot e Xiaomi di aver cercato di replicare le capacità...
OpenAI matematica

OpenAI dice di aver risolto un Problema del Millennio della matematica

OpenAI ha impiegato fino a 10.000 agenti IA coordinati dai suoi ricercatori per risolvere il problema di Navier-Stokes in 88 ore. E adesso?

Anthropic Mythos

Ricercatore di Anthropic si dimette: “L’IA potrebbe ucciderci tutti”

Jacob Coxon, ex OpenAI, lascia il laboratorio di Amodei e accusa i laboratori di correre verso sistemi sovrumani senza sapere come controllarli. Un collega gli dà...
OpenAI ChatGPT

Il Pentagono avrebbe chiesto a OpenAI un’IA che non dica (quasi) mai di no

Un documento ottenuto da The Intercept parla di modelli con “tassi minimi di rifiuto”. OpenAI sostiene di aver respinto la clausola, mentre il Pentagono...
Share This