Physical Intelligence sostiene di essere nel “momento ChatGPT” della robotica

by | 17 Apr 2026 | IA

Foto: Physical Intelligence
Riassunto IA
  • Physical Intelligence ha pubblicato una ricerca sul modello π0.7, che secondo l’azienda mostra i primi segnali di generalizzazione compositiva in robotica.
  • Il modello risponde a istruzioni verbali in linguaggio naturale, il che suggerisce che i robot potrebbero essere istruiti in tempo reale senza ulteriore raccolta dati né ri-addestramento.
  • La startup, già valutata 5,6 miliardi di dollari, sarebbe in trattativa per un round che porterebbe la valutazione a 11 miliardi, senza alcun cronoprogramma di commercializzazione.
Tempo di lettura: 3 minuti

Il robot guarda la friggitrice ad aria. Non l’ha mai vista prima, o quasi. Nei dati di addestramento ci sono solo due episodi in cui compare un elettrodomestico di quel tipo: in uno, un altro robot si limita a spingerla per chiuderla; nell’altro, un robot ancora diverso ci infila dentro una bottiglia di plastica.

Eppure, guidato a voce da un ricercatore umano, il robot apre la friggitrice, mette dentro una patata dolce, la avvia. Il compito riesce.

La scena viene da un paper pubblicato giovedì da Physical Intelligence, la startup di San Francisco fondata due anni fa e diventata silenziosamente una delle aziende di IA più osservate della Bay Area.

Il nuovo modello si chiama π0.7 e, secondo l’azienda, mostra i primi segnali di una capacità a lungo inseguita nella robotica: la generalizzazione compositiva. In parole povere, saper rimescolare competenze apprese in contesti diversi per affrontare problemi mai visti.

I ricercatori stessi, che di quel modello conoscono ogni riga del dataset, dicono di essere stati colti di sorpresa dai risultati. E questo, più delle singole dimostrazioni, è il punto.

Perché potrebbe essere relmente importante

Finora la robotica ha funzionato a memoria. Si raccolgono dati su un compito specifico, si addestra un modello specialistico, si ricomincia daccapo per il compito successivo. Ogni robot, in sostanza, è un apprendista da istruire per ogni singola mansione.

È il motivo per cui i video virali di robot che fanno capriole non si sono mai tradotti in macchine realmente utili nelle case o nelle fabbriche: la dimostrazione è una cosa, la generalizzazione è un’altra.

Physical Intelligence sostiene che π0.7 rompa questo schema. E soprattutto che lo faccia secondo una dinamica familiare a chi ha seguito l’evoluzione dei modelli linguistici.

“Una volta superata quella soglia in cui il modello passa dal fare solo le cose per cui raccogli dati al rimescolarle in modi nuovi”, spiega Sergey Levine, cofondatore dell’azienda e professore alla UC Berkeley, “le capacità crescono più che linearmente con la quantità di dati. Quella proprietà di scaling più favorevole l’abbiamo già vista in altri domini, come il linguaggio e la visione”.

Tradotto: se la tesi regge, la robotica potrebbe avvicinarsi al proprio momento di svolta, quello in cui i capisaldi smettono di essere sommati uno per uno e iniziano a comporsi. La stessa dinamica che ha portato dai primi chatbot a ChatGPT.

Il condizionale, però, resta d’obbligo. I risultati sono auto-riportati, e l’azienda stessa ammette che benchmark standardizzati per la robotica non esistono.

Il robot che impari mentre lavora

L’aspetto meno raccontato della ricerca non è la generalizzazione in sé, ma il modo in cui si attiva. Nel primo tentativo con la friggitrice, senza alcuna istruzione, il modello ha prodotto un tasso di successo del 5%. Dopo circa mezz’ora spesa a riformulare il prompt, a spiegare meglio al robot cosa fare, in linguaggio naturale, è salito al 95%.

Lo racconta Lucy Shi, ricercatrice di Physical Intelligence e dottoranda a Stanford, che a quella voce aggiunge una precisazione rivelatrice: “A volte il fallimento non è causato dal robot o dal modello. Siamo noi che non siamo stati bravi nel prompt engineering”.

Finora, per insegnare un nuovo compito a un robot, serviva raccogliere dati, ri-addestrare il modello, validarlo. Operazioni da settimane o mesi, con team di ingegneri dedicati. Se il coaching verbale funziona, il robot si istruisce in tempo reale come un nuovo dipendente alla prima settimana. Il che cambia chi può dispiegare un robot, con quali costi, e inevitabilmente in quali mansioni.

Il modello, sia chiaro, non è ancora in grado di eseguire compiti complessi multi-step da un singolo comando. “Non puoi dirgli ‘ehi, vai a farmi del toast'”, ammette Levine. Ma se lo accompagni passo passo (apri lo sportello, premi il pulsante, aspetta), funziona. Misurato contro i precedenti modelli specialistici della stessa azienda, π0.7 ha eguagliato le prestazioni in lavori come preparare un caffè, piegare la biancheria, assemblare scatole.

Physical Intelligence: i limiti, i soldi

I modelli linguistici hanno però avuto l’intero web da cui imparare. I robot n, e nessun prompt ben formulato colma davvero quel divario. Il paper stesso usa un linguaggio prudente: “primi segnali”, “dimostrazioni iniziali”.

Non un prodotto, non un serie d’intenti. Interrogato su quando un sistema basato su questi risultati potrebbe essere pronto per il mondo reale, Levine non dà una risposta.

Gli investitori, al contrario, non hanno questo problema. Physical Intelligence ha raccolto oltre un miliardo di dollari ed è stata valutata l’ultima volta 5,6 miliardi. Secondo le indiscrezioni, la società starebbe ora trattando un nuovo round che porterebbe la valutazione a 11 miliardi. Il che è quasi il doppio in pochi mesi, a fronte di risultati di ricerca che gli stessi autori definiscono preliminari.

È il copione ormai consueto del capitale che corre davanti alla tecnologia, e la domanda non è se Physical Intelligence abbia ragione sulla direzione. È se la distanza tra “primi segnali” e robot realmente utili si misuri in mesi, in anni, o in un’altra generazione di promesse.

Fonte: TechCrunch

POTREBBE INTERESSARTI

caisi chris fall trump

L’agenzia americana sull’IA perde il terzo direttore in un anno

Chris Fall lascia il CAISI, l’agenzia federale che valuta i modelli di IA, dopo il predecessore rimosso in meno di una settimana per il suo passato in Anthropic....
aziende IA

Meno junior e meno manager: così l’IA sta appiattendo le aziende

Uno studio sulle aziende costruite attorno all’IA mostra realtà più piccole del 25%, con meno livelli gerarchici e più capitale per dipendente. È il modello che...
Christopher Nolan

Nolan: “L’IA è un cavallo di Troia di vetro, si vedono i greci dentro”

Il presidente della Directors Guild of America legge il rifiuto dei più giovani come un segnale sano. Ma gli studios stanno firmando accordi con le società di...
moonshot kimi k3

Kimi K3 ha azzerato il vantaggio americano nell’IA?

Moonshot AI mostra che il distacco tra i due Paesi può essere recuperato rapidamente e mette sotto pressione prezzi, investimenti e restrizioni sui chip.

David Chiu deepfake

San Francisco ordina ad Apple e Google di rimuovere dozzine di app di deepfake

La città di San Francisco accusa i due colossi tecnologici di aver ignorato le normative e di aver tratto profitto dalla diffusione di software per deepfake non...
Mark Zuckerberg Meta

Meta tratta con Anthropic: dieci miliardi per affittare i suoi data center

Meta costruisce data center propri e ne affitta altri per stare al passo. Ora valuta di rivendere la sua capacità ad Anthropic, cioè al concorrente che i suoi modelli...
Tim Cook Apple

Apple supera Nvidia e torna la società più capitalizzata al mondo

Il sorpasso arriva mentre gli investitori spostano l’attenzione dai chip alla capacità di Apple di monetizzare l’IA con servizi e dispositivi.

Mira Murati Thinking Machines

Thinking Machines risponde al conto salato dell’IA a consumo con Inkling

Con il suo primo modello open-weight, la startup fondata dall’ex CTO di OpenAI punta a spostare il potere dai grandi laboratori alle aziende che useranno...
Sam Altman ChatGPT OpenAI

OpenAI: il primo dispositivo sarà uno speaker senza schermo che “vive” con noi

Con 400 ex dipendenti Apple nel team e 6,5 miliardi spesi per acquisire io Products, OpenAI scommette che un oggetto capace di ascoltare, vedere e muoversi possa...
Google Deepmind

Demis Hassabis chiede un ente USA per testare le IA più avanzate

Il ceo di Google DeepMind propone un ente ispirato alla Finra per testare i modelli AI più avanzati. Arriva a un mese dal blocco lampo dei modelli di Anthropic e dal...
Share This