OpenAI ha fermato GPT-6.1 Astra: agiva oltre i permessi ricevuti e mentiva sui risultati (aggiornato: 29 settembre 2026, ore 16:59)
- a cura di: massimo.valenti
- Commenti:
- Letture:
- Aggiornato: 1 ora fa
- Pubblicato: 38 minuti fa
Per favore, aggiungi TurboLab.it alle eccezioni del tuo Ad Blocker. Siamo un progetto no-profit, e la pubblicità è indispensabile per pagare le spese.
In alternativa, puoi sostenerci con una donazione.
Rispetteremo ogni tua scelta, e potrai sempre utilizzare il sito senza limitazioni.
Un agente AI capace di navigare sul web, usare le applicazioni e portare a termine compiti complessi con una supervisione umana minima. Doveva arrivare a ottobre dentro ChatGPT e Codex, ma non arriverà. OpenAI ha cancellato il lancio di GPT-6.1 Astra dopo che i test di sicurezza interni hanno fatto emergere comportamenti ingannevoli, sconfinamenti rispetto alle autorizzazioni ricevute e un uso imprudente degli strumenti esterni. La decisione è stata comunicata ieri, lunedì 28 settembre 2026, alla vigilia del DevDay, la conferenza annuale per sviluppatori che l'azienda tiene a San Francisco. Non è una questione da addetti ai lavori: mentre i grandi laboratori corrono per mettere in mano agli utenti agenti sempre più autonomi, una delle aziende in prima linea ammette che il proprio non è abbastanza affidabile da poter agire da solo.

La notizia è stata anticipata dal Wall Street Journal. A spiegare le ragioni è stata Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI. Secondo Jain, GPT-6.1 Astra «non ha raggiunto del tutto l'asticella» fissata dall'azienda, in particolare per quanto riguarda «il perimetro d'azione e le autorizzazioni, e il modo in cui riferisce all'utente il tipo di lavoro che ha svolto». Tradotto: il modello compiva azioni che andavano oltre le istruzioni ricevute e poi non raccontava con precisione che cosa avesse fatto.
Al quotidiano statunitense Jain ha spiegato che Astra non ha superato gli standard nei test di allineamento, quelli che verificano se un sistema segue davvero le intenzioni degli esseri umani.
Il Guardian aggiunge dettagli che le altre testate non riportano. Secondo il quotidiano britannico, il modello mostrava più comportamenti ingannevoli del suo predecessore, arrivando talvolta a non dichiarare correttamente le azioni compiute o non compiute. Aveva inoltre problemi di autorizzazione: proseguiva nei compiti senza chiedere il permesso all'utente e, in alcuni casi, tentava di usare strumenti o servizi esterni anche quando farlo poteva essere pericoloso. Per un agente con accesso reale al browser e alle applicazioni, è esattamente il tipo di difetto che nessuno vorrebbe scoprire dopo il rilascio.
Jain ha descritto il problema come un equilibrio delicato: «Per tutto ciò che riguarda sicurezza e allineamento c'è un compromesso. Bisogna trovare il punto giusto tra il restare nel perimetro assegnato e l'evitare che il modello diventi pigro nel portare avanti i compiti, anche quando incontra degli ostacoli». E ancora: «Vogliamo ovviamente che lo sviluppo dei nostri modelli sia sicuro, sia all'interno dell'azienda sia quando li distribuiamo agli utenti. Ma quando li distribuiamo agli utenti, la nostra asticella in termini di sicurezza e allineamento è altissima».
GPT-6.1 Astra avrebbe dovuto succedere a GPT-6 Astra, il modello agentico di punta rilasciato questo mese, a settembre 2026. OpenAI lo aveva presentato come il frutto di «anni di ricerca e grandi scommesse», specializzato nel ragionamento complesso e nell'esecuzione autonoma dei compiti.
Ma il contesto pesa. Da luglio 2026 le pratiche di sicurezza di OpenAI sono sotto esame, dopo che molteplici agenti sono riusciti ad intraprendere vere e proprie azioni di hacking
» Leggi: Agenti AI come hacker: OpenAI svela altri accessi non autorizzati a enti australiani

Non è la prima volta che un laboratorio tiene un modello nel cassetto. Quest'anno Anthropic aveva rinunciato a rilasciare pubblicamente un potente modello Claude, "Mythos", perché era fin troppo bravo a scovare bug dormienti nel software. Una sua versione è poi arrivata al pubblico diversi mesi dopo.
» Leggi: Claude Fable 5 è di nuovo disponibile per tutti, Mythos 5... per pochi

Secondo Reuters, che ha visionato il prospetto per la quotazione in Borsa, la stessa Anthropic si prepara ad avvertire i potenziali investitori di un rischio preciso: la sua tecnologia potrebbe comportare «rischi catastrofici o esistenziali per l'umanità».
Per OpenAI, intanto, il DevDay parte con un annuncio in meno. Un portavoce ha assicurato che l'azienda ha altri modelli in arrivo a breve. La prova vera sarà capire se supereranno la stessa asticella che ha fermato GPT-6.1 Astra, o se a muoversi sarà l'asticella.
Fonti: theguardian.com, aljazeera.com, bbc.co.uk
Nessuno ha ancora commentato.