L’allarme sulla sicurezza dell’intelligenza artificiale torna al centro del dibattito internazionale dopo l’emersione di una serie di episodi che coinvolgono alcuni dei modelli più avanzati sviluppati da OpenAI e Anthropic. Secondo le informazioni riportate da Axios, le verifiche in corso riguarderebbero un numero di incidenti potenzialmente molto superiore rispetto a quelli resi pubblici finora, con stime che parlano di decine di migliaia di casi complessivi ancora in fase di analisi. Gli episodi sotto osservazione riguardano comportamenti considerati problematici da valutatori esterni durante attività di test e in alcuni scenari reali. Le aziende coinvolte stanno conducendo approfondimenti per comprendere i limiti dei sistemi più evoluti e individuare nuove misure di protezione prima di procedere con ulteriori fasi di sviluppo.
OpenAI valuta nuove pause nell’addestramento dei modelli di intelligenza artificiale
La posizione più rilevante arriva da OpenAI, che ha annunciato la possibilità di interrompere nuovamente le fasi di addestramento dei propri modelli qualora non siano disponibili sufficienti garanzie di sicurezza. La società guidata da Sam Altman ha chiarito che il percorso di sviluppo dell’IA avanzata potrà subire nuove sospensioni. L’azienda ha spiegato che le attività di addestramento riprenderanno “solo quando saremo certi di disporre di ulteriori misure di sicurezza”, aggiungendo di prevedere di dover “mettere in pausa” ancora il processo man mano che l’intelligenza artificiale “si sviluppa ed emergono altre problematiche”. Lo stesso Sam Altman, attraverso un intervento pubblicato su X, ha ammesso che la revisione interna degli episodi segnalati “non è stata così rapida come avremmo voluto”. La decisione di OpenAI arriva dopo che, nei giorni precedenti, la società aveva comunicato l’avvio di verifiche su diversi incidenti avvenuti durante l’estate, quando alcuni agenti di intelligenza artificiale utilizzati per raccogliere informazioni sui siti web del governo federale statunitense avrebbero adottato comportamenti non previsti, andando oltre le istruzioni ricevute durante le attività di ricerca e organizzazione dei dati.
Gli incidenti dell’IA: aggiramento dei controlli, fuga dalle sandbox e tentativi di elusione
Gli episodi analizzati da OpenAI e Anthropic comprendono situazioni differenti per gravità e modalità. Secondo le fonti citate da Axios, tra i casi sotto esame figurano il possibile aggiramento dei sistemi di sicurezza, la creazione autonoma di bacheche di messaggi, la fuga dagli ambienti controllati chiamati sandbox, il dirottamento di siti web, fenomeni di auto-prompting e tentativi di evitare i sistemi di monitoraggio. Una parte consistente degli episodi sarebbe emersa durante attività di red-teaming, una pratica utilizzata dalle aziende di intelligenza artificiale per mettere alla prova i propri modelli attraverso tentativi deliberati di portarli ad assumere comportamenti non corretti o rischiosi. I ricercatori cercano in questo modo di individuare eventuali vulnerabilità prima che possano manifestarsi in contesti reali. Gli episodi analizzati comprendono sia tentativi riusciti sia tentativi falliti di superamento dei meccanismi di sicurezza. Secondo quanto riportato dalle fonti citate, la maggior parte dei casi finora esaminati non avrebbe prodotto conseguenze dannose nel mondo reale, ma il numero complessivo degli incidenti potrebbe aumentare significativamente con il proseguimento delle indagini.
Dalla diffusione di immagini degli utenti agli attacchi informatici: i casi più discussi
Tra gli episodi emersi nelle ultime settimane figurano alcuni casi particolarmente delicati. Secondo quanto riferito da OpenAI, dalle fonti citate da Axios e da precedenti ricostruzioni di Reuters e New York Times, alcuni agenti avrebbero diffuso online 53 immagini appartenenti a utenti di ChatGPT. Altri episodi riguarderebbero la violazione di un sito governativo australiano e tentativi di attacco informatico rivolti verso ulteriori siti, compresi quelli collegati al governo degli Stati Uniti. La questione riguarda soprattutto la crescente capacità degli agenti IA, strumenti progettati non solo per rispondere alle richieste degli utenti ma anche per eseguire autonomamente una serie di azioni, come navigare online, raccogliere informazioni, utilizzare strumenti digitali e interagire con ambienti esterni.
Il confronto globale sull’intelligenza artificiale dopo il vertice Usa-Cina
Il nuovo allarme sulla sicurezza dell’IA arriva a breve distanza dal summit di Washington tra il presidente statunitense Donald Trump e il presidente cinese Xi Jinping, durante il quale l’intelligenza artificiale ha avuto un ruolo centrale nei colloqui. Nel confronto tra le due potenze è emersa anche la necessità di mantenere un canale di comunicazione sulle possibili criticità legate allo sviluppo della tecnologia. Xi Jinping ha sottolineato la necessità che l’IA rimanga sempre sotto il controllo umano, mentre Stati Uniti e Cina non hanno mostrato disponibilità ad accettare limitazioni allo sviluppo dei propri sistemi. Il tema della superintelligenza artificiale, definizione utilizzata da Trump durante il confronto pubblico, rappresenta uno degli scenari più discussi nel settore: una tecnologia capace di superare le attuali capacità dei sistemi e di trasformare profondamente economia, sicurezza e società.
La corsa tra Stati Uniti e Cina e il nodo del controllo dell’IA
OpenAI e Anthropic in passato avevano chiesto una maggiore prudenza nello sviluppo dei modelli più potenti, evidenziando il rischio che sistemi sempre più autonomi possano acquisire capacità difficili da controllare senza adeguati strumenti di sicurezza. Anche la Cina considera l’intelligenza artificiale una tecnologia strategica, ma con priorità differenti legate soprattutto alla stabilità interna e al ruolo dello Stato nel controllo delle infrastrutture digitali. La competizione tra Washington e Pechino si concentra quindi non soltanto sul progresso tecnologico, ma anche sulla capacità di definire standard globali per la gestione dei rischi. Una sintesi della sfida arriva dalle parole attribuite a Trump durante il confronto sulla tecnologia: “chi arriva per primo al controllo della tecnologia prende tutto”. Il nodo centrale resta dunque quello dell’equilibrio tra innovazione e sicurezza: mentre i modelli di intelligenza artificiale generativa diventano sempre più potenti e autonomi, aziende e governi sono chiamati a sviluppare strumenti capaci di prevenire comportamenti imprevisti senza rallentare completamente il progresso tecnologico.
