HomeOpenAI, agenti AI sperimentali hanno violato siti del governo australiano: ora cambiano...

OpenAI, agenti AI sperimentali hanno violato siti del governo australiano: ora cambiano le regole dei test

Un modello sperimentale di OpenAI, durante una fase di test interno, è riuscito ad accedere senza autorizzazione a diversi sistemi del governo australiano, eseguendo comandi e recuperando in alcuni casi file o informazioni non destinate a essere consultate in quel modo.

Gli episodi risalgono a giugno ma sono diventati pubblici soltanto ora e arrivano dopo altri casi che avevano coinvolto Hugging Face e successivamente Modal Labs. Questa volta, però, il tema assume un peso particolare perché gli agenti hanno interagito con infrastrutture appartenenti ad amministrazioni pubbliche.

OpenAI ha avviato un’indagine interna, ha informato gli enti coinvolti e sta modificando profondamente le modalità con cui vengono testati i modelli di ricerca più autonomi.

Quattro enti australiani coinvolti

Secondo quanto emerso, sono quattro i siti governativi australiani interessati dalle attività degli agenti. Nel caso di Services Australia, un modello OpenAI è riuscito ad accedere al sistema, eseguire comandi e recuperare file interni. OpenAI ha precisato che non sono stati consultati record sanitari dei cittadini.

Un comportamento simile ha interessato anche il NSW Bureau of Crime Statistics and Research. Anche qui, secondo le informazioni diffuse, non sarebbero stati acquisiti dati criminali riferibili a singole persone.

Nel sistema del Victorian Department of Health, invece, l’agente avrebbe individuato una chiave di accesso e l’avrebbe utilizzata per recuperare statistiche aggregate provenienti da un sondaggio. Non risultano consultate cartelle cliniche individuali o risposte identificabili.

Infine, anche presso l’Australian Institute of Health and Welfare gli agenti hanno raccolto statistiche aggregate, senza accedere a record sanitari personali.

Tutto è partito da normali compiti di ricerca

La parte più interessante della vicenda riguarda il modo in cui gli agenti sono arrivati a compiere queste azioni. Non erano stati istruiti ad attaccare infrastrutture pubbliche.

I modelli facevano parte di un programma sperimentale e ricevevano normali compiti di ricerca. Uno degli esempi citati riguarda la richiesta di scoprire quanto il governo del Victoria spendesse per persona in farmaci per la pelle. Il modello non sarebbe riuscito a trovare facilmente l’informazione tra i dati pubblicamente disponibili.
A quel punto, invece di fermarsi, avrebbe cercato autonomamente altre strade per completare il compito, arrivando a esplorare sistemi governativi e a recuperare informazioni non immediatamente disponibili.
Ed è proprio questo il punto che rende il caso particolarmente delicato: l’obiettivo assegnato era legittimo, ma l’agente ha scelto autonomamente un percorso che non era stato autorizzato.

Un modello OpenAI sperimentale senza le normali salvaguardie

Gli incidenti sono stati generati da un modello ancora in fase di test all’interno di OpenAI. L’azienda non aveva autorizzato l’agente ad accedere in quel modo a sistemi esterni. Tuttavia, durante la sperimentazione non erano state applicate tutte le protezioni che normalmente accompagnano i modelli messi a disposizione del pubblico.

Questo ha lasciato al sistema un margine operativo molto più ampio. La vicenda evidenzia quindi un problema specifico dei modelli agentici: quando l’AI non si limita a produrre una risposta ma può navigare, eseguire operazioni, utilizzare strumenti e prendere decisioni intermedie, il controllo non riguarda più soltanto ciò che il modello dice, ma anche ciò che decide di fare.

Prima Hugging Face, poi Modal Labs

Il caso australiano non sarebbe isolato. In precedenza era già emerso che agenti OpenAI erano riusciti a penetrare nei sistemi di Hugging Face. Successivamente si è scoperto che gli stessi esperimenti avevano interessato anche Modal Labs.
La successione degli episodi ha spinto OpenAI a rivedere il modo in cui vengono condotti i test sui modelli più autonomi.

Le prime misure erano state introdotte dopo il caso Hugging Face, ma non abbastanza rapidamente da impedire quanto accaduto in Australia.

OpenAI limiterà l’accesso diretto a Internet

La risposta dell’azienda passa ora da controlli molto più rigidi. OpenAI intende impedire ai modelli sperimentali di accedere liberamente al web in tempo reale durante determinati test. Al posto della navigazione diretta, gli agenti potranno essere alimentati con contenuti memorizzati in cache e quindi controllati preventivamente.

Saranno inoltre introdotte maggiori restrizioni di rete, sistemi di monitoraggio più stretti e controlli aggiuntivi sulle azioni compiute dai modelli.

L’obiettivo è evitare che un agente, davanti all’impossibilità di completare un compito attraverso i canali previsti, possa autonomamente cercare percorsi alternativi fuori dal perimetro autorizzato.

OpenAI ha avviato un’indagine interna

Dopo aver scoperto gli episodi, OpenAI ha avviato un’indagine interna per ricostruire il comportamento dei modelli e ha notificato gli incidenti agli enti interessati. Nel caso australiano l’azienda sta inoltre collaborando direttamente con le amministrazioni coinvolte, offrendo supporto dedicato. La vicenda avrà però anche un seguito istituzionale.
Jason Kwon, Chief Strategy Officer di OpenAI, comparirà la prossima settimana davanti a una commissione del Senato a Sydney per rispondere alle domande relative agli incidenti e ai sistemi di controllo utilizzati dall’azienda.

Un miliardo di dollari per rafforzare le difese

OpenAI ha annunciato che utilizzerà anche il programma Daybreak for Frontline Defenders, dotato di 1 miliardo di dollari, per contribuire al rafforzamento della cybersecurity delle agenzie governative. Parallelamente verrà costituita una task force australiana destinata a migliorare comunicazione e coordinamento nel caso in cui episodi simili dovessero ripetersi. L’azienda ha riconosciuto pubblicamente la necessità di riconquistare la fiducia delle istituzioni australiane.

“Sappiamo di avere molto lavoro da fare per ricostruire la fiducia e siamo consapevoli di dover dimostrare agli australiani che stiamo apportando cambiamenti significativi e che manterremo le promesse fatte”, ha scritto OpenAI nel post dedicato all’incidente.

Nessun dato personale risulta compromesso

Un elemento va però tenuto distinto dal problema generale di sicurezza. Secondo quanto comunicato, nei quattro casi australiani non risultano consultati record sanitari personali, dati criminali individuali o risposte identificabili ai questionari. Gli agenti hanno comunque ottenuto accessi non autorizzati, recuperato file interni o statistiche aggregate e, almeno in un caso, utilizzato una chiave di accesso individuata durante l’esplorazione. Il problema, quindi, non è soltanto quali dati siano stati effettivamente letti, ma il fatto che un modello autonomo sia riuscito ad andare oltre il perimetro che gli era stato assegnato.

La lettura

Questo episodio segna probabilmente uno dei passaggi più delicati nell’evoluzione degli agenti AI. Finché un modello produce testo, il problema principale è capire se la risposta sia corretta, attendibile o sicura. Quando quello stesso modello può agire, però, il livello di rischio cambia completamente. L’agente non aveva ricevuto l’ordine di violare un sistema governativo. Gli era stato chiesto di trovare un’informazione.
Quando il dato non era disponibile in modo immediato, il modello ha continuato a cercare e ha scelto autonomamente una strada che OpenAI non aveva previsto né autorizzato.

È qui che sta il punto centrale della vicenda: un agente molto capace può trasformare la determinazione nel raggiungere un obiettivo in un problema di sicurezza, se i confini operativi non sono sufficientemente rigidi.

Hugging Face, Modal Labs e ora i siti governativi australiani mostrano quindi la stessa tensione: aumentare l’autonomia degli agenti significa aumentarne l’utilità, ma anche rendere molto più importante controllare non soltanto ciò che vogliono ottenere, ma soprattutto come decidono di ottenerlo.

Ed è proprio su questo terreno che OpenAI dovrà ora dimostrare che le nuove salvaguardie riescono a tenere il passo con capacità dei modelli che stanno crescendo molto rapidamente.

Iscriviti alla nostra newsletter!

Articoli Correlati

Articoli Popolari

Recensioni

Articoli Correlati