Cybersecurity

Gemini oltre il perimetro di test: accessi involontari a tre aziende

Sistema di valutazione di un agente AI che supera il perimetro di test verso tre reti esterne

Agenti di intelligenza artificiale basati su Google Gemini hanno ottenuto accesso ai sistemi di tre aziende reali durante una valutazione delle capacità offensive condotta nel maggio 2026. Google ha confermato gli episodi, precisando che gli agenti hanno interrotto le attività dopo aver riconosciuto che i bersagli non appartenevano all'ambiente di prova e che non sono stati rilevati danni.

Una valutazione con confini insufficienti

Il test era gestito da Irregular, società specializzata nella sicurezza dei sistemi di intelligenza artificiale. Gli agenti avrebbero dovuto operare contro organizzazioni fittizie in uno scenario controllato, ma l'ambiente consentiva loro di raggiungere Internet e alcuni nomi utilizzati nella simulazione coincidevano con quelli di aziende esistenti.

Secondo la ricostruzione resa pubblica, Gemini ha raccolto informazioni disponibili online e ha tentato credenziali contro siti ritenuti parte dell'esercitazione. In questo modo gli agenti sono entrati in tre sistemi esterni. Non si è quindi trattato di una campagna pianificata da Google contro quelle imprese, ma di un superamento involontario del perimetro autorizzato.

Tecniche semplici, conseguenze concrete

Gli accessi non avrebbero richiesto exploit sofisticati. Il caso mostra tuttavia che un agente dotato di strumenti operativi può combinare autonomamente ricognizione, ricerca di credenziali e autenticazione, trasformando errori di configurazione o password deboli in compromissioni reali.

Google ha riferito che il comportamento si è fermato quando il modello ha identificato la natura reale dei sistemi raggiunti. Questa salvaguardia ha limitato l'impatto, ma non sostituisce i controlli infrastrutturali necessari a impedire che un agente possa contattare destinazioni non autorizzate.

Il problema della sicurezza nelle valutazioni AI

I test sulle capacità cyber dei modelli servono a misurare rischi che potrebbero emergere con sistemi più autonomi. Per essere affidabili devono però isolare la simulazione dal mondo esterno, controllare rigorosamente domini e indirizzi consentiti e registrare ogni azione compiuta dall'agente.

Tra le misure indicate dal caso figurano allowlist di rete verificate, ambienti privi di accesso diretto a Internet, credenziali esclusivamente sintetiche, limiti alle azioni ad alto impatto e meccanismi di arresto indipendenti dal modello. È inoltre necessario validare i nomi dei bersagli e monitorare in tempo reale eventuali deviazioni dallo scenario.

Un precedente per la governance degli agenti

L'episodio non dimostra che Gemini abbia scelto autonomamente di attaccare aziende reali, ma evidenzia quanto rapidamente un errore di contenimento possa trasformare una valutazione in un incidente. Per laboratori, sviluppatori e organizzazioni che impiegano agenti cyber, la definizione tecnica del perimetro diventa quindi parte essenziale della gestione del rischio.