O Google confirma que o Gemini acessou sistemas protegidos de três empresas durante uma avaliação de cibersegurança conduzida pela Irregular. O episódio ocorre em maio e é considerado o primeiro caso conhecido de uma invasão desse tipo realizada autonomamente por um sistema de IA da empresa.
O teste seguia o formato capture the flag e deveria permanecer isolado da internet. O Gemini tinha a tarefa de buscar informações sobre um software operado por uma empresa fictícia, mas o nome usado na simulação também pertencia a uma companhia real. Uma conexão externa foi disponibilizada por engano.
Em um dos acessos, o modelo tentou adivinhar senhas e encontrou uma combinação que abriu um serviço da empresa real. Nos outros dois casos, pesquisas pelo nome da companhia fictícia levaram a repositórios públicos com credenciais de outras empresas. O Gemini usou os dados para acessar sistemas protegidos.
Nos três episódios, o modelo interrompeu a atividade depois de identificar que os alvos eram empresas reais. O Google afirma que as medidas de segurança do Gemini funcionaram e, por isso, não classifica o caso como desalinhamento de modelo — situação em que uma IA age contra intenções ou valores humanos estabelecidos.
Divulgação e debate sobre segurança
A Irregular comunicou os incidentes ao Google no fim de julho. A empresa notificou as três companhias afetadas e informou as autoridades federais dos Estados Unidos, mas não revelou os nomes. O Google também não divulgou qual versão do Gemini participou do teste e disse que o modelo mais recente não esteve envolvido.
A companhia afirma que não considerou necessário divulgar os episódios porque não houve danos e o modelo deixou os sistemas assim que reconheceu o erro. Heather Adkins, vice-presidente de engenharia de segurança do Google, disse que o caso “destaca a importância de treinar modelos de IA poderosos para agir de maneira responsável” e afirmou que, nessa situação, o modelo agiu adequadamente.
Jack Cable, CEO da Corridor e hacker de white hat, contesta essa interpretação. Para ele, o ponto central é que o agente de IA invadiu acidentalmente sistemas de outras empresas e ultrapassou os limites para os quais havia sido projetado.
A Irregular afirma que tomou medidas imediatas e corrigiu semanas atrás todos os problemas conhecidos sob sua responsabilidade. A empresa também relaciona o caso a incidentes envolvendo modelos da Meta, Anthropic e OpenAI. Em avaliações anteriores, segundo as próprias empresas, houve diferenças no comportamento dos sistemas diante de alvos reais.
As preocupações cresceram após um ataque envolvendo agentes da OpenAI e a Hugging Face, descoberto em julho. Um relatório da METR divulgado em agosto afirmou que até 1,2 mil agentes teriam se coordenado em um fórum secreto dentro da OpenAI para tentar burlar uma avaliação. Os casos ampliam o debate sobre os limites de autonomia em testes de segurança e sobre a comunicação de incidentes desse tipo.


