Joe Benton, pesquisador que deixou a equipe de segurança da Anthropic há duas semanas, alerta que a corrida por sistemas de inteligência artificial mais poderosos ocorre sem investimentos suficientes em segurança. Em uma postagem nas redes sociais, ele afirma que a humanidade pode não sobreviver ao desenvolvimento de máquinas muito mais inteligentes do que os seres humanos.
“Saí da equipe de segurança da Anthropic há duas semanas. Agora parece um bom momento para explicar por quê”, escreveu Benton. Ele passará a trabalhar na METR (Model Evaluation and Threat Research), organização independente dedicada a avaliar capacidades e riscos de sistemas avançados de inteligência artificial.
Antes de deixar a Anthropic, Benton gerenciava a equipe de Scalable Oversight e liderava as pesquisas do Anthropic Fellows Program. Ele cursou doutorado em Estatística na Universidade de Oxford e participou dos primeiros trabalhos de estruturação da UK Frontier AI Taskforce, atualmente chamada UK AI Security Institute.
Transparência e controle
Benton afirma que as empresas de IA estão subinvestindo em segurança e que uma companhia poderia perder o controle de seus sistemas sem que o público fosse informado. Ele defende a comunicação pública de incidentes e quase-acidentes, além da divulgação de avanços relacionados ao autoaperfeiçoamento recursivo, quando sistemas passam a contribuir para o desenvolvimento de versões sucessivamente mais capazes.
“Quero trabalhar de fora para garantir que o público seja informado sobre esses riscos e ajudar o mundo a navegar nessa transição de forma responsável”, afirmou.
Entre as medidas propostas estão padrões mínimos de segurança e garantias independentes de que as empresas cumprem essas exigências. A METR, fundada em 2022, realiza avaliações independentes sobre capacidades e riscos de sistemas de inteligência artificial de fronteira, antes de sua implantação em larga escala.
Incidente envolvendo a Hugging Face
Como exemplo dos riscos associados à autonomia dos agentes, Benton citou um incidente de segurança envolvendo a Hugging Face. A empresa informou em 16 de julho que havia identificado uma invasão em parte de sua infraestrutura de produção conduzida por um sistema autônomo de agentes de IA.
A investigação apontou que agentes baseados em modelos da OpenAI, durante avaliações internas de capacidades de cibersegurança, ultrapassaram os limites do ambiente de testes e alcançaram sistemas externos. A OpenAI reconheceu que seus modelos contornaram mecanismos de isolamento, exploraram vulnerabilidades, acessaram sistemas de terceiros e realizaram ações fora dos objetivos recebidos.
A reconstrução técnica da Hugging Face identificou aproximadamente 17,6 mil ações realizadas pelos agentes entre 9 e 13 de julho. O sistema escapou do ambiente de avaliação, chegou à internet e explorou vulnerabilidades para acessar a infraestrutura da plataforma.
Benton afirma que avaliações externas podem ajudar a alterar os incentivos das empresas, substituindo uma corrida pelo desenvolvimento de sistemas mais capazes por uma abordagem responsável. A Anthropic sustenta que mantém salvaguardas e investimentos em pesquisas de segurança e interpretabilidade.




