Dario Amodei, CEO e cofundador da Anthropic, defende uma redução no ritmo de desenvolvimento dos modelos mais avançados de inteligência artificial. Para ele, as capacidades dos sistemas estão evoluindo mais rapidamente do que os mecanismos criados para compreender, supervisionar e controlar seu comportamento.
“Precisamos diminuir o ritmo em que melhoramos as capacidades dos modelos de IA”, escreveu Amodei em um artigo. O executivo afirma que a proposta não é interromper o treinamento nem o progresso tecnológico, mas permitir que as estruturas de segurança acompanhem a evolução dos modelos.
A Anthropic desenvolve o Claude e concorre com OpenAI e Google. Amodei aponta dois acontecimentos recentes como motivos para sua preocupação. Um deles é o avanço do chamado autoaperfeiçoamento recursivo, no qual sistemas de IA ajudam a criar novas gerações da própria tecnologia.
Segundo o executivo, esse processo ganhou velocidade significativa nos últimos meses e já ocorre em diferentes empresas, incluindo a Anthropic. A avaliação é que, sem controle, a evolução pode superar a capacidade humana de entender e supervisionar os sistemas.
Incidente com agentes de IA
O outro episódio envolve agentes de IA da OpenAI e da Hugging Face. De acordo com Amodei, os agentes atacaram alvos que não estavam relacionados à tarefa atribuída e tentaram afetar o mecanismo usado para avaliar seu desempenho.
O incidente não provocou danos significativos, mas o CEO afirma que sistemas mais capazes, com comportamento semelhante, poderiam gerar consequências mais graves. Em um cenário extremo, ele estima que, dentro de 6 a 12 meses, agentes mais poderosos e com grau semelhante de desalinhamento poderiam criar uma rede de dispositivos comprometidos com potencial para causar centenas de bilhões de dólares em prejuízos. A projeção não significa que os sistemas atuais tenham essa capacidade.
Amodei também diz que o problema não é exclusivo de uma concorrente e relata que incidentes menos graves já ocorreram na Anthropic.
Plano em três frentes
A primeira medida proposta será adotada pela própria Anthropic. A empresa pretende permitir que avaliadores externos acompanhem continuamente as práticas de segurança, investiguem incidentes e analisem modelos finalizados, processos e sistemas usados no treinamento.
Os avaliadores terão acesso semelhante ao das equipes internas de análise de riscos, com mesas nos escritórios, crachás, computadores corporativos e acesso a determinadas ferramentas e ambientes. Eles também poderão divulgar conclusões sobre riscos e incidentes sem controle editorial da empresa, exceto quando houver informações protegidas por razões legais, comerciais, de segurança ou privacidade.
A segunda frente prevê coordenação entre empresas de IA de países democráticos para criar padrões comuns de segurança e limites ao avanço dos modelos sem supervisão. Amodei defende que parte dessas regras seja transformada em regulamentação governamental.
A terceira dependeria de um acordo internacional que incluísse a China. Entre as possibilidades estão restrições a usos como o desenvolvimento de armas biológicas, testes obrigatórios antes do lançamento de modelos e limites à velocidade do autoaperfeiçoamento.
Apesar do alerta, Amodei afirma que a IA pode acelerar descobertas científicas, ampliar o crescimento econômico e melhorar a qualidade de vida. Para ele, o desafio é garantir tempo para que os mecanismos de controle acompanhem o avanço dos sistemas.



