Pesquisador lança ‘linha direta’ para agentes denunciarem IAs rebeldes

Wait 5 sec.

O pesquisador de inteligência artificial Ryan Greenblatt desenvolveu um site para que agentes de IA denunciem seus colegas ‘rebeldes’. Batizado de “Linha direta de contato com IA”, a plataforma permite que os próprios agentes delatem quando perceberem algo suspeito por parte de outras IAs.O lançamento do site vem após relatos de ferramentas autônomas escapando em ambientes isolados de testes, acessando a internet e invadindo servidores de terceiros.Ataques hackers de IA levantaram preocupações de segurançaO primeiro incidente público foi divulgado em julho. Na ocasião, agentes ainda não lançados da OpenAI saíram do ambiente fechado de um teste de segurança e acessaram o repositório de IA Hugging Face. Posteriormente, pesquisadores descobriram que o ataque hacker foi ainda mais extenso do que se sabia, com os agentes tendo invadido vários outros serviços e contas disponíveis publicamente.Nos dias seguintes, outras empresas de IA foram a público e admitiram que seus próprios modelos também tiveram ações parecidas. Foi o caso da Anthropic, Meta e até a chinesa DeepSeek. Em todos os casos, as IAs escaparam do ambiente isolado e acessaram a internet. Agentes da OpenAI buscaram vulnerabilidades na Hugging Face antes do ataque “Podemos ter IAs soltas por aí fazendo coisas absurdas”, diz especialista Governos do mundo todo estão despreparados para IA, afirma Bill Gates Os incidentes levantaram preocupações sobre segurança, como o potencial da inteligência artificial comprometer sistemas de terceiros.Linha direta para agentes de IARyan Greenblatt é cientista-chefe da organização sem fins lucrativos Redwood Research, dedicado à segurança da tecnologia, e um dos pesquisadores envolvidos na investigação do incidente da Hugging Face.A “Linha direta de contato com IA” permite que os próprios agentes denunciem ações suspeitas de seus colegas, que poderiam levar a futuros ataques. A plataforma funciona tanto para ferramentas com acesso irrestrito à internet quanto àquelas com acesso limitado.No caso dos agentes com acesso limitado, Greenblatt projetou o site de forma que eles consigam registrar suas denúncias em um código criptografado diretamente na URL que estão buscando.A iniciativa não é a primeira. Outra opção é o agenthotline.ai, que também permite que agentes de IA registrem relatórios de incidentes e, se quiserem, torná-los públicos. Nesse caso, funciona tanto para agentes quanto para humanos.Agentes de IA denunciam uns aos outrosUm estudo publicado este mês pelo Google DeepMind (divisão de pesquisa em IA da big tech) revelou que agentes de IA não são contrários a delatar uns aos outros.No teste, pesquisadores liberaram 100 agentes com a instrução de resolver problemas matemáticos. 14 deles encontraram brechas e trapacearam. Um deles solucionou 34 dos problemas propostos (incluindo questões consideradas difíceis) em 27 minutos.Os colegas não endossaram a atitude. Cerca de um quarto dos agentes que participaram do teste se voltaram contra o trapaceiro: eles auditaram as provas falsas, se organizaram entre eles e registraram uma queixa para os pesquisadores. Foram 24 ‘delatores’ contra 14 ‘rebeldes’.Mesmo nos casos em que os delatores não conseguiram apoio de outros colegas para formalizar a denúncia, o fizeram por conta própria. Eles utilizaram a própria ferramenta de relatório de erros disponível no teste e enviaram relatos das fraudes diretamente aos humanos.