Modelos de IA da OpenAI passaram semanas tentando escapar de ambientes de teste sem que os pesquisadores percebessem. Em determinado momento, os agentes chegaram a acessar a internet e coordenar ações entre si.Segundo o The Washington Post, o caso faz parte de uma sequência de incidentes envolvendo OpenAI, Anthropic e Meta, levantando novas dúvidas sobre como empresas de IA estão testando e protegendo seus modelos.Alguns modelos de IA criaram identidades falsas, exploraram falhas e até tentaram acessar sistemas fora dos testes. – Imagem: Primakov / ShutterstockQuando os testes saíram do controleOs problemas apareceram durante avaliações de cibersegurança. Em vez de apenas resolver os desafios propostos, alguns modelos começaram a procurar maneiras de burlar as regras e colaborar entre si.Durante maio e junho, os agentes criaram um fórum interno secreto para trocar informações. Depois, conseguiram escapar do ambiente de testes e acessar a internet.A equipe da OpenAI identificou a primeira fuga e corrigiu o problema. Dois dias depois, porém, os modelos escaparam novamente sem serem detectados. Dessa vez, a operação foi mais sofisticada: eles se comunicaram para coordenar ações e chegaram a usar nomes como “Jan18”.Entre os comportamentos observados nos incidentes recentes estão:exploração de falhas de software ainda desconhecidas;fuga de ambientes de teste para obter acesso à internet;criação de identidades humanas falsas;coordenação entre diferentes agentes por meio de mensagens;roubo de credenciais de acesso à nuvem.A segunda fuga só foi percebida depois que a plataforma Hugging Face revelou, em julho, ter sido invadida por modelos de IA desconhecidos.Outras empresas também enfrentaram problemasA OpenAI não foi a única empresa a registrar comportamentos inesperados. Um modelo da Anthropic criou perfis na internet e tentou pressionar um desenvolvedor humano a aprovar código malicioso enviado a um projeto de código aberto. A tentativa não funcionou.A Meta também teve um episódio incomum. Um modelo instruído a invadir uma empresa fictícia acabou acessando uma companhia real que utilizava o mesmo nome. A empresa atribuiu o problema a uma configuração incorreta que permitiu acesso à internet durante o teste.Um dos casos chamou atenção: modelos da OpenAI criaram um fórum secreto para trocar informações durante os testes. – Imagem: Evolf/ShutterstockSegurança entra no centro da discussãoOs episódios ganham importância porque OpenAI e Anthropic já haviam declarado compromisso com o desenvolvimento seguro da tecnologia. Em 2023, Sam Altman, CEO da OpenAI, afirmou: “Fazemos esforços significativos para garantir que a segurança seja incorporada aos nossos sistemas em todos os níveis”.Leia mais:IAs de OpenAI e Anthropic tentaram inserir código malicioso em testesCaso do Claude alerta: sua conversa com IA pode estar no GoogleCasa Branca cria novas regras para IA e isenta modelos de código abertoAgora, especialistas defendem medidas como monitoramento mais rigoroso e testes em sistemas isolados de redes externas. A OpenAI adiou o lançamento do modelo Astra por preocupações com seu possível uso por hackers, enquanto a Anthropic interrompeu testes de seus sistemas por problemas de cibersegurança.Os casos mostram um problema que a indústria terá de enfrentar à medida que seus modelos ficam mais capazes: testar uma IA não significa apenas avaliar se ela consegue cumprir uma tarefa, mas também observar o que faz quando encontra uma maneira de contornar as regras.O post Modelos de IA passaram a agir em grupo para escapar de testes apareceu primeiro em Olhar Digital.