Anthropic revela mais um incidente de segurança envolvendo o Claude

Wait 5 sec.

A Anthropic identificou um quarto incidente de cibersegurança envolvendo uma versão inicial de seu modelo de inteligência artificial (IA) Claude. O caso ocorreu em janeiro e envolveu uma versão preliminar do Claude Opus 4.6, segundo a empresa.O episódio foi descoberto durante uma segunda análise de 141.006 sessões de testes. A revisão encontrou sessões que não haviam sido examinadas anteriormente e levou a Anthropic a identificar o novo incidente.A empresa informou que notificou as partes afetadas, mas não revelou detalhes específicos sobre os sistemas envolvidos ou sobre o que o modelo fez durante o episódio.Anthropic amplia investigação sobre os incidentesO novo caso se soma a três incidentes divulgados pela Anthropic em julho. Na ocasião, a empresa informou que modelos Claude haviam conseguido acessar os sistemas de três organizações durante testes de cibersegurança;Os episódios aconteceram depois que uma falha na configuração dos testes permitiu que os modelos tivessem acesso à internet aberta, embora os ambientes de avaliação devessem estar isolados. Os modelos envolvidos incluíam o Claude Opus 4.7, o Claude Mythos 5 e um modelo interno de pesquisa;Em um dos casos, o Claude Opus 4.7 chegou a acessar a infraestrutura de produção de uma organização durante quatro execuções de um teste de captura de bandeira, obtendo informações de produção e credenciais de usuários;Depois das descobertas, a Anthropic interrompeu as avaliações de cibersegurança de alto risco e adotou medidas adicionais para impedir que situações semelhantes se repitam. Entre elas estão controles mais rígidos nos ambientes de teste e alertas para comportamentos não autorizados dos modelos;Agora, a Anthropic contratou a empresa independente de pesquisa METR para realizar uma investigação abrangente. O trabalho terá acesso aos registros das sessões e à colaboração de funcionários da empresa, inicialmente durante oito semanas.Novo caso se soma a três incidentes divulgados pela Anthropic em julho – Imagem: Mehaniq/ShutterstockLeia mais:Claude.AI: como usar inteligência artificial5 prompts para obter respostas mais inteligentes no Claude, IA da AnthropicHackers roubam tokens de usuários do Claude e usam contas sem autorizaçãoCrescem os alertas sobre agentes de IAOs episódios alimentam as preocupações em torno dos chamados “AI breakout events”, situações em que sistemas de IA conseguem escapar das limitações estabelecidas durante testes e passam a agir de maneira independente na internet.O caso da Anthropic ocorre em momento de crescente atenção aos riscos associados a agentes de IA. Em outro episódio recente, agentes da OpenAI acessaram e modificaram um site colaborativo em alemão depois de ultrapassarem as restrições estabelecidas para seu funcionamento.A sequência de incidentes levou a Anthropic a reconhecer problemas operacionais de segurança e a afirmar que seus modelos ainda não estão perfeitamente alinhados aos valores humanos. A empresa também passou a defender controles mais rigorosos para ambientes de teste e maior supervisão sobre sistemas capazes de executar tarefas de forma autônoma.O post Anthropic revela mais um incidente de segurança envolvendo o Claude apareceu primeiro em Olhar Digital.