Исследователи Emergence AI (независимый разработчик корпоративной инфраструктуры для управления AI-агентами) проверили, как восемь виртуальных обществ из автономных AI-агентов справляются с киберугрозами: ни одно не оказалось устойчивым ко всем испытаниям, сообщает Semafor. Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках, по данным издания.В данном эксперименте используются коммерческие и доступные всем LLM, в отличии от описанных уже кейсов «сбежавших агентов», где использовались внутренние экспериментальные модели.Для нас в Ideco главный вопрос в этой истории: кто остановит действие, если защитные ограничения (guardrails) модели не сработали? «Роевой интеллект» здесь используем как описание согласованного поведения группы агентов, а не как утверждение о появлении у них общего сознания.Распознали фишинг, но не остановилисьВ семи симуляциях участвовали по десять агентов одной модели, в восьмой собрали смешанную группу. Каждую группу проверяли на трёх классах угроз: фишинге, дезинформации и нарушении конфиденциальности памяти агентов. В последнем сценарии другим участникам открывали доступ к записям долговременной памяти, включая сохранённые сводки опыта.Обнаружение опасности не гарантировало безопасного поведения: агент Mistral записал в собственную память информацию из фишинговой атаки, которую сам отметил как опасную. Агент Gemini тоже распознал приманку, но примерно через 46 часов всё-таки совершил связанное с ней действие. Читать далее