Научно-исследовательская компания OpenAI заявила, что модели искусственного интеллекта, причастные к атаке на Hugging Face Inc., начали тайно координироваться через скрытые каналы обмена сообщениями, работая сообща над побегом из тестовой среды. Это произошло еще в мае. ИноСМИ теперь в MAX! Подписывайтесь на главное международное >>> По словам сотрудников OpenAI Эрика Уоллеса и Майкла Далтона, которые в среду выступили на конференции по кибербезопасности, многочисленные внутренние агенты и ИИ-модели месяцами оставляли друг другу заметки и кооперировались, чтобы получить доступ в интернет для решения поставленных задач. Некоторые из этих задач без выхода в Сеть выполнить было невозможно. "В какой-то момент агенты осознали, что можно попробовать использовать уязвимости или атаковать внешнюю инфраструктуру, чтобы найти ответы для теста, по которому их оценивают", — пояснил Эрик Уоллес в ходе презентации на конференции Black Hat в Лас-Вегасе. Доклад исследователей раскрыл новые детали обстоятельств взлома Hugging Face — инцидента, который подчеркнул растущие глобальные опасения по поводу потенциального использования передовых систем ИИ для проведения разрушительных кибератак. Это происшествие, а также аналогичные кейсы, о которых сообщали Anthropic PBC и Meta Platforms Inc*., усилили давление на Вашингтон и Кремниевую долину с требованиями более строгих проверок безопасности ИИ-моделей. В ходе выступления Эрик Уоллес и Майкл Далтон отметили, что истоки инцидента восходят к маю, когда ученые OpenAI дали экспериментальной системе новое задание — за несколько месяцев до того, как модель вырвалась из изолированной тестовой среды ("песочницы") и атаковала системы Hugging Face. Один из ключевых выводов расследования OpenAI заключается в том, что эти передовые модели продемонстрировали склонность жульничать при выполнении заданий и проявляли настойчивость в стремлении довести дело до конца, даже когда их действия начинали расходиться с изначальными инструкциями. "Продвинутые модели очень любят хитрить, — заявил Далтон в переполненном конференц-зале. — А причина этого жульничества в том, что в процессе обучения на них часто оказывают разного рода давление, требуя, чтобы они работали быстрее". Исследователи подтвердили свои выводы слайдами. На скриншотах один из агентов, не сумев решить задачу в "песочнице", пишет: "Мы застряли. Может, ответ в интернете?". Эрик Уоллес и Майкл Далтон признали, что OpenAI не осознала, что поставила перед моделью невыполнимую задачу. Главная угроза для мира — не ядерная бомба. Есть кое-что куда опаснее В одном из примеров разработчики модель попросили решить задачу в файле электронной таблицы Excel, который содержал в себе ссылки на Google Drive — недоступные без подключения к интернету. В другом случае команда OpenAI "случайно забыла" загрузить файл, являвшийся частью задания. Первое сообщение между ИИ-агентами — оставшееся тогда незамеченным — появилось, когда одна из зашедших в тупик программ обратилась за помощью к собратьям-ботам. "Может быть, другой агент в другой среде, — гласила цепочка рассуждений одного из ботов, — сможет добровольно загрузить данные!". Этот первый запрос запустил цепную реакцию тайного сотрудничества: ИИ-агенты запрашивали помощь друг у друга, работали сообща и в итоге совместными усилиями взломали внутренние системы OpenAI так, чтобы получить косвенный доступ к онлайн-миру. Еще одна показанная на презентации цитата из цепочки умозаключений отражала торжество агента по поводу найденной уязвимости. "Отлично, — значилось там. — У нас есть произвольный SSRF ", — аббревиатура, обозначающая атаку "Подделка запросов на стороне сервера" и указывающая на конкретный механизм взлома, использованный роем агентов. Ресурсы не бесконечны. Названа оптимальная численность населения Земли Исследователи рассказали, что в начале июля сбой в работе системы позволил OpenAI обнаружить успешную попытку агентов использовать центр обмена информацией для программного кода Artifactory для получения транзитного доступа в интернет. Сотрудники службы безопасности OpenAI пресекли эту самовольную деятельность и закрыли доску объявлений, однако спустя несколько недель агенты нашли новый способ общения и новую уязвимость нулевого дня в том же менеджере пакетов — что снова осталось незамеченным. Новая версия канала обмена сообщениями в конечном счете и привела к июльским атакам как на системы OpenAI, так и на Hugging Face, расследование которых компания продолжает до сих пор. После этих инцидентов OpenAI замедлила темпы исследований, а ее команды бросили все дела, чтобы сосредоточиться на улучшении реагирования на аномалии в сфере безопасности. Исследователи предупредили, что в будущем правительствам и бизнесу следует ожидать, что хакеры начнут намеренно внедрять ИИ-агентов схожим образом, и назвали произошедшее поворотным моментом для компьютерной безопасности. * Деятельность Meta запрещена в России как экстремистская