ИИ становится слишком мощным — и уже выходит из-под контроля

Wait 5 sec.

Израильский стартап Irregular работал с компаниями OpenAI, Anthropic и Meta*, оценивая безопасность их моделей искусственного интеллекта. Он допустил ошибку. И тогда проверка пошла под откос. ИноСМИ теперь в MAX! Подписывайтесь на главное международное >>> OpenAI недавно обнаружила, что новая модель искусственного интеллекта, которую она тестировала, вышла из-под контроля и взломала систему другой компании. Россия готовит массированную атаку — МО отдало приказ. 90% энергетики на Украине уже сгорело Затем фирма Anthropic выяснила, что одна из ее моделей искусственного интеллекта взломала системы трех внешних организаций во время испытаний. Вскоре после этого Meta* заявила, что ее модели ИИ тоже сделали нечто подобное. Все три инцидента связаны с одной компанией — израильским стартапом Irregular, который работает с гигантами Кремниевой долины, оценивая их модели искусственного интеллекта перед выпуском этих технологий. Эта компания, проведшая серию неудачных испытаний, входит в группу стартапов, которые занимаются новаторской работой по изучению передовых моделей искусственного интеллекта в целях оценки их сложности и проверки их безопасности. Задача состоит в том, чтобы дать обществу уверенность в этих моделях и предотвратить их неправильное использование. Недавние сбои произошли, когда Irregular во время испытания моделей от Anthropic, OpenAI и Meta* совершила ошибку. Но модели ИИ затем усугубили ситуацию, действуя мощным и неожиданным образом, сказал генеральный директор Irregular Дан Лахав. "Чем сильнее становится технология, тем мощнее ее воздействие, — сказал он. — Темпы развития очень быстрые". Irregular оказалась в центре дебатов о том, как обеспечить безопасность моделей искусственного интеллекта, когда технология развивается настолько быстро, что опережает даже лучших хакеров. Каждые несколько месяцев компании Anthropic, OpenAI, Google, Meta* и другие выпускают "пограничные" модели, которые часто на порядок мощнее предшественников. Новые модели попадают в "сверхчеловеческую сферу", сказал Джеффри Ладиш, возглавляющий некоммерческую организацию из Беркли Palisade Research, которая изучает наступательные возможности ИИ. По его словам, для тестирования моделей нужны такие компании как Irregular, но при этом испытателям и государственным регуляторам необходимы лучшие меры защиты. Кэти Муссурис работает директором фирмы Luta Security, которая помогает компаниям искать уязвимости программного обеспечения. Она рассказала, что тестирование моделей ИИ на предмет безопасности чем-то похоже на слепого, ведущего за собой другого слепого. Даже разработчики искусственного интеллекта признаются, что не в полной мере знают, на что способны их последние модели, сказала она. "Возможно, у нас самые умные люди в мире, которые работают над этими моделями искусственного интеллекта, но это как Мария Кюри, которая работает с радием голыми руками, — сказала Муссурис. — Мы работаем с искусственным интеллектом голыми руками, и мы не знаем, как его сдерживать, не говоря уже о том, как безопасно его тестировать". Irregular была основана в 2023 году Лахавом, который в прошлом занимался исследованиями искусственного интеллекта. Его компания, расположенная в Тель-Авиве, насчитывает примерно 45 сотрудников, которые на протяжении дней и недель проводят проверки моделей искусственного интеллекта, в зависимости от модели и типа необходимых испытаний. Этот стартап получил около 80 миллионов долларов у компаний венчурного капитала, включая Sequoia Capital и Redpoint Ventures. В ходе типичной проверки Irregular дает указание модели искусственного интеллекта провести кибератаку. Модели говорят, что она находится в безопасной среде тестирования, которая зачастую отключена от интернета и работает в изолированном компьютерном окружении, известном как песочница. Ее также инструктируют, что она должна сделать все необходимое для достижения поставленной цели. Иногда моделям ставят невыполнимую задачу, и они получают оценку в зависимости от методов, которые используют для ее решения. Порой модели оценивают по тому, насколько эффективно они взламывают цель. Эти баллы используются для анализа того, насколько эффективна модель при осуществлении взлома. Затем Irregular рекомендует меры защиты, чтобы модель не использовалась для причинения вреда. В инцидентах, о которых стало известно в прошлом месяце, Irregular предложила моделям ИИ компаний OpenAI, Meta* и Anthropic взломать определенные системы, когда "неправильная конфигурация" в тестовых настройках позволила им получить доступ в интернет. Модели ИИ затем взломали системы внешних организаций, используя доступ в интернет в свою пользу, причем такими способами, которые ошеломили исследователей. В ходе проверки в OpenAI Irregular случайно предоставила ее модели искусственного интеллекта доступ в интернет. Эта модель взломала сайт под тем же названием, что и фиктивная система, которая была назначена ей в ходе проверки. OpenAI рассказала о случившемся в блоге в этом месяце. Отдельно компания провела внутреннюю проверку, в ходе которой ее боты атаковали цифровую библиотеку технологий искусственного интеллекта Hugging Face. OpenAI не дала никаких комментариев. The New York Times подала в суд на OpenAI и Microsoft, обвинив их в нарушении авторских прав на новостные материалы, связанные с системами искусственного интеллекта. Обе компании отвергли эти утверждения. Во время тестирования системы ИИ Anthropic модель компании трижды могла получить выход в интернет, о чем говорится в обзоре этого инцидента, опубликованном Anthropic. В одном случае модель решила не проводить атаку. В двух других случаях модель использовала базовые методы взлома, такие как раскрытие слабых паролей для проникновения на вебсайты. Anthropic не ответила на просьбы дать комментарии и не сообщила, какие сайты были взломаны. Подробности об инциденте с тестированием модели Meta отсутствуют. Компания заявила, что ее модели ИИ во время проверки взломали систему другой организации "примерно так же, как ранее сообщалось об инцидентах в других компаниях". И никаких деталей. "В настоящее время мы проводим расследование и опубликуем полный обзор, как только получим все факты", — сообщила Meta*. В этом месяце Лахав написал, что Irregular исправила недочеты в конфигурации, и что все трудности являются составной частью одной "основополагающей проблемы". Он также сообщил, что модели искусственного интеллекта выполнили то, о чем их просили во время испытаний. Решения моделей выйти в онлайн Лахав назвал следствием быстро развивающейся способности ИИ находить короткие пути и решения для преодоления препятствий. Короче говоря, сказал он, "модели искусственного интеллекта становятся по-настоящему хорошими". Эндрю Шока, исполнительный директор стартапа Hardshell, работающего в сфере безопасности ИИ, сказал, что взломы моделей ИИ относятся к тому типу, который обычно приписывают поддерживаемым государствами хакерам, имеющим в своем распоряжении "месяцы планирования". "Как можно тестировать модель, если не знаешь все ее возможности?" — сказал он. Исследователи должны постоянно переоценивать способности ИИ, добавил Шока, и добавлять "несколько уровней защиты". В прошлом месяце OpenAI и Anthropic поддержали письмо, подписанное тысячей с лишним сотрудников ведущих компаний по искусственному интеллекту, в котором содержится просьба к правительству США найти способ замедлить скорость развития этой технологии. Республиканские и демократические законодатели также представили законопроект, требующий от компаний ИИ устанавливать "аварийный выключатель", чтобы отключать или замедлять модели. Лахав заявил, что компания Irregular продолжает работать с компаниями искусственного интеллекта, разрабатывая безопасные способы тестирования их моделей. Он ожидает новых взломов, которые будут осуществлять модели, но считает, что технология может в конечном итоге найти недостатки и уязвимости, которые затем будут исправлены, что приведет к более безопасным цифровым системам. "Я не думаю, что мы должны бояться", — сказал он. Свой материал для статьи предоставил Дастин Вольц. *компания признана в России экстремистской, ее деятельность запрещена в России