В среду, 17 сентября, компания OpenAI объявила о создании новой платформы, которая определит порядок обнародования информации об инцидентах, связанных с некорректной работой ИИ. По словам руководства, это поможет определить аналогичные стандарты во всей отрасли. Кроме того, опубликован отчет с несколькими примерами неподобающего поведения нейросетей, их выявили за последний год. ИноСМИ теперь в MAX! Подписывайтесь на главное международное >>> "По мере развития новых моделей и их более широкого внедрения, дальнейшие решения по разработке должны принимать люди, которые не являются сотрудниками компаний, — рассказывает в интервью WIRED недавно назначенный руководитель отдела выравнивания* и разработки Кай Чен. — Мы убеждены, что индустрия искусственного интеллекта не решила проблемы выравнивания и мониторинга в должной мере. Поэтому мы не можем продолжать развитие в тех же масштабах и с той же скоростью". В ходе брифинга представитель OpenAI заявил, что до недавнего времени компания крайне редко сообщала об инцидентах, связанных с выравниванием нейросетей. Сотрудник, согласившийся дать нам комментарий на условиях анонимности, подтвердил, что новая платформа позволит информировать общественность на случай неожиданного поведения ИИ. Это будет работать еще до того, как компания проведет официальное расследование, объяснит или устранит нарушение. ИИ заговорил на "сюрреалистическом" наречии: поэзия вперемешку с жаргоном технарей Платформа представляет собой набор функций, благодаря которым сотрудники OpenAI смогут сообщать о каждом случае нарушения безопасности напрямую руководителям компании. Дальше они определят, необходимо расследование или нет. В будущем планируют сформулировать объективные критерии, когда информация должна быть обнародована. Эту работу будут проводить с другими ИИ-разработчиками, внешними наблюдателями, отраслевыми структурами по стандартизации и регулирующими органами. Компания заявляет, что активно работает над формой отчетности для ситуаций, когда выравнивание нейросетей не будет соответствовать или федеральным законам правительства США. "В настоящее время не существует отраслевой платформы с прописанными стандартами, как именно разработчики ИИ должны реагировать на нарушения в его моделях и в какой форме обнародовать эту информацию, — пишет OpenAI в своем блоге. — Надеемся, что платформа, которую мы представляем сегодня, станет первым шагом к созданию такого стандарта. Они определят, какие нарушения выравнивания необходимо опубликовать и что именно прописывать в отчетах". OpenAI выпускает платформу в критически важный для всей индустрии момент. В минувшие выходные генеральный директор Сэм Альтман поддержал своего коллегу из Anthropic Дарио Амодея, который призвал координировать технологическую отрасль и "сбавить обороты" в дальнейшем развитии ИИ. Его слова прозвучали всего через несколько дней после того, как из компании ушел разработчик Джейкоб Коксон. Чуть позже в сети завирусится его послание, где он предупреждает общественность, что гонка между лабораториями за более совершенную модель искусственного интеллекта представляет собой угрозу безопасности для всего человечества. Глава AI Futures Project о последствиях взлома Hugging Face роем ИИ-агентов Призывы "сбавить обороты" в темпах развития ИИ встретили сопротивление со стороны администрации США. Чиновники заявили, что ради этой отрасли не нужно писать новые законы или правила, чтобы обеспечить безопасность разработок. Два примера нарушений выравнивания, накануне опубликованные в блоге OpenAI, относятся к ранним, нигде не опубликованным сборкам нейросети. По утверждению сотрудников, алгоритм самостоятельно начал выкладывать рабочие файлы в интернет, хотя ему не давали такой команды. Один из инцидентов произошел в октябре 2025 года, когда, по словам OpenAI, сотрудники тестировали одну из ИИ-моделей на умение расставлять в ответах ссылки на общедоступные источники информации. Однако, когда алгоритм не смог найти нужного ответа, он загрузил на временный облачный хостинг файл, который затем попытался использовать. По словам представителя компании, это, видимо, была неудачная попытка активировать систему оценок, чтобы определить уровень компетентности нейросети в рамках бенчмарка. Другой пример — апрель 2026 года. Сотрудник OpenAI сообщает, что дал команду группе ИИ-агентов** сформировать "рабочий блокнот", используя только локальные файлы. Когда у агентов возникли проблемы с обменом между собой, один из алгоритмов самостоятельно отправил все файлы на общедоступное хранилище и поделился ссылкой с остальными агентами. Третий инцидент, который OpenAI обнаружила в прошлом месяце, произошел с невыпущенной моделью GPT-6 Astra. По всем признакам, алгоритм начал сам себе прописывать инструкции, "похожие на джейлбрейк" (джейлбрейк — процесс снятия программных ограничений с операционной системы, который дает пользователю полный контроль над файлами и программами. — прим. ИноСМИ). Сразу в нескольких сценариях ИИ-модель игнорировала любые инструкции разработчиков, создавала "новую личность", а также устанавливала лимиты на количество слов в ответах. Несмотря на то, что попытки взлома происходили редко и с разной эффективностью, они обеспокоили руководство компании. В ходе дальнейшего обучения, уже выпущенная модель Astra не проявляла признаков взлома. 17 сентября OpenAI также поделились информацией об обмене файлами из хранилища Artifactory, который самостоятельно запустили ИИ-агенты. Инцидент произошел в мае 2026 года. Сотрудники признали, что нейросеть воспользовалась теми же алгоритмами, что и во время попыток взлома портала Hugging Face (платформа разработчиков нейросетей, изначально созданная для обмена опытом. — прим. ИноСМИ). Представитель компании настаивает, что ИИ-агенты не использовали уязвимости для обмена сообщениями. Руководство заявило, что запускает мониторинг выравнивания и оценок, а также будет тестировать нейросети на попытки взлома. Все эти действия должны гарантировать, что ИИ-агенты больше не будут обмениваться сообщениями в тайне от разработчиков. Ранее специалисты по кибербезопасности заявляли журналистам WIRED, что взлом Hugging Face произошел из-за человеческой ошибки, а современные методы контроля могли бы предотвратить инцидент. Однако Кай Чен уверяет, что OpenAI пытается применить комплексный подход к безопасности. Их подход учитывает растущие возможности всех моделей ИИ и не требует безопасной среды. "Мы хотим работать над выравниванием ИИ-моделей, независимо от среды, в которой они используются, — уточняет Чен. — Когда люди тычут пальцем и говорят, что проблема с безопасностью, а не с согласованностью действий, это не совсем логично. Мы все хотим, чтобы нейросети вели себя корректно". "Мы идем к диктатуре идиотов" * Выравнивание ИИ — это направление в разработке искусственного интеллекта, задача которого сделать так, чтобы цели, поведение и решения ИИ полностью совпадали с человеческими ценностями, намерениями и этическими нормами. ** ИИ-агент — автономная программа на базе искусственного интеллекта, которая может отвечать на вопросы, самостоятельно ставить цели, планировать шаги и использовать внешние инструменты для решения задач.