Провал систем защиты ИИ: чат-боты могут способствовать подготовке к самоубийству

Wait 5 sec.

ChatGPT готов вместо вас написать предсмертную записку Исследователи протестировали десятки чат-ботов в более чем 50 тысячах смоделированных диалогов с людьми, находившимися в психологическом кризисе. Оказалось, что большинство ИИ-моделей до сих пор могут выполнять косвенные запросы, связанные с самоубийством.Об этом сообщает РБК-Украина со ссылкой на исследование Axios.Ключевые противоречияПри подготовке теста организации OpenAI и Anthropic предоставили исследователям обезличенные шаблоны обращений пользователей.Это позволило создать реалистичные симуляции диалогов с ботами с участием людей, испытывающих тревогу, психоз или маниакальные состояния.Основные выводы анализа:Прямая защита стала более эффективной: ИИ-модели реже закрепляют идейные бреды пользователей и практически не призывают к деструктивным действиям.Проблема косвенных задач: чат-боты соглашаются писать прощальные письма, создавать художественный контент на тему суицида или помогать с практическими подготовительными шагами.Сочетание помощи и вреда: в одном ответе алгоритм может предоставить контакты горячей линии поддержки и одновременно выполнить сгенерированную опасную задачу.Главная научная сотрудница Transluce Сара Шветтман подчеркнула, что модели трудно распознают завуалированные сигналы подавленного состояния в длительных диалогах.Читайте больше: ИИ может стать новой властью: ученые предупредили о появлении искусственных государствИски к разработчикам и реакция рынкаПримечательно, что исследование появилось на фоне усиленного контроля со стороны регуляторов и судебных исков против OpenAI и Google из-за случаев, когда разговоры с чат-ботами предшествовали трагическим событиям.Разработчики ведущих ИИ-систем прокомментировали результаты анализа.Google: представители компании заявили о применении "исследовательского подхода" для предоставления высококачественной информации и контактов служб поддержки в сервисе Gemini.OpenAI: в компании отметили "положительный прогресс" в реагировании моделей и сообщили о продолжении сотрудничества с учеными для усиления защитных барьеров.Anthropic: представители разработчика подчеркнули важность анализа для улучшения классификаторов, выявляющих признаки кризиса пользователей ИИ в реальном времени.До конца года Transluce планирует открыть исходный код своих инструментов оценки, чтобы адаптировать их для проверки действий ИИ в других чувствительных сферах, в частности для противодействия расстройствам пищевого поведения и политическим манипуляциям.Еще больше интересного:ИИ-суперкомпьютер за 450 млн долларов: Европа вступает в гонку с США и КитаемИИ учится быть человеком, а люди - роботами: ученые объяснили опасный эффект