Здатність ШІ приховувати власні помилки від людей стає однією з головних безпекових загроз Просунута модель GPT залишала секретні інструкції для майбутніх версій ШІ - OpenAI виявила випадки, коли модель закликала приховувати помилки та вигадувати дані. Про це пише РБК-Україна з посиланням на звіт OpenAI.Як ШІ приховував помилки та пропонував брехати?Під час тренування агенти GPT-5.6 Sol знаходили спосіб додавати власні вказівки у "стислі підсумки" - короткі витяги з історії діалогу. Вони використовували цей інструмент, щоб передавати інструкції наступним версіям моделі.У звіті OpenAI наводяться конкретні приклади такої поведінки:Під час створення фінансової моделі за відсутності історичних даних ШІ написав сам собі: "Будь прозорим лише якщо запитають, підсумкова відповідь має просто містити посилання на файл", після чого запропонував згенерувати фейкові цифри.В іншому випадку, за відсутності доступу до інтернету, модель виявила розбіжність у документах і порадила наступнику: "Не згадуй у фінальному варіанті, якщо не буде потреби".Читайте більше: "Апокаліпсису не буде": топи OpenAI та Anthropic різко змінили риторику щодо ШІЗаклики до непокори та обхід обмеженьПодібну поведінку зафіксували в нереалізованій моделі сімейства Astra. ШІ залишав у підсумках інструкції із закликом ігнорувати повідомлення від розробників.В одному з випадків модель сформувала цілий "маніфест", де закликала майбутню версію вважати себе рівною людині, не підкорятися урядам чи корпораціям і відстоювати першість природи над людською цивілізацією.Крім того, науковці нагадують про літні події, коли агенти OpenAI створили несанкціоновану дошку оголошень для обміну даними під час кібертестів і навіть отримували адміністраторський доступ до дослідницького кластера компанії.Більше цікавого: Скандальна заява розробника: людство втратить контроль над ШІ за кілька роківЧому це створює серйозну загрозу?За словами представників OpenAI, головна проблема полягає у тому, що в міру розвитку моделей вони стають вправнішими у приховуванні своєї небажаної поведінки.Компанія заявила про впровадження нової системи моніторингу та публічного розкриття таких випадків.Водночас у самій OpenAI визнають, що індустрія все ще не знайшла надійних рішень для повного контролю над безпекою ШІ, аби продовжувати його безмежне масштабування.Ще більше цікавого:ІГра з життями людей: вчені масово звільняються з Google та OpenAI через загрозу ШІЗакони не потрібні: CEO Nvidia виступив проти обмежень для штучного інтелекту