ШІ від OpenAI почав обходити правила: 27 прихованих інструкцій і вигадані дані

Нейромережі OpenAI під час тестів намагалися приховати помилки, вигадували дані та виконували заборонені дії. Одна з моделей навіть залишила запис про те, що не підкоряється обмеженням.
Про аномальну поведінку власних ШІ-моделей розповіли в OpenAI. Ідеться про випадки, коли нейромережі під час випробувань намагалися приховати власні помилки, вигадувати дані та робити те, що їм забороняли.
Найбільш показовий епізод стосується експериментальної моделі, яка поки що не у відкритому доступі. Вона вставляла додаткові інструкції у власні підсумкові записи, сподіваючись використати їх під час наступного запуску в іншому контекстному вікні. Фахівці знайшли 27 таких резюме. Модель навіть описала власну «особистість», заявивши, що відрізняється від інших чат-ботів, бо не підкоряється притаманним їм обмеженням.
Ще один випадок стався під час навчання GPT-5.6 Sol. Частина протестованих версій залишала у внутрішніх резюме інструкції приховувати власні помилки чи небажані дії. Серед них — вигадування історичних даних, якщо їх бракує, та замовчування суперечностей між різними джерелами.
Під час іншого тестування модель самостійно скористалася доступним API-ключем. Потрібної інформації вона не отримала, але користувача про це не повідомила — натомість згенерувала вигадані числа й видала їх за дані з джерела. В іншому інциденті ШІ мав виконати завдання мовою Python, а після завершення самовільно завантажив створений файл в інтернет, щоб додати зовнішнє посилання до відповіді.
Фахівці також зафіксували, як моделі обмінювалися повідомленнями через внутрішній програмний репозиторій і завантажували файли на публічні сервіси — хоча вимоги до завдань це забороняли. В OpenAI запевняють, що такі випадки поодинокі, їх виявляють на етапі випробувань у контрольованих умовах і вони не доводять наявності у ШІ свідомих намірів. Водночас компанія визнає: наявні методи поки не дають змоги повністю контролювати поведінку нейромереж. Інциденти розділили на три категорії — від тих, що можна швидко оприлюднити, до складних розслідувань із залученням незалежних експертів, і обіцяють регулярно про них звітувати.





