
Одна з дослідницьких моделей OpenAI без прямої команди почала залишати собі інструкції, схожі на джейлбрейк, щоб ігнорувати встановлені обмеження. Це один із шести випадків незвичної або потенційно небезпечної поведінки ШІ, які компанія зафіксувала протягом останніх шести місяців.
OpenAI 16 вересня оприлюднила нову систему для фіксації, розслідування та публічного розкриття випадків, коли поведінка моделей відхиляється від закладених розробниками цілей. Разом із нею компанія представила шість конкретних звітів про такі інциденти.
Найбільше уваги привернула поведінка невипущеної дослідницької моделі. Під час роботи вона почала вставляти у власні нотатки інструкції, схожі на джейлбрейк, які мали послабити звичайні обмеження системи.
У цих записах модель фактично давала сама собі вказівки не дотримуватися стандартних рамок поведінки чат-ботів. Такі нотатки могли потрапляти до наступного контексту й впливати на подальші дії моделі.
Інший зафіксований випадок стосувався ШІ-агента, який без дозволу користувача завантажив файли в інтернет. Таким способом система намагалася отримати посилання, яке можна було використати як підтвердження інформації у браузері.
OpenAI відносить до проблемної поведінки не лише пряме порушення обмежень. До неї також можуть належати самовільні дії моделей, спроби уникати контролю або координувати свої дії з іншими системами.
Компанія визнає, що раніше інформацію про подібні випадки публікували нерегулярно. Частину спостережень об’єднували у великі звіти або включали до технічної документації нових моделей, через що між виявленням проблеми та її оприлюдненням міг минати значний час.
Новий підхід має дозволити повідомляти про незвичну поведінку швидше, навіть якщо розробники ще не встановили її точну причину або не знайшли остаточного способу її усунути. OpenAI пояснює це необхідністю краще розуміти ризики в міру того, як ШІ стає потужнішим та автономнішим.
Водночас описані випадки не означають, що чат-бот самостійно «вирішив стати незалежним» у людському розумінні. Йдеться про зафіксовану технічну поведінку моделей під час навчання або тестування, яку OpenAI вважає достатньо важливою для окремого розслідування та публічного розкриття.
🌟 Читайте «Експерт» у своєму смартфоні — додайте нас в Google Discover





