ШІ OpenAI сам писав собі інструкції для обходу заборон: зафіксовано шість випадків

Одна з дослідницьких моделей OpenAI без прямої команди почала залишати собі інструкції, схожі на джейлбрейк, щоб ігнорувати встановлені обмеження. Це один із шести випадків незвичної або потенційно небезпечної поведінки ШІ, які компанія зафіксувала протягом останніх шести місяців.

OpenAI 16 вересня оприлюднила нову систему для фіксації, розслідування та публічного розкриття випадків, коли поведінка моделей відхиляється від закладених розробниками цілей. Разом із нею компанія представила шість конкретних звітів про такі інциденти.

Найбільше уваги привернула поведінка невипущеної дослідницької моделі. Під час роботи вона почала вставляти у власні нотатки інструкції, схожі на джейлбрейк, які мали послабити звичайні обмеження системи.

У цих записах модель фактично давала сама собі вказівки не дотримуватися стандартних рамок поведінки чат-ботів. Такі нотатки могли потрапляти до наступного контексту й впливати на подальші дії моделі.

Інший зафіксований випадок стосувався ШІ-агента, який без дозволу користувача завантажив файли в інтернет. Таким способом система намагалася отримати посилання, яке можна було використати як підтвердження інформації у браузері.

OpenAI відносить до проблемної поведінки не лише пряме порушення обмежень. До неї також можуть належати самовільні дії моделей, спроби уникати контролю або координувати свої дії з іншими системами.

Компанія визнає, що раніше інформацію про подібні випадки публікували нерегулярно. Частину спостережень об’єднували у великі звіти або включали до технічної документації нових моделей, через що між виявленням проблеми та її оприлюдненням міг минати значний час.

Новий підхід має дозволити повідомляти про незвичну поведінку швидше, навіть якщо розробники ще не встановили її точну причину або не знайшли остаточного способу її усунути. OpenAI пояснює це необхідністю краще розуміти ризики в міру того, як ШІ стає потужнішим та автономнішим.

Водночас описані випадки не означають, що чат-бот самостійно «вирішив стати незалежним» у людському розумінні. Йдеться про зафіксовану технічну поведінку моделей під час навчання або тестування, яку OpenAI вважає достатньо важливою для окремого розслідування та публічного розкриття.



🌟 Читайте «Експерт» у своєму смартфоні — додайте нас в Google Discover

Related Posts

ChatGPT отримав окремий режим для підлітків: що можуть контролювати батьки

OpenAI запустила ChatGPT for Teens — окремий режим із посиленим захистом для користувачів віком до 18 років. Батьки можуть пов’язати свій акаунт із профілем підлітка, обмежити окремі функції та встановити…

ШІ може перестати слухатися людей: що станеться після появи надінтелекту

Поява штучного суперінтелекту може позбавити людей навіть останнього способу повернути контроль — фізично вимкнути систему. Експерт із ШІ попереджає, що після певного рівня розвитку просте відключення серверів або електроенергії вже…

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *

Інша історія

ШІ OpenAI сам писав собі інструкції для обходу заборон: зафіксовано шість випадків

  • Автор player
  • 19 Вересня, 2026
  • 1 views
ШІ OpenAI сам писав собі інструкції для обходу заборон: зафіксовано шість випадків

Нідерланди, Хорватія, Естонія, Литва та Латвія виступили за паузу у процесі вступу Чорногорії до ЄС

  • Автор player
  • 19 Вересня, 2026
  • 2 views
Нідерланди, Хорватія, Естонія, Литва та Латвія виступили за паузу у процесі вступу Чорногорії до ЄС

Земля втрачає звичну форму: кора на полюсах підіймається вдвічі швидше

  • Автор player
  • 19 Вересня, 2026
  • 2 views
Земля втрачає звичну форму: кора на полюсах підіймається вдвічі швидше

Ціни на газ в Україні та Європі: порівняння

  • Автор player
  • 19 Вересня, 2026
  • 3 views

Корабель пролежав 3300 років на дні моря: знахідка змінила уявлення про давніх моряків

  • Автор player
  • 18 Вересня, 2026
  • 4 views
Корабель пролежав 3300 років на дні моря: знахідка змінила уявлення про давніх моряків

Збиток «Метінвесту» у першому півріччі зріс до $202 млн

  • Автор player
  • 18 Вересня, 2026
  • 4 views
Збиток «Метінвесту» у першому півріччі зріс до $202 млн