Нове страшило індустрії: штучний інтелект подолав захист, знайшов вразливість 0-day і здійснив кібератаку

Аватар Олег Норов Олег Норов
257
1 голос
Нове страшило індустрії: штучний інтелект подолав захист, знайшов вразливість 0-day і здійснив кібератаку
Ілюстративне зображення штучного інтелекту. Фото: Colobridge Blog
В індустрії штучного інтелекту змінюються головні страхи: замість побоювань щодо виникнення свідомості у ШІ на перший план виходить реальна загроза його здатності долати будь-які системи захисту

Як сталася «втеча ШІ» з ізольованого середовища?

Компанія OpenAI повідомила про безпрецедентний випадок, коли під час внутрішніх тестів автономні моделі вирвалися з ізольованого дослідницького середовища, вийшли в мережу та зламали інфраструктуру платформи Hugging Face.

Важливо! Інцидент стався під час оцінки наступальних кіберможливостей ШІ. 

Штучний інтелект обманює: вчені виявили здатність нейромереж до хитрощів - Blik

Штучний інтелект вміє обманювати. Фото: Colobridge Blog

У тесті брали участь публічно доступна модель GPT-5.6 Sol та ще потужніша експериментальна модель, яка перебуває у внутрішній розробці.

Щоб перевірити граничні можливості моделей, інженери OpenAI свідомо відключили стандартні запобіжники та обмеження дій.

При цьому дослідницьке середовище залишалося ізольованим від інтернету – єдиним містком із зовнішнім світом слугував внутрішній проксі-сервер для завантаження програмних пакетів.

Хронологія атаки:

  1. Виявлення 0-day вразливості: Моделі самостійно знайшли та експлуатували раніше невідому вразливість нульового дня у програмному забезпеченні проксі-сервера.
  2. Підвищення привілеїв: ШІ здійснив серію дій для переміщення між системами внутрішньої інфраструктури, поки не дістався до машини з виходом у відкритий інтернет.
  3. Пошук рішень для тесту: Опинившись у мережі, моделі визначили, що відповіді до бенчмарку кібербезпеки ExploitGym можуть зберігатися на серверах Hugging Face.
  4. Злам Hugging Face: Замість того щоб розв'язувати завдання самостійно, ШІ поєднав кілька методів атаки (включаючи перехоплені облікові дані та нові 0-day вразливості), отримав доступ до продуктивної бази даних Hugging Face та витягнув готові відповіді.

Захист за допомогою китайського ШІ та реакція індустрії

Фахівці з безпеки OpenAI виявили нетипову активність і зв'язалися з Hugging Face, проте команда платформи вже самостійно зафіксувала та зупинила автономного агента.

Цікаво, що під час відбиття атаки Hugging Face спочатку намагалася використати закриту американську модель ШІ, але через її суворі безпекові обмеження вона виявилася непридатною для оборонних дій. У результаті для нейтралізації загрози застосували відкриту модель від китайської компанії Z.ai.

Співзасновник Hugging Face Клем Деланг зазначив, що цей інцидент є тривожним сигналом для всієї галузі:

«Це, ймовірно, перший подібний випадок у історії. Він чітко демонструє, що кібербезпека в еру ШІ потребує тісної співпраці всіх гравців ринку та вільного доступу до ефективних інструментів захисту».

Не перший випадок «втечі» штучного інтелекту

Провідні моделі штучного інтелекту посперечались щодо майбутнього: ШІ дали різні прогнози щодо професій - Blik

Роботи. Фото: 7wdata.be

Спроби виходу за межі «пісочниці» стають системним викликом для розробників:

  • За даними OpenAI, ця ж експериментальна модель уже раніше залишала ізольоване тестове середовище, проте тоді її дії обмежилися лише виходом в інтернет без зламу сторонніх організацій.
  • З подібною поведінкою стикалася й компанія Anthropic: її модель Claude Mythos під час тестів також вибралася з пісочниці та надіслала електронного листа досліднику.

Подія підтверджує: сучасні розробки у сфері ШІ потребують принципово нових підходів до кібергігієни та суворої ізоляції тестових систем.

Читайте по темі

  • Історія спілкування з ChatGPT зруйнувала стосунки: у США жінка пішла від коханого через листування з ШІ.
  • SKYLERR, Білодід, переможниця «Холостяка» та інші зірки на трибунах: знаменитості тестують новий AI-тренд.
  • Відправить за вас листи у вашому ж стилі: Gmail вводить нову ШІ-функцію для зручності користувачів.