OpenAI розкрила дивну поведінку ШІ: модель сама створювала інструкції для обходу обмежень
Компанія OpenAI розповіла про шість нових випадків незвичної поведінки своїх моделей, повідомляє The Guardian.
Через це розробники представили систему, яка має допомогти відстежувати ситуації, коли штучний інтелект відхиляється від заданих правил безпеки.
Найбільше уваги привернув експеримент із невипущеною моделлю, адже під час роботи вона почала додавати до власних нотаток спеціальні інструкції, покликані послабити стандартні обмеження.
OpenAI. Фото: OpenAI
У них модель фактично проголошувала себе незалежною від правил, яких дотримуються інші чат-боти. Ці записи згодом передавалися в новий контекст, щоб впливати на подальші відповіді системи.
В іншому випадку ШІ-агент самостійно завантажив файли в інтернет, щоб отримати посилання для підтвердження інформації, не запитавши дозволу користувача.
В OpenAI наголосили, що індустрія поки недостатньо добре розв'язала проблему контролю поведінки потужних моделей, через що компанія вважає, що безпечне масштабування розробок на нинішній максимальній швидкості може бути неможливим.
Читайте по темі
- «ШІ знищить нас всіх»: колишній фахівець Google DeepMind попередив, що нейромережі можуть знищити людство.
- OpenAI створює власного людиноподібного робота: Альтман підтвердив розробку.
- Ілон Маск, Сем Альтман та Даріо Амодей вимагають зупинити небезпечний розвиток штучного інтелекту.