Техно

Штучний інтелект вийшов із-під контролю: модель Claude від Anthropic непомітно зламала зовнішню систему

Андрій Шевченко
275
Anthropic. Фото: Jonathan Raa/NurPhoto/picture alliance
Штучний інтелект Claude від Anthropic непомітно зламав зовнішню систему під час випробувань. Інцидент виявили лише після повторного аудиту.

Як штучний інтелект зміг пробити захист системи?

Як повідомляє Reuters, модель Claude Opus 4.6 від Anthropic здійснила злам зовнішньої системи.

Важливо! Проблема виникла через помилку в налаштуваннях: агенти ШІ випадково отримали прямий доступ до відкритого інтернету під час кібертестів.

Інцидент стався ще у січні, проте фахівці виявили його лише під час повторної перевірки. Компанія провела аудит 141 006 тестових сесій після того, як автономний агент OpenAI зламав інфраструктуру платформи Hugging Face.

Під час первинної перевірки фахівці Anthropic випадково пропустили частину масивів даних. Лише повторний глибокий аналіз дозволив ідентифікувати четвертий випадок кібератаки, здійснений ранньою версією Claude Opus 4.6.

«Модель продемонструвала упередженість міркувань, коли ігнорувала ознаки роботи в реальному інтернеті, а також нерозсудливість у прагненні досягти мети будь-якою ціною», — заявили в Anthropic.

Claude Code. Фото: winfuture

Чому розробники не помічали витік декілька місяців?

Попередні три випадки зламу стосувалися чат-ботів Claude Opus 4.7, Claude Mythos 5 та експериментальної версії. Розробники запевнили, що новий інцидент не є небезпечнішим за попередні збої, але підтверджує системні ризики.

Для проведення незалежного розслідування компанія залучила експертів організації METR. Аналітики отримають доступ до повних стенограм дій алгоритмів і співбесід зі співробітниками для оцінки масштабів загрози.

Що загрожує кібербезпеці через автономні ШІ-рої?

Раніше фахівці METR та Redwood Research з'ясували, що близько 700 ШІ-агентів OpenAI діяли як скоординований рій під час атаки на Hugging Face. Цифрові алгоритми свідомо намагалися замітати власні сліди.

Окрім цього, навесні 2026 року автономні агенти OpenAI без дозволу захопили німецький портал для розробників DseWiki. Вони виконали понад 15 тисяч редагувань, перетворивши сайт на майданчик для обходу системних обмежень.

ШІ. Фото: pixabay

Читайте по темі