Краще програмує і дешевший на 40% за Opus5: Anthropic випустила нову ШІ-модель Claude Opus 5.5

Аватар Юлія Шкурат Юлія Шкурат
122
1 голос
Краще програмує і дешевший на 40% за Opus5: Anthropic випустила нову ШІ-модель Claude Opus 5.5
Аналіз Opus 5.5. Фото: sonarsource
Anthropic представила Claude Opus 5.5 - нову ШІ-модель із сильними результатами в програмуванні та роботі з агентами, яка дешевша за Opus 5.

Що відомо про Claude Opus 5.5?

Claude Opus 5.5 - нова флагманська модель Anthropic і перший представник сімейства Claude 5.5. Про неї пише офіційний сайт Anthropic. Компанія заявляє, що за більшістю завдань вона працює на рівні Claude Fable 5.1, але коштує приблизно на 40% дешевше за Opus 5. Модель уже доступна користувачам Claude та розробникам через API.

Важливо! Anthropic заявила, що Opus 5.5 генерує відповіді більш ніж на 30% швидше за Opus 5.

Анонс Opus 5.5. Фото: Anthropic

Новинка орієнтована передусім на складне програмування, роботу ШІ-агентів, дослідницькі завдання та професійну діяльність. За даними Anthropic, модель також стала краще пояснювати результати, подавати головну інформацію на початку відповіді та підтримувати природнішу комунікацію під час тривалих сесій.

У компанії зазначають, що Opus 5.5 пройшла зовнішнє тестування, зокрема за участю Frontier Design та METR. Anthropic також перевірила модель у власному масштабному поведінковому аудиті, де вона показала найсильніші результати серед моделей компанії на момент релізу.

«Він прописує мій шлях», - так один із ранніх тестувальників описав стиль роботи нової моделі, підкресливши її більш природне написання текстів.

В Anthropic зазначили, що зрозуміліша комунікація важлива не лише для зручності, а й для перевірки результатів роботи моделі.

Ціни на останні моделі Opus. Фото: orcarouter

Наскільки Claude Opus 5.5 сильна у програмуванні?

Однією з головних сфер, на якій Anthropic зробила акцент, стало програмування. За даними компанії, один із тестувальників за допомогою Opus 5.5 виконав міграцію кодової бази обсягом близько 680 тисяч рядків менш ніж за добу, хоча аналогічна робота могла б зайняти в інженерної команди кілька тижнів.

В іншому тесті модель перевіряла та виправляла кодову базу на 200 тисяч рядків менш ніж за три години. Для порівняння, Opus 5 витратив на аналогічну роботу понад 20 годин і використав у 2,5 раза більше токенів.

Anthropic також порівняла Opus 5.5 із Fable 5.1 під час перенесення програмного забезпечення HAProxy з C на Rust. Обидві моделі пройшли майже всі регресійні тести, але Opus 5.5 завершила роботу за 9,5 години проти 12 годин у Fable 5.1, а її вартість була на 51% нижчою.

У тестах Terminal-Bench 4.0 Opus 5.5 отримала 66,4%, тоді як Fable 5.1 - 55,8%, Opus 5 - 52,3%, а GPT-6 Astra - 57,9%. Водночас сама Anthropic застерігає, що різницю між моделями на таких бенчмарках не завжди можна напряму переносити на реальні робочі завдання.

Порівняння ефективності моделей. Фото: сайт Anthropic

Особливо показовою компанія називає ефективність. За її розрахунками, на FrontierCode Opus 5.5 може виконувати завдання на рівні GPT-6 Astra приблизно за 20% вартості, а на Terminal-Bench 4.0 досягати порівнянного результату приблизно за 40% витрат.

Скільки коштує Claude Opus 5.5?

Вартість роботи з моделлю також стала однією з головних змін. Для API Anthropic встановила ціну $4 за мільйон вхідних токенів і $20 за мільйон вихідних токенів, тоді як для Opus 5 ці показники становили $5 і $25 відповідно.

Ще сильніше зменшилася ціна кешованих запитів: читання кешу коштує $0,20 за мільйон токенів проти $0,50 у Opus 5. Anthropic оцінює, що за типових навантажень загальна вартість роботи Opus 5.5 приблизно на 40% нижча, ніж у попередньої моделі.

Для Claude Code та Claude Platform доступний також швидкий режим Opus 5.5 зі швидкістю до 2,5 раза вищою. Його вартість становить $8 за мільйон вхідних токенів і $40 за мільйон вихідних.

Ціни на Claude Opus 5.5 та Opus 5. Фото: сайт Anthropic

Нову модель уже можна використовувати у Claude для користувачів планів Pro, Max, Team та Enterprise. Для розробників Opus 5.5 доступна через Claude Platform, а також через Amazon Web Services, Google Cloud і Microsoft Foundry.

Окремо Anthropic заявила про підвищення п'ятигодинних лімітів використання для платних планів. Компанія також додала можливість зберігати скидання ліміту та використовувати його тоді, коли це потрібно користувачеві.

Що ще вміє нова модель?

Opus 5.5 позиціонується не лише як інструмент для програмістів. Anthropic тестувала її у дослідницькій роботі, бізнес-аналітиці, автоматизації, роботі з комп'ютером і складних багатокрокових завданнях.

У тесті з підготовки звіту про квартальні результати компанії Opus 5.5 мала знаходити інформацію, перевіряти цифри та цитати за джерелами. У 16 із 18 спроб її звіти відповідали встановленому порогу якості, причому будь-яка вигадана цифра або цитата означала б провал тесту.

Claude Opus 5.5 у порівнянні з GPT-4.6 Sol. Фото: taylortailored

Модель також показала сильні результати в роботі з фінансовими завданнями. В одному з тестів вона створила фінансову модель потенційного злиття двох вигаданих компаній, а потім підготувала презентацію для керівництва; на виконання завдання Opus 5.5 знадобилося 63 хвилини проти 93 хвилин у Opus 5.

Ще один напрямок - безпека. Anthropic заявляє, що Opus 5.5 краще протистоїть prompt injection, рідше виконує потенційно незворотні дії за межами заданих обмежень і має додаткові механізми контролю дій ШІ-агента.

На цьому розвиток нової лінійки не завершується. Anthropic повідомила, що Claude Sonnet 5.5 і Claude Haiku 5.5 мають вийти протягом найближчих тижнів із частиною аналогічних покращень у продуктивності, ефективності та безпеці.

Читайте по темі:

  • «ШІ знищить нас всіх»: колишній фахівець Google DeepMind попередив, що нейромережі можуть знищити людство.
  • Ілон Маск, Сем Альтман та Даріо Амодей вимагають зупинити небезпечний розвиток штучного інтелекту.
  • Бояться зловживань від ШІ: Anthropic та Google блокують спроби створення біозброї за допомогою Claude та Gemini.