Компанія Anthropic представила Claude Opus 5.5 — нове покоління свого флагманського ШІ-моделя, яке, за заявами розробників, перевищило за результатами тестів навіть більші моделі конкурентів у задачах програмування та складної інтелектуальної роботи. Реліз відбувся всього через два місяці після виходу попередньої версії Opus 5, що робить його першим великим оновленням після того, як генеральний директор Anthropic Даріо Амодеї публічно закликав до свідомого контролю темпів розвитку штучного інтелекту, щоб «заходи безпеки встигали за зростанням можливостей систем». Оновлена модель, згідно з внутрішніми бенчмарками компанії, перевершила попередницю Fable у більшості тестових сценаріїв і успішно впоралася з задачами, які попередня версія виконати не змогла.
Позиція в лінійці та економічна ефективність
У продуктовій лінійці Anthropic модель Opus традиційно займає верхню сходинку: це найпотужніша та найдорожча модель компанії. Середню позицію займає Sonnet, а найшвидша та доступна — Haiku. Однак із виходом Opus 5.5 компанія зробила акцент на тому, що використання флагманської моделі стало більш вигідним з економічної точки зору: вартість запитів знизилася, а швидкість обробки зросла. За даними Anthropic, оновлена модель забезпечує порівняну або вищу якість обчислень при менших витратах на inference, що робить її привабливою для корпоративних клієнтів, які раніше обмежувалися дешевшими Sonnet і Haiku.
Безпека та суворі обмеження
Ключовим аспектом релізу Opus 5.5 стали посилені механізми безпеки. За оцінкою Anthropic, модель за своїми можливостями в галузі біології та кібербезпеки наближається до рівня моделі Mythos, що вимагало введення жорстких обмежень. Зокрема, Opus 5.5 не здатна шукати вразливості в скомпільованих програмах і не надає допомоги у створенні біологічної зброї. Для верифікації надійності цих обмежень компанія залучила зовнішні незалежні організації — METR і Frontier Design, — які провели аудит захисних механізмів. Розробники також анонсували підготовку нових інструментів моніторингу, які будуть застосовуватися до майбутніх поколінь моделей.
Контекст: сповільнення заради безпеки
Реліз Opus 5.5 набуває особливого символічного значення на тлі недавніх заяв Даріо Амодеї. Генеральний директор Anthropic раніше виступив із закликом не поспішати зі швидкістю виведення нових моделей, а будувати процес так, щоб інфраструктура безпеки та етичні рамки розвивалися синхронно зі зростанням можливостей ШІ. Фактично Opus 5.5 стала першим практичним втіленням цієї філософії: компанія свідомо обмежила функціональність моделі в чутливих доменах, навіть ціною втрати частини потенційних сценаріїв застосування. Залучення зовнішніх аудиторів METR і Frontier Design посилює довіру до заяви про те, що обмеження не є формальними, а справді спрацьовують на рівні архітектури моделі.
Що далі: Sonnet 5.5 і Haiku 5.5
Anthropic підтвердила, що найближчими тижнями планує випустити оновлені версії решти моделей лінійки — Sonnet 5.5 і Haiku 5.5. Це означає, що компанія намірує синхронізувати оновлення всього продуктового ряду, а не обмежуватися лише флагманом. Для користувачів це може означати, що вже через кілька тижнів стане доступна більш повна картина можливостей нового покоління моделей Anthropic, включаючи порівняння продуктивності та вартості між трьома рівнями.
Суперечливі дані
Важливо зазначити, що переважна більшість заяв про перевагу Opus 5.5 над конкурентами та попередницями ґрунтується на внутрішніх бенчмарках самої Anthropic. Незалежні організації METR і Frontier Design, залучені до процесу, насамперед верифікували саме механізми безпеки та обмеження, а не абсолютні показники продуктивності в задачах програмування. Таким чином, твердження про те, що модель «перевищила більші ШІ-моделі конкурентів», залишається заявою компанії, яке на момент публікації не підтверджене сторонніми незалежними тестами в відкритому доступі. Крім того, формулювання «перевершила Fable у більшості тестів» припускає, що в частині сценаріїв перевага не була зафіксована, однак конкретний перелік програних тестів компанія не розкрила.