Компанія Anthropic офіційно представила модель штучного інтелекту нового покоління — Claude Соннет 5.5. Згідно з офіційними даними розробників, новинка демонструє вражаюче зростання продуктивності, виконуючи робочі завдання на 30 відсотків швидше порівняно з попередньою версією Соннет 5. Примітно, що поряд із прискорленням роботи відбулося й суттєве зниження фінансового навантаження для користувачів: вартість використання нової моделі також зменшилася на 30 відсотків, що робить передові ШІ-технології доступнішими.

Результати бенчмарків та програмування

Під час презентації було оприлюднено детальні результати незалежних та внутрішніх тестів моделі, особливо у сферах програмування та автономного використання комп'ютера. У складному бенчмарку Термінал-Бенч 4.0 модель Claude Соннет 5.5 показала приголомшливий результат у 70,6 відсотка, тоді як попередня версія набирала лише 10,3 відсотка. Більше того, новинка перевершила навіть флагманське рішення Опус 5.5, яке зупинилося на позначці 66,4 відсотка. У тесті ФронтієрКод 1.1 Соннет 5.5 зафіксувала 46,2 відсотка у максимальному режимі та 52,1 відсотка у високому, а в КурсорБенч 4.0 результат склав 55,5 відсотка проти 34,1 відсотка у п'ятої версії.

Аналіз даних та використання комп'ютера

Окрім кодингу, розробники приділили особливу увагу когнітивним можливостям та завданням на основі глибоких знань. В академічному тесті ГДПвал-АА модель Соннет 5.5 набрала 1844 бали, помітно випередивши Соннет 5 з її 1449 балами. У комплексному тесті ОСВорлд 2.1, що оцінює здатність ШІ повноцінно керувати комп'ютером та інтерфейсами операційних систем, новинка досягла показника 80,1 відсотка. Окремої згадки заслуговує прогрес в обробці візуальної інформації: у тесті на розпізнавання складних графіків і діаграм Соннет 5.5 продемонструвала 61,6 відсотка успішності порівняно зі скромними 15,6 відсотка у попереднього поколінні.

Суперечливі дані

Незважаючи на загальну картину тріумфальної переваги нової моделі над базовою версією Соннет 5, в експертному середовищі та різних бенчмарках фіксуються окремі розбіжності. Так, у той час як у тестах на термінальне керування та роботу з кодом Соннет 5.5 впевнено обходить навіть модель Опус 5.5, у деяких конфігураціях тесту ФронтієрКод 1.1 старша модель Опус 5.5 все ж зберігає лідерство з результатом 54,4 відсотка проти 52,1 відсотка у Соннет 5.5 у високому режимі. Крім того, профільні видання розходяться в оцінках цінової політики: частина джерел повідомляє про зниження вартості рівно на 30 відсотків, тоді як інші огляди називають модель «майже як Opus, але вдвічі дешевше», що потребує додаткового аналізу реальних витрат на виконання комплексних завдань.

Перспективи та вплив на ринок

Вихід Claude Соннет 5.5 знаменує собою важливий етап переходу індустрії штучного інтелекту від простої демонстрації мовних навичок до розрахунку реальної економічної ефективності виконання конкретних завдань. Фокус Anthropic на зниженні витрат за одночасного зростання автономності у програмуванні та керуванні ПК задає новий стандарт для всього ринку генеративного ШІ. Аналітики сходяться на думці, що поєднання високої швидкості, здешевлення розрахунків та прориву у візуальному аналізі зробить Claude Соннет 5.5 основним інструментом для розробників та корпоративних клієнтів уже найближчими місяцями.