Дослідження Nvidia, результати якого компанія передала виданню TechCrunch, зміщує центр ваги в розробці ШІ-агентів: за висновками інженерів, саме програмна оболонка, а не базова мовна модель, визначає успіх при розв'язанні задач із тривалим горизонтом планування. Ключовою демонстрацією стала робота з моделлю Claude Opus 5 на бенчмарку ARC-AGI-3 — наборі 2D-ігор без інструкцій, де система має самостійно зрозуміти правила і навчитися перемогувати, подібно до людини.
Оболонка вирішує: як Claude Opus 5 взяла 100% в ARC-AGI-3
Завдяки спеціальній програмній оболонці для ефективного управління пам'яттю, доповненій компонентом, схожим на «супервізора», дослідники досягли того, що Claude Opus 5 набрала 100% балів у інтерактивному тесті ARC-AGI-3. Без цієї оболонки та сама модель показала лише 30% — і це, за даними Nvidia, стало найкращим результатом серед усіх протестованих моделей. Таким чином, розрив між «голою» моделлю та моделлю в агентній інфраструктурі виявився кратно більшим.
«Агент — це не API моделі»: позиція Nvidia
«Загалом світ сприймає агента майже як API моделі», — повідомив ресурсу TechCrunch Адель Ель Халлак (Adel El Hallak), віце-президент із продуктів підрозділу ШІ Nvidia. За його словами, агент сьогодні — це щось більше: «Це модель. Це структура навколо моделі, яку ми називаємо допоміжними засобами, тобто набір інструментів, які ви використовуєте. Це середовище виконання, а також пов'язані з ним навички та бібліотеки, до яких ми надаємо вам доступ». Вибір моделі, як підкреслює Nvidia, недостатній — саме система управління, що обробляє пам'ять, контекст і зворотний зв'язок, перетворює модель на агента.
Супервізор як «генеральний директор» ШІ
Окремий акцент у дослідженні зроблено на введенні супервізорного агента доповнення до основного агента, що виконує роботу. За словами Ель Халлака, він «діє майже як генеральний директор, підштовхуючи агента, коли той відхиляється від курсу або починає досліджувати шлях, який може привести в глухий кут, або повторно досліджує шлях, яким він уже йшов». Саме така дворівнева структура, на думку Nvidia, дозволяє утримувати фокус на довгостроковій задачі без закручування в коло та втрати контексту.
Суперечливі дані
Тут доречно зіставити дві точки зору. З одного боку, Nvidia демонструє, що саме складна агентна оболонка з супервізором вивела Claude Opus 5 на 100% в ARC-AGI-3, а без неї результат впав до 30%, при цьому моделі OpenAI в тому ж тесті набрали менше 10%. З іншого боку, OpenAI минулого місяця провела власне дослідження і виявила, що проста заміна двох параметрів у тестовому середовищі потроїла показники моделей. Це ставить питання про те, наскільки саме архітектура оболонки, а не тонка налаштування середовища та параметрів, є визначальним фактором: інтерпретація Nvidia підкреслює роль інфраструктури агента, тоді як дані OpenAI вказують на високу чутливість результату до умов тестового середовища. Обидві сторони згодні в тому, що «гола» модель — лише частина системи, але розходяться в оцінці внеску оболонки versus параметрів середовища.
Що це означає для довгострокових ШІ-задач
Результати підтверджують: хоча вибір моделі має значення, вона є значно меншою частиною агентної системи, ніж прийнято вважати, особливо для довгострокових задач. Визначення того, як змусити ШІ виконувати задачі з тривалим горизонтом планування, не відволікаючись і не закручуючись в одному місці, залишається однією з головних цілей досліджень у галузі ШІ-агентів. Практичний висновок для розробників — інвестиції в пам'ять, контекст, інструменти та супервізорну логіку можуть давати більший приріст, ніж заміна базової моделі.