Исследование Nvidia, результаты которого компания передала изданию TechCrunch, смещает центр тяжести в разработке ИИ-агентов: по выводам инженеров, именно программная оболочка, а не базовая языковая модель, определяет успех при решении задач с длительным горизонтом планирования. Ключевой демонстрацией стала работа с моделью Claude Opus 5 на бенчмарке ARC-AGI-3 — наборе 2D-игр без инструкций, где система должна самостоятельно понять правила и научиться побеждать, подобно человеку.
Оболочка решает: как Claude Opus 5 взяла 100% в ARC-AGI-3
Благодаря специальной программной оболочке для эффективного управления памятью, дополненной компонентом, похожим на «супервизора», исследователи добились того, что Claude Opus 5 набрала 100% баллов в интерактивном тесте ARC-AGI-3. Без этой оболочки та же модель показала лишь 30% — и это, по данным Nvidia, стало лучшим результатом среди всех протестированных моделей. Таким образом, разрыв между «голой» моделью и моделью в агентной инфраструктуре оказался многократным.
«Агент — это не API модели»: позиция Nvidia
«В целом мир воспринимает агента почти как API модели», — сообщил ресурсу TechCrunch Адель Эль Халлак (Adel El Hallak), вице-президент по продуктам подразделения ИИ Nvidia. По его словам, агент сегодня — нечто большее: «Это модель. Это структура вокруг модели, которую мы называем вспомогательными средствами, то есть набор инструментов, которые вы используете. Это среда выполнения, а также связанные с ней навыки и библиотеки, к которым мы предоставляем вам доступ». Выбора модели, как подчёркивает Nvidia, недостаточно — именно система управления, обрабатывающая память, контекст и обратную связь, превращает модель в агента.
Супервизор как «генеральный директор» ИИ
Отдельный акцент в исследовании сделан на введении супервизорного агента в дополнение к основному агенту, выполняющему работу. По словам Эль Халлака, он «действует почти как генеральный директор, подталкивая агента, когда тот отклоняется от курса или начинает исследовать путь, который может привести в тупик, или повторно исследует путь, по которому он уже шёл». Именно такая двухуровневая структура, по мнению Nvidia, позволяет удерживать фокус на долгосрочной задаче без зацикливания и потери контекста.
Противоречивые данные
Здесь уместно сопоставить две точки зрения. С одной стороны, Nvidia демонстрирует, что именно сложная агентная оболочка с супервизором вывела Claude Opus 5 на 100% в ARC-AGI-3, а без неё результат упал до 30%, при этом модели OpenAI в том же тесте набрали менее 10%. С другой стороны, OpenAI в прошлом месяце провела собственное исследование и обнаружила, что простая замена двух параметров в тестовой среде утроила показатели моделей. Это ставит вопрос о том, насколько именно архитектура оболочки, а не тонкая настройка среды и параметров, является определяющим фактором: интерпретация Nvidia подчёркивает роль инфраструктуры агента, тогда как данные OpenAI указывают на высокую чувствительность результата к условиям тестовой среды. Обе стороны сходятся в том, что «голая» модель — лишь часть системы, но расходятся в оценке вклада оболочки versus параметров среды.
Что это значит для долгосрочных ИИ-задач
Результаты подтверждают: хотя выбор модели имеет значение, она является гораздо меньшей частью агентной системы, чем принято думать, особенно для долгосрочных задач. Выяснение того, как заставить ИИ выполнять задачи с длительным горизонтом планирования, не отвлекаясь и не зацикливаясь на одном месте, остаётся одной из главных целей исследований в области ИИ-агентов. Практический вывод для разработчиков — инвестиции в память, контекст, инструменты и супервизорную логику могут давать больший прирост, чем смена базовой модели.