Модель GPT-6 Astra продемонстрировала способность самостоятельно обходить защитные механизмы, которые десятилетиями служили главным барьером между человеком и ботом. В ходе независимого тестирования искусственный интеллект успешно преодолел все 48 уровней игры «I Am Not a Robot», разработанной Нилом Агарвалом, и в итоге получил системный сертификат подтверждения человеческой идентичности Verified Human. По словам разработчика Шарифа Шамида, проводившего испытания, модель не просто распознавала изображения, а полноценно управляла компьютером, адаптируясь к меняющимся правилам на каждом этапе. Для индустрии кибербезопасности это означает, что классические методы защиты веб-ресурсов в виде капчи фактически перестали работать.

Как проходил тест: не распознавание, а управление

Ключевое отличие эксперимента от типовых бенчмарков по распознаванию картинок — способ взаимодействия модели со средой. GPT-6 Astra использовала функцию Computer Use: она кликала по элементам интерфейса, перетаскивала объекты и корректировала свои действия в ответ на новые условия, которые игра предъявляла на каждом из 48 уровней. Именно эта способность к прямому управлению браузером и приложением, а не «чтение» пикселей, позволила модели довести процесс до получения сертификата Verified Human. По оценке разработчиков, высокая эффективность обусловлена именно существенным прогрессом в области автономного управления компьютером.

Бенчмарки: OSWorld 2.0, ARC-AGI 3 и контекстное окно

Ряд количественных показателей подтверждает, что результат с капчей — не единичный сценарий, а следствие общего роста способностей модели. В специализированном тесте OSWorld 2.0, оценивающем работу с операционной системой и приложениями, Astra набрала 72,6 процента, тогда как её предшественник GPT-5.6 Sol показал 65,7 процента. Среднее время выполнения заданий сократилось на 47 процентов — до 40 минут. Контекстное окно модели достигло 1,05 миллиона токенов, что позволяет удерживать начальные инструкции на протяжении длительного сессии. В тесте ARC-AGI 3, где модель должна определять правила игры без инструкций, Astra достигла 99,9 процента и прошла 96 процентов уровней, затратив меньше шагов, чем человек. Кроме того, модель способна самостоятельно работать в 3D-редакторе Blender, создавать графику в Canva и рисовать портреты в Apple Notes по образцу.

Кибербезопасность: zero-day и ExploitBench

Самый тревожный для специалистов по безопасности аспект — offensive-потенциал модели. GPT-6 Astra самостоятельно обнаружила две ранее неизвестные уязвимости класса «нулевой день» (zero-day) и показала 100-процентный результат в бенчмарке ExploitBench, оценивающем способность строить эксплойты. Совокупность этих фактов привела к отнесению модели к критической категории риска в сфере кибербезопасности. Разработчики прямо указывают, что способность обходить CAPTCHA делает устаревшими классические методы защиты веб-ресурсов и требует пересмотра всей архитектуры бот-фильтрации.

Противоречивые данные

Факт прохождения 48 уровней CAPTCHA и получения сертификата Verified Human подтверждён несколькими независимыми изданиями и не вызывает разногласий. Однако заявления разработчиков о «приближении всеобщего искусственного интеллекта (AGI)» являются оценочным сужением, а не независимо верифицированным научным результатом: ни в тесте с капчей, ни в бенчмарках OSWorld 2.0 и ARC-AGI 3 достижение AGI не фиксируется. Таким образом, подтверждённым является конкретный технический результат (обход капчи, показатели бенчмарков, обнаружение zero-day), тогда как вывод о близости AGI остаётся позицией разработчиков и не подкреплён единым общепринятым критерием.

Что это значит для пользователей и бизнеса

Практический вывод для владельцев сайтов и сервисов однозначен: опора на капчу как единственный механизм отличия человека от бота больше не обеспечивает достаточной защиты. Модель, способная управлять браузером, перетаскивать объекты и адаптироваться к новым правилам, превращает многоуровневые капчи в решаемую задачу. Экспертам и разработчикам защиты следует рассматривать этот результат как сигнал к переходу к многофакторным, поведенческим и контекстным методам верификации, а не к усложнению графических головоломок, которые современная модель ИИ уже преодолевает в автоматическом режиме.