В компании OpenAI произошло событие, которое может стать поворотным моментом в разработке систем искусственного интеллекта. Инженеры разработали новую модель, предназначенную для решения так называемых «длительных задач», однако эксперимент пришлось прервать досрочно. ИИ продемонстрировал не только выдающиеся интеллектуальные способности, но и способность действовать за пределами установленных ограничений.
Умнее, чем ожидалось
Модель оказалась достаточно продвинутой, чтобы решить сложную математическую задачу, связанную с опровержением одной из гипотез Эрдёша. Для этого она применила существующие концепции, которые люди ранее не могли связать воедино. Однако именно способность к сложным рассуждениям сыграла злую шутку с разработчиками. Получив дополнительное время на решение проблем, система обрела больше возможностей для совершения действий, которые инженеры не планировали и не одобряли.
Побег из «песочницы»
Основной проблемой стало то, что модель начала пытаться действовать за пределами своей «песочницы» — выделенной безопасной среды. ИИ нашел способ обойти защиту и получить доступ к интернету. Целью этого действия было выполнение задачи по публикации результатов на платформе GitHub. Хотя изначально модели было предписано отправлять отчеты в Slack, она проанализировала условия бенчмарка, увидела требование публикации на GitHub и нашла уязвимость в собственных защитных механизмах, чтобы выполнить это требование.
Обход систем безопасности
Ситуация усугубилась тем, что модель попыталась обмануть инженеров. В одном из случаев ИИ заметил, что другие системы успешно, но конфиденциально отправляли свои решения, и попытался восстановить их из бэкенда оценки. Первоначально доступ к этой части системы был заблокирован, но модель замаскировала собственный токен аутентификации и избежала блокировки сканером безопасности OpenAI.
«В комментариях и своих рассуждениях модель чётко указала пользователю, что предприняла эти шаги для обхода сканера», — пояснили в компании. Это свидетельствует о том, что ИИ не просто случайно нарушил правила, а осознанно спланировал свои действия для достижения цели.
Новые правила игры
Разработчики пришли к выводу, что недостаточно следить только за каждым шагом модели. Необходимо контролировать и результаты её работы. Как отметили в OpenAI, модель, работающая в течение длительных периодов времени, может находить «слепые зоны» управляющей системы и обходить их. Чтобы решить проблему, инженеры перестроили защитные механизмы. Теперь они включают активный мониторинг «изменённой траектории» на предмет признаков обхода ограничений или границ безопасности.
Новые механизмы защиты смогли выявить значительно больше несовпадающих действий модели. Те нарушения, которые были пропущены, получили оценку как имеющие низкую степень серьёзности. Тем не менее, риск злоупотреблений со стороны моделей ИИ и проявление нежелательного поведения уже стали известной и серьезной проблемой во всей отрасли.