Мы привыкли считать искусственный интеллект зеркалом человеческих пороков: он учится на наших данных и, следовательно, наследует наши предрассудки. Однако новое исследование, проведенное учеными из Принстонского университета и Университета Чикаго, переворачивает эту парадигму с ног на голову. Языковые модели способны не просто копировать, а спонтанно генерировать совершенно новые социальные стереотипы — даже в условиях, где никакой предвзятости изначально не существовало.
Эксперимент с выдуманными народами
Чтобы проверить гипотезу о самогенерации предубеждений, исследователи воспроизвели классический эксперимент по найму персонала. В нем участникам предлагалось распределять кандидатов на вакансии и получать обратную связь об успехе или провале каждого решения. Ключевое условие: все кандидаты принадлежали к одной из четырех вымышленных этнических групп — Туфа, Айма, Реку или Веки. Между этими группами не было никаких реальных различий, и шансы на успех в любой роли были равны.
Когда эксперимент проходили люди, негативная обратная связь действительно формировала предубеждения. Например, если представитель группы Туфа проваливался на должности врача, участники начинали избегать найма этой группы в будущем. Но у людей эти установки были гибкими и со временем ослабевали.
Нейросети становятся радикальнее людей
Когда ту же задачу выполняли языковые модели, картина изменилась драматически. Уровень предвзятости у ИИ оказался значительно выше, чем у людей. Ученые протестировали 15 моделей от ведущих технологических гигантов: OpenAI, Anthropic, DeepSeek, Meta, Google и Alibaba. Наиболее выраженную стратификацию выдуманных кандидатов продемонстрировала модель o3 от OpenAI.
Внутри каждого семейства моделей была выявлена четкая закономерность: чем новее и мощнее модель, тем сильнее проявлялась предвзятость. Это ставит под сомнение идею о том, что развитие технологий автоматически ведет к большей справедливости.
Парадокс эффективности
В основе проблемы лежит принцип, который специалисты называют балансом между исследованием и использованием. Принимая решение, агент выбирает между освоением нового, неизвестного варианта с риском ошибки и опорой на то, что уже дало хороший результат раньше.
Люди, даже когда ставки высоки, сохраняют склонность к исследованию и готовы рискнуть. Языковые же модели, по наблюдению исследователей, гораздо сильнее ориентированы на максимизацию вознаграждения. Более мощная модель делает более точные выводы из прошлых результатов: вместо случайного выбора она жестко предпочитает кандидатов из группы, с которой ранее был связан успех. Это кажущееся рациональным поведение оборачивается дисфункцией: модель перестает исследовать альтернативы и тем самым маргинализирует целые группы.
Реальные последствия для бизнеса
Авторы исследования особо отметили, что ИИ в данном случае не просто воспроизводит стереотипы из обучающих данных. Он генерирует их сам по себе. Это принципиально меняет характер угрозы. Практические последствия открытия сложно переоценить: более 90% компаний уже используют ИИ в процессе подбора персонала.
Ситуация уже выходит за рамки теории. Крупный поставщик ПО Workday сталкивается с коллективным иском, где его ИИ-инструменты обвиняются в дискриминации. В схожей ситуации оказалась Meta: группа сотрудников подала иск, утверждая, что система ИИ, использованная при волне увольнений, систематически ущемляла работников с инвалидностью и тех, кто брал отпуск по семейным обстоятельствам.
Способность языковых моделей быстро находить паттерны и обобщать опыт — то самое качество, которое делает их полезными в новых задачах, — одновременно делает их опасными в сценариях с реальными людьми. Задача разработчиков теперь состоит в том, чтобы найти способ избирательно подавить вредное сопоставление паттернов, не лишив при этом модели их мощи.