Американский исследовательский центр Pew Research опубликовал масштабное исследование, посвящённое тому, насколько искусственный интеллект уже проник в англоязычный сегмент интернета. Ключевой вывод работы: более трети — по оценке аналитиков, 35% — веб-страниц, опубликованных после релиза ChatGPT в ноябре 2022 года, содержат значительные признаки того, что текст был написан или существенно отредактирован с помощью ИИ. Для контекста: в случайной выборке из 10 тысяч страниц, сохранённых в июле 2026 года, «значительные признаки авторства ИИ» показали около 10% ресурсов (на графике исследования эта точка отмечена как 9,6%). Разница между двумя цифрами объясняется тем, что в общей выборке неизбежно присутствуют старые страницы, созданные до появления генеративных текстовых моделей, тогда как в отфильтрованной выборке «после ChatGPT» доля ИИ-контента резко возрастает.
Методология: как Pew Research считала ИИ-тексты
Для проведения анализа исследователи использовали веб-архив Common Crawl, из которого извлекли почти полмиллиона опубликованных за последние пять лет веб-страниц — начиная с периода за пару лет до выхода ChatGPT. Определение доли ИИ-авторства выполнялось с помощью технологии Open Pangram, которая по стилистическим и статистическим маркерам оценивает вероятность того, что текст сгенерирован или существенно переработан нейросетью. Важно, что исследование отвечает на вопрос о том, какой материал представлен на страницах, а не о том, кто или что эти страницы просматривает — это принципиальное отличие от данных о бот-трафике.
35% нового контента: что говорят цифры
После того как из выборки были исключены страницы, созданные до появления средств генерации текстов, доля ресурсов с признаками ИИ-авторства в обновлённой выборке составила более трети — 35%. Это означает, что фактически каждый третий новый англоязычный веб-документ, появившийся после ноября 2022 года, с высокой вероятностью так или иначе связан с работой языковой модели. Динамика на графике Pew Research наглядно показывает экспоненциальный рост: кривая остаётся практически плоской до релиза ChatGPT, а затем начинает устойчиво подниматься, ускорившись в 2025–2026 годах и достигнув отметки 9,6% в общей выборке к июлю 2026 года.
Разрыв между коммерческими и институциональными сайтами
Исследование выявило выраженную неравномерность распределения ИИ-контента по доменным зонам. Сайты в зоне .com демонстрируют признаки авторства ИИ примерно в десять раз чаще, чем ресурсы в зонах .edu или .gov — у последних этот показатель составляет около 1%. На доменах в зоне .org ИИ «отметился» в 4,6% случаев. Таким образом, коммерческий и новостной сегмент интернета оказался затронут автоматизацией текстов значительно сильнее, чем академический и государственный, где процессы создания контента остаются преимущественно человеческими.
Боты читают ботов: контекст трафика
Результаты Pew Research логично дополняют недавнее заявление компании Cloudflare о том, что веб-трафик от ботов превысил объёмы трафика, генерируемого людьми, — и произошло это раньше, чем ожидали в самой компании. Сочетание двух фактов даёт тревожную картину: боты не только читают интернет, но всё чаще читают материалы, написанные другими ботами. Это создаёт замкнутый цикл, в котором машинный контент потребляется машинами, что может искажать и поисковую выдачу, и обучающие данные будущих моделей.
Противоречивые данные
Ряд цифр в исследовании требует осторожной интерпретации, и здесь есть несколько нестыковок, которые стоит честно обозначить. Во-первых, показатель 9,6% (общая случайная выборка из 10 тысяч страниц июля 2026 года) и показатель 35% (только страницы после ChatGPT) описывают разные срезы данных, и их нельзя сравнивать напрямую — первое число включает «исторический» контент, второе — только новый. Во-вторых, сам инструмент Open Pangram, как и другие аналогичные детекторы, способен выдавать ложноположительные результаты, указывая на признаки ИИ-авторства даже там, где текст добросовестно написан человеком. В крупной выборке статистика в целом считается верной, но точечные оценки для отдельных сайтов могут быть завышены. Наконец, данные Pew Research о авторстве контента не тождественны данным Cloudflare о трафике ботов: это смежные, но разные измерения, и смешение этих двух потоков в публичной дискуссии может приводить к неверным выводам о «доле ИИ в интернете».
В совокупности исследование Pew Research фиксирует переломный момент: спустя четыре года после запуска ChatGPT искусственный интеллект перестал быть нишевым инструментом и стал системным участником формирования англоязычного веба. Для редакций, SEO-специалистов и регуляторов это означает, что вопросы прозрачности авторства, маркировки ИИ-контента и качества машинных текстов выходят на первый план повестки.