Американський дослідницький центр Pew Research опублікував масштабне дослідження, присвячене тому, наскільки штучний інтелект уже проник у англомовний сегмент інтернету. Ключовий висновок роботи: більше третини — за оцінками аналітиків, 35% — веб-сторінок, опублікованих після релізу ChatGPT у листопаді 2022 року, містять значні ознаки того, що текст був написаний або суттєво відредагований за допомогою ШІ. Для контексту: у випадковій вибірці з 10 тисяч сторінок, збережених у липні 2026 року, «значні ознаки авторства ШІ» виявили приблизно 10% ресурсів (на графіку дослідження ця точка позначена як 9,6%). Різниця між двома цифрами пояснюється тим, що в загальній вибірці неминуче присутні старі сторінки, створені до появи генеративних текстових моделей, тоді як у відфільтрованій вибірці «після ChatGPT» частка ШІ-контенту різко зростає.

Методологія: як Pew Research рахувала ШІ-тексти

Для проведення аналізу дослідники використали веб-архів Common Crawl, з якого вийняли майже півмільйона опублікованих за останні п'ять років веб-сторінок — починаючи з періоду за пару років до виходу ChatGPT. Визначення частки ШІ-авторства виконувалося за допомогою технології Open Pangram, яка за стилістичними та статистичними маркерами оцінює ймовірність того, що текст згенерований або суттєво перероблений нейронною мережею. Важливо, що дослідження відповідає на питання про те, який матеріал представлений на сторінках, а не про те, хто або що ці сторінки переглядає — це принципова відмінність від даних про бот-трафік.

35% нового контенту: що кажуть цифри

Після того, як із вибірки були виключені сторінки, створені до появи засобів генерації текстів, частка ресурсів із ознаками ШІ-авторства в оновленій вибірці становила більше третини — 35%. Це означає, що фактично кожна третя нова англомовна веб-сторінка, що з'явилася після листопада 2022 року, з високою ймовірністю так чи інакше пов'язана з роботою мовної моделі. Динаміка на графіку Pew Research наочно показує експоненційний зростання: крива залишається практично плоскою до релізу ChatGPT, а потім починає стабільно підніматися, прискорившись у 2025–2026 роках і досягнувши позначки 9,6% у загальній вибірці до липня 2026 року.

Розрив між комерційними та інституційними сайтами

Дослідження виявило виражену нерівномірність розподілу ШІ-контенту за доменними зонами. Сайти в зоні .com демонструють ознаки авторства ШІ приблизно в десять разів частіше, ніж ресурси в зонах .edu або .gov — у останніх цей показник становить близько 1%. На доменах у зоні .org ШІ «відзначився» у 4,6% випадків. Таким чином, комерційний та новинний сегмент інтернету опинився під впливом автоматизації текстів значно сильніше, ніж академічний та державний, де процеси створення контенту залишаються переважно людськими.

Боти читають ботів: контекст трафіку

Результати Pew Research логічно доповнюють недавнє заяву компанії Cloudflare про те, що веб-трафік від ботів перевищив обсяги трафіку, генерованого людьми, — і це сталося раніше, ніж очікували в самій компанії. Поєднання двох фактів дає тривожну картину: боти не лише читають інтернет, а все частіше читають матеріали, написані іншими ботами. Це створює замкнене коло, в якому машинний контент споживається машинами, що може спотворювати і пошукову видачу, і навчальні дані майбутніх моделей.

Суперечливі дані

Ряд цифр у дослідженні потребує обережної інтерпретації, і тут є кілька невідповідностей, які варто чесно зазначити. По-перше, показник 9,6% (загальна випадкова вибірка з 10 тисяч сторінок липня 2026 року) і показник 35% (лише сторінки після ChatGPT) описують різні зрізи даних, і їх не можна порівнювати напряму — перше число включає «історичний» контент, друге — лише новий. По-друге, сам інструмент Open Pangram, як і інші подібні детектори, здатний видавати хибнопозитивні результати, вказуючи на ознаки ШІ-авторства навіть там, де текст щиро написаний людиною. У великій вибірці статистика загалом вважається вірною, але точкові оцінки для окремих сайтів можуть бути завищені. Нарешті, дані Pew Research про авторство контенту не тотожні даним Cloudflare про трафік ботів: це суміжні, але різні виміри, і змішування цих двох потоків у публічній дискусії може призводити до хибних висновків про «частку ШІ в інтернеті».

У сукупності дослідження Pew Research фіксує переломний момент: минули чотири роки після запуску ChatGPT, і штучний інтелект перестав бути нішевим інструментом і став системним учасником формування англомовного вебу. Для редакцій, SEO-спеціалістів та регуляторів це означає, що питання прозорості авторства, маркування ШІ-контенту та якості машинних текстів виходять на перший план порядку денного.