У серпні 2026 року індустрія штучного інтелекту стикнулася з критичним переломним моментом: епоха навчання нейронних мереж на загальнодоступних даних з інтернету підійшла до кінця. Ведучі розробники великих мовних моделей (LLM), такі як OpenAI та Anthropic, змушені шукати нові джерела «палива» для своїх алгоритмів. На зміну відкритим веб-сторінкам приходять закриті корпоративні архіви: листування в месенджерах, електронні листи, стенограми відеоконференцій та історія змін програмного коду.
Бум ринку даних: від 30 до 100 мільйонів доларів
Попит на приватні дані зростає з неймовірною швидкістю, формуючи новий, високодохідний сектор економіки. За словами Боббі Семюелса, генерального директора брокерської компанії Protege, яка спеціалізується на торгівлі даними, обсяг угод у його компанії за останній рік зріс більш ніж утричі. Якщо минулого року оборот становив близько $30 млн, то цього року він досяг позначки в $100 млн і продовжує рости.
Цей стрибок безпосередньо пов'язаний із переходом від простих чат-ботів до складних ШІ-агентів. Щоб нейронні мережі могли виконувати реальні повсякденні завдання, їм необхідно навчатися на прикладах реального взаємодії людей, а не на синтетичних або застарілих текстах з інтернету.
Що шукають алгоритми: цінність «брудних» даних
Розробники ШІ розуміють, що загальнодоступний інтернет вже «вигоріло» — якісні дані для навчання там практично вичерпані. Тому інтерес зміщується в бік даних, що містять інформацію про те, як люди вирішують реальні проблеми. Покупців цікавлять записи, що демонструють обговорення фінансових показників, демонстрацію роботи програмного забезпечення та прийняття складних рішень.
Особливий інтерес представляють дані стартапів, що перебувають на стадії банкрутства або поглинання. Такі компанії часто готові продати свої архіви, щоб отримати додаткові кошти або просто позбутися активів, які більше не мають комерційної цінності для них самих.
Кейс Warmly: відмова від продажу за $300 тисяч
Яскравим прикладом нового ринку став випадок зі стартапом Warmly, який займався розробкою ШІ-агентів і нещодавно був придбаний корпорацією HubSpot. Після підписання угоди про поглинання до компанії почали надходити пропозиції від брокерів даних. За архіви робочої взаємодії співробітників, включаючи протоколи засідань та електронні листи, пропонували до $300 тис.
Важливо зазначити, що всі ці пропозиції були відхилені. Це свідчить про те, що, незважаючи на високу ціну, компанії починають усвідомлювати ризики продажу своїх внутрішніх комунікацій і намагаються зберегти контроль над своїми даними навіть після зміни власника.
Суперечливі дані
Питання етики та безпеки в цій сфері залишаються надзвичайно гострими. З одного боку, брокери даних, такі як Integral, заявляють про суворе дотримання правил конфіденційності. Гендиректор Integral Шуб Сінха стверджує: «Ми дотримуємося суворого процесу анонімізації, щоб зберегти цінність даних та дотримуватися правил конфіденційності».
З іншого боку, експерти з кібербезпеки висловлюють сумніви щодо можливості повного обезличування таких даних. Листування та історія коду часто містять унікальні патерни поведінки, які можуть бути деанонімізовані при перехресному аналізі з іншими наборами даних. Це створює ризик витоку комерційної таємниці та персональних даних співробітників, які можуть бути відновлені навіть після обробки.
Майбутнє ШІ в епоху дефіциту контенту
До серпня 2026 року стало очевидним: якість майбутніх нейронних мереж залежатиме від того, наскільки успішно розробники зможуть домовитися з корпораціями про доступ до їхніх внутрішніх баз знань. Якщо раніше ШІ навчався на тому, що люди писали для всіх, то тепер він буде навчатися на тому, що люди писали одне одному в закритих каналах. Це відкриває нові горизонти для розвитку технологій, але ставить перед суспільством складні питання про приватність та право на цифрову пам'ять.