В августе 2026 года индустрия искусственного интеллекта столкнулась с критическим поворотным моментом: эпоха обучения нейросетей на общедоступных данных из интернета подошла к концу. Ведущие разработчики больших языковых моделей (LLM), такие как OpenAI и Anthropic, вынуждены искать новые источники «топлива» для своих алгоритмов. На смену открытым веб-страницам приходят закрытые корпоративные архивы: переписка в мессенджерах, электронные письма, стенограммы видеоконференций и история изменений программного кода.
Бум рынка данных: от 30 до 100 миллионов долларов
Спрос на приватные данные растет с невероятной скоростью, формируя новый, высокодоходный сектор экономики. По словам Бобби Сэмюэлса, генерального директора брокерской компании Protege, которая специализируется на торговле данными, объем сделок в его компании за последний год вырос более чем в три раза. Если в прошлом году оборот составлял около $30 млн, то в текущем году он достиг отметки в $100 млн и продолжает расти.
Этот скачок напрямую связан с переходом от простых чат-ботов к сложным ИИ-агентам. Для того чтобы нейросети могли выполнять реальные повседневные задачи, им необходимо обучаться на примерах реального взаимодействия людей, а не на синтетических или устаревших текстах из интернета.
Что ищут алгоритмы: ценность «грязных» данных
Разработчики ИИ понимают, что общедоступный интернет уже «выжжен» — качественные данные для обучения там практически исчерпаны. Поэтому интерес смещается в сторону данных, содержащих информацию о том, как люди решают реальные проблемы. Покупателей интересуют записи, демонстрирующие обсуждение финансовых показателей, демонстрацию работы программного обеспечения и принятие сложных решений.
Особый интерес представляют данные стартапов, находящихся в стадии банкротства или поглощения. Такие компании часто готовы продать свои архивы, чтобы получить дополнительные средства или просто избавиться от активов, которые больше не имеют коммерческой ценности для них самих.
Кейс Warmly: отказ от продажи за $300 тысяч
Ярким примером нового рынка стал случай со стартапом Warmly, занимавшимся разработкой ИИ-агентов и недавно приобретенным корпорацией HubSpot. После подписания соглашения о поглощении к компании начали поступать предложения от брокеров данных. За архивы рабочего взаимодействия сотрудников, включая протоколы совещаний и электронные письма, предлагалось до $300 тыс.
Важно отметить, что все эти предложения были отклонены. Это свидетельствует о том, что, несмотря на высокую цену, компании начинают осознавать риски продажи своих внутренних коммуникаций и стараются сохранить контроль над своими данными даже после смены собственника.
Противоречивые данные
Вопросы этики и безопасности в этой сфере остаются крайне острыми. С одной стороны, брокеры данных, такие как Integral, заявляют о строгом соблюдении правил конфиденциальности. Гендиректор Integral Шуб Синха утверждает: «Мы придерживаемся строгого процесса анонимизации, чтобы сохранить ценность данных и соблюдать правила конфиденциальности».
С другой стороны, эксперты в области кибербезопасности выражают сомнения в возможности полной обезличивания таких данных. Переписка и история кода часто содержат уникальные паттерны поведения, которые могут быть деанонимизированы при перекрестном анализе с другими наборами данных. Это создает риск утечки коммерческой тайны и персональных данных сотрудников, которые могут быть восстановлены даже после обработки.
Будущее ИИ в эпоху дефицита контента
К августу 2026 года стало очевидно: качество будущих нейросетей будет зависеть от того, насколько успешно разработчики смогут договориться с корпорациями о доступе к их внутренним базам знаний. Если ранее ИИ учился на том, что люди писали для всех, то теперь он будет обучаться на том, что люди писали друг другу в закрытых каналах. Это открывает новые горизонты для развития технологий, но ставит перед обществом сложные вопросы о приватности и праве на цифровую память.