---
title: "В интернете кончились тексты: разработчики ИИ начали скупать корпоративные чаты и письма"
description: "💸 В интернете кончились тексты для обучения ИИ. Разработчики начали скупать корпоративные чаты и письма. Рынок данных взлетел с $30 млн до $100 млн. Стартапы продают архивы за сотни тысяч долларов, но вопрос анонимизации остается спорным. 🤖📉"
date: 2026-08-15T20:55:57.000Z
lang: ru
url: https://xab.info/posts/razrabotchiki-ii-nachali-skupat-korporativnye-chaty-i-pisma
tags: [artificial-intelligence, big-data, corporate-data, privacy, openai, anthropic]
publisher: "XAB.info"
---

# В интернете кончились тексты: разработчики ИИ начали скупать корпоративные чаты и письма

![Голограмма искусственного мозга над ноутбуком: ИИ скупает корпоративные тексты из-за нехватки данных в интернете](https://xab.info/media/2026/08/16/razrabotchiki-ii-nachali-skupat-korporativnye-chaty-i-pisma/razrabotchiki-ii-nachali-skupat-korporativnye-chaty-i-pisma-1.webp)

## 🎯 Key Points

- Разработчики ИИ исчерпали общедоступные данные в интернете и перешли к покупке корпоративных архивов.
- Объем рынка торговли данными вырос с $30 млн до $100 млн за год.
- Особый интерес представляют данные стартапов, подвергающихся банкротству или поглощению.
- Возникают серьезные вопросы о возможности качественной анонимизации продаваемых данных.

В августе 2026 года индустрия искусственного интеллекта столкнулась с критическим поворотным моментом: эпоха обучения нейросетей на общедоступных данных из интернета подошла к концу. Ведущие разработчики больших языковых моделей (LLM), такие как OpenAI и Anthropic, вынуждены искать новые источники «топлива» для своих алгоритмов. На смену открытым веб-страницам приходят закрытые корпоративные архивы: переписка в мессенджерах, электронные письма, стенограммы видеоконференций и история изменений программного кода.

### Бум рынка данных: от 30 до 100 миллионов долларов

Спрос на приватные данные растет с невероятной скоростью, формируя новый, высокодоходный сектор экономики. По словам Бобби Сэмюэлса, генерального директора брокерской компании Protege, которая специализируется на торговле данными, объем сделок в его компании за последний год вырос более чем в три раза. Если в прошлом году оборот составлял около $30 млн, то в текущем году он достиг отметки в $100 млн и продолжает расти.

Этот скачок напрямую связан с переходом от простых чат-ботов к сложным ИИ-агентам. Для того чтобы нейросети могли выполнять реальные повседневные задачи, им необходимо обучаться на примерах реального взаимодействия людей, а не на синтетических или устаревших текстах из интернета.

### Что ищут алгоритмы: ценность «грязных» данных

Разработчики ИИ понимают, что общедоступный интернет уже «выжжен» — качественные данные для обучения там практически исчерпаны. Поэтому интерес смещается в сторону данных, содержащих информацию о том, как люди решают реальные проблемы. Покупателей интересуют записи, демонстрирующие обсуждение финансовых показателей, демонстрацию работы программного обеспечения и принятие сложных решений.

Особый интерес представляют данные стартапов, находящихся в стадии банкротства или поглощения. Такие компании часто готовы продать свои архивы, чтобы получить дополнительные средства или просто избавиться от активов, которые больше не имеют коммерческой ценности для них самих.

### Кейс Warmly: отказ от продажи за $300 тысяч

Ярким примером нового рынка стал случай со стартапом Warmly, занимавшимся разработкой ИИ-агентов и недавно приобретенным корпорацией HubSpot. После подписания соглашения о поглощении к компании начали поступать предложения от брокеров данных. За архивы рабочего взаимодействия сотрудников, включая протоколы совещаний и электронные письма, предлагалось до $300 тыс.

Важно отметить, что все эти предложения были отклонены. Это свидетельствует о том, что, несмотря на высокую цену, компании начинают осознавать риски продажи своих внутренних коммуникаций и стараются сохранить контроль над своими данными даже после смены собственника.

### Противоречивые данные

Вопросы этики и безопасности в этой сфере остаются крайне острыми. С одной стороны, брокеры данных, такие как Integral, заявляют о строгом соблюдении правил конфиденциальности. Гендиректор Integral Шуб Синха утверждает: «Мы придерживаемся строгого процесса анонимизации, чтобы сохранить ценность данных и соблюдать правила конфиденциальности».

С другой стороны, эксперты в области кибербезопасности выражают сомнения в возможности полной обезличивания таких данных. Переписка и история кода часто содержат уникальные паттерны поведения, которые могут быть деанонимизированы при перекрестном анализе с другими наборами данных. Это создает риск утечки коммерческой тайны и персональных данных сотрудников, которые могут быть восстановлены даже после обработки.

### Будущее ИИ в эпоху дефицита контента

К августу 2026 года стало очевидно: качество будущих нейросетей будет зависеть от того, насколько успешно разработчики смогут договориться с корпорациями о доступе к их внутренним базам знаний. Если ранее ИИ учился на том, что люди писали для всех, то теперь он будет обучаться на том, что люди писали друг другу в закрытых каналах. Это открывает новые горизонты для развития технологий, но ставит перед обществом сложные вопросы о приватности и праве на цифровую память.

## ❓ FAQ

### Q: Почему разработчики ИИ начали покупать корпоративные данные?
**A:** Общедоступные данные в интернете для обучения нейросетей практически исчерпаны, и для создания продвинутых ИИ-агентов требуются примеры реального взаимодействия людей.

### Q: Сколько стоят корпоративные данные на рынке?
**A:** Рынок растет стремительно: оборот брокера Protege вырос с $30 млн до $100 млн. Отдельные предложения за данные стартапов достигают $300 тыс.

### Q: Безопасно ли продавать такие данные?
**A:** Компании-продавцы обещают строгую анонимизацию, однако эксперты сомневаются в возможности полной защиты от деанонимизации при перекрестном анализе данных.