В условиях стремительного развития искусственного интеллекта в 2026 году ключевым фактором успеха становится не только мощность вычислительных кластеров, но и качество исходных данных. Бренд-директор по машинному обучению в «Яндексе» Пётр Ермаков в интервью РБК раскрыл детали того, как компания готовит свои модели к работе с реальным миром. Оказалось, что процесс обучения современных нейросетей во многом напоминает школьную систему образования, где роль учителей играют живые эксперты.
Этап сбора и оцифровки: работа с нецифровыми носителями
Первым и фундаментальным этапом обучения является тщательный отбор и подготовка данных. Пётр Ермаков подчеркнул, что «Яндекс» не просто собирает информацию из открытых источников, а специально готовит датасеты, используемые для обучения. Существенной проблемой остается доступность информации: значительный объем знаний все еще находится на нецифровых носителях. Для решения этой задачи компания активно сотрудничает с университетами и библиотеками, чтобы оцифровать архивные материалы и сделать их доступными для алгоритмов. Без этого этапа невозможно обеспечить глубину и точность ответов модели.
Роль тренеров: почему нужны люди с учеными степенями
Второй этап обучения — это работа с «тренерами». В отличие от ранних моделей, которые обучались исключительно на больших массивах текста без контекста, современные системы требуют участия квалифицированных специалистов. В команду тренеров входят учителя, доценты и доктора наук. Именно они помогают модели структурировать знания и понимать сложные причинно-следственные связи. Этот подход позволяет избежать галлюцинаций и обеспечивает логическую целостность ответов.
Специфика обучения юридических моделей
Особое внимание в «Яндексе» уделяется созданию узкоспециализированных моделей, например, в юридической сфере. Чтобы ИИ мог давать корректные правовые консультации, к процессу подключаются опытные практикующие юристы. Их задача — генерировать сложные вопросы и корректировать ответы модели, чтобы она училась отвечать максимально по делу, соблюдая законодательные нормы. Эффективность таких средств контроля напрямую зависит от размера модели и «пропускной способности» команды людей, проверяющих её работу.
Противоречивые данные
В ходе анализа процесса обучения выявляется интересный аспект: существует баланс между автоматизацией и человеческим контролем. С одной стороны, тренеры подчеркивают, что без участия экспертов (юристов, ученых) невозможно достичь высокой точности в узких доменах. С другой стороны, эффективность контроля ограничена человеческим фактором — «пропускной способностью» людей, проверяющих ответы. Это создает вызов для масштабирования: чем больше модель и шире её функционал, тем сложнее обеспечить тотальный человеческий контроль над каждым ответом, что может приводить к вариативности в качестве выдаваемой информации.