Китайский разработчик систем искусственного интеллекта DeepSeek представил экспериментальную мультимодальную версию своей модели V4-Flash. Новинка получила название V4-Flash-Vision-Exp и принципиально отличается от базового варианта тем, что в качестве входных запросов принимает не только текст, но и изображения. Таким образом компания расширяет функциональность флагманской линейки V4 в сторону работы с визуальными данными.

Что представила DeepSeek

По заявлению разработчика, экспериментальная модель V4-Flash-Vision-Exp умеет анализировать изображения, скриншоты и прочие визуальные запросы наряду с текстовыми. При этом компания подчёркивает, что новая версия не является «обрезанной» или специализированной: она сохраняет весь набор существующих возможностей базовой модели, включая функции работы с текстом, навыки логических рассуждений, применение знаний об окружающем мире и управление автономными ИИ-агентами. По сути, мультимодальность добавлена как дополнительный слой поверх уже работающего текстового ядра.

Возможности и позиционирование модели

В DeepSeek акцентируют внимание на прогрессе именно в сценариях с мультимодальными агентами. «В тестах для мультимодальных агентов V4-Flash-Vision-Exp демонстрирует значительный прогресс по сравнению с [базовой] V4-Flash, поднимая производительность мультимодальных агентов на уровень, близкий к Opus-4.8», — заявили в компании. Это позиционирование важно: разработчик прямо сравнивает свою экспериментальную модель с одним из топовых решений конкурентов, утверждая, что разрыв в мультимодальных агентных задачах сократился до минимума.

Инструментарий и доступ через API

Вместе с моделью вышел инструмент DeepSeek Harness 0.1.1, который, по словам разработчика, поддерживает новую модель «из коробки» — то есть без необходимости дополнительной ручной настройки. Обновлённая модель уже доступна через API DeepSeek, что позволяет разработчикам и командам интегрировать мультимодальные возможности в собственные продукты и агентов прямо сейчас, а не ждать общего релиза.

Тарификация и работа с изображениями

Отдельного внимания заслуживает схема расчёта стоимости. При тарификации изображения преобразуются в токены — до 384 токенов на каждое изображение — и учитываются по расценкам базовой модели DeepSeek V4-Flash. Это означает, что визуальные запросы не вынесены в отдельный, более дорогой прайс, а вписаны в привычную токенизированную экономику существующей модели, что упрощает прогнозирование затрат для пользователей API.

Противоречивые данные

При проверке формулировок по нескольким источникам выявлено расхождение в силе заявления о сравнении с Opus 4.8. В собственном тексте компании используется осторожная формулировка «на уровень, близкий к Opus-4.8», тогда как заголовки ряда изданий передают это как «не уступает Claude Opus 4.8» или «способна составить конкуренцию Opus 4.8 от Anthropic». Фактически это разные маркетинговые рамки одного и того же бенчмарка: «близкий к» и «не уступает» — не тождественные утверждения, а независимая сторонняя верификация этих цифр в открытых источниках на момент публикации ограничена. Кроме того, важно не смешивать данную экспериментальную модель с ранее анонсированной полной мультимодальной DeepSeek-V4 с контекстным окном в 1 млн токенов, выход которой планировался на апрель: это отдельный элемент дорожной карты линейки V4, а не тождественный V4-Flash-Vision-Exp продукт.

Контекст: куда движется линейка DeepSeek

Выпуск V4-Flash-Vision-Exp вписывается в более широкую стратегию DeepSeek по наращиванию мультимодальных и агентных возможностей семейства V4. Если ранее компания обозначала планы по полноценной мультимодальной модели V4 с расширенным контекстным окном, то текущий экспериментальный релиз выглядит как промежуточный шаг: проверка мультимодального слоя на базе быстрой версии Flash, доступной через API и с прозрачной токенизированной тарификацией. Для рынка это сигнал, что конкуренция в сегменте мультимодальных агентов, где ранее доминировали западные модели, продолжает усиливаться.