---
title: "DeepSeek представила экспериментальную мультимодальную модель V4-Flash-Vision-Exp"
description: "DeepSeek представила экспериментальную мультимодальную модель V4-Flash-Vision-Exp, способную анализировать изображения наряду с текстом. Компания заявляет, что её уровень близок к Claude Opus 4.8."
date: 2026-08-23T17:28:00.000Z
lang: ru
url: https://xab.info/posts/deepseek-v4-flash-vision-exp-multimodal
tags: [deepseek, ai-models, multimodal-ai, artificial-intelligence, china-tech]
publisher: "XAB.info"
---

# DeepSeek представила экспериментальную мультимодальную модель V4-Flash-Vision-Exp

![Мобильное приложение DeepSeek с приветственным экраном и интерфейсом нового чата](https://xab.info/media/2026/08/24/deepseek-v4-flash-vision-exp-multimodal/deepseek-v4-flash-vision-exp-multimodal-1.webp)

## 🎯 Key Points

- DeepSeek выпустила экспериментальную мультимодальную модель V4-Flash-Vision-Exp, принимающую изображения и текст.
- Модель сохраняет текстовые, рассуждающие и агентные возможности базовой V4-Flash.
- Компания заявляет, что в мультимодальных агентных тестах уровень близок к Opus-4.8.
- Вышел инструмент DeepSeek Harness 0.1.1; модель доступна через API, изображения тарифицируются как токены (до 384 на изображение) по ставкам V4-Flash.

Китайский разработчик систем искусственного интеллекта DeepSeek представил экспериментальную мультимодальную версию своей модели V4-Flash. Новинка получила название V4-Flash-Vision-Exp и принципиально отличается от базового варианта тем, что в качестве входных запросов принимает не только текст, но и изображения. Таким образом компания расширяет функциональность флагманской линейки V4 в сторону работы с визуальными данными.

### Что представила DeepSeek

По заявлению разработчика, экспериментальная модель V4-Flash-Vision-Exp умеет анализировать изображения, скриншоты и прочие визуальные запросы наряду с текстовыми. При этом компания подчёркивает, что новая версия не является «обрезанной» или специализированной: она сохраняет весь набор существующих возможностей базовой модели, включая функции работы с текстом, навыки логических рассуждений, применение знаний об окружающем мире и управление автономными ИИ-агентами. По сути, мультимодальность добавлена как дополнительный слой поверх уже работающего текстового ядра.

### Возможности и позиционирование модели

В DeepSeek акцентируют внимание на прогрессе именно в сценариях с мультимодальными агентами. «В тестах для мультимодальных агентов V4-Flash-Vision-Exp демонстрирует значительный прогресс по сравнению с [базовой] V4-Flash, поднимая производительность мультимодальных агентов на уровень, близкий к Opus-4.8», — заявили в компании. Это позиционирование важно: разработчик прямо сравнивает свою экспериментальную модель с одним из топовых решений конкурентов, утверждая, что разрыв в мультимодальных агентных задачах сократился до минимума.

### Инструментарий и доступ через API

Вместе с моделью вышел инструмент DeepSeek Harness 0.1.1, который, по словам разработчика, поддерживает новую модель «из коробки» — то есть без необходимости дополнительной ручной настройки. Обновлённая модель уже доступна через API DeepSeek, что позволяет разработчикам и командам интегрировать мультимодальные возможности в собственные продукты и агентов прямо сейчас, а не ждать общего релиза.

### Тарификация и работа с изображениями

Отдельного внимания заслуживает схема расчёта стоимости. При тарификации изображения преобразуются в токены — до 384 токенов на каждое изображение — и учитываются по расценкам базовой модели DeepSeek V4-Flash. Это означает, что визуальные запросы не вынесены в отдельный, более дорогой прайс, а вписаны в привычную токенизированную экономику существующей модели, что упрощает прогнозирование затрат для пользователей API.

### Противоречивые данные

При проверке формулировок по нескольким источникам выявлено расхождение в силе заявления о сравнении с Opus 4.8. В собственном тексте компании используется осторожная формулировка «на уровень, близкий к Opus-4.8», тогда как заголовки ряда изданий передают это как «не уступает Claude Opus 4.8» или «способна составить конкуренцию Opus 4.8 от Anthropic». Фактически это разные маркетинговые рамки одного и того же бенчмарка: «близкий к» и «не уступает» — не тождественные утверждения, а независимая сторонняя верификация этих цифр в открытых источниках на момент публикации ограничена. Кроме того, важно не смешивать данную экспериментальную модель с ранее анонсированной полной мультимодальной DeepSeek-V4 с контекстным окном в 1 млн токенов, выход которой планировался на апрель: это отдельный элемент дорожной карты линейки V4, а не тождественный V4-Flash-Vision-Exp продукт.

### Контекст: куда движется линейка DeepSeek

Выпуск V4-Flash-Vision-Exp вписывается в более широкую стратегию DeepSeek по наращиванию мультимодальных и агентных возможностей семейства V4. Если ранее компания обозначала планы по полноценной мультимодальной модели V4 с расширенным контекстным окном, то текущий экспериментальный релиз выглядит как промежуточный шаг: проверка мультимодального слоя на базе быстрой версии Flash, доступной через API и с прозрачной токенизированной тарификацией. Для рынка это сигнал, что конкуренция в сегменте мультимодальных агентов, где ранее доминировали западные модели, продолжает усиливаться.

## 🔍 Fact-Check Verification

- [DeepSeek представила экспериментальную мультимодальную ИИ-модель — она не уступает Claude Opus 4.8 window-new](https://3dnews.ru/1147280/deepseek-predstavila-eksperimentalnuyu-multimodalnuyu-iimodel-ona-ne-ustupaet-claude-opus-48) - Первичный источник базового текста: подтверждает название V4-Flash-Vision-Exp, мультимодальность, сохранение функций, цитату о близости к Opus-4.8, Harness 0.1.1, доступ через API и тарификацию до 384 токенов на изображение. Заголовок использует более сильную формулировку «не уступает».
- [DeepSeek выпустила экспериментальную мультимодальную версию V4 Flash](https://vc.ru/id132674/3091948-deepseek-multimodalnaya-versiya-v4-flash) - Независимое подтверждение факта выпуска экспериментальной мультимодальной версии V4 Flash.
- [DeepSeek представила ИИ-модель, способную составить конкуренцию Opus 4.8 от Anthropic](https://www.finam.ru/publications/item/deepseek-predstavila-ii-model-sposobnuyu-sostavit-konkurentsiyu-opus-48-ot-anthropic-20260821-1432/) - Подтверждает релиз и сравнение с Opus 4.8 от Anthropic; датировано 21.08.2026. Формулировка «составить конкуренцию» — маркетинговая рамка, совпадающая по смыслу с заявлением компании, но не тождественная «близкий к».
- [Мультимодальная ИИ-модель DeepSeek-V4 с контекстным окном в 1 млн токенов выйдет в апреле](https://3dnews.ru/1138345/multimodalnaya-iimodel-deepseekv4-s-milliardami-parametrov-i-kontekstnim-oknom-v-1-mln-tokenov-viydet-v-aprele) - Первичный источник базового текста: подтверждает название V4-Flash-Vision-Exp, мультимодальность, сохранение функций, цитату о близости к Opus-4.8, Harness 0.1.1, доступ через API и тарификацию до 384 токенов на изображение. Заголовок использует более сильную формулировку «не уступает».

## ❓ FAQ

### Q: Чем V4-Flash-Vision-Exp отличается от базовой V4-Flash?
**A:** Экспериментальная версия умеет обрабатывать в качестве запросов не только текст, но и изображения (включая скриншоты), сохраняя при этом текстовые, рассуждающие и агентные возможности базовой модели.

### Q: Как тарифицируются изображения в новой модели?
**A:** Изображения преобразуются в токены — до 384 токенов на каждое — и учитываются по расценкам базовой модели DeepSeek V4-Flash.

### Q: Где доступна модель и что вышло вместе с ней?
**A:** Модель уже доступна через API DeepSeek. Одновременно выпущен инструмент DeepSeek Harness 0.1.1, который поддерживает новую модель «из коробки».

### Q: Насколько модель близка к Claude Opus 4.8?
**A:** По заявлению DeepSeek, в тестах мультимодальных агентов модель поднимает производительность на уровень, близкий к Opus-4.8. Это заявление самого разработчика; часть изданий передаёт его как «не уступает» или «составляет конкуренцию», что является более сильной формулировкой.