Китайський розробник систем штучного інтелекту DeepSeek представив експериментальну мультимодальну версію своєї моделі V4-Flash. Новинка отримала назву V4-Flash-Vision-Exp і принципово відрізняється від базового варіанту тим, що в якості вхідних запитів приймає не лише текст, а й зображення. Таким чином компанія розширює функціональність флагманської лінійки V4 у бік роботи з візуальними даними.

Що представила DeepSeek

За заявою розробника, експериментальна модель V4-Flash-Vision-Exp вміє аналізувати зображення, скріншоти та інші візуальні запити нарівні з текстовими. При цьому компанія підкреслює, що нова версія не є «обрізаною» чи спеціалізованою: вона зберігає весь набір наявних можливостей базової моделі, включаючи функції роботи з текстом, навички логічних міркувань, застосування знань про оточувчий світ та керування автономними ІІ-агентами. По суті, мультимодальність додана як додатковий шар поверх уже працюючого текстового ядра.

Можливості та позиціонування моделі

У DeepSeek акцентують увагу на прогресі саме в сценаріях з мультимодальними агентами. «У тестах для мультимодальних агентів V4-Flash-Vision-Exp демонструє значний прогрес порівняно з [базовою] V4-Flash, піднімаючи продуктивність мультимодальних агентів на рівень, близький до Opus-4.8», — заявили в компанії. Це позиціонування важливе: розробник прямо порівнює свою експериментальну модель з одним із топових рішень конкурентів, стверджуючи, що розрив у мультимодальних агентних задачах скоротився до мінімуму.

Інструментарій та доступ через API

Разом із моделлю вийшов інструмент DeepSeek Harness 0.1.1, який, за словами розробника, підтримує нову модель «з коробки» — тобто без необхідності додаткового ручного налаштування. Оновлена модель уже доступна через API DeepSeek, що дозволяє розробникам і командам інтегрувати мультимодальні можливості у власні продукти та агентів прямо зараз, а не чекати загального релізу.

Тарифікація та робота з зображеннями

Окремої уваги заслуговує схема розрахунку вартості. При тарифікації зображення перетворюються на токени — до 384 токенів на кожне зображення — і враховуються за цінами базової моделі DeepSeek V4-Flash. Це означає, що візуальні запити не винесені в окремий, дорожчий прайс, а вписані у звичну токенізовану економіку наявної моделі, що спрощує прогнозування витрат для користувачів API.

Протирічливі дані

Під час перевірки формулювань за кількома джерелами виявлено розбіжність у силі заяви про порівняння з Opus 4.8. У власному тексті компанії використовується обережна формулювання «на рівень, близький до Opus-4.8», тоді як заголовки ряду видань передають це як «не поступається Claude Opus 4.8» або «здатна скласти конкуренцію Opus 4.8 від Anthropic». Фактично це різні маркетингові рамки одного й того ж бенчмарка: «близький до» і «не поступається» — не тотожні твердження, а незалежна стороння верифікація цих цифр у відкритих джерелах на момент публікації обмежена. Крім того, важливо не змішувати цю експериментальну модель із раніше анонсованою повною мультимодальною DeepSeek-V4 з контекстним вікном у 1 млн токенів, вихід якої планувався на квітень: це окремий елемент дорожньої карти лінійки V4, а не тотожний V4-Flash-Vision-Exp продукт.

Контекст: куди рухається лінійка DeepSeek

Випуск V4-Flash-Vision-Exp вписується у ширшу стратегію DeepSeek щодо нарощування мультимодальних та агентних можливостей сімейства V4. Якщо раніше компанія окреслювала плани щодо повноцінної мультимодальної моделі V4 з розширеним контекстним вікном, то поточний експериментальний реліз виглядає як проміжний крок: перевірка мультимодального шару на базі швидкої версії Flash, доступної через API та з прозорою токенізованою тарифікацією. Для ринку це сигнал, що конкуренція в сегменті мультимодальних агентів, де раніше домінували західні моделі, продовжує посилюватися.