---
title: "DeepSeek stellt experimentelles multimodales Modell V4-Flash-Vision-Exp vor"
description: "DeepSeek hat das experimentelle multimodale Modell V4-Flash-Vision-Exp vorgestellt, das Bilder neben Text analysieren kann. Das Unternehmen erklärt, dass sein Niveau Claude Opus 4.8 nahekommt."
date: 2026-08-23T17:28:00.000Z
lang: de
url: https://xab.info/de/posts/deepseek-v4-flash-vision-exp-multimodal
tags: [deepseek, ai-models, multimodal-ai, artificial-intelligence, china-tech]
publisher: "XAB.info"
---

# DeepSeek stellt experimentelles multimodales Modell V4-Flash-Vision-Exp vor

![DeepSeek-App mit Begrüßungsbildschirm und neuer Chat-Oberfläche auf einem Smartphone](https://xab.info/media/2026/08/24/deepseek-v4-flash-vision-exp-multimodal/deepseek-v4-flash-vision-exp-multimodal-1.webp)

## 🎯 Key Points

- DeepSeek hat das experimentelle multimodale Modell V4-Flash-Vision-Exp veröffentlicht, das Bilder und Text akzeptiert.
- Das Modell behält die textbasierten, schließenden und agentischen Fähigkeiten der Basisversion V4-Flash bei.
- Das Unternehmen erklärt, dass das Niveau in multimodalen Agententests Opus-4.8 nahekommt.
- Das Werkzeug DeepSeek Harness 0.1.1 wurde veröffentlicht; das Modell ist über die API verfügbar, Bilder werden als Token abgerechnet (bis zu 384 pro Bild) nach den Sätzen von V4-Flash.

Der chinesische Entwickler für Künstliche-Intelligenz-Systeme DeepSeek hat eine experimentelle multimodale Version seines Modells V4-Flash vorgestellt. Die Neuheit trägt den Namen V4-Flash-Vision-Exp und unterscheidet sich grundlegend von der Basissvariante dadurch, dass sie als Eingabe nicht nur Text, sondern auch Bilder akzeptiert. Damit erweitert das Unternehmen die Funktionalität der Flaggschiff-Serie V4 in Richtung der Verarbeitung visueller Daten.

### Was DeepSeek vorgestellt hat

Laut Aussage des Entwicklers kann das experimentelle Modell V4-Flash-Vision-Exp Bilder, Screenshots und andere visuelle Anfragen neben Textanfragen analysieren. Dabei betont das Unternehmen, dass die neue Version weder eine „gekürzte“ noch eine spezialisierte Variante ist: Sie behält den gesamten Bestand an Funktionen des Basismodells bei, einschließlich der Textverarbeitung, der Fähigkeiten logischen Schließens, des Einsatzes von Weltwissen und der Steuerung autonomer KI-Agenten. Im Wesentlichen wird die Multimodalität als zusätzliche Schicht über dem bereits funktionierenden Textkern ergänzt.### Fähigkeiten und Positionierung des Modells

Bei DeepSeek liegt der Schwerpunkt auf dem Fortschritt gerade in Szenarien mit multimodalen Agenten. „In Tests für multimodale Agenten zeigt V4-Flash-Vision-Exp einen erheblichen Fortschritt gegenüber [der Basisversion] V4-Flash und hebt die Leistungsfähigkeit multimodaler Agenten auf ein Niveau, das Opus-4.8 nahekommt“, erklärte das Unternehmen. Diese Positionierung ist wichtig: Der Entwickler vergleicht sein experimentelles Modell ausdrücklich mit einer der Spitzenlösungen der Konkurrenz und behauptet, dass der Abstand in multimodalen Agentenaufgaben auf ein Minimum geschrumpft ist.

### Werkzeuge und API-Zugang

Gleichzeitig mit dem Modell wurde das Werkzeug DeepSeek Harness 0.1.1 veröffentlicht, das laut Entwickler das neue Modell „out of the box“ unterstützt – also ohne zusätzliche manuelle Konfiguration. Das aktualisierte Modell ist bereits über die DeepSeek-API verfügbar, was es Entwicklern und Teams ermöglicht, multimodale Fähigkeiten sofort und nicht erst ab dem allgemeinen Release in eigene Produkte und Agenten zu integrieren.

### Abrechnung und Bildverarbeitung

Besondere Aufmerksamkeit verdient das Abrechnungsschema. Bei der Tarifberechnung werden Bilder in Token umgewandelt – bis zu 384 Token pro Bild – und nach den Preisen des Basismodells DeepSeek V4-Flash abgerechnet. Das bedeutet, dass visuelle Anfragen nicht in einen separaten, teureren Preiskatalog ausgelagert wurden, sondern in die vertraute tokenbasierte Wirtschaftlichkeit des bestehenden Modells eingebettet sind, was die Kostenprognose für API-Nutzer vereinfacht.

### Widersprüchliche Angaben

Bei der Überprüfung der Formulierungen in mehreren Quellen wurde eine Diskrepanz in der Stärke der Aussage zum Vergleich mit Opus 4.8 festgestellt. Im eigenen Text des Unternehmens wird die vorsichtige Formulierung „auf ein Niveau, das Opus-4.8 nahekommt“ verwendet, während die Schlagzeilen einiger Medien dies als „nicht schlechter als Claude Opus 4.8“ oder „fähig, Opus 4.8 von Anthropic Konkurrenz zu machen“ wiedergeben. Tatsächlich handelt es sich dabei um unterschiedliche marketingseitige Rahmungen desselben Benchmarks: „nahe an“ und „nicht schlechter als“ sind keine identischen Aussagen, und eine unabhängige externe Verifizierung dieser Zahlen in öffentlichen Quellen ist zum Zeitpunkt der Veröffentlichung begrenzt. Außerdem ist es wichtig, dieses experimentelle Modell nicht mit dem zuvor angekündigten vollständigen multimodalen DeepSeek-V4 mit einem Kontextfenster von 1 Mio. Token zu verwechseln, dessen Veröffentlichung für April geplant war: Dies ist ein separates Element der Roadmap der V4-Serie und kein mit V4-Flash-Vision-Exp identisches Produkt.

### Kontext: In welche Richtung entwickelt sich die DeepSeek-Serie

Die Veröffentlichung von V4-Flash-Vision-Exp fügt sich in die breitere Strategie von DeepSeek ein, die multimodalen und agentischen Fähigkeiten der V4-Familie auszubauen. Wenn das Unternehmen zuvor Pläne für ein vollständiges multimodales V4-Modell mit erweitertem Kontextfenster skizziert hatte, so wirkt das aktuelle experimentelle Release wie ein Zwischenschritt: die Prüfung der multimodalen Schicht auf Basis der schnellen Flash-Version, die über die API verfügbar ist und über eine transparente tokenbasierte Abrechnung verfügt. Für den Markt ist dies ein Signal, dass der Wettbewerb im Segment der multimodalen Agenten, in dem zuvor westliche Modelle dominierten, weiter an Intensität gewinnt.

## 🔍 Fact-Check Verification

- [DeepSeek stellt experimentelles multimodales KI-Modell vor – es ist nicht schlechter als Claude Opus 4.8 window-new](https://3dnews.ru/1147280/deepseek-predstavila-eksperimentalnuyu-multimodalnuyu-iimodel-ona-ne-ustupaet-claude-opus-48) - Первичный источник базового текста: подтверждает название V4-Flash-Vision-Exp, мультимодальность, сохранение функций, цитату о близости к Opus-4.8, Harness 0.1.1, доступ через API и тарификацию до 384 токенов на изображение. Заголовок использует более сильную формулировку «не уступает».
- [DeepSeek veröffentlicht experimentelle multimodale Version V4 Flash](https://vc.ru/id132674/3091948-deepseek-multimodalnaya-versiya-v4-flash) - Независимое подтверждение факта выпуска экспериментальной мультимодальной версии V4 Flash.
- [DeepSeek stellt KI-Modell vor, das Opus 4.8 von Anthropic Konkurrenz machen kann](https://www.finam.ru/publications/item/deepseek-predstavila-ii-model-sposobnuyu-sostavit-konkurentsiyu-opus-48-ot-anthropic-20260821-1432/) - Подтверждает релиз и сравнение с Opus 4.8 от Anthropic; датировано 21.08.2026. Формулировка «составить конкуренцию» — маркетинговая рамка, совпадающая по смыслу с заявлением компании, но не тождественная «близкий к».
- [Multimodales KI-Modell DeepSeek-V4 mit Kontextfenster von 1 Mio. Token erscheint im April](https://3dnews.ru/1138345/multimodalnaya-iimodel-deepseekv4-s-milliardami-parametrov-i-kontekstnim-oknom-v-1-mln-tokenov-viydet-v-aprele) - Первичный источник базового текста: подтверждает название V4-Flash-Vision-Exp, мультимодальность, сохранение функций, цитату о близости к Opus-4.8, Harness 0.1.1, доступ через API и тарификацию до 384 токенов на изображение. Заголовок использует более сильную формулировку «не уступает».

## ❓ FAQ

### Q: Wodurch unterscheidet sich V4-Flash-Vision-Exp von der Basisversion V4-Flash?
**A:** Die experimentelle Version kann als Anfragen nicht nur Text, sondern auch Bilder (einschließlich Screenshots) verarbeiten und behält dabei die textbasierten, schließenden und agentischen Fähigkeiten des Basismodells bei.

### Q: Wie werden Bilder im neuen Modell abgerechnet?
**A:** Bilder werden in Token umgewandelt – bis zu 384 Token pro Bild – und nach den Preisen des Basismodells DeepSeek V4-Flash abgerechnet.

### Q: Wo ist das Modell verfügbar und was wurde gleichzeitig veröffentlicht?
**A:** Das Modell ist bereits über die DeepSeek-API verfügbar. Gleichzeitig wurde das Werkzeug DeepSeek Harness 0.1.1 veröffentlicht, das das neue Modell „out of the box“ unterstützt.

### Q: Wie nah kommt das Modell Claude Opus 4.8?
**A:** Laut Aussage von DeepSeek hebt das Modell in Tests multimodaler Agenten die Leistungsfähigkeit auf ein Niveau, das Opus-4.8 nahekommt. Dies ist die Aussage des Entwicklers selbst; einige Medien geben sie als „nicht schlechter als“ oder „macht Konkurrenz“ wieder, was eine stärkere Formulierung darstellt.