News / Model Watch · Offizieller Release + Entwickler-Guide
DeepSeek-V4-Flash-Vision-Exp (2026): Offizieller Launch, Preise und ein Copy-Paste-API-Schnellstart
Zwei Tage nach dem Teaser mit dem Wal-Maskottchen und einen Tag, nachdem der Name in API-Listen für Gray-Releases durchgesickert war, machte DeepSeek es offiziell: deepseek-v4-flash-vision-exp, ein experimentelles multimodales Modell für Bildverständnis, ist seit dem 21. August 2026 über die offizielle API verfügbar. Die Textqualität bleibt auf Augenhöhe mit V4-Flash; die multimodalen Agenten-Fähigkeiten liegen „nahe an Opus-4.8“; die Preise sind unverändert gegenüber V4-Flash; und eine neue Files API wird direkt mitgeliefert. Dieser Leitfaden enthält die Launch-Timeline, den Preisvergleich mit westlichen Vision-Modellen, funktionierenden Schnellstart-Code und Empfehlungen, an welches DeepSeek-Modell die jeweiligen Workloads geroutet werden sollten.
DeepSeek-V4-Flash-Vision-Exp ist ein offizielles DeepSeek-Modell, veröffentlicht am 21. August 2026, laut dem API-Changelog-Eintrag vom 2026-08-21.
Rufen Sie es mit model='deepseek-v4-flash-vision-exp' auf; es akzeptiert Text + Bilder via base64, externe URLs oder die neue Files API über Chat Completions, die Anthropic-kompatible Messages API und die Responses API.
Laut der offiziellen Preisseite kostet es exakt so viel wie V4-Flash – $0.22 pro 1M Input-Tokens in der Nebenzeit ($0.44 Hauptzeit) – und jedes Bild wird mit maximal 384 Tokens abgerechnet.
DeepSeek Harness v0.1.1-rc.1 unterstützt es nativ.
Vom Teaser zum Launch: die 72-Stunden-Timeline
| Wann | Was geschah · Quelle |
|---|---|
| 18. Jun. | DeepSeek App/Web erhalten Bild-Vision (nur Produkt, kein API-Modell). Forscher auf X: „Vision ist jetzt im Web und in der App live.“ |
| 3.–4. Aug. | Die Community will nicht warten: Der DeepSeek-V4-Flash-Vision-NVFP4 MoonViT-Adapter von WebBrain und 0731-vision von FlyCockpit erscheinen auf Hugging Face (mehr dazu unten). |
| 19.–20. Aug. | DeepSeek-Multimodal-Forscher Xiaokang Chen postet auf X den Teaser mit dem Wal mit offenen Augen „Now, we see you. 👀“ – TestingCatalog bringt ihn mit einem kommenden Vision-Modell in Verbindung. |
| 20. Aug. | Die exakte Modell-ID taucht im Gray-Release auf: Screenshots der API-Modellliste mit deepseek-v4-flash-vision-exp kursieren auf X (@NFT_Chen) und im DeepSeek Harness-Code – Dokumentation noch nicht aktualisiert. |
| 21. Aug. (Abend UTC+8) | Offizieller Launch. Changelog-Eintrag „DeepSeek-V4-Flash-Vision-Exp Release“ (2026-08-21); Preisseite, Vision-Leitfaden und Files-API-Leitfaden gehen online; offizielle WeChat-Ankündigung (Presseberichte innerhalb einer Stunde); DeepSeek Harness v0.1.1-rc.1 fügt native Unterstützung hinzu. |
Anmerkung der Redaktion: Eine frühere Version dieser Kurzübersicht, die am Morgen des 21. Aug. vor dem Launch veröffentlicht wurde, kam zu dem Schluss, dass kein offizielles Modell existiert – zu diesem Zeitpunkt zutreffend (die Dokumentation enthielt keinen Eintrag; der Name tauchte nur im Gray-Release auf), am Abend jedoch überholt. Offizielle Releases am selben Tag sind genau der Grund, warum wir jede Angabe mit einem Datumsstempel versehen.
Was veröffentlicht wurde, laut offizieller Dokumentation
- Das Modell. Experimentelles Modell für Bildverständnis;
model='deepseek-v4-flash-vision-exp'. Offizielle Einordnung: Textqualität „auf Augenhöhe mit dem offiziellen DeepSeek-V4-Flash“, multimodale Agenten-Fähigkeiten „nahe an Opus-4.8“. V4-Pro hat keine Vision-Fähigkeiten erhalten – dies ist vorerst der Flash-Familie vorbehalten. - Drei Möglichkeiten, Bilder zu senden. Base64-
data:-URLs inline; eine öffentliche externe Bild-URL (Limit von 8.192 Zeichen, 60s Download-Timeout); oder die Files API – einmal hochladen,file_idreferenzieren. Alle drei Endpunkte funktionieren: OpenAI-kompatible Chat Completions, Anthropic-kompatible Messages (Files API benötigt den Headeranthropic-beta: files-api-2025-04-14) und Responses. - Bild-Limits. JPEG / PNG / GIF / WebP; 32 MiB pro Bild inline oder per URL, 64 MiB via file_id; bis zu 600 Bilder pro Request; 48 MiB Request-Body (64 MiB für Bilder insgesamt, 200 MiB bei file_id-Bildern); max. 8.192 px pro Seite (4.096 px beim Senden von 15+ Bildern).
- Die Files API (neuer, separater Launch). purpose=
user_data; 64 MiB pro Datei; 25 GiB und 10.000 Dateien pro Benutzer; Aufbewahrungsdauer 1 Stunde bis 30 Tage oder dauerhaft; Format wird anhand des Inhalts erkannt, nicht anhand der Dateiendung. - Harness-Support am selben Tag. DeepSeek Harness v0.1.1-rc.1 (offizieller Account, 21. Aug. 18:22): „DeepSeek 模型适配器新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项,并支持配置原生图片请求“ – die Bildanbindung aus rc.7/rc.8 der letzten Woche hat nun ein First-Party-Modell zur Integration (siehe unseren rc.7/rc.8-Bericht).
deepseek-v4-flash-vision-exp Preise (2026): identisch mit V4-Flash, Bilder auf 384 Tokens gedeckelt
deepseek-v4-flash-vision-exp kostet genauso viel wie deepseek-v4-flash: $0.22 pro 1M Input-Tokens in der Nebenzeit, $0.44 in der Hauptzeit, $0.66/$1.32 Output – und jedes Bild wird mit maximal 384 Tokens abgerechnet. Hauptverkehrszeiten sind UTC 01:00–04:00 und 06:00–10:00 (Peking 09:00–12:00 und 14:00–18:00); die Nebenzeit kostet die Hälfte der Hauptzeit.
| Pro 1M Tokens (USD) | Nebenzeit | Hauptzeit | Hinweise |
|---|---|---|---|
| Input — Cache-Hit | $0.007 | $0.014 | Identisch mit deepseek-v4-flash |
| Input — Cache-Miss | $0.22 | $0.44 | ≈ ¥1.5 / ¥3.0 |
| Ausgabe | $0.66 | $1.32 | ≈ ¥4.5 / ¥9.0 |
| Bildabrechnung | Größenanpassung vor der Inferenz: <~384×384 wird hochskaliert, größere Bilder auf ein Äquivalent von ~800×800 Pixeln herunterskaliert | Obergrenze von 384 Tokens pro Bild – ein 2000×2000- und ein 5000×5000-Bild kosten gleich viel; jedes Bild in einem Multi-Image-Request wird unabhängig abgerechnet | |
Quelle: offizielle Preisseite und Vision-Token-Nutzungsleitfaden, Stand 2026-08-21.
Was ein Bild tatsächlich kostet: vision-exp vs. westliche Vision-Modelle (2026)
Ein Bild maximaler Größe kostet bei vision-exp höchstens $0.00017 in der Hauptzeit ($0.000084 in der Nebenzeit) – rund 1.000 Screenshots für unter $0.09 in der Nebenzeit. Westliche bildfähige Modelle rechnen Bilder nach ihren eigenen (größeren, auflösungsabhängigen) Token-Zahlen zu 1.7×–13.6× höheren Preisen pro Token ab:
| Modell (2026) | Eingabe $/1M | vs. vision-exp | Bildabrechnung |
|---|---|---|---|
| deepseek-v4-flash-vision-exp | $0.22 / $0.44 (Neben-/Hauptzeit) | Baseline | ≤384 Token/Bild, harte Grenze |
| Gemini 3.7 Flash (Einführung) | $0.75 | 1.7–3.4× | auflösungsabhängig, keine veröffentlichte Obergrenze wie bei 384 |
| Grok 4.6 | $2.00 | 4.5–9.1× | auflösungsabhängig |
| Claude Sonnet 4.5 | $3.00 | 6.8–13.6× | typischer Screenshot ≈1,000+ Token → ≈$0.003+/Bild (Schätzung) |
Vergleichspreise sind Listenpreise von öffentlichen Preisseiten für Claude Sonnet 4.5 und Grok 4.6 sowie Googles veröffentlichte Einführungspreise für Gemini 3.7 Flash (unser Gemini 3.7-Bericht); Bild-Token-Zahlen der Konkurrenz variieren je nach Auflösung und sind Schätzungen. Der strukturelle Vorteil bleibt dennoch bestehen: vision-exp kombiniert den günstigsten Preis pro Token in seiner Klasse mit der einzigen festen Token-Obergrenze pro Bild.
So rufen Sie deepseek-v4-flash-vision-exp auf: Schnellstart (curl + Python)
Die API ist OpenAI-kompatibel – das Standard-Format für Vision-Nachrichten funktioniert direkt mit https://api.deepseek.com. Bild per öffentlicher URL:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Describe the UI bug visible in this screenshot."},
{"type": "image_url",
"image_url": {"url": "https://example.com/screenshot.png"}}
]
}]
}'
Derselbe Aufruf in Python mit dem offiziellen OpenAI-SDK – base_url auf DeepSeek setzen, das Bild inline als base64 übergeben:
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Summarize this dashboard."},
{"type": "image_url",
"image_url": {"url": "data:image/png;base64,"}},
],
}],
)
print(resp.choices[0].message.content)
- JavaScript/Node: identische Struktur mit dem npm-Paket
openai– tauschen Sie einfachbaseURLund die Modell-ID aus. - Wiederholte Screenshots (Agent-Schleifen): Einmal über die Files API hochladen (
purpose="user_data"), dann die zurückgegebenefile_idreferenzieren – 64 MiB pro Bild, kein erneuter Upload in jedem Durchlauf. Dies ist das Muster, das DeepSeek Harness v0.1.1-rc.1 nativ verwendet. - Anthropic-Stack: Der Messages-Endpunkt funktioniert ebenfalls; Files-API-Referenzen benötigen den Header
anthropic-beta: files-api-2025-04-14. - Über ein Relay oder Gateway: Jeder OpenAI-kompatible Proxy, der die Content-Blöcke
image_urlweiterleitet, übergibt Vision-Payloads unverändert – stellen Sie sicher, dass Ihr Gateway mehrteilige Content-Arrays weiterleitet, bevor Sie das Problem beim Modell suchen.
Welches DeepSeek-Modell routen: vision-exp vs. v4-flash vs. v4-pro
| Ihr Workload | Routen an | Warum |
|---|---|---|
| Text + Agent-Coding-Schleifen, Tool-Calls, langer Kontext | deepseek-v4-flash | Stabiles GA-Modell, gleicher Preis; kein Grund, bei reinen Textdurchläufen den Vision-Overhead zu zahlen |
| Screenshots, UI-Debugging, Lesen von Diagrammen/Dashboards, Dokumentenbilder | deepseek-v4-flash-vision-exp | Flash-Preise + 384-Token-Bildobergrenze; multimodaler Agent nahe an Opus-4.8; experimentell – ID fest pinnen |
| Anspruchsvollstes Reasoning, maximale Qualität, 1M Kontext | deepseek-v4-pro | Leistungsstärkstes DeepSeek-Modell; weiterhin rein textbasiert – kombinieren Sie es für den Bildschritt mit vision-exp |
| Natives Vision mit offenen Gewichten, selbst gehostet | Kimi K3 / Qwen-VL | vision-exp ist rein API-basiert; für Open-Weights-Vision siehe unseren Kimi API-Leitfaden |
Erhalten Sie bildfähige chinesische Modelle über einen einzigen OpenAI-kompatiblen Endpunkt
ChinaModelAPI ist ein unabhängiges Relay, das chinesische Frontier-Modelle – DeepSeek, Qwen, GLM, Kimi – für Entwickler weltweit über eine einzige OpenAI-kompatible API bereitstellt, mit Zahlungen in USDT/USD1 und ohne Abonnement. Modell-Releases wie vision-exp sind genau das, wofür die Plattform entwickelt wurde: Modellverfügbarkeit ab Tag eins, transparente Preise pro Token und eine einzige Integration für das gesamte chinesische Modellangebot.
ChinaModelAPI ist ein unabhängiges Relay ohne offizielle Beziehung zu DeepSeek. Geroutete Modell-IDs werden vor dem Launch live verifiziert – treten Sie der Warteliste bei, um benachrichtigt zu werden, sobald das Vision-Routing live geht.
Was das für die Community-Adapter (und die Verwirrung) bedeutet
- Die Namenskollision ist gelöst – zugunsten von DeepSeek. Zwei Wochen lang stand „V4-Flash vision“ für Community-Checkpoints: WebBrains DeepSeek-V4-Flash-Vision-NVFP4 (eingefrorenes V4-Flash + eingefrorenes Kimi-K2.6 MoonViT + ein trainierter Projektor mit 40.1M Parametern, 3. Aug.) und 0731-vision von FlyCockpit (4. Aug.). Das offizielle Modell beansprucht den Namen nun für sich – mit Support, Dokumentation und Flash-Preisen, mit denen die Adapter nicht mithalten können.
- Die Adapter sind nicht wertlos – sie wurden neu positioniert. Wenn Sie V4-Flash-Gewichte auf Ihren eigenen GPUs selbst hosten und Offline-/Air-Gapped-Vision benötigen, bleiben sie die einzige Option; das offizielle vision-exp ist rein API-basiert und es wurden keine Vision-Gewichte als Open Source veröffentlicht.
- Das Muster vom Gray-Release zum Launch sollte man sich merken. Dies ist bereits das zweite DeepSeek-Release innerhalb eines Monats, das in API-Listen oder Code auftauchte, bevor die Dokumentation aktualisiert wurde (V4-Flash-0731 nahm denselben Weg). Für Relay-Betreiber und Tool-Entwickler gilt: Den Modelllisten-Endpunkt und die DSH-Release-Notes im Auge zu behalten, ist besser als auf das Changelog zu warten.
Primärquellen
- DeepSeek API-Changelog – Eintrag „DeepSeek-V4-Flash-Vision-Exp Release“ vom 2026-08-21
- Offizielle DeepSeek-Preise – vision-exp identisch mit V4-Flash; Haupt-/Nebenzeit-Fenster; Concurrency 2,500
- DeepSeek Vision-Leitfaden – Bildeingabemethoden, Limits, 384-Token-pro-Bild-Regel
- DeepSeek Files-API-Leitfaden – Formate, 64 MiB/Datei, 25 GiB & 10k Dateien pro Benutzer
- DeepSeek Harness 官方公众号 — v0.1.1-rc.1 新增 vision-exp 模型选项与原生图片请求(2026-08-21)
- 爱范儿 — 突发:DeepSeek 多模态模型发布,鲸鱼终于开「天眼」(2026-08-21,含定价截图)
- X — @NFT_Chen:vision-exp 现身 API 列表灰度截图(2026-08-20)
- TestingCatalog – Wal-Augen-Teaser von DeepSeek-Multimodal-Forscher Xiaokang Chen (19.–20. Aug.)
- LINUX DO — 官宣 DeepSeek-V4-Flash-Vision-Exp 发布(2026-08-21,社区一手讨论与价格表)
- Hugging Face – WebBrain-Community-Adapter (Kontext: das Ökosystem vor dem Launch)
Häufig gestellte Fragen (2026)
Ist vision-exp jetzt offiziell?
Ja – am 21. August 2026 mit einem datierten Changelog-Eintrag, Live-Dokumentation und offiziellen Ankündigungen veröffentlicht. Die Screenshots zum „Gray-Release“ vom 20. August zeigten die tatsächliche Bereitstellung des Modells und waren kein Gerücht.
Hat V4-Pro ebenfalls Vision erhalten?
Nein. Nur die Flash-Familie hat eine Vision-Variante erhalten. V4-Pro bleibt rein textbasiert; ob eine Vision-Version auf Pro-Niveau folgt, ist nicht angekündigt.
Wie werden Bilder abgerechnet?
Bilder werden auf ein Äquivalent von ca. 800×800 Pixeln skaliert (mind. ~384×384), in Tokens umgewandelt und als Input abgerechnet – gedeckelt auf maximal 384 Tokens pro Bild. Ein 2K- und ein 5K-Bild kosten gleich viel.
Sind die Open Weights verfügbar?
Nein. vision-exp ist vorerst nur über die API verfügbar. Für Self-Hoster bleiben die Community-Adapter (WebBrain NVFP4, FlyCockpit) die Offline-Option – inoffiziell und ohne Benchmark-Vergleich mit diesem Release.
Ist es auf OpenRouter / Drittanbietern verfügbar?
Zum Zeitpunkt der Veröffentlichung (21. Aug. Abend UTC+8) wurde das Modell über die offizielle Plattform von DeepSeek bereitgestellt; die Verfügbarkeit bei Drittanbietern war noch nicht bestätigt. Prüfen Sie vor dem Routing die aktuelle Modellliste Ihres Anbieters.
Video- oder PDF-Eingabe?
Nein – die offizielle Dokumentation listet nur Bildeingaben auf (JPEG/PNG/GIF/WebP). Extrahieren Sie für Dokumente die Seiten auf Aufruferseite als Bilder; sampeln Sie bei Videos Einzelbilder.
Rate-Limits?
Die offizielle Preisseite listet eine Concurrency von 2,500 für beide Flash-Modelle auf (im Vergleich zu 500 für V4-Pro). Der experimentelle Status bedeutet, dass sich Limits ändern können – prüfen Sie dies in der Dokumentation.
Produktionsreif?
Nehmen Sie das „Exp“ ernst: Mögliche Verhaltensänderungen, Preis-/Bedingungsanpassungen oder Deprecation/Umbenennung (DeepSeeks eigene Historie: Preview → 0731 GA). Halten Sie ein Fallback mit nativem Vision (Kimi K3, Qwen-VL) über ein Konfigurations-Flag bereit.