ChinaModelAPI

Leitfäden / Chinesische Vision-Modelle 2026

Vergleich · aktualisiert 2026-08-21 · DeepSeek-Zahlen offiziell; Kimi/Qwen laut Tracker

Chinesische Vision-Modell-APIs im Jahr 2026: DeepSeek Vision-Exp vs. Qwen-VL vs. Kimi

Jedes führende chinesische Frontier-Labor bietet inzwischen eine Vision-fähige API an. DeepSeeks deepseek-v4-flash-vision-exp (21. Aug. 2026) ist der neueste und günstigste starke Neuzugang; Alibabas Qwen-VL-Familie ist die breiteste; Moonshots Kimi-Reihe verfügt am längsten über native Vision. Diese Seite vergleicht die entscheidenden Faktoren für Routing-Entscheidungen – Leistungsfähigkeit, Preise, Kontext, offene Gewichte – mit Quellenangaben pro Zeile.

Direkte Antwort

Routing nach Anforderung: günstigste starke Vision → deepseek-v4-flash-vision-exp ($0.22/1M Input außerhalb der Spitzenzeiten, ≤384 Tokens pro Bild, multimodaler Agent nahe Opus-4.8); Open-Weights-Frontier-Vision + 1M Kontext → Kimi K3; breiteste Modellstaffelung von selbst hostbaren Small-Modellen bis zum proprietären Max → Qwen3-VL-Familie. Alle drei sprechen das OpenAI-kompatible Format, sodass ein Gateway alle mit modellbasierten Fallbacks bedienen kann.

Die Vergleichstabelle 2026

ModellVisionKontextEingabe $/1MOffene GewichteHinweise
deepseek-v4-flash-vision-exp
DeepSeek · 21. Aug. 2026 · offiziell
✓ experimentell 1M $0.22 / $0.44
≤384 t/Bild
✗ (nur API) Textparität mit V4-Flash; multimodaler Agent ≈ Opus-4.8; neue Files-API
Kimi K3
Moonshot · Jul. 2026
✓ nativ (MoonViT) 1M K3 TBA
K2.5 Ref.: $0.45 (Tracker)
✓ angekündigt Flaggschiff der 2.8T-Klasse; Vision seit K2.5 (Jan. 2026, 400M-MoonViT-Encoder)
Qwen3-VL-Familie
Alibaba · 2025–2026
✓ nativ bis 1M
(3.6 Plus)
ab ~$0.13
(VL 30B, Tracker)
✓ Small-/Mid-Tiers Breiteste Staffelung: offene Small-Modelle → Qwen3.6 Plus ($0.325, Tracker) → proprietäres VL-Max; über DashScope
GLM-5.2 / 5.3
Zhipu · 2026
✗ nur Text 1M $1.40 Der Vollständigkeit halber aufgeführt – Chinas führende Open-Coding-Flaggschiffe bieten noch keine Vision-Unterstützung

DeepSeek-Zeile aus den offiziellen Dokumenten (21. Aug. 2026). Kimi/Qwen-Zahlen stammen aus öffentlichen Modell-Trackern (Roboflow-Modellseiten, AIViewer; aktualisiert 14.–20. Aug. 2026) und unserem Kimi-API-Leitfaden – vor der Budgetplanung bitte für jede Stufe in der jeweiligen Anbieterkonsole überprüfen.

Drei Familien, drei Philosophien

  • DeepSeek: Vision als Preiswaffe. Vision-Exp ist kein separates Premium-Produkt – es ist dasselbe V4-Flash zum selben Token-Preis mit einer Obergrenze von 384 Tokens pro Bild. Der strategische Ansatz: Vision so günstig zu machen, dass es in jedem Agenten-Loop genutzt werden kann. Kompromiss: Es ist experimentell, nur über API verfügbar und beschränkt auf die Flash-Familie (bisher noch keine V4-Pro-Vision).
  • Moonshot: Vision als natives Flaggschiff-Feature. Kimi bietet seit K2.5 (Januar 2026) native Vision über seinen MoonViT-Encoder – genau den Encoder, den die Community buchstäblich übernommen hat, um V4-Flash inoffiziell Sehen beizubringen, bevor DeepSeek nachzog. K3 kombiniert dies mit einem Modell der 2.8T-Klasse und 1M Kontext. Kompromiss: Frontier-Preise (K2.5-Referenz: $0.45/1M Input).
  • Alibaba: Vision als Stufenleiter. Qwen-VL reicht von selbst hostbaren Open-Modellen (kleinere Qwen3-VL-Stufen) bis hin zum proprietären Max – wählen Sie Ihren optimalen Preis-Leistungs-Punkt. Kompromiss: Durch die große Bandbreite liegt die Entscheidungslast bei Ihnen, und die Bildabrechnung ist auflösungsabhängig statt gedeckelt.

Welches Modell routen: Entscheidungstabelle

Ihr WorkloadRouten an
Hochvolumige Screenshot-/UI-Agenten-Loops, kostensensibeldeepseek-v4-flash-vision-exp — ≤384t/Bild zu Flash-Preisen
Anspruchsvolles multimodales Reasoning auf einem führenden Open-ModellKimi K3 — native Vision + 2.8T + 1M Kontext
Self-Hosting / Air-Gapped-VisionOffene Qwen3-VL-Stufen (oder Community-Adapter für V4-Flash)
Eine Integration, alle Anbieter, Fallback pro ModellOpenAI-kompatibles Relay für alle drei (das sind wir – Warteliste)

Im Vergleich zu westlichen Vision-APIs

Zur Einordnung: Claude Sonnet 4.5 liegt bei $3/1M Input, Grok 4.6 bei $2/1M, Gemini 3.7 Flash zur Einführung bei $0.75/1M (unser Gemini-Briefing). Vision-Exp unterbietet alle drei um das 1,7- bis 13,6-Fache pro Token bei der einzigen festen Obergrenze pro Bild; das chinesische Vision-Angebot reicht insgesamt von $0.13 bis $0.45/1M Input – ein Preisbereich, den westliche Anbieter nicht erreichen. Die vollständige Kostenrechnung finden Sie in unserem Leitfaden zu den Vision-Preisen.

FAQ

Welches Modell ist für bildintensive Agenten am günstigsten?

Vision-Exp, mit deutlichem Abstand: $0.22/1M Input außerhalb der Spitzenzeiten bei einer Bildobergrenze von 384 Tokens. 1.000 Screenshots in Maximalgröße kosten ≈ $0.08 außerhalb der Spitzenzeiten.

Verfügt GLM-5.2/5.3 über Vision?

Noch nicht – Zhipus Flaggschiffe für 2026 sind mit Stand vom 21. Aug. 2026 reine Textmodelle. Die offenen Vision-Optionen aus China sind Kimi (angekündigte Gewichte) und die Qwen-VL-Stufen.

Ist Vision-Exp im Vergleich zu Kimis nativer Vision produktionsreif?

Unterschiedliche Risikoprofile: Vision-Exp ist experimentell (mögliche Drift/Einstellung), aber am günstigsten; Kimis Vision ist seit K2.5 produktiv im Einsatz. Sinnvolles Muster: Vision-Exp für minimale Kosten, Kimi/Qwen-VL als stabiler Fallback – nur ein Konfigurations-Flag entfernt.

Sind diese Zahlen stabil?

Chinesische API-Preise ändern sich schnell (DeepSeek hat die Preise seit April bereits zweimal angepasst). Die hier genannten DeepSeek-Zahlen sind offiziell mit Stand vom 21. Aug. 2026; Kimi/Qwen stammen aus Trackern. Vor der Budgetfestlegung bitte nochmals überprüfen.

Verwandte Themen