Leitfäden / Chinesische Vision-Modelle 2026
Chinesische Vision-Modell-APIs im Jahr 2026: DeepSeek Vision-Exp vs. Qwen-VL vs. Kimi
Jedes führende chinesische Frontier-Labor bietet inzwischen eine Vision-fähige API an. DeepSeeks deepseek-v4-flash-vision-exp (21. Aug. 2026) ist der neueste und günstigste starke Neuzugang; Alibabas Qwen-VL-Familie ist die breiteste; Moonshots Kimi-Reihe verfügt am längsten über native Vision. Diese Seite vergleicht die entscheidenden Faktoren für Routing-Entscheidungen – Leistungsfähigkeit, Preise, Kontext, offene Gewichte – mit Quellenangaben pro Zeile.
Routing nach Anforderung: günstigste starke Vision → deepseek-v4-flash-vision-exp ($0.22/1M Input außerhalb der Spitzenzeiten, ≤384 Tokens pro Bild, multimodaler Agent nahe Opus-4.8); Open-Weights-Frontier-Vision + 1M Kontext → Kimi K3; breiteste Modellstaffelung von selbst hostbaren Small-Modellen bis zum proprietären Max → Qwen3-VL-Familie. Alle drei sprechen das OpenAI-kompatible Format, sodass ein Gateway alle mit modellbasierten Fallbacks bedienen kann.
Die Vergleichstabelle 2026
| Modell | Vision | Kontext | Eingabe $/1M | Offene Gewichte | Hinweise |
|---|---|---|---|---|---|
| deepseek-v4-flash-vision-exp DeepSeek · 21. Aug. 2026 · offiziell |
✓ experimentell | 1M | $0.22 / $0.44 ≤384 t/Bild |
✗ (nur API) | Textparität mit V4-Flash; multimodaler Agent ≈ Opus-4.8; neue Files-API |
| Kimi K3 Moonshot · Jul. 2026 |
✓ nativ (MoonViT) | 1M | K3 TBA K2.5 Ref.: $0.45 (Tracker) |
✓ angekündigt | Flaggschiff der 2.8T-Klasse; Vision seit K2.5 (Jan. 2026, 400M-MoonViT-Encoder) |
| Qwen3-VL-Familie Alibaba · 2025–2026 |
✓ nativ | bis 1M (3.6 Plus) |
ab ~$0.13 (VL 30B, Tracker) |
✓ Small-/Mid-Tiers | Breiteste Staffelung: offene Small-Modelle → Qwen3.6 Plus ($0.325, Tracker) → proprietäres VL-Max; über DashScope |
| GLM-5.2 / 5.3 Zhipu · 2026 |
✗ nur Text | 1M | $1.40 | ✓ | Der Vollständigkeit halber aufgeführt – Chinas führende Open-Coding-Flaggschiffe bieten noch keine Vision-Unterstützung |
DeepSeek-Zeile aus den offiziellen Dokumenten (21. Aug. 2026). Kimi/Qwen-Zahlen stammen aus öffentlichen Modell-Trackern (Roboflow-Modellseiten, AIViewer; aktualisiert 14.–20. Aug. 2026) und unserem Kimi-API-Leitfaden – vor der Budgetplanung bitte für jede Stufe in der jeweiligen Anbieterkonsole überprüfen.
Drei Familien, drei Philosophien
- DeepSeek: Vision als Preiswaffe. Vision-Exp ist kein separates Premium-Produkt – es ist dasselbe V4-Flash zum selben Token-Preis mit einer Obergrenze von 384 Tokens pro Bild. Der strategische Ansatz: Vision so günstig zu machen, dass es in jedem Agenten-Loop genutzt werden kann. Kompromiss: Es ist experimentell, nur über API verfügbar und beschränkt auf die Flash-Familie (bisher noch keine V4-Pro-Vision).
- Moonshot: Vision als natives Flaggschiff-Feature. Kimi bietet seit K2.5 (Januar 2026) native Vision über seinen MoonViT-Encoder – genau den Encoder, den die Community buchstäblich übernommen hat, um V4-Flash inoffiziell Sehen beizubringen, bevor DeepSeek nachzog. K3 kombiniert dies mit einem Modell der 2.8T-Klasse und 1M Kontext. Kompromiss: Frontier-Preise (K2.5-Referenz: $0.45/1M Input).
- Alibaba: Vision als Stufenleiter. Qwen-VL reicht von selbst hostbaren Open-Modellen (kleinere Qwen3-VL-Stufen) bis hin zum proprietären Max – wählen Sie Ihren optimalen Preis-Leistungs-Punkt. Kompromiss: Durch die große Bandbreite liegt die Entscheidungslast bei Ihnen, und die Bildabrechnung ist auflösungsabhängig statt gedeckelt.
Welches Modell routen: Entscheidungstabelle
| Ihr Workload | Routen an |
|---|---|
| Hochvolumige Screenshot-/UI-Agenten-Loops, kostensensibel | deepseek-v4-flash-vision-exp — ≤384t/Bild zu Flash-Preisen |
| Anspruchsvolles multimodales Reasoning auf einem führenden Open-Modell | Kimi K3 — native Vision + 2.8T + 1M Kontext |
| Self-Hosting / Air-Gapped-Vision | Offene Qwen3-VL-Stufen (oder Community-Adapter für V4-Flash) |
| Eine Integration, alle Anbieter, Fallback pro Modell | OpenAI-kompatibles Relay für alle drei (das sind wir – Warteliste) |
Im Vergleich zu westlichen Vision-APIs
Zur Einordnung: Claude Sonnet 4.5 liegt bei $3/1M Input, Grok 4.6 bei $2/1M, Gemini 3.7 Flash zur Einführung bei $0.75/1M (unser Gemini-Briefing). Vision-Exp unterbietet alle drei um das 1,7- bis 13,6-Fache pro Token bei der einzigen festen Obergrenze pro Bild; das chinesische Vision-Angebot reicht insgesamt von $0.13 bis $0.45/1M Input – ein Preisbereich, den westliche Anbieter nicht erreichen. Die vollständige Kostenrechnung finden Sie in unserem Leitfaden zu den Vision-Preisen.
FAQ
Welches Modell ist für bildintensive Agenten am günstigsten?
Vision-Exp, mit deutlichem Abstand: $0.22/1M Input außerhalb der Spitzenzeiten bei einer Bildobergrenze von 384 Tokens. 1.000 Screenshots in Maximalgröße kosten ≈ $0.08 außerhalb der Spitzenzeiten.
Verfügt GLM-5.2/5.3 über Vision?
Noch nicht – Zhipus Flaggschiffe für 2026 sind mit Stand vom 21. Aug. 2026 reine Textmodelle. Die offenen Vision-Optionen aus China sind Kimi (angekündigte Gewichte) und die Qwen-VL-Stufen.
Ist Vision-Exp im Vergleich zu Kimis nativer Vision produktionsreif?
Unterschiedliche Risikoprofile: Vision-Exp ist experimentell (mögliche Drift/Einstellung), aber am günstigsten; Kimis Vision ist seit K2.5 produktiv im Einsatz. Sinnvolles Muster: Vision-Exp für minimale Kosten, Kimi/Qwen-VL als stabiler Fallback – nur ein Konfigurations-Flag entfernt.
Sind diese Zahlen stabil?
Chinesische API-Preise ändern sich schnell (DeepSeek hat die Preise seit April bereits zweimal angepasst). Die hier genannten DeepSeek-Zahlen sind offiziell mit Stand vom 21. Aug. 2026; Kimi/Qwen stammen aus Trackern. Vor der Budgetfestlegung bitte nochmals überprüfen.