Guide / Modelli vision cinesi 2026
API dei modelli vision cinesi nel 2026: DeepSeek Vision-Exp vs Qwen-VL vs Kimi
Ogni laboratorio di frontiera cinese offre ormai un'API con funzionalità di visione. deepseek-v4-flash-vision-exp di DeepSeek (21 ago 2026) è l'opzione avanzata più recente ed economica; la famiglia Qwen-VL di Alibaba è la più ampia; la linea Kimi di Moonshot supporta la visione nativa da più tempo. Questa pagina mette a confronto i fattori chiave per le decisioni di routing — capacità, prezzi, contesto, open weights — con fonti indicate per ciascuna riga.
Routing in base ai vincoli: visione avanzata più economica → deepseek-v4-flash-vision-exp ($0.22/1M input off-peak, ≤384 token per immagine, agente multimodale vicino a Opus-4.8); visione di frontiera open-weights + 1M di contesto → Kimi K3; gamma più ampia, dai modelli leggeri self-hostable al proprietario Max → famiglia Qwen3-VL. Tutti e tre supportano il formato compatibile con OpenAI, quindi un unico gateway può gestirli tutti con fallback per modello.
Tabella comparativa 2026
| Modello | Visione | Contesto | Input $/1M | Pesi aperti | Note |
|---|---|---|---|---|---|
| deepseek-v4-flash-vision-exp DeepSeek · 21 ago 2026 · ufficiale |
✓ sperimentale | 1M | $0.22 / $0.44 ≤384 t/immagine |
✗ (solo API) | Parità di testo con V4-Flash; agente multimodale ≈ Opus-4.8; nuova Files API |
| Kimi K3 Moonshot · lug 2026 |
✓ nativa (MoonViT) | 1M | K3 da annunciare Rif. K2.5: $0.45 (tracker) |
✓ annunciati | Top di gamma classe 2.8T; visione da K2.5 (gen 2026, encoder MoonViT da 400M) |
| Famiglia Qwen3-VL Alibaba · 2025–2026 |
✓ nativa | fino a 1M (3.6 Plus) |
da ~$0.13 (VL 30B, tracker) |
✓ livelli small/mid | Gamma più ampia: open small → Qwen3.6 Plus ($0.325, tracker) → proprietario VL-Max; tramite DashScope |
| GLM-5.2 / 5.3 Zhipu · 2026 |
✗ solo testo | 1M | $1.40 | ✓ | Incluso per completezza — i migliori modelli di punta open cinesi per il coding non supportano ancora la visione |
Riga DeepSeek dalla documentazione ufficiale (21 ago 2026). Dati Kimi/Qwen dai tracker pubblici dei modelli (pagine modello di Roboflow, AIViewer; aggiornati al 14–20 ago 2026) e dalla nostra guida all'API Kimi — verifica per ciascun livello nella console del rispettivo fornitore prima di pianificare il budget.
Tre famiglie, tre filosofie
- DeepSeek: la visione come arma di prezzo. Vision-Exp non è un prodotto premium separato: è lo stesso V4-Flash allo stesso prezzo per token con un limite di 384 token per immagine. La mossa mira a rendere la visione sufficientemente economica da poter essere inserita in ogni loop di agenti. Compromesso: è sperimentale, disponibile solo via API, solo per la famiglia Flash (nessuna visione per V4-Pro al momento).
- Moonshot: la visione come funzionalità nativa di punta. Kimi include la visione nativa tramite il suo encoder MoonViT fin da K2.5 (gennaio 2026) — l'encoder che la community ha letteralmente preso in prestito per dare occhi non ufficiali a V4-Flash prima che DeepSeek si mettesse al passo. K3 lo affianca a un modello di classe 2.8T e 1M di contesto. Compromesso: prezzi da modello di frontiera (riferimento K2.5: $0.45/1M input).
- Alibaba: la visione come scala di soluzioni. Qwen-VL spazia dai modelli open self-hostable (livelli small di Qwen3-VL) fino alla versione proprietaria Max: scegli il livello prezzo-prestazioni più adatto. Compromesso: l'ampiezza dell'offerta pone su di te la scelta, e la fatturazione delle immagini dipende dalla risoluzione invece di avere un tetto massimo.
Quale scegliere: tabella decisionale
| Il tuo carico di lavoro | Indirizza a |
|---|---|
| Loop di agenti su screenshot/UI ad alto volume, sensibili ai costi | deepseek-v4-flash-vision-exp — ≤384t/immagine a prezzi Flash |
| Ragionamento multimodale complesso su un modello open di frontiera | Kimi K3 — visione nativa + 2.8T + 1M ctx |
| Visione self-hosted / air-gapped | Livelli open di Qwen3-VL (o adapter della community per V4-Flash) |
| Un'unica integrazione, tutti i fornitori, fallback per modello | Relay compatibile con OpenAI per tutti e tre (siamo noi — lista d'attesa) |
A confronto con le API di visione occidentali
Per riferimento: Claude Sonnet 4.5 ha un prezzo di listino di $3/1M input, Grok 4.6 $2/1M, Gemini 3.7 Flash lancio a $0.75/1M (la nostra sintesi su Gemini). Vision-Exp batte tutti e tre con un costo per token da 1,7 a 13,6 volte inferiore e l'unico tetto massimo fisso per immagine; il catalogo di visione cinese nel suo complesso va ora da $0.13 a $0.45/1M input — una fascia di prezzo intoccabile per i listini occidentali. Tutti i dettagli sui costi nella nostra guida ai prezzi di Vision.
FAQ
Qual è il più economico per gli agenti ad alto utilizzo di immagini?
Vision-Exp, con ampio distacco: $0.22/1M input off-peak con immagini limitate a 384 token. 1.000 screenshot a dimensione massima ≈ $0.08 off-peak.
GLM-5.2/5.3 supporta la visione?
Non ancora — i modelli di punta 2026 di Zhipu sono solo testo al 21 ago 2026. Le opzioni di visione open dalla Cina sono Kimi (pesi annunciati) e i livelli Qwen-VL.
Vision-Exp è pronto per la produzione rispetto alla visione nativa di Kimi?
Profili di rischio differenti: Vision-Exp è sperimentale (possibile deriva/deprecazione) ma più economico; la visione di Kimi è distribuita in produzione da K2.5. Approccio consigliato: Vision-Exp per i costi, Kimi/Qwen-VL come fallback stabile a una sola opzione di configurazione di distanza.
Questi numeri sono stabili?
I prezzi delle API cinesi cambiano rapidamente (DeepSeek ha modificato i listini due volte da aprile). I dati di DeepSeek qui riportati sono ufficiali al 21 ago 2026; quelli di Kimi/Qwen provengono da tracker. Verifica nuovamente prima di approvare i budget.