ChinaModelAPI

Guide / Modelli vision cinesi 2026

Confronto · aggiornato il 2026-08-21 · Dati DeepSeek ufficiali; Kimi/Qwen rilevati da tracker

API dei modelli vision cinesi nel 2026: DeepSeek Vision-Exp vs Qwen-VL vs Kimi

Ogni laboratorio di frontiera cinese offre ormai un'API con funzionalità di visione. deepseek-v4-flash-vision-exp di DeepSeek (21 ago 2026) è l'opzione avanzata più recente ed economica; la famiglia Qwen-VL di Alibaba è la più ampia; la linea Kimi di Moonshot supporta la visione nativa da più tempo. Questa pagina mette a confronto i fattori chiave per le decisioni di routing — capacità, prezzi, contesto, open weights — con fonti indicate per ciascuna riga.

Risposta diretta

Routing in base ai vincoli: visione avanzata più economica → deepseek-v4-flash-vision-exp ($0.22/1M input off-peak, ≤384 token per immagine, agente multimodale vicino a Opus-4.8); visione di frontiera open-weights + 1M di contesto → Kimi K3; gamma più ampia, dai modelli leggeri self-hostable al proprietario Max → famiglia Qwen3-VL. Tutti e tre supportano il formato compatibile con OpenAI, quindi un unico gateway può gestirli tutti con fallback per modello.

Tabella comparativa 2026

ModelloVisioneContestoInput $/1MPesi apertiNote
deepseek-v4-flash-vision-exp
DeepSeek · 21 ago 2026 · ufficiale
✓ sperimentale 1M $0.22 / $0.44
≤384 t/immagine
✗ (solo API) Parità di testo con V4-Flash; agente multimodale ≈ Opus-4.8; nuova Files API
Kimi K3
Moonshot · lug 2026
✓ nativa (MoonViT) 1M K3 da annunciare
Rif. K2.5: $0.45 (tracker)
✓ annunciati Top di gamma classe 2.8T; visione da K2.5 (gen 2026, encoder MoonViT da 400M)
Famiglia Qwen3-VL
Alibaba · 2025–2026
✓ nativa fino a 1M
(3.6 Plus)
da ~$0.13
(VL 30B, tracker)
✓ livelli small/mid Gamma più ampia: open small → Qwen3.6 Plus ($0.325, tracker) → proprietario VL-Max; tramite DashScope
GLM-5.2 / 5.3
Zhipu · 2026
✗ solo testo 1M $1.40 Incluso per completezza — i migliori modelli di punta open cinesi per il coding non supportano ancora la visione

Riga DeepSeek dalla documentazione ufficiale (21 ago 2026). Dati Kimi/Qwen dai tracker pubblici dei modelli (pagine modello di Roboflow, AIViewer; aggiornati al 14–20 ago 2026) e dalla nostra guida all'API Kimi — verifica per ciascun livello nella console del rispettivo fornitore prima di pianificare il budget.

Tre famiglie, tre filosofie

  • DeepSeek: la visione come arma di prezzo. Vision-Exp non è un prodotto premium separato: è lo stesso V4-Flash allo stesso prezzo per token con un limite di 384 token per immagine. La mossa mira a rendere la visione sufficientemente economica da poter essere inserita in ogni loop di agenti. Compromesso: è sperimentale, disponibile solo via API, solo per la famiglia Flash (nessuna visione per V4-Pro al momento).
  • Moonshot: la visione come funzionalità nativa di punta. Kimi include la visione nativa tramite il suo encoder MoonViT fin da K2.5 (gennaio 2026) — l'encoder che la community ha letteralmente preso in prestito per dare occhi non ufficiali a V4-Flash prima che DeepSeek si mettesse al passo. K3 lo affianca a un modello di classe 2.8T e 1M di contesto. Compromesso: prezzi da modello di frontiera (riferimento K2.5: $0.45/1M input).
  • Alibaba: la visione come scala di soluzioni. Qwen-VL spazia dai modelli open self-hostable (livelli small di Qwen3-VL) fino alla versione proprietaria Max: scegli il livello prezzo-prestazioni più adatto. Compromesso: l'ampiezza dell'offerta pone su di te la scelta, e la fatturazione delle immagini dipende dalla risoluzione invece di avere un tetto massimo.

Quale scegliere: tabella decisionale

Il tuo carico di lavoroIndirizza a
Loop di agenti su screenshot/UI ad alto volume, sensibili ai costideepseek-v4-flash-vision-exp — ≤384t/immagine a prezzi Flash
Ragionamento multimodale complesso su un modello open di frontieraKimi K3 — visione nativa + 2.8T + 1M ctx
Visione self-hosted / air-gappedLivelli open di Qwen3-VL (o adapter della community per V4-Flash)
Un'unica integrazione, tutti i fornitori, fallback per modelloRelay compatibile con OpenAI per tutti e tre (siamo noi — lista d'attesa)

A confronto con le API di visione occidentali

Per riferimento: Claude Sonnet 4.5 ha un prezzo di listino di $3/1M input, Grok 4.6 $2/1M, Gemini 3.7 Flash lancio a $0.75/1M (la nostra sintesi su Gemini). Vision-Exp batte tutti e tre con un costo per token da 1,7 a 13,6 volte inferiore e l'unico tetto massimo fisso per immagine; il catalogo di visione cinese nel suo complesso va ora da $0.13 a $0.45/1M input — una fascia di prezzo intoccabile per i listini occidentali. Tutti i dettagli sui costi nella nostra guida ai prezzi di Vision.

FAQ

Qual è il più economico per gli agenti ad alto utilizzo di immagini?

Vision-Exp, con ampio distacco: $0.22/1M input off-peak con immagini limitate a 384 token. 1.000 screenshot a dimensione massima ≈ $0.08 off-peak.

GLM-5.2/5.3 supporta la visione?

Non ancora — i modelli di punta 2026 di Zhipu sono solo testo al 21 ago 2026. Le opzioni di visione open dalla Cina sono Kimi (pesi annunciati) e i livelli Qwen-VL.

Vision-Exp è pronto per la produzione rispetto alla visione nativa di Kimi?

Profili di rischio differenti: Vision-Exp è sperimentale (possibile deriva/deprecazione) ma più economico; la visione di Kimi è distribuita in produzione da K2.5. Approccio consigliato: Vision-Exp per i costi, Kimi/Qwen-VL come fallback stabile a una sola opzione di configurazione di distanza.

Questi numeri sono stabili?

I prezzi delle API cinesi cambiano rapidamente (DeepSeek ha modificato i listini due volte da aprile). I dati di DeepSeek qui riportati sono ufficiali al 21 ago 2026; quelli di Kimi/Qwen provengono da tracker. Verifica nuovamente prima di approvare i budget.

Correlati