ChinaModelAPI

Notizie / Model Watch · Rilascio ufficiale + Guida per sviluppatori

Rilascio ufficiale deepseek-v4-flash-vision-exp Vision API Prezzi Guida rapida
2026-08-21 · Model Watch · lanciato la sera del 21 agosto (UTC+8) dopo il rilascio graduale del 20 agosto

DeepSeek-V4-Flash-Vision-Exp (2026): lancio ufficiale, prezzi e guida rapida all'API da copiare e incollare

Due giorni dopo il teaser della balena mascotte e un giorno dopo la comparsa del nome negli elenchi API del rilascio graduale, DeepSeek l'ha reso realtà: deepseek-v4-flash-vision-exp, un modello multimodale sperimentale di comprensione visiva, è disponibile sull'API ufficiale dal 21 agosto 2026. La qualità del testo resta al pari di V4-Flash; le capacità per agenti multimodali si attestano "vicine a Opus-4.8"; i prezzi rimangono invariati rispetto a V4-Flash; e una nuova Files API viene rilasciata contestualmente. Questa guida contiene la cronologia del lancio, il calcolo dei prezzi a confronto con i modelli di visione occidentali, codice di avvio rapido funzionante e le indicazioni su quale modello DeepSeek instradare ciascun carico di lavoro.

Risposta diretta

DeepSeek-V4-Flash-Vision-Exp è un modello ufficiale di DeepSeek, lanciato il 21 agosto 2026, in base alla voce del changelog dell'API datata 2026-08-21. È possibile invocarlo con model='deepseek-v4-flash-vision-exp'; accetta testo + immagini tramite base64, URL esterni o la nuova Files API attraverso Chat Completions, la Messages API compatibile con Anthropic e la Responses API. In base alla pagina ufficiale dei prezzi costa esattamente quanto V4-Flash — $0.22 per 1M di token di input fuori punta ($0.44 nelle ore di punta) — e ogni immagine viene fatturata al massimo a 384 token. DeepSeek Harness v0.1.1-rc.1 lo supporta nativamente.

Dal teaser al lancio: la cronologia delle 72 ore

QuandoCosa è successo · fonte
18 giuL'app e il sito web di DeepSeek ottengono la visione delle immagini (solo nel prodotto, nessun modello API). I ricercatori su X: "La visione è ora attiva su web e app."
3–4 agoLa community non intende aspettare: l'adattatore MoonViT DeepSeek-V4-Flash-Vision-NVFP4 di WebBrain e 0731-vision di FlyCockpit arrivano su Hugging Face (maggiori dettagli di seguito).
19–20 agoIl ricercatore multimodale di DeepSeek Xiaokang Chen pubblica su X il teaser della balena con gli occhi aperti "Now, we see you. 👀" — TestingCatalog lo collega a un modello di visione in arrivo.
20 agoL'ID esatto del modello compare nella fase di rilascio graduale: screenshot dell'elenco dei modelli API che mostrano deepseek-v4-flash-vision-exp circolano su X (@NFT_Chen) e nel codice di DeepSeek Harness — documentazione non ancora aggiornata.
21 ago (sera UTC+8)Lancio ufficiale. Voce del changelog "DeepSeek-V4-Flash-Vision-Exp Release" (2026-08-21); la pagina dei prezzi, la guida a Vision e la guida alla Files API sono online; annuncio ufficiale su WeChat (copertura mediatica entro un'ora); DeepSeek Harness v0.1.1-rc.1 aggiunge il supporto nativo.

Nota dell'editore: una versione precedente di questo articolo, pubblicata la mattina del 21 agosto prima del lancio, concludeva che non esistesse alcun modello ufficiale — affermazione corretta a quell'ora (la documentazione non conteneva alcuna voce; il nome compariva solo nel rilascio graduale), ma smentita entro sera. I lanci ufficiali in giornata sono esattamente il motivo per cui apponiamo data e ora a ogni affermazione.

Cosa è stato rilasciato, secondo la documentazione ufficiale

  • Il modello. Modello sperimentale di comprensione visiva; model='deepseek-v4-flash-vision-exp'. Presentazione ufficiale: qualità del testo "al pari dell'ufficiale DeepSeek-V4-Flash", capacità degli agenti multimodali "vicine a Opus-4.8". V4-Pro non ha ricevuto funzionalità di visione — per ora è una capacità riservata alla famiglia Flash.
  • Tre modalità per inviare immagini. URL data: inline in base64; URL pubblico esterno dell'immagine (limite di 8.192 caratteri, timeout di download di 60s); oppure la Files API — caricamento una sola volta, riferimento tramite file_id. Tutti e tre gli endpoint funzionano: Chat Completions compatibile con OpenAI, Messages compatibile con Anthropic (la Files API richiede l'header anthropic-beta: files-api-2025-04-14) e Responses.
  • Limiti delle immagini. JPEG / PNG / GIF / WebP; 32 MiB per immagine inline o tramite URL, 64 MiB tramite file_id; fino a 600 immagini per richiesta; corpo della richiesta di 48 MiB (64 MiB totali per le immagini, 200 MiB con immagini tramite file_id); massimo 8.192 px per lato (4.096 px quando si inviano 15+ immagini).
  • La Files API (nuovo lancio separato). purpose=user_data; 64 MiB per file; 25 GiB e 10.000 file per utente; conservazione da 1 ora a 30 giorni o permanente; formato rilevato dal contenuto, non dall'estensione.
  • Supporto in Harness, lo stesso giorno. DeepSeek Harness v0.1.1-rc.1 (account ufficiale, 21 ago 18:22): "L'adattatore di modelli DeepSeek aggiunge l'opzione per il modello multimodale DeepSeek-V4-Flash-Vision-Exp e supporta la configurazione di richieste native di immagini" — l'infrastruttura per le immagini introdotta la scorsa settimana in rc.7/rc.8 ha ora un modello proprietario a cui collegarsi (vedere il nostro articolo su rc.7/rc.8).

Prezzi di deepseek-v4-flash-vision-exp (2026): identici a V4-Flash, immagini con tetto massimo a 384 token

deepseek-v4-flash-vision-exp costa quanto deepseek-v4-flash: $0.22 per 1M di token di input fuori punta, $0.44 nelle ore di punta, $0.66/$1.32 per l'output — e ogni immagine viene fatturata al massimo a 384 token. Le ore di punta sono UTC 01:00–04:00 e 06:00–10:00 (Pechino 09:00–12:00 e 14:00–18:00); la fascia fuori punta costa la metà rispetto alla fascia di punta.

Per 1M di token (USD)Non di puntaDi puntaNote
Input — cache hit$0.007$0.014Identico a deepseek-v4-flash
Input — cache miss$0.22$0.44≈ ¥1.5 / ¥3.0
Output$0.66$1.32≈ ¥4.5 / ¥9.0
Fatturazione immaginiRidimensionamento pre-inferenza: <~384×384 ingrandite, dimensioni superiori ridotte all'equivalente di ~800×800 pixelLimite massimo di 384 token per immagine — un'immagine 2000×2000 e una 5000×5000 costano lo stesso; ogni immagine in una richiesta con più immagini viene fatturata separatamente

Fonte: pagina ufficiale dei prezzi e guida all'uso dei token di Vision, consultate il 2026-08-21.

Quanto costa realmente un'immagine: vision-exp rispetto ai modelli di visione occidentali (2026)

Un'immagine di dimensioni massime su vision-exp costa al massimo $0.00017 nelle ore di punta ($0.000084 fuori punta) — circa 1.000 screenshot per meno di $0.09 fuori punta. I modelli occidentali dotati di visione fatturano le immagini in base al proprio conteggio di token (più elevato e variabile in base alla risoluzione) con prezzi per token da 1.7× a 13.6× più alti:

Modello (2026)Input $/1Mvs vision-expFatturazione immagini
deepseek-v4-flash-vision-exp$0.22 / $0.44 (fuori punta / punta)riferimento base≤384 token/immagine, limite fisso
Gemini 3.7 Flash (intro)$0.751.7–3.4×dipendente dalla risoluzione, nessun limite prefissato di 384 token
Grok 4.6$2.004.5–9.1×dipendente dalla risoluzione
Claude Sonnet 4.5$3.006.8–13.6×screenshot tipico ≈1.000+ token → ≈$0.003+/immagine (stima)

I prezzi di confronto sono i prezzi di listino tratti dalle pagine pubbliche dei prezzi per Claude Sonnet 4.5 e Grok 4.6 e dal prezzo di lancio pubblicato da Google per Gemini 3.7 Flash (il nostro articolo su Gemini 3.7); i conteggi dei token delle immagini dei concorrenti variano in base alla risoluzione e costituiscono delle stime. Il punto fondamentale resta valido: vision-exp combina il prezzo per token più basso della sua categoria con l'unico tetto massimo rigido di token per immagine.

Come chiamare deepseek-v4-flash-vision-exp: guida rapida (curl + Python)

L'API è compatibile con OpenAI — il formato standard dei messaggi di visione funziona così com'è su https://api.deepseek.com. Immagine tramite URL pubblico:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Describe the UI bug visible in this screenshot."},
        {"type": "image_url",
         "image_url": {"url": "https://example.com/screenshot.png"}}
      ]
    }]
  }'

La stessa chiamata in Python con l'SDK ufficiale di OpenAI — impostare base_url su DeepSeek e inserire l'immagine inline come base64:

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com")

resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Summarize this dashboard."},
            {"type": "image_url",
             "image_url": {"url": "data:image/png;base64,"}},
        ],
    }],
)
print(resp.choices[0].message.content)
  • JavaScript/Node: struttura identica con il pacchetto npm openai — è sufficiente sostituire baseURL e l'ID del modello.
  • Screenshot ripetuti (cicli di agenti): caricare una volta tramite la Files API (purpose="user_data"), quindi fare riferimento al file_id restituito — 64 MiB per immagine, senza doverla ricaricare a ogni passaggio. È il pattern utilizzato nativamente da DeepSeek Harness v0.1.1-rc.1.
  • Stack in stile Anthropic: funziona anche l'endpoint Messages; i riferimenti alla Files API richiedono l'header anthropic-beta: files-api-2025-04-14.
  • Tramite relay o gateway: qualsiasi proxy compatibile con OpenAI che inoltri i blocchi di contenuto image_url trasmette i payload di visione senza modifiche — verificare che il proprio gateway inoltri gli array di contenuti multiparte prima di attribuire errori al modello.

Quale modello DeepSeek scegliere: vision-exp vs v4-flash vs v4-pro

Il tuo carico di lavoroIndirizza aPerché
Testo + cicli di coding con agenti, chiamate di strumenti, contesto lungodeepseek-v4-flashModello GA stabile, stesso prezzo; nessun motivo per pagare il sovraccarico di elaborazione della visione per passaggi di solo testo
Screenshot, debug di interfacce utente, lettura di grafici/dashboard, immagini di documentideepseek-v4-flash-vision-expPrezzi di Flash + limite di 384 token per immagine; capacità per agenti multimodali vicine a Opus-4.8; sperimentale — bloccare la versione con l'ID
Ragionamento più complesso, massima qualità, contesto da 1Mdeepseek-v4-proIl modello DeepSeek più potente; ancora solo testo — abbinatelo a vision-exp per il passaggio relativo alle immagini
Visione nativa con pesi aperti, self-hostedKimi K3 / Qwen-VLvision-exp è disponibile solo tramite API; per la visione con pesi aperti consultare la nostra guida all'API di Kimi

Accedi ai modelli cinesi con visione tramite un unico endpoint compatibile con OpenAI

ChinaModelAPI è un relay indipendente che offre i modelli di frontiera cinesi — DeepSeek, Qwen, GLM, Kimi — agli sviluppatori di tutto il mondo attraverso un'unica API compatibile con OpenAI, con pagamenti in USDT/USD1 e senza abbonamento. I nuovi lanci di modelli come vision-exp sono esattamente ciò per cui la piattaforma è progettata: disponibilità immediata dal primo giorno, prezzi trasparenti per token e un'unica integrazione per l'intero catalogo di modelli cinesi.

ChinaModelAPI è un relay indipendente senza alcun legame ufficiale con DeepSeek. Gli ID dei modelli instradati vengono verificati attivamente prima del lancio — iscriviti alla lista d'attesa per ricevere una notifica quando l'instradamento per vision sarà disponibile.

Cosa cambia per gli adattatori della community (e la confusione generata)

  • Il conflitto di denominazione è risolto — a favore di DeepSeek. Per due settimane, "visione per V4-Flash" faceva riferimento ai checkpoint della community: DeepSeek-V4-Flash-Vision-NVFP4 di WebBrain (V4-Flash congelato + Kimi-K2.6 MoonViT congelato + un proiettore addestrato da 40.1M di parametri, 3 ago) e 0731-vision di FlyCockpit (4 ago). Il modello ufficiale detiene ora il nome — con supporto, documentazione e prezzi Flash che gli adattatori non possono eguagliare.
  • Gli adattatori non sono inutili — sono stati riposizionati. Se si esegue il self-hosting dei pesi di V4-Flash sulle proprie GPU e si desidera la visione offline/isolata (air-gapped), rimangono l'unica opzione; l'ufficiale vision-exp è disponibile solo via API e nessun peso per la visione è stato rilasciato come open source.
  • Il pattern dal rilascio graduale al lancio ufficiale è da tenere a mente. È il secondo rilascio di DeepSeek in un mese comparso nelle liste API o nel codice prima dell'aggiornamento della documentazione (V4-Flash-0731 ha seguito lo stesso iter). Per i gestori di relay e gli sviluppatori di strumenti: monitorare l'endpoint model-list e le note di rilascio di DSH è più efficace che aspettare il changelog.

Fonti primarie

Domande frequenti (2026)

vision-exp è ora ufficiale?

Sì — lanciato il 21 agosto 2026 con una voce datata nel changelog, documentazione online e annunci ufficiali. Gli screenshot del "rilascio graduale" del 20 agosto mostravano il modello reale in fase di staging, non un'indiscrezione.

Anche V4-Pro ha ottenuto la visione?

No. Solo la famiglia Flash ha ricevuto una variante con visione. V4-Pro rimane solo testo; non è stato annunciato se seguirà una versione con visione a livello Pro.

Come vengono tariffate le immagini?

Le immagini vengono ridimensionate all'equivalente di circa 800×800 pixel (minimo ~384×384), convertite in token e tariffate come input — con un limite massimo di 384 token per immagine. Un'immagine in 2K e una in 5K costano esattamente lo stesso.

I pesi open source sono disponibili?

No. Per ora vision-exp è disponibile solo via API. Chi esegue il self-hosting può continuare a usare gli adattatori della community (WebBrain NVFP4, FlyCockpit) come opzione offline — non ufficiali e non valutati rispetto a questo rilascio.

È disponibile su OpenRouter / provider di terze parti?

Al momento della pubblicazione (sera del 21 agosto UTC+8) il modello era erogato dalla piattaforma ufficiale di DeepSeek; la disponibilità su terze parti non era ancora confermata. Controlla l'elenco dei modelli attivi del tuo provider prima di instradare le richieste.

Input di video o PDF?

No — la documentazione ufficiale elenca solo l'input di immagini (JPEG/PNG/GIF/WebP). Per i documenti, estrarre le pagine come immagini lato client; per i video, campionare i fotogrammi.

Limiti di frequenza (rate limit)?

La pagina ufficiale dei prezzi indica una concorrenza di 2.500 per entrambi i modelli Flash (contro 500 per V4-Pro). Trattandosi di uno stato sperimentale i limiti possono cambiare — verificare nella documentazione.

Pronto per la produzione?

Considera seriamente la dicitura "Exp": possibili variazioni di comportamento, modifiche a prezzi/termini, oppure deprecazione/rinomina (la storia stessa di DeepSeek: preview → 0731 GA). Tieni una soluzione di riserva con visione nativa (Kimi K3, Qwen-VL) a portata di un semplice flag di configurazione.

Guide correlate