Notizie / Model Watch · Rilascio ufficiale + Guida per sviluppatori
DeepSeek-V4-Flash-Vision-Exp (2026): lancio ufficiale, prezzi e guida rapida all'API da copiare e incollare
Due giorni dopo il teaser della balena mascotte e un giorno dopo la comparsa del nome negli elenchi API del rilascio graduale, DeepSeek l'ha reso realtà: deepseek-v4-flash-vision-exp, un modello multimodale sperimentale di comprensione visiva, è disponibile sull'API ufficiale dal 21 agosto 2026. La qualità del testo resta al pari di V4-Flash; le capacità per agenti multimodali si attestano "vicine a Opus-4.8"; i prezzi rimangono invariati rispetto a V4-Flash; e una nuova Files API viene rilasciata contestualmente. Questa guida contiene la cronologia del lancio, il calcolo dei prezzi a confronto con i modelli di visione occidentali, codice di avvio rapido funzionante e le indicazioni su quale modello DeepSeek instradare ciascun carico di lavoro.
DeepSeek-V4-Flash-Vision-Exp è un modello ufficiale di DeepSeek, lanciato il 21 agosto 2026, in base alla voce del changelog dell'API datata 2026-08-21.
È possibile invocarlo con model='deepseek-v4-flash-vision-exp'; accetta testo + immagini tramite base64, URL esterni o la nuova Files API attraverso Chat Completions, la Messages API compatibile con Anthropic e la Responses API.
In base alla pagina ufficiale dei prezzi costa esattamente quanto V4-Flash — $0.22 per 1M di token di input fuori punta ($0.44 nelle ore di punta) — e ogni immagine viene fatturata al massimo a 384 token.
DeepSeek Harness v0.1.1-rc.1 lo supporta nativamente.
Dal teaser al lancio: la cronologia delle 72 ore
| Quando | Cosa è successo · fonte |
|---|---|
| 18 giu | L'app e il sito web di DeepSeek ottengono la visione delle immagini (solo nel prodotto, nessun modello API). I ricercatori su X: "La visione è ora attiva su web e app." |
| 3–4 ago | La community non intende aspettare: l'adattatore MoonViT DeepSeek-V4-Flash-Vision-NVFP4 di WebBrain e 0731-vision di FlyCockpit arrivano su Hugging Face (maggiori dettagli di seguito). |
| 19–20 ago | Il ricercatore multimodale di DeepSeek Xiaokang Chen pubblica su X il teaser della balena con gli occhi aperti "Now, we see you. 👀" — TestingCatalog lo collega a un modello di visione in arrivo. |
| 20 ago | L'ID esatto del modello compare nella fase di rilascio graduale: screenshot dell'elenco dei modelli API che mostrano deepseek-v4-flash-vision-exp circolano su X (@NFT_Chen) e nel codice di DeepSeek Harness — documentazione non ancora aggiornata. |
| 21 ago (sera UTC+8) | Lancio ufficiale. Voce del changelog "DeepSeek-V4-Flash-Vision-Exp Release" (2026-08-21); la pagina dei prezzi, la guida a Vision e la guida alla Files API sono online; annuncio ufficiale su WeChat (copertura mediatica entro un'ora); DeepSeek Harness v0.1.1-rc.1 aggiunge il supporto nativo. |
Nota dell'editore: una versione precedente di questo articolo, pubblicata la mattina del 21 agosto prima del lancio, concludeva che non esistesse alcun modello ufficiale — affermazione corretta a quell'ora (la documentazione non conteneva alcuna voce; il nome compariva solo nel rilascio graduale), ma smentita entro sera. I lanci ufficiali in giornata sono esattamente il motivo per cui apponiamo data e ora a ogni affermazione.
Cosa è stato rilasciato, secondo la documentazione ufficiale
- Il modello. Modello sperimentale di comprensione visiva;
model='deepseek-v4-flash-vision-exp'. Presentazione ufficiale: qualità del testo "al pari dell'ufficiale DeepSeek-V4-Flash", capacità degli agenti multimodali "vicine a Opus-4.8". V4-Pro non ha ricevuto funzionalità di visione — per ora è una capacità riservata alla famiglia Flash. - Tre modalità per inviare immagini. URL
data:inline in base64; URL pubblico esterno dell'immagine (limite di 8.192 caratteri, timeout di download di 60s); oppure la Files API — caricamento una sola volta, riferimento tramitefile_id. Tutti e tre gli endpoint funzionano: Chat Completions compatibile con OpenAI, Messages compatibile con Anthropic (la Files API richiede l'headeranthropic-beta: files-api-2025-04-14) e Responses. - Limiti delle immagini. JPEG / PNG / GIF / WebP; 32 MiB per immagine inline o tramite URL, 64 MiB tramite file_id; fino a 600 immagini per richiesta; corpo della richiesta di 48 MiB (64 MiB totali per le immagini, 200 MiB con immagini tramite file_id); massimo 8.192 px per lato (4.096 px quando si inviano 15+ immagini).
- La Files API (nuovo lancio separato). purpose=
user_data; 64 MiB per file; 25 GiB e 10.000 file per utente; conservazione da 1 ora a 30 giorni o permanente; formato rilevato dal contenuto, non dall'estensione. - Supporto in Harness, lo stesso giorno. DeepSeek Harness v0.1.1-rc.1 (account ufficiale, 21 ago 18:22): "L'adattatore di modelli DeepSeek aggiunge l'opzione per il modello multimodale DeepSeek-V4-Flash-Vision-Exp e supporta la configurazione di richieste native di immagini" — l'infrastruttura per le immagini introdotta la scorsa settimana in rc.7/rc.8 ha ora un modello proprietario a cui collegarsi (vedere il nostro articolo su rc.7/rc.8).
Prezzi di deepseek-v4-flash-vision-exp (2026): identici a V4-Flash, immagini con tetto massimo a 384 token
deepseek-v4-flash-vision-exp costa quanto deepseek-v4-flash: $0.22 per 1M di token di input fuori punta, $0.44 nelle ore di punta, $0.66/$1.32 per l'output — e ogni immagine viene fatturata al massimo a 384 token. Le ore di punta sono UTC 01:00–04:00 e 06:00–10:00 (Pechino 09:00–12:00 e 14:00–18:00); la fascia fuori punta costa la metà rispetto alla fascia di punta.
| Per 1M di token (USD) | Non di punta | Di punta | Note |
|---|---|---|---|
| Input — cache hit | $0.007 | $0.014 | Identico a deepseek-v4-flash |
| Input — cache miss | $0.22 | $0.44 | ≈ ¥1.5 / ¥3.0 |
| Output | $0.66 | $1.32 | ≈ ¥4.5 / ¥9.0 |
| Fatturazione immagini | Ridimensionamento pre-inferenza: <~384×384 ingrandite, dimensioni superiori ridotte all'equivalente di ~800×800 pixel | Limite massimo di 384 token per immagine — un'immagine 2000×2000 e una 5000×5000 costano lo stesso; ogni immagine in una richiesta con più immagini viene fatturata separatamente | |
Fonte: pagina ufficiale dei prezzi e guida all'uso dei token di Vision, consultate il 2026-08-21.
Quanto costa realmente un'immagine: vision-exp rispetto ai modelli di visione occidentali (2026)
Un'immagine di dimensioni massime su vision-exp costa al massimo $0.00017 nelle ore di punta ($0.000084 fuori punta) — circa 1.000 screenshot per meno di $0.09 fuori punta. I modelli occidentali dotati di visione fatturano le immagini in base al proprio conteggio di token (più elevato e variabile in base alla risoluzione) con prezzi per token da 1.7× a 13.6× più alti:
| Modello (2026) | Input $/1M | vs vision-exp | Fatturazione immagini |
|---|---|---|---|
| deepseek-v4-flash-vision-exp | $0.22 / $0.44 (fuori punta / punta) | riferimento base | ≤384 token/immagine, limite fisso |
| Gemini 3.7 Flash (intro) | $0.75 | 1.7–3.4× | dipendente dalla risoluzione, nessun limite prefissato di 384 token |
| Grok 4.6 | $2.00 | 4.5–9.1× | dipendente dalla risoluzione |
| Claude Sonnet 4.5 | $3.00 | 6.8–13.6× | screenshot tipico ≈1.000+ token → ≈$0.003+/immagine (stima) |
I prezzi di confronto sono i prezzi di listino tratti dalle pagine pubbliche dei prezzi per Claude Sonnet 4.5 e Grok 4.6 e dal prezzo di lancio pubblicato da Google per Gemini 3.7 Flash (il nostro articolo su Gemini 3.7); i conteggi dei token delle immagini dei concorrenti variano in base alla risoluzione e costituiscono delle stime. Il punto fondamentale resta valido: vision-exp combina il prezzo per token più basso della sua categoria con l'unico tetto massimo rigido di token per immagine.
Come chiamare deepseek-v4-flash-vision-exp: guida rapida (curl + Python)
L'API è compatibile con OpenAI — il formato standard dei messaggi di visione funziona così com'è su https://api.deepseek.com. Immagine tramite URL pubblico:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Describe the UI bug visible in this screenshot."},
{"type": "image_url",
"image_url": {"url": "https://example.com/screenshot.png"}}
]
}]
}'
La stessa chiamata in Python con l'SDK ufficiale di OpenAI — impostare base_url su DeepSeek e inserire l'immagine inline come base64:
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Summarize this dashboard."},
{"type": "image_url",
"image_url": {"url": "data:image/png;base64,"}},
],
}],
)
print(resp.choices[0].message.content)
- JavaScript/Node: struttura identica con il pacchetto npm
openai— è sufficiente sostituirebaseURLe l'ID del modello. - Screenshot ripetuti (cicli di agenti): caricare una volta tramite la Files API (
purpose="user_data"), quindi fare riferimento alfile_idrestituito — 64 MiB per immagine, senza doverla ricaricare a ogni passaggio. È il pattern utilizzato nativamente da DeepSeek Harness v0.1.1-rc.1. - Stack in stile Anthropic: funziona anche l'endpoint Messages; i riferimenti alla Files API richiedono l'header
anthropic-beta: files-api-2025-04-14. - Tramite relay o gateway: qualsiasi proxy compatibile con OpenAI che inoltri i blocchi di contenuto
image_urltrasmette i payload di visione senza modifiche — verificare che il proprio gateway inoltri gli array di contenuti multiparte prima di attribuire errori al modello.
Quale modello DeepSeek scegliere: vision-exp vs v4-flash vs v4-pro
| Il tuo carico di lavoro | Indirizza a | Perché |
|---|---|---|
| Testo + cicli di coding con agenti, chiamate di strumenti, contesto lungo | deepseek-v4-flash | Modello GA stabile, stesso prezzo; nessun motivo per pagare il sovraccarico di elaborazione della visione per passaggi di solo testo |
| Screenshot, debug di interfacce utente, lettura di grafici/dashboard, immagini di documenti | deepseek-v4-flash-vision-exp | Prezzi di Flash + limite di 384 token per immagine; capacità per agenti multimodali vicine a Opus-4.8; sperimentale — bloccare la versione con l'ID |
| Ragionamento più complesso, massima qualità, contesto da 1M | deepseek-v4-pro | Il modello DeepSeek più potente; ancora solo testo — abbinatelo a vision-exp per il passaggio relativo alle immagini |
| Visione nativa con pesi aperti, self-hosted | Kimi K3 / Qwen-VL | vision-exp è disponibile solo tramite API; per la visione con pesi aperti consultare la nostra guida all'API di Kimi |
Accedi ai modelli cinesi con visione tramite un unico endpoint compatibile con OpenAI
ChinaModelAPI è un relay indipendente che offre i modelli di frontiera cinesi — DeepSeek, Qwen, GLM, Kimi — agli sviluppatori di tutto il mondo attraverso un'unica API compatibile con OpenAI, con pagamenti in USDT/USD1 e senza abbonamento. I nuovi lanci di modelli come vision-exp sono esattamente ciò per cui la piattaforma è progettata: disponibilità immediata dal primo giorno, prezzi trasparenti per token e un'unica integrazione per l'intero catalogo di modelli cinesi.
ChinaModelAPI è un relay indipendente senza alcun legame ufficiale con DeepSeek. Gli ID dei modelli instradati vengono verificati attivamente prima del lancio — iscriviti alla lista d'attesa per ricevere una notifica quando l'instradamento per vision sarà disponibile.
Cosa cambia per gli adattatori della community (e la confusione generata)
- Il conflitto di denominazione è risolto — a favore di DeepSeek. Per due settimane, "visione per V4-Flash" faceva riferimento ai checkpoint della community: DeepSeek-V4-Flash-Vision-NVFP4 di WebBrain (V4-Flash congelato + Kimi-K2.6 MoonViT congelato + un proiettore addestrato da 40.1M di parametri, 3 ago) e 0731-vision di FlyCockpit (4 ago). Il modello ufficiale detiene ora il nome — con supporto, documentazione e prezzi Flash che gli adattatori non possono eguagliare.
- Gli adattatori non sono inutili — sono stati riposizionati. Se si esegue il self-hosting dei pesi di V4-Flash sulle proprie GPU e si desidera la visione offline/isolata (air-gapped), rimangono l'unica opzione; l'ufficiale vision-exp è disponibile solo via API e nessun peso per la visione è stato rilasciato come open source.
- Il pattern dal rilascio graduale al lancio ufficiale è da tenere a mente. È il secondo rilascio di DeepSeek in un mese comparso nelle liste API o nel codice prima dell'aggiornamento della documentazione (V4-Flash-0731 ha seguito lo stesso iter). Per i gestori di relay e gli sviluppatori di strumenti: monitorare l'endpoint model-list e le note di rilascio di DSH è più efficace che aspettare il changelog.
Fonti primarie
- Changelog dell'API di DeepSeek — voce "DeepSeek-V4-Flash-Vision-Exp Release" datata 2026-08-21
- Prezzi ufficiali di DeepSeek — vision-exp identico a V4-Flash; fasce di punta/fuori punta; concorrenza 2.500
- Guida a DeepSeek Vision — metodi di inserimento delle immagini, limiti, regola dei 384 token per immagine
- Guida alla Files API di DeepSeek — formati, 64 MiB/file, 25 GiB e 10.000 file per utente
- Account ufficiale WeChat di DeepSeek Harness — v0.1.1-rc.1 aggiunge l'opzione per il modello vision-exp e le richieste native di immagini (2026-08-21)
- ifanr — Notizia dell'ultima ora: rilascio del modello multimodale DeepSeek, la balena apre finalmente gli occhi (2026-08-21, con screenshot dei prezzi)
- X — @NFT_Chen: screenshot del rilascio graduale di vision-exp nell'elenco API (2026-08-20)
- TestingCatalog — teaser con gli occhi della balena del ricercatore multimodale di DeepSeek Xiaokang Chen (19–20 ago)
- LINUX DO — Annuncio ufficiale del rilascio di DeepSeek-V4-Flash-Vision-Exp (2026-08-21, discussione della community e tabella dei prezzi)
- Hugging Face — adattatore della community di WebBrain (contesto: l'ecosistema pre-lancio)
Domande frequenti (2026)
vision-exp è ora ufficiale?
Sì — lanciato il 21 agosto 2026 con una voce datata nel changelog, documentazione online e annunci ufficiali. Gli screenshot del "rilascio graduale" del 20 agosto mostravano il modello reale in fase di staging, non un'indiscrezione.
Anche V4-Pro ha ottenuto la visione?
No. Solo la famiglia Flash ha ricevuto una variante con visione. V4-Pro rimane solo testo; non è stato annunciato se seguirà una versione con visione a livello Pro.
Come vengono tariffate le immagini?
Le immagini vengono ridimensionate all'equivalente di circa 800×800 pixel (minimo ~384×384), convertite in token e tariffate come input — con un limite massimo di 384 token per immagine. Un'immagine in 2K e una in 5K costano esattamente lo stesso.
I pesi open source sono disponibili?
No. Per ora vision-exp è disponibile solo via API. Chi esegue il self-hosting può continuare a usare gli adattatori della community (WebBrain NVFP4, FlyCockpit) come opzione offline — non ufficiali e non valutati rispetto a questo rilascio.
È disponibile su OpenRouter / provider di terze parti?
Al momento della pubblicazione (sera del 21 agosto UTC+8) il modello era erogato dalla piattaforma ufficiale di DeepSeek; la disponibilità su terze parti non era ancora confermata. Controlla l'elenco dei modelli attivi del tuo provider prima di instradare le richieste.
Input di video o PDF?
No — la documentazione ufficiale elenca solo l'input di immagini (JPEG/PNG/GIF/WebP). Per i documenti, estrarre le pagine come immagini lato client; per i video, campionare i fotogrammi.
Limiti di frequenza (rate limit)?
La pagina ufficiale dei prezzi indica una concorrenza di 2.500 per entrambi i modelli Flash (contro 500 per V4-Pro). Trattandosi di uno stato sperimentale i limiti possono cambiare — verificare nella documentazione.
Pronto per la produzione?
Considera seriamente la dicitura "Exp": possibili variazioni di comportamento, modifiche a prezzi/termini, oppure deprecazione/rinomina (la storia stessa di DeepSeek: preview → 0731 GA). Tieni una soluzione di riserva con visione nativa (Kimi K3, Qwen-VL) a portata di un semplice flag di configurazione.