ChinaModelAPI

Notizie / Model Watch · Strumenti

Open source DeepSeek Harness (dsh) Multimodale rc.7 / rc.8
2026-08-20 · Model Watch · rc.7 rilasciata il 17-08, rc.8 rilasciata il 19-08 (UTC)

DeepSeek Harness aggiunge l'input multimodale di immagini — l'harness ha ottenuto gli occhi, i modelli no

A una settimana dal rilascio open source di Harness v0.1, DeepSeek ha distribuito due release candidate che integrano l'input di immagini nel runtime degli agenti: rc.7 (allegati immagine persistenti) e rc.8 (richieste native di immagini per gli adapter DeepSeek, input di immagini per /goal e /plan). Gli analisti internazionali definiscono l'harness "un secondo momento DeepSeek". Ecco esattamente cosa è arrivato, cosa rimane solo testo e cosa dovrebbero fare gli sviluppatori di API.

Aggiornamento · 2026-08-21: DeepSeek ha lanciato ufficialmente deepseek-v4-flash-vision-exp — il modello ufficiale con supporto alla visione che questo articolo indicava come mancante. V4-Pro rimane solo testo. Leggi la sintesi del lancio con prezzi, codice di avvio rapido e guida al routing dei modelli →
Risposta diretta

DeepSeek Harness può ora gestire immagini end-to-end — e a partire dal 21 agosto, un modello ufficiale DeepSeek è finalmente in grado di leggerle. In base alle note di rilascio ufficiali: rc.7 (17 ago) ha aggiunto allegati immagine persistenti a MCP e ACP, con inoltro nidificato delle immagini in modalità PTC; rc.8 (19 ago) ha esteso il supporto multimodale con richieste native di immagini configurabili per gli adapter DeepSeek, input di immagini per /goal / /plan e riferimenti a file & sessioni nel menu @. Al momento della pubblicazione (20 ago) l'inghippo era che V4-Pro e V4-Flash erano ancora solo testo; il 21 agosto DeepSeek ha lanciato deepseek-v4-flash-vision-exp, il primo modello ufficiale di visione della famiglia Flash — sintesi del lancio qui. V4-Pro rimane solo testo. rc.8 adotta il tag npm next (latest è ancora rc.7) e il suo nuovo formato di archiviazione SQLite è incompatibile con le sessioni precedenti.

Cosa è stato rilasciato, secondo le fonti ufficiali

ElementoDettaglio
rc.7 · 2026-08-17 12:01 UTCAllegati immagine persistenti in MCP e ACP, inoltro nidificato delle immagini in modalità PTC; i plugin possono registrare le proprie schede delle impostazioni; le attività dei subagenti Codex e Claude Code si aggiungono al Job Panel; nuovo livello di sforzo di ragionamento low per i modelli DeepSeek (il valore predefinito rimane high); il preset inglese "Code mode" è stato rinominato in "PTC mode"
rc.8 · 2026-08-19 15:37 UTCEspansione multimodale: richieste native di immagini configurabili per gli adapter DeepSeek, input di immagini per /goal / /plan, riferimenti a file & sessioni nel menu @ (a cura di @LegGasai e @CreatixChu); subagenti Claude Code & Codex installabili su richiesta come Profile Bundles; PowerShell persistente su PTY Windows; web_search concorrente; download di dipendenze più leggeri; backend SQLite più veloce & compatto — formato di archiviazione incompatibile; "DeepSeek Harness" dichiarato marchio registrato con linee guida del brand
I fix più rilevantirc.8 risolve i fallimenti delle richieste ai modelli causati da immagini di dimensioni eccessive o da payload di immagini accumulati eccessivi — l'esatta modalità di errore in cui incorrono i loop di agenti ad alta densità di immagini — e corregge alcuni gateway personalizzati compatibili con OpenAI che fallivano a causa di differenze nel formato di richiesta o per contenuti di ragionamento mancanti
Canali npm (verificato il 20-08)latest → 0.1.0-rc.7; next → 0.1.0-rc.8. Il comando base npx @deepseek-ai/dsh punta ancora a rc.7; passa a rc.8 con npx @deepseek-ai/dsh@next
Dinamica del repository167.928 stelle / 17.953 fork (API GitHub, verificato il 2026-08-20) — in aumento rispetto agli oltre 149.000 citati da Turing Post nella pubblicazione del 17 agosto

Contesto: Harness v0.1 è stato reso open source il 13 agosto insieme alla GA di V4-Pro — consulta la nostra sintesi del lancio di v0.1 per l'architettura (struttura everything-is-a-plugin su Cordis, quattro modalità operative, licenza MIT).

La separazione: infrastruttura dell'harness vs capacità dei modelli

  • Ciò che è diventato multimodale è il runtime, non i modelli. Incolla un'immagine in dsh oggi e questa persisterà attraverso le chiamate agli strumenti MCP/ACP, verrà inoltrata tramite programmi in modalità PTC e potrà accompagnare i comandi di pianificazione /goal e /plan. Si tratta di un'infrastruttura reale che mancava nella v0.1 — i primi recensori avevano penalizzato lo stack della settimana di lancio proprio perché un modello solo testo non poteva analizzare un bug visivo di due righe.
  • I modelli API proprietari di DeepSeek erano ancora solo testo al momento della pubblicazione — e hanno acquisito la visione il giorno dopo. Il 21 agosto 2026, DeepSeek ha lanciato ufficialmente deepseek-v4-flash-vision-exp, un modello di visione sperimentale della famiglia Flash a prezzi invariati; V4-Pro rimane solo testo. Al momento della pubblicazione il changelog non riportava alcuna voce relativa alla visione dalla nota della GA di V4-Pro del 13 agosto, e una discussione di punta su Hugging Face relativa a V4-Pro lamentava la mancanza della "multimodalità nativa che ogni altro modello di punta cinese possiede ora, inclusi Qwen e Kimi" — esattamente la lacuna che il lancio ha appena colmato per Flash.
  • La documentazione ufficiale rende esplicito il pattern previsto. La tabella di risoluzione dei problemi del repository: se un'immagine viene rifiutata prima dell'invio, il modello "dichiara nessuna modalità immagine" — risolvi aggiungendo input: [text, image] alla voce del modello in $DSH_HOME/settings.yaml. In altre parole: attiva le richieste di immagini per un modello che possiede effettivamente la visione, tramite l'adapter di DeepSeek o qualsiasi endpoint compatibile con OpenAI.
  • Il divario di visione veniva già colmato dai plugin. modlens (autodefinito primo plugin di visione per dsh) consente di incollare un'immagine in una sessione solo testo e ottenere dati strutturati in JSON — OCR, layout, semantica — instradati attraverso un pool di motori di visione (una chiave Gemini gratuita, Antigravity CLI o qualsiasi endpoint compatibile con OpenAI; il suo README mostra esempi con Qwen-VL tramite la modalità compatibile di DashScope). Strumenti simili della community includono agent-vision-toolkit (Q&A su immagini, OCR di screenshot lunghi, ripristino UI, automazione GUI) e dsh-vision-router. Progetti della community, non affiliati a DeepSeek — la qualità varia.

Cosa dicono i media internazionali

  • Turing Post (17 ago) ha pubblicato l'analisi in lingua inglese più incisiva: "DeepSeek sta vivendo il suo secondo momento DeepSeek." La sua tesi: con R1, DeepSeek ha indebolito il vantaggio competitivo dei modelli; con Harness (MIT, oltre 149.000 stelle al momento della pubblicazione), sta "aprendo il livello che tutti avevano iniziato a considerare come il prossimo vantaggio competitivo" — il livello di esecuzione degli agenti. Ripercorre inoltre le origini di Cordis fino a Koishi, il framework per chatbot sviluppato da Shigma (ora in DeepSeek), i cui quattro anni di problemi legati al ciclo di vita dei plugin si sono rivelati problemi di runtime degli agenti.
  • Stampa della settimana di lancio (trattata nella nostra sintesi su v0.1): VentureBeat ha inquadrato dsh come un "rivale open source di Claude Code"; The Decoder ha tracciato il profilo dell'architettura e del responsabile di progetto Cui Tianyi (ex Jane Street); la prova pratica notturna di 36Kr ha rilevato 288 repository di plugin entro 24 ore; Pandaily l'ha strutturata come Modello + Harness = Agente.
  • I rilasci rc.7/rc.8 in sé sono stati seguiti per lo più da chi monitora i changelog e dall'ecosistema dei plugin piuttosto che dai media generalisti nelle prime 48 ore — le guide di terze parti (chat-deep.ai, dshdocs.com, freedom.tech) hanno registrato la riga sugli "allegati immagine persistenti" entro un giorno. Se segui la vicenda, segui le note di rilascio, non i titoli.
  • Su X, il thread di annuncio del progetto (@deepseek_ai, 13 ago) e i post del maintainer @tianyi restano i canali canonici; l'autore di modlens @liustack pubblica le note di rilascio prima su X — in linea con il baricentro dell'ecosistema situato nel repository e su X piuttosto che nei blog.

Perché questo è rilevante per uno stack di modelli cinesi

  • L'harness è gratuito; i token immagine sono la nuova variabile. Con V4-Pro soggetto a prezzi di punta e fuori punta (fuori punta $0.66 input / $1.98 output per 1M, di punta $1.32 / $3.96 — in base alla lettura della pagina ufficiale dei prezzi da parte di The Decoder), il costo del loop dell'agente si sposta ovunque vengano elaborate le immagini. Instradare le chiamate secondarie di visione verso un modello economico dotato di visione mentre i modelli di testo guidano il loop di programmazione è esattamente il pattern multi-modello per cui è stato creato il livello dei modelli dei plugin di dsh.
  • La correzione del gateway di rc.8 è direttamente rilevante per gli utenti dei relay. Il rilascio corregge i gateway personalizzati compatibili con OpenAI che fallivano a causa di differenze nel formato di richiesta o scartavano i contenuti di ragionamento — la tipologia di bug che colpisce chiunque colleghi dsh a un endpoint di terze parti anziché a chiavi dirette. Testa il tuo endpoint con rc.8 prima di incolpare l'harness.
  • Il ritmo dei breaking change è concreto e confermato. La v0.1 prometteva modifiche che avrebbero interrotto la compatibilità; rc.8 ne introduce una (formato di archiviazione SQLite incompatibile). Blocca la tua versione di dsh, mantieni i dati di sessione al di fuori del percorso di aggiornamento e verifica nuovamente dopo ogni incremento di rc — la serie sta ancora correndo verso una versione stabile 0.1.0.
  • Il branding è ora ufficiale. Le note di rc.8 chiariscono che "DeepSeek Harness" è un marchio registrato con linee guida del brand pubblicate — gli autori di plugin e costruttori di strumenti dovrebbero leggerle prima di denominare progetti derivati.
  • Inquadramento come progetto indipendente. dsh è il progetto open source di DeepSeek. ChinaModelAPI è un relay indipendente compatibile con OpenAI senza alcun legame ufficiale con esso o con DeepSeek — l'intersezione pratica è che un harness indipendente dal modello costituisce un client naturale per l'instradamento multi-modello, e gli ID dei modelli dotati di visione dovrebbero essere verificati in tempo reale nella dashboard del proprio provider prima di collegarli.

Fonti primarie

FAQ

dsh può leggere le immagini adesso?

L'harness può gestirle — incollare, persistere, inoltrare, pianificare con esse. La lettura avviene comunque nel modello: V4-Pro/V4-Flash sono solo testo, quindi indirizza il passaggio di visione a un modello dotato di visione tramite la configurazione dell'adapter o un endpoint compatibile con OpenAI.

Come posso provare rc.8?

npx @deepseek-ai/dsh@next — il tag latest risolve ancora rc.7. Il formato di archiviazione SQLite di rc.8 è incompatibile con le sessioni precedenti; esegui una nuova installazione, quindi aggiungi nuovamente la configurazione del tuo provider.

Vision-Exp è stato lanciato — e per quanto riguarda V4-Pro?

deepseek-v4-flash-vision-exp è diventato attivo il 21 ago 2026 — la nostra sintesi del lancio riporta prezzi, guida rapida e limiti. La visione per V4-Pro rimane non annunciata.

E per quanto riguarda il mio gateway personale?

Supportato e consolidato di recente — rc.8 risolve i problemi relativi al formato delle richieste e all'assenza di contenuti di ragionamento sui gateway personalizzati compatibili con OpenAI. Dichiara input: [text, image] sui modelli che accettano immagini affinché dsh le invii in modo nativo.

Guide correlate