Notizie / Model Watch · Strumenti
DeepSeek Harness v0.1: DeepSeek rende open source il suo harness per agenti
Poche ore dopo il rilascio di DeepSeek-V4-Pro-0813, DeepSeek ha lanciato Harness v0.1 in Developer Preview — il framework per agenti open source con licenza MIT utilizzato per eseguire i benchmark dei propri modelli. La stampa estera lo ha subito definito un rivale aperto di Claude Code e OpenAI Codex. Ecco di cosa si tratta realmente, cosa è emerso dalle prime prove pratiche e quali sono le implicazioni per chi sviluppa con le API.
Aggiornamento · 2026-08-20: Harness compie i suoi primi passi nel multimodale — rc.7 (17 ago) ha introdotto allegati immagine persistenti per MCP/ACP; rc.8 (19 ago) ha aggiunto richieste native di immagini configurabili per gli adapter DeepSeek e l'input di immagini per /goal e /plan. I modelli V4 di DeepSeek rimangono solo testo. Leggi l'approfondimento successivo →
DeepSeek Harness (dsh) è un harness per agenti gratuito, con licenza MIT ed eseguibile localmente — ed è agnostico rispetto al modello.
Annunciato dall'account X ufficiale di DeepSeek il 13 ago 2026 (21:02 UTC+8) e pubblicato su
github.com/deepseek-ai/deepseek-harness.
Tutto — strumenti, sandbox, sessioni, UI — è un plugin intercambiabile basato sul sistema di plugin Cordis. Avvialo con
npx @deepseek-ai/dsh web (Web UI su 127.0.0.1:3080).
È una developer preview v0.1 con modifiche incompatibili già annunciate — valutalo, ma non puntarci ancora per la produzione.
Cosa è stato rilasciato, secondo le fonti ufficiali
| Elemento | Dettaglio |
|---|---|
| Cosa | DeepSeek Harness v0.1 — Developer Preview di un harness per agenti open source (dsh) |
| Quando | Annunciato il 2026-08-13 alle 21:02 (UTC+8) su X; repository reso pubblico la sera stessa |
| Licenza | MIT |
| Architettura | "Tutto è un plugin" su Cordis; strumenti / sandbox / sessioni / UI sono tutti sostituibili |
| Avvio | npx @deepseek-ai/dsh web → Web UI locale su 127.0.0.1:3080 |
| Avvertenza sullo stato | Iterazione rapida; "CI SARANNO MODIFICHE INCOMPATIBILI CON LE VERSIONI PRECEDENTI" (README) |
| Riferimenti nella documentazione ufficiale | Il changelog delle API di DeepSeek segnala che i benchmark pubblici di V4-Flash sono stati eseguiti nella "modalità minimale" di Harness; la barra laterale della documentazione ora rimanda ai documenti di Harness |
La stessa sera, DeepSeek-V4-Pro-0813 è entrato in GA su app/web/API con supporto nativo per le Responses API e adattamento a Codex — consulta il nostro report sul rilascio del 0813; la variazione dei prezzi di punta/fuori punta entrerà in vigore il 16 ago alle 16:00 UTC.
Cosa dicono i media internazionali
- VentureBeat ha inquadrato direttamente il lancio: un "rivale open source di Claude Code" rilasciato insieme a V4-Pro sulle API "con prezzi più alti" — la doppia faccia della notizia della settimana: strumenti più economici, token dei modelli di punta più cari.
- The Decoder evidenzia l'architettura e la genesi del progetto: "tutte le funzionalità sono plugin intercambiabili" sul neonato sistema Cordis; i log persistenti delle sessioni registrano ogni prompt, chiamata a tool e risultato, con esecuzioni che possono essere riprese, ramificate e riprodotte; la modalità minimale mantiene solo una shell e un editor di file — la configurazione utilizzata dalla stessa DeepSeek per le sessioni di benchmark. Sottolinea inoltre che il responsabile del progetto è Cui Tianyi, arrivato in DeepSeek da Jane Street nel marzo 2026, e che la selezione dei tester ha raccolto 712 candidature in tre giorni.
- 36Kr (English) ha pubblicato una prova pratica notturna con una tesi diretta — "Non è semplicemente un altro Claude Code, è qui per battere Claude Code" — e riscontri concreti: quattro modalità operative (standard; PTC, in cui il modello scrive TypeScript che raggruppa circa 10 round di chiamate a tool in un'unica esecuzione; minimale per i benchmark; e una modalità di creazione per sviluppare nuove modalità); log di traiettoria append-only; 288 repository di plugin entro 24 ore; caricamento a caldo di oltre 20 plugin con zero riavvii grazie al tracciamento degli effetti collaterali reversibili di Cordis; e l'importazione delle sessioni da Claude Code, opencode e Antigravity che "ha funzionato alla perfezione". L'osservazione più acuta: il modello non occupa una posizione privilegiata — "I modelli stessi di DeepSeek non fanno eccezione. Sono semplicemente un altro plugin."
- Pandaily lo ha definito forse "il progetto open source per agenti più ambizioso dell'anno", strutturandolo attorno all'equazione Model + Harness = Agent.
- Reddit (r/LocalLLaMA, r/DeepSeek) ha ripreso immediatamente il repository; i thread della community segnalano le build Desktop/CLI e il fatto che i benchmark degli agenti pubblicati da DeepSeek girano tutti attraverso questo harness.
- SCMP aveva precedentemente riferito che DeepSeek "rafforza l'IA agentica con i test dell'harness" — un utile elemento di contesto che dimostra come questo rilascio fosse annunciato e non improvvisato.
Perché questo è rilevante per uno stack di modelli cinesi
- L'harness è gratuito; il vero costo sono i token. Con il passaggio di V4-Pro ai prezzi di punta/fuori punta (fuori punta $0.66 input / $1.98 output per 1M; nelle ore di punta il doppio; i costi per i cache hit sono quelli aumentati di più — secondo l'analisi della pagina ufficiale dei prezzi di The Decoder), l'economia dei cicli di agenti si sposta verso modelli più economici e open-weight per il lavoro massivo. È esattamente qui che si inserisce un gateway multimodello compatibile con OpenAI.
- Agnostico rispetto al modello fin dalla progettazione. Il livello del modello è un plugin; esistono già plugin di routing sviluppati dalla community. Indirizzare
dshverso un endpoint compatibile con OpenAI (tier DeepSeek, Qwen, GLM, Kimi) è il pattern previsto, non un espediente — verifica i termini del tuo provider e il supporto al tool-calling per ciascun modello. - I log di traiettoria rappresentano una svolta per il debugging. I log append-only con funzionalità di ripresa/ramificazione/riproduzione rendono ispezionabili le lunghe sessioni degli agenti — una risorsa preziosa quando si eseguono test A/B per determinare quale modello di frontiera cinese gestisca meglio i task su scala di repository.
- L'importazione delle sessioni riduce i costi di transizione. Se disponi di una cronologia su Claude Code o opencode, la prova pratica di 36Kr dimostra che puoi importarla facilmente — un dettaglio prezioso prima di scegliere il tuo prossimo harness.
- Non migrare ancora in produzione. È una preview v0.1 con modifiche incompatibili già preannunciate, e gran parte della UX dipende attualmente da plugin della community in rapida evoluzione e di qualità variabile. Testalo in sandbox, usalo per i benchmark e rivalutalo a partire dalla v0.2+.
Fonti primarie
- github.com/deepseek-ai/deepseek-harness (repo ufficiale: MIT, developer preview, Cordis, istruzioni per l'avvio)
- DeepSeek su X — Annuncio della Developer Preview di Harness v0.1 (2026-08-13)
- Changelog delle API di DeepSeek — V4-Pro-0813 GA, nota sui benchmark in modalità minimale di Harness, prezzi del 16 ago
- The Decoder — DeepSeek lancia una versione migliorata di V4 Pro, aumenta i prezzi delle API e rende open source il suo software per agenti
- VentureBeat — DeepSeek Harness debutta come rivale open source di Claude Code
- 36Kr English — Dopo aver testato DeepSeek Harness tutta la notte (quattro modalità, plugin, importazione sessioni)
- Pandaily — Prova pratica di DeepSeek Harness: quattro modalità di lavoro, Model + Harness = Agent
- SCMP — DeepSeek potenzia l'IA agentica con i test dell'harness (contesto pre-rilascio)
FAQ
DeepSeek Harness è gratuito?
L'harness in sé è gratuito e con licenza MIT. Si pagano solo i token del modello — tramite le API di DeepSeek o qualsiasi provider compatibile con OpenAI a cui viene indirizzato.
Il killer di Claude Code?
Le prime impressioni d'oltreoceano sono positive ma realistiche: è una versione v0.1, sono previste modifiche incompatibili e la qualità dei plugin è eterogenea. È il primo harness open source realizzato da un laboratorio di frontiera con un'architettura interna pensata per i benchmark: un solido contendente, ma non ancora un sostituto ad oggi.
Posso usarlo con Qwen / GLM / Kimi?
A livello di architettura sì — il modello è semplicemente un altro plugin ed esistono già plugin di routing. Verifica il supporto al tool-calling e i termini specifici di ciascun provider; gli utenti di ChinaModelAPI devono verificare gli ID dei modelli attivi nella dashboard.
Cos'è la "modalità minimale"?
Solo shell ed editor di file, senza funzionalità superflue — la configurazione utilizzata da DeepSeek per valutare le prestazioni pure del modello. Usala per ottenere confronti omogenei tra modelli diversi.