ChinaModelAPI

Notizie / Model Watch · Strumenti

Open source DeepSeek Harness (dsh) Harness per agenti MIT
2026-08-14 · Model Watch · rilasciato la sera del 2026-08-13 (UTC+8)

DeepSeek Harness v0.1: DeepSeek rende open source il suo harness per agenti

Poche ore dopo il rilascio di DeepSeek-V4-Pro-0813, DeepSeek ha lanciato Harness v0.1 in Developer Preview — il framework per agenti open source con licenza MIT utilizzato per eseguire i benchmark dei propri modelli. La stampa estera lo ha subito definito un rivale aperto di Claude Code e OpenAI Codex. Ecco di cosa si tratta realmente, cosa è emerso dalle prime prove pratiche e quali sono le implicazioni per chi sviluppa con le API.

Aggiornamento · 2026-08-20: Harness compie i suoi primi passi nel multimodale — rc.7 (17 ago) ha introdotto allegati immagine persistenti per MCP/ACP; rc.8 (19 ago) ha aggiunto richieste native di immagini configurabili per gli adapter DeepSeek e l'input di immagini per /goal e /plan. I modelli V4 di DeepSeek rimangono solo testo. Leggi l'approfondimento successivo →

Risposta diretta

DeepSeek Harness (dsh) è un harness per agenti gratuito, con licenza MIT ed eseguibile localmente — ed è agnostico rispetto al modello. Annunciato dall'account X ufficiale di DeepSeek il 13 ago 2026 (21:02 UTC+8) e pubblicato su github.com/deepseek-ai/deepseek-harness. Tutto — strumenti, sandbox, sessioni, UI — è un plugin intercambiabile basato sul sistema di plugin Cordis. Avvialo con npx @deepseek-ai/dsh web (Web UI su 127.0.0.1:3080). È una developer preview v0.1 con modifiche incompatibili già annunciate — valutalo, ma non puntarci ancora per la produzione.

Cosa è stato rilasciato, secondo le fonti ufficiali

ElementoDettaglio
CosaDeepSeek Harness v0.1 — Developer Preview di un harness per agenti open source (dsh)
QuandoAnnunciato il 2026-08-13 alle 21:02 (UTC+8) su X; repository reso pubblico la sera stessa
LicenzaMIT
Architettura"Tutto è un plugin" su Cordis; strumenti / sandbox / sessioni / UI sono tutti sostituibili
Avvionpx @deepseek-ai/dsh web → Web UI locale su 127.0.0.1:3080
Avvertenza sullo statoIterazione rapida; "CI SARANNO MODIFICHE INCOMPATIBILI CON LE VERSIONI PRECEDENTI" (README)
Riferimenti nella documentazione ufficialeIl changelog delle API di DeepSeek segnala che i benchmark pubblici di V4-Flash sono stati eseguiti nella "modalità minimale" di Harness; la barra laterale della documentazione ora rimanda ai documenti di Harness

La stessa sera, DeepSeek-V4-Pro-0813 è entrato in GA su app/web/API con supporto nativo per le Responses API e adattamento a Codex — consulta il nostro report sul rilascio del 0813; la variazione dei prezzi di punta/fuori punta entrerà in vigore il 16 ago alle 16:00 UTC.

Cosa dicono i media internazionali

  • VentureBeat ha inquadrato direttamente il lancio: un "rivale open source di Claude Code" rilasciato insieme a V4-Pro sulle API "con prezzi più alti" — la doppia faccia della notizia della settimana: strumenti più economici, token dei modelli di punta più cari.
  • The Decoder evidenzia l'architettura e la genesi del progetto: "tutte le funzionalità sono plugin intercambiabili" sul neonato sistema Cordis; i log persistenti delle sessioni registrano ogni prompt, chiamata a tool e risultato, con esecuzioni che possono essere riprese, ramificate e riprodotte; la modalità minimale mantiene solo una shell e un editor di file — la configurazione utilizzata dalla stessa DeepSeek per le sessioni di benchmark. Sottolinea inoltre che il responsabile del progetto è Cui Tianyi, arrivato in DeepSeek da Jane Street nel marzo 2026, e che la selezione dei tester ha raccolto 712 candidature in tre giorni.
  • 36Kr (English) ha pubblicato una prova pratica notturna con una tesi diretta — "Non è semplicemente un altro Claude Code, è qui per battere Claude Code" — e riscontri concreti: quattro modalità operative (standard; PTC, in cui il modello scrive TypeScript che raggruppa circa 10 round di chiamate a tool in un'unica esecuzione; minimale per i benchmark; e una modalità di creazione per sviluppare nuove modalità); log di traiettoria append-only; 288 repository di plugin entro 24 ore; caricamento a caldo di oltre 20 plugin con zero riavvii grazie al tracciamento degli effetti collaterali reversibili di Cordis; e l'importazione delle sessioni da Claude Code, opencode e Antigravity che "ha funzionato alla perfezione". L'osservazione più acuta: il modello non occupa una posizione privilegiata — "I modelli stessi di DeepSeek non fanno eccezione. Sono semplicemente un altro plugin."
  • Pandaily lo ha definito forse "il progetto open source per agenti più ambizioso dell'anno", strutturandolo attorno all'equazione Model + Harness = Agent.
  • Reddit (r/LocalLLaMA, r/DeepSeek) ha ripreso immediatamente il repository; i thread della community segnalano le build Desktop/CLI e il fatto che i benchmark degli agenti pubblicati da DeepSeek girano tutti attraverso questo harness.
  • SCMP aveva precedentemente riferito che DeepSeek "rafforza l'IA agentica con i test dell'harness" — un utile elemento di contesto che dimostra come questo rilascio fosse annunciato e non improvvisato.

Perché questo è rilevante per uno stack di modelli cinesi

  • L'harness è gratuito; il vero costo sono i token. Con il passaggio di V4-Pro ai prezzi di punta/fuori punta (fuori punta $0.66 input / $1.98 output per 1M; nelle ore di punta il doppio; i costi per i cache hit sono quelli aumentati di più — secondo l'analisi della pagina ufficiale dei prezzi di The Decoder), l'economia dei cicli di agenti si sposta verso modelli più economici e open-weight per il lavoro massivo. È esattamente qui che si inserisce un gateway multimodello compatibile con OpenAI.
  • Agnostico rispetto al modello fin dalla progettazione. Il livello del modello è un plugin; esistono già plugin di routing sviluppati dalla community. Indirizzare dsh verso un endpoint compatibile con OpenAI (tier DeepSeek, Qwen, GLM, Kimi) è il pattern previsto, non un espediente — verifica i termini del tuo provider e il supporto al tool-calling per ciascun modello.
  • I log di traiettoria rappresentano una svolta per il debugging. I log append-only con funzionalità di ripresa/ramificazione/riproduzione rendono ispezionabili le lunghe sessioni degli agenti — una risorsa preziosa quando si eseguono test A/B per determinare quale modello di frontiera cinese gestisca meglio i task su scala di repository.
  • L'importazione delle sessioni riduce i costi di transizione. Se disponi di una cronologia su Claude Code o opencode, la prova pratica di 36Kr dimostra che puoi importarla facilmente — un dettaglio prezioso prima di scegliere il tuo prossimo harness.
  • Non migrare ancora in produzione. È una preview v0.1 con modifiche incompatibili già preannunciate, e gran parte della UX dipende attualmente da plugin della community in rapida evoluzione e di qualità variabile. Testalo in sandbox, usalo per i benchmark e rivalutalo a partire dalla v0.2+.

Fonti primarie

FAQ

DeepSeek Harness è gratuito?

L'harness in sé è gratuito e con licenza MIT. Si pagano solo i token del modello — tramite le API di DeepSeek o qualsiasi provider compatibile con OpenAI a cui viene indirizzato.

Il killer di Claude Code?

Le prime impressioni d'oltreoceano sono positive ma realistiche: è una versione v0.1, sono previste modifiche incompatibili e la qualità dei plugin è eterogenea. È il primo harness open source realizzato da un laboratorio di frontiera con un'architettura interna pensata per i benchmark: un solido contendente, ma non ancora un sostituto ad oggi.

Posso usarlo con Qwen / GLM / Kimi?

A livello di architettura sì — il modello è semplicemente un altro plugin ed esistono già plugin di routing. Verifica il supporto al tool-calling e i termini specifici di ciascun provider; gli utenti di ChinaModelAPI devono verificare gli ID dei modelli attivi nella dashboard.

Cos'è la "modalità minimale"?

Solo shell ed editor di file, senza funzionalità superflue — la configurazione utilizzata da DeepSeek per valutare le prestazioni pure del modello. Usala per ottenere confronti omogenei tra modelli diversi.

Guide correlate