ChinaModelAPI

Actualités / Model Watch · Outillage

Open source DeepSeek Harness (dsh) Multimodal rc.7 / rc.8
2026-08-20 · Model Watch · rc.7 sortie le 17/08, rc.8 sortie le 19/08 (UTC)

DeepSeek Harness ajoute la saisie d'images multimodale — le harness a des yeux, pas les modèles

Une semaine après le passage en open source de Harness v0.1, DeepSeek a publié deux release candidates qui intègrent la saisie d'images dans le runtime d'agents : rc.7 (pièces jointes d'images durables) et rc.8 (requêtes d'images natives pour les adaptateurs DeepSeek, saisie d'images pour /goal et /plan). Les analystes internationaux qualifient le harness de « second moment DeepSeek ». Voici précisément ce qui a été déployé, ce qui reste 100 % textuel et ce que les concepteurs d'API devraient en faire.

Mise à jour · 2026-08-21 : DeepSeek a officiellement lancé deepseek-v4-flash-vision-exp — le modèle officiel doté de capacités visuelles dont cet article soulignait l'absence. V4-Pro reste 100 % textuel. Consultez la fiche de lancement avec les tarifs, le code de démarrage rapide et les conseils de routage des modèles →
Réponse directe

DeepSeek Harness peut désormais acheminer des images de bout en bout — et depuis le 21 août, un modèle officiel DeepSeek peut enfin les lire. D'après les notes de version officielles : la rc.7 (17 août) a ajouté les pièces jointes d'images durables pour MCP et ACP, avec transfert d'images imbriquées en mode PTC ; la rc.8 (19 août) a étendu la prise en charge multimodale avec des requêtes d'images natives configurables pour les adaptateurs DeepSeek, la saisie d'images pour /goal / /plan, et les références de fichiers & de sessions dans le menu @. À la publication (20 août), le bémol était que V4-Pro et V4-Flash restaient limités au texte ; le 21 août, DeepSeek a lancé deepseek-v4-flash-vision-exp, le premier modèle de vision officiel de la gamme Flash — fiche de lancement ici. V4-Pro reste 100 % textuel. La rc.8 s'appuie sur le tag npm next (latest pointe toujours sur la rc.7), et son nouveau format de stockage SQLite est incompatible avec les anciennes sessions.

Ce qui a été livré, selon les sources officielles

ÉlémentDétail
rc.7 · 2026-08-17 12:01 UTCPièces jointes d'images durables dans MCP et ACP, transfert d'images imbriquées en mode PTC ; les plugins peuvent enregistrer leurs propres cartes de paramètres ; les tâches de sous-agents Codex et Claude Code rejoignent le Job Panel ; nouvel effort de raisonnement low pour les modèles DeepSeek (la valeur par défaut reste high) ; le preset anglais « Code mode » a été renommé « PTC mode »
rc.8 · 2026-08-19 15:37 UTCExtension multimodale : requêtes d'images natives configurables pour les adaptateurs DeepSeek, saisie d'images pour /goal / /plan, références de fichiers & de sessions dans le menu @ (par @LegGasai et @CreatixChu) ; sous-agents Claude Code & Codex installables à la demande sous forme de Profile Bundles ; PowerShell persistant sur le PTY Windows ; requêtes web_search simultanées ; téléchargements de dépendances plus légers ; backend SQLite plus rapide & plus compact — format de stockage incompatible ; « DeepSeek Harness » déclaré marque déposée avec directives de marque
Les correctifs notablesLa rc.8 corrige les échecs de requêtes de modèles causés par des images surdimensionnées ou des charges utiles d'images accumulées excessives — le mode de défaillance précis que rencontraient les boucles d'agents intensives en images — et corrige certaines passerelles personnalisées compatibles OpenAI qui échouaient en raison de différences de format de requête ou de contenu de raisonnement manquant
Canaux npm (vérifié le 20/08)latest → 0.1.0-rc.7 ; next → 0.1.0-rc.8. La commande standard npx @deepseek-ai/dsh résout toujours la rc.7 ; basculez sur la rc.8 avec npx @deepseek-ai/dsh@next
Dynamique du dépôt167 928 étoiles / 17 953 forks (API GitHub, vérifié le 2026-08-20) — en hausse par rapport aux 149 000+ cités par Turing Post lors de sa publication du 17 août

Contexte : Harness v0.1 est passé en open source le 13 août en même temps que la disponibilité générale (GA) de V4-Pro — consultez notre fiche de lancement de la v0.1 pour découvrir l'architecture (« tout est plugin » sur Cordis, quatre modes de travail, licence MIT).

La distinction : plomberie du harness vs capacités du modèle

  • Ce qui est devenu multimodal, c'est le runtime, pas les modèles. Collez une image dans dsh aujourd'hui et elle persiste à travers les appels d'outils MCP/ACP, est transmise via les programmes en mode PTC et peut accompagner les commandes de planification /goal et /plan. C'est une véritable plomberie technique qui manquait à la v0.1 — les premiers testeurs avaient précisément critiqué la stack de la semaine de lancement parce qu'un modèle exclusivement textuel ne pouvait pas traquer un bug visuel de deux lignes.
  • Les propres modèles API de DeepSeek étaient encore 100 % textuels à la publication — et ont gagné la vision un jour plus tard. Le 21 août 2026, DeepSeek a officiellement lancé deepseek-v4-flash-vision-exp, un modèle de vision expérimental de la gamme Flash à tarif inchangé ; V4-Pro reste 100 % textuel. Au moment de la publication, le journal des modifications ne comportait aucune entrée relative à la vision depuis la note de GA de V4-Pro du 13 août, et une discussion très suivie sur Hugging Face à propos de V4-Pro déplorait l'absence de « multimodalité native dont disposent désormais tous les autres modèles phares chinois, y compris Qwen et Kimi » — exactement l'écart que ce lancement vient de combler pour Flash.
  • La documentation officielle explicite le fonctionnement prévu. Selon le tableau de dépannage du dépôt : si une image est refusée avant l'envoi, le modèle « déclare ne pas accepter la modalité image » — corrigez cela en ajoutant input: [text, image] à l'entrée du modèle dans $DSH_HOME/settings.yaml. En d'autres termes : activez les requêtes d'images pour un modèle qui possède réellement la vision, via l'adaptateur de DeepSeek ou tout endpoint compatible OpenAI.
  • Le manque de vision était déjà comblé par des plugins. modlens (qui se définit comme le premier plugin de vision pour dsh) vous permet de coller une image dans une session 100 % textuelle et d'obtenir des données JSON structurées en retour — OCR, mise en page, sémantique — routées via un pool de moteurs de vision (une clé Gemini gratuite, Antigravity CLI ou tout endpoint compatible OpenAI ; son README présente une démo de Qwen-VL via le mode compatible de DashScope). Parmi les outils communautaires similaires figurent agent-vision-toolkit (Q&R sur images, OCR de captures d'écran longues, restauration d'UI, automatisation de GUI) et dsh-vision-router. Projets communautaires, non affiliés à DeepSeek — qualité variable.

Ce qu'en dit la presse internationale

  • Turing Post (17 août) a publié l'analyse anglophone la plus incisive : « DeepSeek vit son deuxième moment DeepSeek. » Sa thèse : avec R1, DeepSeek a érodé le fossé concurrentiel des modèles ; avec Harness (sous licence MIT, plus de 149 000 étoiles lors de la publication), l'entreprise « ouvre la couche que tout le monde commençait à voir comme le prochain bastion » — la couche d'exécution des agents. L'article retrace également les origines de Cordis jusqu'à Koishi, le framework de chatbot de Shigma (désormais chez DeepSeek), dont les quatre années passées sur les problématiques de cycle de vie des plugins se sont avérées être des enjeux de runtime d'agents.
  • La presse de la semaine de lancement (évoquée dans notre fiche v0.1) : VentureBeat a présenté dsh comme un « rival open source de Claude Code » ; The Decoder a détaillé l'architecture et dressé le portrait du responsable du projet Cui Tianyi (ancien de Jane Street) ; le test express de 36Kr a recensé 288 dépôts de plugins en 24 heures ; Pandaily l'a résumé par Modèle + Harness = Agent.
  • Les versions rc.7/rc.8 elles-mêmes ont principalement été suivies par les observateurs de changelogs et l'écosystème de plugins plutôt que par les grands médias lors des premières 48 heures — des guides tiers (chat-deep.ai, dshdocs.com, freedom.tech) ont relevé la mention « pièces jointes d'images durables » en une journée. Si vous suivez cette actualité, consultez les notes de version plutôt que les gros titres.
  • Sur X, le fil d'annonce officiel du projet (@deepseek_ai, 13 août) et les publications du mainteneur @tianyi restent les canaux de référence ; l'auteur de modlens @liustack publie d'abord ses notes de version sur X — ce qui confirme que le centre de gravité de l'écosystème réside sur le dépôt et sur X plutôt que sur des blogs.

Pourquoi c'est important pour une stack de modèles chinois

  • Le harness est gratuit ; les tokens d'image sont la nouvelle variable. Avec la tarification heures pleines / heures creuses de V4-Pro (heures creuses $0.66 en entrée / $1.98 en sortie par 1M, heures pleines $1.32 / $3.96 — selon la lecture de la grille tarifaire officielle par The Decoder), le coût d'une boucle d'agent se déplace vers le lieu de traitement des images. Router les sous-appels de vision vers un modèle économique doté de capacités visuelles pendant que les modèles de texte gèrent la boucle de code correspond exactement au schéma multimodèle pour lequel la couche de modèles de plugins de dsh a été conçue.
  • Le correctif de passerelle de la rc.8 concerne directement les utilisateurs de relais. La version corrige les passerelles personnalisées compatibles OpenAI qui échouaient en raison de différences de format de requête ou perdaient le contenu de raisonnement — le type de bug qui touche quiconque fait pointer dsh vers un endpoint tiers plutôt que d'utiliser des clés officielles directes. Testez votre endpoint avec la rc.8 avant d'incriminer le harness.
  • Le rythme des changements cassants est bien réel. La v0.1 annonçait des ruptures de compatibilité ; la rc.8 en concrétise une (format de stockage SQLite incompatible). Figez votre version de dsh, gardez les données de session hors du chemin de mise à jour et revérifiez après chaque passage à une nouvelle rc — la branche évolue encore à un rythme soutenu vers une version 0.1.0 stable.
  • L'image de marque est désormais officialisée. Les notes de la rc.8 précisent que « DeepSeek Harness » est une marque déposée assortie de consignes de marque publiées — les auteurs de plugins et concepteurs d'outils doivent les consulter avant de nommer des projets dérivés.
  • Clarification sur l'indépendance du projet. dsh est le projet open source de DeepSeek. ChinaModelAPI est un relais indépendant compatible OpenAI sans relation officielle avec ce dernier ni avec DeepSeek — le point commun pratique réside dans le fait qu'un harness indépendant du modèle est un client naturel pour le routage multimodèle, et que les identifiants de modèles compatibles avec la vision doivent être vérifiés en direct dans le tableau de bord de votre fournisseur avant de les intégrer.

Sources primaires

FAQ

dsh peut-il lire les images désormais ?

Le harness peut les transporter — coller, conserver, transmettre, planifier avec elles. La lecture s'effectue toujours dans le modèle : V4-Pro/V4-Flash sont 100 % textuels, orientez donc l'étape de vision vers un modèle capable de traiter la vision via la configuration de l'adaptateur ou un endpoint compatible OpenAI.

Comment essayer la rc.8 ?

npx @deepseek-ai/dsh@next — le tag latest résout toujours la rc.7. Le format de stockage SQLite de la rc.8 est incompatible avec les anciennes sessions ; installez à neuf, puis réajoutez la configuration de votre fournisseur.

Vision-Exp est lancé — qu'en est-il de V4-Pro ?

deepseek-v4-flash-vision-exp a été mis en ligne le 21 août 2026 — notre fiche de lancement contient les tarifs, le guide de démarrage rapide et les limites. La vision pour V4-Pro reste non annoncée.

Qu'en est-il de ma propre passerelle ?

Pris en charge et fraîchement renforcé — la rc.8 corrige les erreurs de format de requête et de raisonnement manquant sur les passerelles personnalisées compatibles OpenAI. Déclarez input: [text, image] sur les modèles acceptant les images pour que dsh les envoie nativement.

Guides connexes