News / Model Watch · Tooling
DeepSeek Harness erhält multimodale Bildeingabe – das Harness hat jetzt Augen, die Modelle nicht
Eine Woche nach der Open-Source-Veröffentlichung von Harness v0.1 hat DeepSeek zwei Release Candidates herausgebracht, die Bildeingaben in die Agent-Laufzeitumgebung integrieren: rc.7 (persistente Bildanhänge) und rc.8 (native Bildanfragen für DeepSeek-Adapter, Bildeingabe für /goal und /plan). Internationale Analysten bezeichnen das Harness bereits als „einen zweiten DeepSeek-Moment“. Hier erfahren Sie genau, was neu hinzugekommen ist, was weiterhin rein textbasiert bleibt und was API-Entwickler jetzt tun sollten.
DeepSeek Harness kann Bilder jetzt durchgängig verarbeiten – und seit dem 21. August kann ein offizielles DeepSeek-Modell sie endlich auch lesen.
Laut den offiziellen Release Notes:
rc.7 (17. Aug.) brachte persistente Bildanhänge für MCP und ACP mit verschachtelter Bildweiterleitung im PTC-Modus;
rc.8 (19. Aug.) erweiterte die multimodale Unterstützung um konfigurierbare native Bildanfragen für DeepSeek-Adapter, Bildeingaben für
/goal / /plan sowie Datei- & Sitzungsreferenzen im @-Menü.
Zum Zeitpunkt der Veröffentlichung (20. Aug.) lag der Haken darin, dass V4-Pro und V4-Flash noch rein textbasiert waren; am 21. August veröffentlichte DeepSeek deepseek-v4-flash-vision-exp, das erste offizielle Vision-Modell der Flash-Familie – Launch-Überblick hier. V4-Pro bleibt weiterhin rein textbasiert.
rc.8 läuft unter dem npm-Tag next (latest ist weiterhin rc.7), und das neue SQLite-Speicherformat ist nicht kompatibel mit älteren Sitzungen.
Neuerungen laut offiziellen Quellen
| Eintrag | Details |
|---|---|
| rc.7 · 2026-08-17 12:01 UTC | Persistente Bildanhänge in MCP und ACP, verschachtelte Bildweiterleitung im PTC-Modus; Plugins können eigene Einstellungskarten registrieren; Subagent-Tasks für Codex und Claude Code werden im Job Panel integriert; neuer low Reasoning-Aufwand für DeepSeek-Modelle (Standard bleibt high); englisches Preset „Code mode“ in „PTC mode“ umbenannt |
| rc.8 · 2026-08-19 15:37 UTC | Multimodale Erweiterung: konfigurierbare native Bildanfragen für DeepSeek-Adapter, Bildeingabe für /goal / /plan, Datei- & Sitzungsreferenzen im @-Menü (von @LegGasai und @CreatixChu); Claude Code & Codex Subagents bei Bedarf als Profile Bundles installierbar; persistente PowerShell auf Windows PTY; gleichzeitige web_search; kleinere Dependency-Downloads; SQLite-Backend schneller & schlanker – Speicherformat inkompatibel; „DeepSeek Harness“ als eingetragene Marke mit Markenrichtlinien deklariert |
| Besonders relevante Fehlerbehebungen | rc.8 behebt Fehler bei Modell-Anfragen, die durch zu große Bilder oder übermäßig viele kumulierte Bilddaten verursacht wurden – genau das Fehlerbild, das bei bildintensiven Agent-Schleifen auftritt – und behebt Probleme bei bestimmten benutzerdefinierten OpenAI-kompatiblen Gateways, die aufgrund von Unterschieden im Anfrageformat oder fehlendem Reasoning-Inhalt fehlschlugen |
| npm-Channels (Stand: 20.08.) | latest → 0.1.0-rc.7; next → 0.1.0-rc.8. Das einfache npx @deepseek-ai/dsh löst weiterhin rc.7 auf; zu rc.8 wechseln mit npx @deepseek-ai/dsh@next |
| Repo-Dynamik | 167.928 Stars / 17.953 Forks (GitHub API, Stand: 20.08.2026) – ein Anstieg gegenüber den 149.000+, die Turing Post bei der Veröffentlichung am 17. August anführte |
Hintergrund: Harness v0.1 wurde am 13. August zusammen mit der V4-Pro GA als Open Source veröffentlicht – siehe unseren v0.1 Launch-Überblick zur Architektur (Alles-ist-ein-Plugin auf Basis von Cordis, vier Arbeitsmodi, MIT-Lizenz).
Die Trennung: Harness-Infrastruktur vs. Modellfähigkeiten
- Multimodal wurde die Laufzeitumgebung, nicht die Modelle. Wenn man heute ein Bild in dsh einfügt, bleibt es über MCP/ACP-Toolaufrufe hinweg persistent, wird durch Programme im PTC-Modus weitergeleitet und kann in Planungsbefehlen wie
/goalund/planmitgeführt werden. Das ist echte Infrastruktur, die in v0.1 noch fehlte – frühe Tester kritisierten den Launch-Stack gerade deshalb, weil ein rein textbasiertes Modell keinen zweizeiligen visuellen Bug beheben konnte. - Die hauseigenen API-Modelle von DeepSeek waren bei Veröffentlichung noch rein textbasiert – und erhielten einen Tag später Vision-Fähigkeiten. Am 21. August 2026 brachte DeepSeek offiziell deepseek-v4-flash-vision-exp heraus, ein experimentelles Vision-Modell der Flash-Familie zu unveränderten Preisen; V4-Pro bleibt weiterhin rein textbasiert. Zum Zeitpunkt der Veröffentlichung enthielt das Changelog seit der V4-Pro-GA-Meldung vom 13. August keinen Vision-Eintrag mehr, und eine vielbeachtete Hugging-Face-Diskussion zu V4-Pro bemängelte das Fehlen „nativer Multimodalität, die mittlerweile jedes andere chinesische Flaggschiff-Modell besitzt, einschließlich Qwen und Kimi“ – genau die Lücke, die der Launch für Flash nun geschlossen hat.
- Die offizielle Dokumentation stellt das vorgesehene Muster klar heraus. Die Troubleshooting-Tabelle des Repositories: Wird ein Bild vor dem Senden abgewiesen, deklariert das Modell „keine Bildmodalität“ – die Lösung besteht darin,
input: [text, image]zum Modelleintrag in$DSH_HOME/settings.yamlhinzuzufügen. Mit anderen Worten: Bildanfragen für ein Modell aktivieren, das tatsächlich über Vision-Fähigkeiten verfügt, sei es über den DeepSeek-Adapter oder einen beliebigen OpenAI-kompatiblen Endpunkt. - Die Vision-Lücke wurde bereits durch Plugins überbrückt. modlens (nach eigenen Angaben das erste Vision-Plugin für dsh) ermöglicht es, ein Bild in eine rein textbasierte Sitzung einzufügen und strukturierte JSON-Ergebnisse zurückzuerhalten – OCR, Layout, Semantik –, weitergeleitet über einen Pool von Vision-Engines (ein kostenloser Gemini-Key, die Antigravity CLI oder ein beliebiger OpenAI-kompatibler Endpunkt; die README demonstriert Qwen-VL über den Kompatibilitätsmodus von DashScope). Ähnliche Community-Tools sind agent-vision-toolkit (Bild-F&A, OCR für lange Screenshots, UI-Wiederherstellung, GUI-Automatisierung) und dsh-vision-router. Community-Projekte ohne Verbindung zu DeepSeek – die Qualität variiert.
Was die internationale Berichterstattung sagt
- Turing Post (17. Aug.) veröffentlichte die treffendste englischsprachige Analyse: „DeepSeek erlebt seinen zweiten DeepSeek-Moment.“ Die Argumentation: Mit R1 schwächte DeepSeek den Burggraben (Moat) auf Modellebene; mit dem Harness (MIT-Lizenz, über 149.000 Stars bei Veröffentlichung) öffnet das Unternehmen „die Ebene, die viele bereits als nächsten Burggraben ins Auge gefasst hatten“ – die Agent-Ausführungsschicht. Zudem wird der Ursprung von Cordis auf Koishi zurückgeführt, das Chatbot-Framework von Shigma (heute bei DeepSeek), dessen vier Jahre an Plugin-Lifecycle-Problemen sich letztlich als typische Agent-Laufzeitprobleme herausstellten.
- Presse der Launch-Woche (zusammengefasst in unserem v0.1-Überblick): VentureBeat bezeichnete dsh als „Open-Source-Konkurrenten zu Claude Code“; The Decoder porträtierte die Architektur sowie Projektleiter Cui Tianyi (ehemals Jane Street); der Praxistest von 36Kr zählte innerhalb von 24 Stunden bereits 288 Plugin-Repositories; Pandaily fasste es als Modell + Harness = Agent zusammen.
- Die Releases rc.7/rc.8 selbst wurden in den ersten 48 Stunden vor allem von Changelog-Beobachtern und dem Plugin-Ökosystem statt von Mainstream-Medien verfolgt – Drittanbieter-Leitfäden (chat-deep.ai, dshdocs.com, freedom.tech) griffen die Neuerung „persistente Bildanhänge“ innerhalb eines Tages auf. Wer die Entwicklung verfolgen will, sollte sich an die Release Notes halten, nicht an Schlagzeilen.
- Auf X bleiben der Ankündigungsthread des Projekts (@deepseek_ai, 13. Aug.) und die Beiträge von Maintainer @tianyi die maßgeblichen Kanäle; modlens-Autor @liustack veröffentlicht Release Notes zuerst auf X – passend dazu, dass der Schwerpunkt des Ökosystems im Repository und auf X liegt, nicht in Blogs.
Warum dies für einen China-Modell-Stack wichtig ist
- Das Harness ist kostenlos; Bild-Tokens sind die neue Variable. Angesichts der gestaffelten Haupt-/Nebenzeiten-Preise von V4-Pro (Nebenzeiten $0.66 Input / $1.98 Output pro 1M, Hauptzeiten $1.32 / $3.96 – laut The Decoders Auswertung der offiziellen Preisseite) verlagern sich die Kosten einer Agent-Schleife dorthin, wo Bilder verarbeitet werden. Das Weiterleiten von Vision-Unteraufrufen an ein günstiges, bildfähiges Modell, während Textmodelle die Programmierschleife steuern, ist genau das Multi-Modell-Muster, für das die Plugin-Modellschicht von dsh entwickelt wurde.
- Der Gateway-Fix in rc.8 ist für Relay-Nutzer direkt relevant. Das Release behebt Probleme bei benutzerdefinierten OpenAI-kompatiblen Gateways, die aufgrund von Formatabweichungen bei Anfragen fehlschlugen oder Reasoning-Inhalte verloren – eine Fehlerkategorie, die jeden betrifft, der dsh auf einen Drittanbieter-Endpunkt statt auf First-Party-Keys ausrichtet. Testen Sie Ihren Endpunkt mit rc.8, bevor Sie den Fehler beim Harness suchen.
- Breaking Changes kommen schnell und spürbar. v0.1 kündigte inkompatible Änderungen an; rc.8 liefert eine davon (SQLite-Speicherformat inkompatibel). Pinnen Sie Ihre dsh-Version, halten Sie Sitzungsdaten aus dem Upgrade-Pfad heraus und überprüfen Sie die Konfiguration nach jedem rc-Update erneut – die Entwicklung steuert weiterhin rasant auf ein stabiles 0.1.0 zu.
- Das Branding ist nun offiziell geregelt. Die Versionshinweise von rc.8 stellen klar, dass „DeepSeek Harness“ eine eingetragene Marke mit veröffentlichten Markenrichtlinien ist – Plugin-Entwickler und Tool-Ersteller sollten diese vor der Benennung von Ableitungen lesen.
- Einordnung als unabhängiges Projekt. dsh ist das Open-Source-Projekt von DeepSeek. ChinaModelAPI ist ein unabhängiges OpenAI-kompatibles Relay ohne offizielle Verbindung dazu oder zu DeepSeek – die praktische Schnittmenge liegt darin, dass ein modellunabhängiges Harness ein idealer Client für Multi-Modell-Routing ist und bildfähige Modell-IDs vor der Einbindung live im Dashboard Ihres Anbieters überprüft werden sollten.
Primärquellen
- GitHub — deepseek-ai/deepseek-harness Releases (rc.7- und rc.8-Hinweise, CN/EN)
- npm — @deepseek-ai/dsh dist-tags (latest = rc.7, next = rc.8, Stand: 20.08.2026)
- deepseek.com/harness — offizielle Developer-Preview-Seite
- DeepSeek API Changelog — kein Vision-Eintrag seit 13.08.2026 (rein textbasierter Status der V4-Modelle)
- Turing Post — FOD#163: DeepSeek is having its second DeepSeek moment (17.08.2026)
- VentureBeat — DeepSeek Harness startet als Open-Source-Rivale zu Claude Code (Launch-Woche)
- The Decoder — verbessertes V4 Pro, höhere API-Preise, Agent-Software als Open Source (Preisdetails)
- GitHub — liustack/modlens (Community-Vision-Plugin für dsh, MIT)
- DeepSeek Code Verzeichnis — agent-vision-toolkit Plugin-Profil (Community)
- Hugging Face Diskussion — Lücke bei nativer Multimodalität in V4-Pro (Community)
FAQ
Kann dsh jetzt Bilder lesen?
Das Harness kann sie transportieren – einfügen, persistent speichern, weiterleiten und für Planungen nutzen. Das Auslesen erfolgt weiterhin im Modell: Da V4-Pro/V4-Flash rein textbasiert sind, leiten Sie den Vision-Schritt über die Adapter-Konfiguration oder einen OpenAI-kompatiblen Endpunkt an ein bildfähiges Modell weiter.
Wie kann ich rc.8 ausprobieren?
npx @deepseek-ai/dsh@next – der latest-Tag verweist weiterhin auf rc.7. Das SQLite-Speicherformat von rc.8 ist nicht kompatibel mit älteren Sitzungen; führen Sie eine Neuinstallation durch und richten Sie Ihre Provider-Konfiguration anschließend neu ein.
Vision-Exp ist gestartet – was ist mit V4-Pro?
deepseek-v4-flash-vision-exp ging am 21. August 2026 online – unser Launch-Überblick enthält Preise, Quickstart und Limits. Vision für V4-Pro bleibt weiterhin unangekündigt.
Was ist mit einem eigenen Gateway?
Wird unterstützt und wurde zusätzlich gehärtet – rc.8 behebt Fehler beim Anfrageformat und bei fehlendem Reasoning bei benutzerdefinierten OpenAI-kompatiblen Gateways. Deklarieren Sie input: [text, image] für Modelle, die Bilder akzeptieren, damit dsh diese nativ übermittelt.