News / Model Watch · Tooling
DeepSeek Harness v0.1: DeepSeek veröffentlicht sein Agent-Harness als Open Source
Nur wenige Stunden nach der Veröffentlichung von DeepSeek-V4-Pro-0813 hat DeepSeek Harness v0.1 als Developer Preview herausgebracht – das quelloffene, unter MIT-Lizenz stehende Agent-Framework, mit dem das Unternehmen seine eigenen Modelle benchmarkt. Internationale Medien bezeichneten es rasch als offene Konkurrenz zu Claude Code und OpenAI Codex. Hier erfahren Sie, worum es sich dabei wirklich handelt, was erste Praxistests gezeigt haben und was API-Entwickler daraus mitnehmen sollten.
Update · 2026-08-20: Harness macht erste Schritte in Richtung Multimodalität – rc.7 (17. Aug.) brachte persistente Bildanhänge für MCP/ACP; rc.8 (19. Aug.) ergänzte konfigurierbare native Bildanfragen für DeepSeek-Adapter sowie Bildeingaben für /goal und /plan. Die V4-Modelle von DeepSeek bleiben weiterhin rein textbasiert. Zum Folge-Briefing →
DeepSeek Harness (dsh) ist ein kostenloses, MIT-lizenziertes und lokal ausführbares Agent-Harness – und es ist modellagnostisch.
Angekündigt über den offiziellen X-Account von DeepSeek am 13. Aug. 2026 (21:02 UTC+8) und veröffentlicht unter
github.com/deepseek-ai/deepseek-harness.
Alles – Tools, Sandbox, Sessions, UI – ist ein austauschbares Plugin auf Basis des Cordis-Plugin-Systems. Starten lässt es sich mit
npx @deepseek-ai/dsh web (Web-UI unter 127.0.0.1:3080).
Es handelt sich um eine v0.1 Developer Preview mit angekündigten Breaking Changes – evaluieren Sie es, aber setzen Sie es noch nicht in der Produktion ein.
Neuerungen laut offiziellen Quellen
| Eintrag | Details |
|---|---|
| Was | DeepSeek Harness v0.1 – Developer Preview eines quelloffenen Agent-Harness (dsh) |
| Wann | Angekündigt am 13.08.2026 um 21:02 Uhr (UTC+8) auf X; Repository noch am selben Abend öffentlich |
| Lizenz | MIT |
| Architektur | „Alles ist ein Plugin“ auf Basis von Cordis; Tools / Sandbox / Sessions / UI sind alle austauschbar |
| Ausführung | npx @deepseek-ai/dsh web → lokale Web-UI unter 127.0.0.1:3080 |
| Status-Hinweis | Rasante Iteration; „THERE WILL BE COMPATIBILITY-BREAKING CHANGES“ (README) |
| Einbindung in die offizielle Dokumentation | Im API-Changelog von DeepSeek wird vermerkt, dass die öffentlichen V4-Flash-Benchmarks im „Minimal Mode“ des Harness durchgeführt wurden; die Seitenleiste der Dokumentation verlinkt nun auf die Harness-Docs |
Am selben Abend ging DeepSeek-V4-Pro-0813 für App/Web/API mit nativer Unterstützung für die Responses-API und Codex-Anpassung in die allgemeine Verfügbarkeit (GA) über – siehe unser 0813-Release-Briefing; die Preisumstellung für Spitzen- und Nebenzeiten (Peak/Off-Peak) greift ab dem 16. Aug., 16:00 Uhr UTC.
Was die internationale Berichterstattung sagt
- VentureBeat brachte den Launch direkt auf den Punkt: eine „Open-Source-Konkurrenz zu Claude Code“, die parallel zu V4-Pro auf der API „zu höheren Preisen“ erscheint – die zweischneidige Story der Woche: günstigere Tooling-Infrastruktur, teurere Flaggschiff-Token.
- The Decoder hebt die Architektur und Herkunft hervor: „Alle Features sind austauschbare Plugins“ auf Basis des neu veröffentlichten Cordis-Systems; persistente Session-Logs zeichnen jeden Prompt, Tool-Aufruf und jedes Ergebnis auf, wobei Durchläufe fortgesetzt, verzweigt und erneut abgespielt werden können; der Minimal-Modus beschränkt sich lediglich auf eine Shell und einen Datei-Editor – genau die Konfiguration, die DeepSeek selbst für Benchmark-Läufe nutzt. Zudem wird erwähnt, dass Projektleiter Cui Tianyi im März 2026 von Jane Street zu DeepSeek wechselte und der Tester-Aufruf 712 Bewerbungen in drei Tagen verzeichnete.
- 36Kr (English) veröffentlichte einen Praxistest über Nacht mit einer deutlichen These – „Es ist nicht bloß ein weiteres Claude Code, es soll Claude Code ablösen“ – und konkreten Erkenntnissen: vier Arbeitsmodi (Standard; PTC, bei dem das Modell TypeScript generiert, das rund 10 Runden von Tool-Aufrufen in einer einzigen Ausführung bündelt; Minimal für Benchmarks; sowie ein Creation-Modus zum Erstellen neuer Modi); Append-Only-Trajectory-Logs; 288 Plugin-Repositories innerhalb von 24 Stunden; Hot-Plugging von mehr als 20 Plugins ohne Neustart dank des Trackings reversibler Nebeneffekte in Cordis; und ein Session-Import aus Claude Code, opencode und Antigravity, der „perfekt funktionierte“. Die treffendste Beobachtung: Das Modell genießt keine Sonderstellung – „DeepSeeks eigene Modelle bilden da keine Ausnahme. Sie sind einfach nur ein weiteres Plugin.“
- Pandaily bezeichnete es als womöglich „das ambitionierteste Open-Source-Agentenprojekt des Jahres“, aufgebaut um die Formel Model + Harness = Agent.
- Reddit (r/LocalLLaMA, r/DeepSeek) griff das Repository umgehend auf; Community-Threads heben die Desktop-/CLI-Builds hervor sowie die Tatsache, dass die von DeepSeek veröffentlichten Agenten-Benchmarks allesamt über dieses Harness laufen.
- SCMP hatte zuvor berichtet, dass DeepSeek „seine agentische KI mit Harness-Tests ausbaut“ – ein nützlicher Kontext, der zeigt, dass dieses Release von langer Hand vorbereitet und nicht improvisiert war.
Warum dies für einen China-Modell-Stack wichtig ist
- Das Harness ist kostenlos; die Token sind der Kostenfaktor. Durch die Umstellung von V4-Pro auf Peak-/Off-Peak-Preise (Off-Peak 0,66 $ Input / 1,98 $ Output pro 1M; Peak das Doppelte; Cache-Hit-Preise steigen am stärksten – laut Analyse der offiziellen Preisseite durch The Decoder) verschiebt sich die Wirtschaftlichkeit von Agent-Loops für Massenaufgaben hin zu günstigeren Modellen und Open-Weight-Modellen. Genau hier setzt ein OpenAI-kompatibles Multi-Modell-Gateway an.
- Modellagnostisch by Design. Die Modell-Ebene ist ein Plugin; Community-Routing-Plugins existieren bereits. Das Weiterleiten von
dshan einen OpenAI-kompatiblen Endpunkt (DeepSeek-, Qwen-, GLM-, Kimi-Tiers) ist das vorgesehene Einsatzmuster, kein Workaround – prüfen Sie die Nutzungsbedingungen und den Tool-Calling-Support Ihres Anbieters für jedes Modell. - Trajectory-Logs sind ein echtes Debugging-Upgrade. Append-Only-Logs mit Fortsetzungs-, Verzweigungs- und Replay-Funktionen machen lange Agenten-Läufe nachvollziehbar – besonders wertvoll beim A/B-Testing, welches chinesische Frontier-Modell Aufgaben auf Repository-Ebene am besten bewältigt.
- Session-Import senkt die Wechselkosten. Wenn Sie bestehende Verläufe aus Claude Code oder opencode haben, zeigt der 36Kr-Praxistest, dass Sie diese problemlos mitnehmen können – ein wichtiges Detail vor Ihrer nächsten Harness-Entscheidung.
- Noch nicht für Produktionssysteme migrieren. Es handelt sich um eine v0.1-Preview mit angekündigten Breaking Changes, und ein Großteil der UX hängt derzeit von sich schnell verändernden Community-Plugins mit schwankender Qualität ab. Testen Sie es in einer Sandbox, führen Sie Benchmarks durch und evaluieren Sie es ab v0.2+ erneut.
Primärquellen
- github.com/deepseek-ai/deepseek-harness (offizielles Repo: MIT, Developer Preview, Cordis, Ausführungsanleitung)
- DeepSeek auf X – Ankündigung der Harness v0.1 Developer Preview (13.08.2026)
- DeepSeek API-Changelog – V4-Pro-0813 GA, Benchmark-Hinweis zum Minimal Mode von Harness, Preisgestaltung ab 16. Aug.
- The Decoder – DeepSeek veröffentlicht verbessertes V4 Pro, erhöht API-Preise und stellt Agenten-Software als Open Source bereit
- VentureBeat – DeepSeek Harness startet als Open-Source-Rivale zu Claude Code
- 36Kr English – Nach einer ganzen Nacht im Praxistest mit DeepSeek Harness (vier Modi, Plugins, Session-Import)
- Pandaily – Praxistest zu DeepSeek Harness: Vier Arbeitsmodi, Model + Harness = Agent
- SCMP – DeepSeek verstärkt agentische KI durch Harness-Tests (Kontext vor der Veröffentlichung)
FAQ
Ist DeepSeek Harness kostenlos?
Das Harness selbst ist kostenlos und unter MIT lizenziert. Sie zahlen lediglich für die Modell-Token – über die API von DeepSeek oder jeden OpenAI-kompatiblen Anbieter, an den Sie Anfragen weiterleiten.
Claude-Code-Killer?
Internationale Praxistests zeigen sich beeindruckt, aber realistisch: v0.1, angekündigte Breaking Changes, uneinheitliche Plugin-Qualität. Es ist das erste offene Harness eines führenden KI-Labors mit Benchmark-reifen Interna – ein ernstzunehmender Konkurrent, heute aber noch kein vollständiger Ersatz.
Kann ich es mit Qwen / GLM / Kimi nutzen?
Architektonisch ja – das Modell ist lediglich ein weiteres Plugin und Routing-Plugins sind bereits vorhanden. Überprüfen Sie den Tool-Calling-Support und die Bedingungen des jeweiligen Anbieters; Nutzer von ChinaModelAPI sollten die aktiven Modell-IDs im Dashboard abgleichen.
Was ist der „Minimal Mode“?
Nur Shell + Datei-Editor, ohne zusätzliche Schnörkel – genau die Konfiguration, die DeepSeek nutzt, um die reine Modellleistung zu benchmarken. Nutzen Sie diesen Modus, wenn Sie vergleichbare Werte über verschiedene Modelle hinweg erzielen möchten.