Noticias / Model Watch · Herramientas
DeepSeek Harness v0.1: DeepSeek publica como código abierto su harness de agentes
Pocas horas después de lanzar DeepSeek-V4-Pro-0813, DeepSeek publicó Harness v0.1 en Developer Preview: el framework de agentes de código abierto con licencia MIT que utiliza para evaluar sus propios modelos. La prensa internacional lo definió rápidamente como un rival de código abierto para Claude Code y OpenAI Codex. Esto es lo que realmente es, lo que revelaron las primeras pruebas prácticas y las conclusiones clave para los desarrolladores de API.
Actualización · 2026-08-20: Harness dio sus primeros pasos multimodales: la versión rc.7 (17 de ago.) añadió adjuntos de imágenes persistentes a MCP/ACP; la rc.8 (19 de ago.) incorporó solicitudes de imágenes nativas configurables para los adaptadores de DeepSeek y entrada de imágenes para /goal y /plan. Los modelos V4 de DeepSeek continúan siendo solo de texto. Leer el informe de seguimiento →
DeepSeek Harness (dsh) es un harness de agentes gratuito, con licencia MIT, de ejecución local y agnóstico respecto al modelo.
Anunciado por la cuenta oficial de X de DeepSeek el 13 de agosto de 2026 (21:02 UTC+8) y publicado en
github.com/deepseek-ai/deepseek-harness.
Todo —herramientas, sandbox, sesiones, UI— es un plugin intercambiable en el sistema de plugins Cordis. Inícialo con
npx @deepseek-ai/dsh web (Web UI en 127.0.0.1:3080).
Es una Developer Preview v0.1 con cambios incompatibles previstos: evalúalo, pero no apuestes tu producción a él todavía.
Novedades incluidas, según fuentes oficiales
| Elemento | Detalle |
|---|---|
| Qué | DeepSeek Harness v0.1 — Developer Preview de un harness de agentes de código abierto (dsh) |
| Cuándo | Anunciado el 2026-08-13 a las 21:02 (UTC+8) en X; repositorio público esa misma noche |
| Licencia | MIT |
| Arquitectura | «Todo es un plugin» en Cordis; herramientas / sandbox / sesiones / UI, todo reemplazable |
| Ejecución | npx @deepseek-ai/dsh web → Web UI local en 127.0.0.1:3080 |
| Aviso sobre el estado | Iteración rápida; «HABRÁ CAMBIOS QUE ROMPAN LA COMPATIBILIDAD» (README) |
| Vínculo con la documentación oficial | El registro de cambios de la API de DeepSeek señala que los benchmarks públicos de V4-Flash se ejecutaron en el «modo mínimo» de Harness; la barra lateral de la documentación ahora enlaza a la documentación del harness |
Esa misma noche, DeepSeek-V4-Pro-0813 pasó a GA en app/web/API con soporte nativo para la API de Responses y adaptación de Codex; consulta nuestro resumen del lanzamiento 0813; el cambio de precios en horas punta/valle entra en vigor el 16 de agosto a las 16:00 UTC.
Qué dice la cobertura internacional
- VentureBeat abordó el lanzamiento directamente: un «rival de código abierto para Claude Code» que llega junto con V4-Pro a la API «con precios más altos»: las dos caras de la noticia de la semana, herramientas más baratas y tokens insignia más caros.
- The Decoder destaca la arquitectura y su linaje: «todas las funciones son plugins intercambiables» en el recién publicado sistema Cordis; los registros de sesión persistentes guardan cada prompt, llamada a herramienta y resultado, con ejecuciones que se pueden reanudar, ramificar y reproducir; el modo mínimo conserva solo una shell y un editor de archivos, la configuración que la propia DeepSeek utiliza para ejecutar sus benchmarks. También señala que el líder del proyecto es Cui Tianyi, quien se incorporó a DeepSeek procedente de Jane Street en marzo de 2026, y que la convocatoria de evaluadores atrajo 712 solicitudes en tres días.
- 36Kr (English) publicó una prueba práctica de un día para otro con una tesis contundente («No es solo otro Claude Code, ha llegado para superar a Claude Code») y conclusiones concretas: cuatro modos de trabajo (estándar; PTC, donde el modelo escribe TypeScript que combina unas 10 rondas de llamadas a herramientas en una sola ejecución; mínimo para benchmarking; y un modo de creación para diseñar nuevos modos); registros de trayectoria de solo anexado; 288 repositorios de plugins en 24 horas; conexión en caliente de más de 20 plugins sin reinicios mediante el seguimiento de efectos secundarios reversibles de Cordis; e importación de sesiones desde Claude Code, opencode y Antigravity que «funcionó a la perfección». Su observación más aguda: el modelo no goza de una posición privilegiada: «Los propios modelos de DeepSeek no son una excepción. Son simplemente otro plugin».
- Pandaily lo calificó como posiblemente «el proyecto de código abierto de agentes más ambicioso del año», estructurándolo en torno a la ecuación Model + Harness = Agent.
- Reddit (r/LocalLLaMA, r/DeepSeek) recogió el repositorio de inmediato; los hilos de la comunidad destacan las versiones para Desktop/CLI y el hecho de que todos los benchmarks de agentes publicados por DeepSeek se ejecutan a través de este harness.
- SCMP había informado anteriormente de que DeepSeek «refuerza la IA agéntica con pruebas de harness», un contexto útil que muestra que este lanzamiento estaba anticipado y no fue improvisado.
Por qué esto importa para un stack de modelos chinos
- El harness es gratuito; el coste reside en los tokens. Con el paso de V4-Pro a precios de horas punta y valle (horas valle: $0.66 entrada / $1.98 salida por cada 1M; horas punta el doble; el precio por acierto de caché es el que más sube, según The Decoder tras consultar la página oficial de precios), la economía de los bucles de agentes se inclina hacia modelos más baratos y de pesos abiertos para tareas masivas. Ahí es exactamente donde encaja una pasarela multimodelo compatible con OpenAI.
- Agnóstico respecto al modelo por diseño. La capa del modelo es un plugin; ya existen plugins de enrutamiento comunitarios. Apuntar
dsha un endpoint compatible con OpenAI (niveles de DeepSeek, Qwen, GLM, Kimi) es el patrón previsto, no un parche: verifica las condiciones de tu proveedor y el soporte para llamadas a herramientas de cada modelo. - Los registros de trayectoria suponen una gran mejora para la depuración. Los registros de solo anexado con opciones de reanudación, ramificación y reproducción permiten inspeccionar ejecuciones largas de agentes, algo muy valioso al evaluar en test A/B qué modelo puntero chino gestiona mejor tus proyectos a escala de repositorio.
- La importación de sesiones reduce la fricción de cambio. Si cuentas con historial en Claude Code u opencode, la prueba práctica de 36Kr demuestra que puedes transferirlo, un dato muy útil antes de decidir qué harness utilizar.
- No migres a producción todavía. Es una versión preliminar v0.1 con cambios incompatibles previstos, y gran parte de la experiencia de usuario depende actualmente de plugins comunitarios en constante evolución y con una calidad irregular. Pruébalo en entornos aislados, úsalo para benchmarks y vuelve a evaluarlo a partir de la v0.2+.
Fuentes primarias
- github.com/deepseek-ai/deepseek-harness (repositorio oficial: MIT, developer preview, Cordis, instrucciones de ejecución)
- DeepSeek en X — Anuncio de Harness v0.1 Developer Preview (2026-08-13)
- Registro de cambios de la API de DeepSeek: disponibilidad general de V4-Pro-0813, nota sobre benchmarks en modo mínimo de Harness, precios del 16 de ago.
- The Decoder — DeepSeek lanza una versión mejorada de V4 Pro, sube los precios de la API y publica su software de agentes como código abierto
- VentureBeat — DeepSeek Harness se lanza como rival de código abierto para Claude Code
- 36Kr English — Tras probar DeepSeek Harness toda la noche (cuatro modos, plugins, importación de sesiones)
- Pandaily — Prueba práctica de DeepSeek Harness: cuatro modos de trabajo, Model + Harness = Agent
- SCMP — DeepSeek refuerza la IA agéntica con pruebas de harness (contexto previo al lanzamiento)
FAQ
¿Es gratuito DeepSeek Harness?
El harness en sí es gratuito y cuenta con licencia MIT. Pagas por los tokens del modelo, ya sea a través de la API de DeepSeek o mediante cualquier proveedor compatible con OpenAI al que lo dirijas.
¿El asesino de Claude Code?
Las pruebas prácticas internacionales están impresionadas pero son realistas: v0.1, cambios incompatibles anunciados y calidad irregular de los plugins. Es el primer harness abierto de un laboratorio de primera línea con arquitectura interna de nivel de benchmark: un competidor creíble, no un reemplazo hoy en día.
¿Puedo usarlo con Qwen / GLM / Kimi?
En cuanto a arquitectura sí: el modelo es simplemente otro plugin y ya existen plugins de enrutamiento. Verifica la compatibilidad con llamadas a herramientas y las condiciones según el proveedor; los usuarios de ChinaModelAPI deben confirmar los identificadores de modelos activos en el panel de control.
¿Qué es el «modo mínimo»?
Solo shell y editor de archivos, sin funciones complejas: la configuración que utiliza DeepSeek para evaluar el rendimiento básico del modelo. Úsalo cuando desees cifras comparables entre diferentes modelos.