Noticias / Model Watch · Herramientas
DeepSeek Harness añade entrada multimodal de imágenes: el harness tiene ojos, los modelos no
Una semana después de liberar como código abierto Harness v0.1, DeepSeek lanzó dos versiones candidatas que integran la entrada de imágenes en el runtime de agentes: rc.7 (adjuntos de imagen persistentes) y rc.8 (solicitudes nativas de imagen para adaptadores de DeepSeek, entrada de imágenes para /goal y /plan). Los analistas internacionales están calificando al harness como «un segundo momento DeepSeek». Aquí explicamos con precisión qué novedades llegaron, qué sigue siendo solo texto y qué deberían hacer los desarrolladores que integran la API.
DeepSeek Harness ahora puede transportar imágenes de extremo a extremo y, a partir del 21 de agosto, un modelo oficial de DeepSeek por fin puede leerlas.
Según las notas oficiales de la versión:
rc.7 (17 de agosto) añadió adjuntos de imagen persistentes a MCP y ACP, con reenvío de imágenes anidadas en modo PTC;
rc.8 (19 de agosto) amplió la compatibilidad multimodal con solicitudes nativas de imagen configurables para adaptadores de DeepSeek, entrada de imágenes para
/goal / /plan y referencias a archivos & sesiones en el menú @.
Al momento de la publicación (20 de agosto), el inconveniente era que V4-Pro y V4-Flash seguían siendo solo texto; el 21 de agosto, DeepSeek lanzó deepseek-v4-flash-vision-exp, el primer modelo de visión oficial de la familia Flash (resumen del lanzamiento aquí). V4-Pro continúa siendo solo texto.
rc.8 está disponible bajo la etiqueta next de npm (latest sigue siendo rc.7), y su nuevo formato de almacenamiento SQLite es incompatible con sesiones anteriores.
Novedades incluidas, según fuentes oficiales
| Elemento | Detalle |
|---|---|
| rc.7 · 2026-08-17 12:01 UTC | Adjuntos de imagen persistentes en MCP y ACP, reenvío de imágenes anidadas en modo PTC; los plugins pueden registrar sus propias tarjetas de configuración; las tareas de subagentes de Codex y Claude Code se integran en el Job Panel; nuevo esfuerzo de razonamiento low para modelos de DeepSeek (el valor predeterminado sigue siendo high); el ajuste predeterminado en inglés «Code mode» se renombra a «PTC mode» |
| rc.8 · 2026-08-19 15:37 UTC | Expansión multimodal: solicitudes nativas de imagen configurables para adaptadores de DeepSeek, entrada de imágenes para /goal / /plan, referencias a archivos & sesiones en el menú @ (por @LegGasai y @CreatixChu); subagentes de Claude Code & Codex instalables bajo demanda como Profile Bundles; PowerShell persistente en Windows PTY; web_search concurrente; descargas de dependencias más pequeñas; backend SQLite más rápido y ligero — formato de almacenamiento incompatible; «DeepSeek Harness» declarada marca registrada con directrices de marca |
| Correcciones clave para este caso | rc.8 corrige los fallos en solicitudes al modelo causados por imágenes de tamaño excesivo o cargas acumuladas excesivas de imágenes (el modo de fallo exacto en el que caían los bucles de agentes con alto uso de imágenes) y soluciona fallos en algunas pasarelas personalizadas compatibles con OpenAI debidos a diferencias en el formato de solicitud o a la falta de contenido de razonamiento |
| Canales de npm (verificado el 20-08) | latest → 0.1.0-rc.7; next → 0.1.0-rc.8. El comando directo npx @deepseek-ai/dsh todavía resuelve a rc.7; para usar rc.8 ejecuta npx @deepseek-ai/dsh@next |
| Impulso del repositorio | 167.928 estrellas / 17.953 forks (API de GitHub, verificado el 2026-08-20) — frente a las más de 149.000 que citó Turing Post en su publicación del 17 de agosto |
Contexto: Harness v0.1 se publicó como código abierto el 13 de agosto junto con el lanzamiento general (GA) de V4-Pro. Consulta nuestro resumen de lanzamiento de v0.1 para conocer la arquitectura (todo basado en plugins sobre Cordis, cuatro modos de trabajo, licencia MIT).
La división: infraestructura del harness vs. capacidad del modelo
- Lo que se volvió multimodal es el runtime, no los modelos. Pega una imagen hoy en dsh y persistirá a través de llamadas a herramientas MCP/ACP, se reenviará mediante programas en modo PTC y podrá acompañar a los comandos de planificación
/goaly/plan. Esa es una infraestructura real que faltaba en la v0.1; los primeros analistas criticaron la versión de la semana de lanzamiento precisamente porque un modelo exclusivo de texto no podía rastrear un error visual de dos líneas. - Los modelos de la API propia de DeepSeek seguían siendo solo de texto al momento de la publicación... y ganaron visión un día después. El 21 de agosto de 2026, DeepSeek lanzó oficialmente deepseek-v4-flash-vision-exp, un modelo experimental de visión en la familia Flash con el mismo precio; V4-Pro continúa siendo solo texto. Al momento de la publicación, el registro de cambios no incluía ninguna entrada de visión desde la nota de GA de V4-Pro del 13 de agosto, y un destacado debate en Hugging Face sobre V4-Pro se quejaba de que carecía de «la multimodalidad nativa que ya tienen todos los demás modelos insignia chinos, incluidos Qwen y Kimi», precisamente la brecha que este lanzamiento acaba de cerrar para Flash.
- La documentación oficial deja claro el patrón previsto. En la tabla de solución de problemas del repositorio: si una imagen es rechazada antes de enviarse, el modelo «declara no admitir la modalidad de imagen»; corrígelo añadiendo
input: [text, image]a la entrada del modelo en$DSH_HOME/settings.yaml. En otras palabras: activa las solicitudes de imagen para un modelo que realmente cuente con visión, ya sea a través del adaptador de DeepSeek o de cualquier endpoint compatible con OpenAI. - La brecha de visión ya se estaba cerrando mediante plugins. modlens (autodefinido como el primer plugin de visión para dsh) permite pegar una imagen en una sesión de solo texto y recibir de vuelta evidencia estructurada en JSON (OCR, maquetación, semántica), enrutada a través de un conjunto de motores de visión (una clave gratuita de Gemini, Antigravity CLI o cualquier endpoint compatible con OpenAI; su README muestra una demo de Qwen-VL mediante el modo compatible de DashScope). Otras herramientas comunitarias similares incluyen agent-vision-toolkit (preguntas y respuestas sobre imágenes, OCR de capturas largas, restauración de UI, automatización de GUI) y dsh-vision-router. Son proyectos comunitarios no afiliados a DeepSeek; la calidad puede variar.
Qué dice la cobertura internacional
- Turing Post (17 de agosto) publicó el análisis en inglés más agudo: «DeepSeek está viviendo su segundo momento DeepSeek». Su argumento: con R1, DeepSeek debilitó la barrera competitiva de los modelos; con Harness (MIT, más de 149.000 estrellas al momento de publicarse), está «abriendo la capa que todos habían empezado a considerar como la siguiente barrera defensiva»: la capa de ejecución de agentes. También rastrea el origen de Cordis hasta Koishi, el framework para chatbots de Shigma (ahora en DeepSeek), cuyos cuatro años resolviendo problemas del ciclo de vida de plugins resultaron ser problemas del runtime de agentes.
- Prensa de la semana de lanzamiento (cubierta en nuestro resumen de v0.1): VentureBeat calificó a dsh como un «rival de código abierto para Claude Code»; The Decoder perfiló la arquitectura y al líder del proyecto, Cui Tianyi (ex-Jane Street); las pruebas de primera mano de 36Kr encontraron 288 repositorios de plugins en menos de 24 horas; Pandaily lo sintetizó como Modelo + Harness = Agente.
- Los lanzamientos de rc.7 y rc.8 en sí fueron seguidos principalmente por observadores de registros de cambios y por el ecosistema de plugins, más que por los medios tradicionales durante las primeras 48 horas; guías de terceros (chat-deep.ai, dshdocs.com, freedom.tech) registraron la novedad de los «adjuntos de imagen persistentes» en cuestión de un día. Si sigues la evolución de este proyecto, sigue las notas de la versión, no los titulares.
- En X, el hilo de anuncio del proyecto (@deepseek_ai, 13 de agosto) y las publicaciones del mantenedor @tianyi siguen siendo los canales canónicos; el autor de modlens @liustack publica las notas de versión primero en X, lo que confirma que el centro de gravedad del ecosistema reside en el repositorio y en X en lugar de en blogs.
Por qué esto importa para un stack de modelos chinos
- El harness es gratuito; los tokens de imagen son la nueva variable. Con la tarificación de horas punta y valle de V4-Pro (valle: $0.66 entrada / $1.98 salida por cada 1M; punta: $1.32 / $3.96, según la lectura de The Decoder de la página oficial de precios), el coste del bucle de un agente se traslada a donde se procesen las imágenes. Enrutar las subllamadas de visión a un modelo económico con capacidad visual mientras los modelos de texto gestionan el bucle de programación es exactamente el patrón multimodelo para el que se diseñó la capa de modelos por plugins de dsh.
- La corrección de pasarela de rc.8 es directamente relevante para usuarios de relays. La versión corrige pasarelas personalizadas compatibles con OpenAI que fallaban por diferencias en el formato de solicitud o perdían el contenido de razonamiento, el tipo de error que afecta a cualquiera que apunte dsh a un endpoint de terceros en lugar de usar claves de primera mano. Prueba tu endpoint con rc.8 antes de culpar al harness.
- El ritmo de cambios que rompen la compatibilidad es real y ya está aquí. v0.1 prometió cambios incompatibles; rc.8 trae uno (formato de almacenamiento SQLite incompatible). Fija la versión de tu dsh, mantén los datos de sesión fuera de la ruta de actualización y vuelve a verificar tras cada nueva rc; la línea sigue avanzando rápidamente hacia una versión 0.1.0 estable.
- La marca ya es oficial. Las notas de rc.8 aclaran que «DeepSeek Harness» es una marca registrada con directrices de marca publicadas; los autores de plugins y creadores de herramientas deberían consultarlas antes de nombrar proyectos derivados.
- Enfoque como proyecto independiente. dsh es el proyecto de código abierto de DeepSeek. ChinaModelAPI es un relay independiente compatible con OpenAI que no guarda relación oficial con él ni con DeepSeek; la coincidencia práctica es que un harness agnóstico respecto al modelo es un cliente natural para el enrutamiento multimodelo, y los identificadores de modelos con capacidad de visión deben verificarse directamente en el panel de control de tu proveedor antes de conectarlos.
Fuentes primarias
- GitHub — lanzamientos de deepseek-ai/deepseek-harness (notas de rc.7 y rc.8, CN/EN)
- npm — dist-tags de @deepseek-ai/dsh (latest = rc.7, next = rc.8, verificado el 2026-08-20)
- deepseek.com/harness — página oficial de vista previa para desarrolladores
- Registro de cambios de la API de DeepSeek: sin entradas de visión desde el 2026-08-13 (estado de solo texto de los modelos V4)
- Turing Post — FOD#163: DeepSeek está viviendo su segundo momento DeepSeek (2026-08-17)
- VentureBeat — DeepSeek Harness se lanza como rival de código abierto para Claude Code (semana de lanzamiento)
- The Decoder — V4 Pro mejorado, precios de API más altos, software de agentes de código abierto (detalle de precios)
- GitHub — liustack/modlens (plugin de visión comunitario para dsh, MIT)
- Directorio de DeepSeek Code — perfil del plugin agent-vision-toolkit (comunidad)
- Debate en Hugging Face — brecha de multimodalidad nativa en V4-Pro (comunidad)
FAQ
¿Puede dsh leer imágenes ahora?
El harness puede transportarlas: pegarlas, conservarlas, reenviarlas y planificar con ellas. La lectura sigue ocurriendo en el modelo: V4-Pro y V4-Flash son solo de texto, por lo que debes dirigir el paso de visión hacia un modelo con capacidad visual mediante la configuración del adaptador o un endpoint compatible con OpenAI.
¿Cómo puedo probar rc.8?
npx @deepseek-ai/dsh@next — la etiqueta latest todavía resuelve a rc.7. El formato de almacenamiento SQLite de rc.8 es incompatible con sesiones anteriores; realiza una instalación limpia y vuelve a añadir la configuración de tu proveedor.
Vision-Exp ya se lanzó, ¿qué pasa con V4-Pro?
deepseek-v4-flash-vision-exp se lanzó el 21 de agosto de 2026; nuestro resumen de lanzamiento incluye los precios, la guía rápida y los límites. La visión para V4-Pro sigue sin anunciarse.
¿Qué pasa con mi propia pasarela?
Es compatible y ha sido reforzada recientemente: rc.8 soluciona los fallos de formato de solicitud y de falta de razonamiento en pasarelas personalizadas compatibles con OpenAI. Declara input: [text, image] en los modelos que acepten imágenes para que dsh las envíe de forma nativa.