ChinaModelAPI

Notícias / Radar de Modelos · Ferramentas

Código aberto DeepSeek Harness (dsh) Multimodal rc.7 / rc.8
2026-08-20 · Model Watch · rc.7 lançado em 17-08, rc.8 lançado em 19-08 (UTC)

DeepSeek Harness adiciona entrada multimodal de imagem — o Harness ganhou olhos, os modelos não

Uma semana após abrir o código do Harness v0.1, a DeepSeek lançou dois release candidates que adicionam entrada de imagem ao runtime do agente: rc.7 (anexos de imagem duráveis) e rc.8 (requisições nativas de imagem para adaptadores DeepSeek, entrada de imagem para /goal e /plan). Analistas internacionais estão chamando o harness de "um segundo momento DeepSeek". Confira exatamente o que chegou, o que ainda é apenas texto e o que desenvolvedores de API devem fazer com isso.

Atualização · 2026-08-21: A DeepSeek lançou oficialmente o deepseek-v4-flash-vision-exp — o modelo oficial com capacidade de visão que este artigo dizia estar ausente. O V4-Pro continua sendo apenas de texto. Leia o resumo do lançamento com preços, código de início rápido e orientações de roteamento de modelos →
Resposta direta

O DeepSeek Harness agora suporta imagens de ponta a ponta — e, a partir de 21 de agosto, um modelo oficial do DeepSeek finalmente pode lê-las. De acordo com as notas oficiais de lançamento: o rc.7 (17 de agosto) adicionou anexos duradouros de imagem ao MCP e ACP, com encaminhamento aninhado de imagens no modo PTC; o rc.8 (19 de agosto) expandiu o suporte multimodal com solicitações nativas e configuráveis de imagem para adaptadores do DeepSeek, entrada de imagem para /goal / /plan e referências a arquivos & sessões no menu @. Na data de publicação (20 de agosto), o porém era que o V4-Pro e o V4-Flash ainda eram apenas de texto; em 21 de agosto, o DeepSeek lançou o deepseek-v4-flash-vision-exp, o primeiro modelo oficial de visão da família Flash — resumo do lançamento aqui. O V4-Pro continua apenas de texto. O rc.8 utiliza a tag next do npm (latest ainda é o rc.7), e seu novo formato de armazenamento SQLite é incompatível com sessões mais antigas.

O que foi lançado, segundo fontes oficiais

ItemDetalhe
rc.7 · 2026-08-17 12:01 UTCAnexos de imagem duráveis no MCP e ACP, encaminhamento de imagens aninhadas no modo PTC; plugins podem registrar seus próprios cartões de configurações; tarefas de subagentes do Codex e Claude Code passam a integrar o Job Panel; novo esforço de raciocínio low para modelos DeepSeek (o padrão permanece high); predefinição em inglês "Code mode" renomeada para "PTC mode"
rc.8 · 2026-08-19 15:37 UTCExpansão multimodal: requisições nativas de imagem configuráveis para adaptadores DeepSeek, entrada de imagem para /goal / /plan, referências de arquivos & sessões no menu @ (por @LegGasai e @CreatixChu); subagentes Claude Code & Codex instaláveis sob demanda como Profile Bundles; PowerShell persistente no Windows PTY; web_search simultâneo; downloads de dependências menores; backend SQLite mais rápido & menor — formato de armazenamento incompatível; "DeepSeek Harness" declarada marca registrada com diretrizes de marca
Correções que realmente importam aquiO rc.8 corrige falhas em requisições de modelos causadas por imagens excessivamente grandes ou pelo acúmulo excessivo de payloads de imagem — exatamente o modo de falha enfrentado por loops de agentes com uso intenso de imagens — e corrige falhas em alguns gateways personalizados compatíveis com a OpenAI decorrentes de diferenças no formato da requisição ou da ausência de conteúdo de raciocínio
canais do npm (verificado em 08-20)latest → 0.1.0-rc.7; next → 0.1.0-rc.8. O simples npx @deepseek-ai/dsh ainda resolve para rc.7; opte por rc.8 com npx @deepseek-ai/dsh@next
Momento do repositório167.928 estrelas / 17.953 forks (GitHub API, verificado em 2026-08-20) — acima dos mais de 149.000 citados pelo Turing Post em sua publicação de 17 de agosto

Contexto: o Harness v0.1 teve seu código aberto em 13 de agosto junto com o V4-Pro GA — confira nosso resumo de lançamento da v0.1 para conhecer a arquitetura (tudo é plugin no Cordis, quatro modos de trabalho, licença MIT).

A divisão: infraestrutura do harness vs. capacidade do modelo

  • O que se tornou multimodal foi o runtime, não os modelos. Cole uma imagem no dsh hoje e ela persiste entre chamadas de ferramentas MCP/ACP, é encaminhada por programas em modo PTC e pode acompanhar os comandos de planejamento /goal e /plan. Essa é a infraestrutura real que faltava na v0.1 — os primeiros avaliadores criticaram a stack da semana de lançamento justamente porque um modelo apenas de texto não conseguia rastrear um bug visual de duas linhas.
  • Os modelos da própria API da DeepSeek ainda eram apenas de texto no momento da publicação — e ganharam visão um dia depois. Em 21 de agosto de 2026, a DeepSeek lançou oficialmente o deepseek-v4-flash-vision-exp, um modelo experimental de visão da família Flash sem alteração de preço; o V4-Pro continua apenas de texto. No momento da publicação, o changelog não trazia nenhum registro de visão desde a nota de GA do V4-Pro em 13 de agosto, e uma das principais discussões no Hugging Face sobre o V4-Pro reclamava da falta de "multimodalidade nativa que todos os outros modelos chineses de ponta já possuem, incluindo Qwen e Kimi" — exatamente a lacuna que o lançamento acabou de fechar para o Flash.
  • A documentação oficial deixa explícito o padrão pretendido. Na tabela de solução de problemas do repositório: se uma imagem for recusada antes do envio, o modelo "declara não ter modalidade de imagem" — resolva isso adicionando input: [text, image] à entrada do modelo em $DSH_HOME/settings.yaml. Em outras palavras: ative o envio de imagens para um modelo que realmente tenha visão, via adaptador do DeepSeek ou qualquer endpoint compatível com a OpenAI.
  • A lacuna de visão já vinha sendo preenchida por plugins. modlens (autointitulado o primeiro plugin de visão para dsh) permite colar uma imagem em uma sessão somente de texto e obter evidências estruturadas em JSON — OCR, layout, semântica — roteadas por um pool de motores de visão (uma chave gratuita do Gemini, Antigravity CLI ou qualquer endpoint compatível com a OpenAI; seu README demonstra o Qwen-VL via modo compatível do DashScope). Ferramentas semelhantes da comunidade incluem o agent-vision-toolkit (Q&A de imagens, OCR de capturas de tela longas, restauração de UI, automação de GUI) e o dsh-vision-router. Projetos da comunidade, sem afiliação com a DeepSeek — a qualidade varia.

O que diz a cobertura internacional

  • O Turing Post (17 de agosto) publicou a análise mais perspicaz em inglês: "A DeepSeek está vivendo seu segundo momento DeepSeek." Seu argumento: com o R1, a DeepSeek enfraqueceu o fosso dos modelos; com o Harness (MIT, 149K+ estrelas na publicação), ela está "abrindo a camada que todos começavam a ver como o próximo fosso" — a camada de execução de agentes. Também traça a linhagem do Cordis até o Koishi, o framework de chatbot de Shigma (agora na DeepSeek), cujos quatro anos de problemas com o ciclo de vida de plugins se revelaram problemas de runtime de agentes.
  • Imprensa na semana de lançamento (abordado em nosso resumo da v0.1): o VentureBeat definiu o dsh como um "rival de código aberto do Claude Code"; o The Decoder detalhou a arquitetura e o líder do projeto Cui Tianyi (ex-Jane Street); o teste prático da 36Kr encontrou 288 repositórios de plugins em 24 horas; a Pandaily estruturou como Modelo + Harness = Agente.
  • Os próprios lançamentos rc.7/rc.8 foram acompanhados principalmente por observadores de changelog e pelo ecossistema de plugins, em vez da grande mídia nas primeiras 48 horas — guias de terceiros (chat-deep.ai, dshdocs.com, freedom.tech) registraram a linha "durable image attachments" em menos de um dia. Se você acompanha a história, siga as notas de lançamento, não as manchetes.
  • No X, a thread de anúncio do projeto (@deepseek_ai, 13 de ago.) e as publicações do mantenedor @tianyi continuam sendo os canais canônicos; o autor do modlens, @liustack, publica as notas de lançamento primeiro no X — consistente com o centro de gravidade do ecossistema estar no repositório e no X, em vez de em blogs.

Por que isso importa para uma stack de modelos chineses

  • O harness é gratuito; os tokens de imagem são a nova variável. Com o V4-Pro adotando precificação de pico/fora de pico (fora de pico: $0.66 entrada / $1.98 saída por 1M, pico: $1.32 / $3.96 — segundo a leitura da página oficial de preços pelo The Decoder), o custo de um loop de agente se desloca para onde quer que as imagens sejam processadas. Rotear subchamadas de visão para um modelo econômico com capacidade de visão enquanto modelos de texto conduzem o loop de código é exatamente o padrão multimodelo para o qual a camada de modelo de plugins do dsh foi construída.
  • A correção de gateway da rc.8 é diretamente relevante para usuários de relay. Esta versão corrige gateways personalizados compatíveis com OpenAI que falhavam por diferenças no formato da requisição ou descartavam conteúdo de raciocínio — o tipo de bug que afeta qualquer um que aponte o dsh para um endpoint de terceiros em vez de chaves oficiais. Teste seu endpoint com a rc.8 antes de culpar o harness.
  • A cadência de breaking changes é real e foi entregue. A v0.1 prometeu mudanças com quebra de compatibilidade; o rc.8 entrega uma (formato de armazenamento SQLite incompatível). Fixe sua versão do dsh, mantenha os dados de sessão fora do caminho de upgrade e reverifique a cada bump de rc — a linha continua acelerando rumo a um 0.1.0 estável.
  • O branding agora é oficial. As notas do rc.8 esclarecem que "DeepSeek Harness" é uma marca registrada com diretrizes de marca publicadas — autores de plugins e criadores de ferramentas devem lê-las antes de nomear derivados.
  • Enquadramento de projeto independente. O dsh é o projeto de código aberto da DeepSeek. A ChinaModelAPI é um relay independente compatível com a OpenAI, sem qualquer relação oficial com ele ou com a DeepSeek — a intersecção prática é que uma interface agnóstica a modelos é um cliente natural para roteamento multimodelo, e os IDs dos modelos com suporte a visão devem ser verificados diretamente no painel do seu provedor antes de conectá-los.

Fontes primárias

FAQ

O dsh consegue ler imagens agora?

O harness pode carregá-los — colar, persistir, encaminhar, planejar com eles. A leitura ainda ocorre no modelo: V4-Pro/V4-Flash são apenas texto, então direcione a etapa de visão para um modelo com suporte a visão por meio da adapter config ou de um endpoint compatível com a OpenAI.

Como faço para testar o rc.8?

npx @deepseek-ai/dsh@next — a tag latest ainda resolve para o rc.7. O formato de armazenamento SQLite do rc.8 é incompatível com sessões anteriores; faça uma instalação limpa e adicione novamente a configuração do seu provedor.

Vision-Exp lançado — e o V4-Pro?

deepseek-v4-flash-vision-exp foi lançado em 21 de agosto de 2026 — nosso resumo de lançamento traz os preços, o guia de início rápido e os limites. O V4-Pro vision ainda não foi anunciado.

E quanto ao meu próprio gateway?

Suportado e recém-reforçado — o rc.8 corrige falhas no formato de requisição e de ausência de raciocínio em gateways personalizados compatíveis com OpenAI. Declare input: [text, image] nos modelos que aceitam imagens para que o dsh as envie nativamente.

Guias relacionados