Notícias / Radar de Modelos · Ferramentas
DeepSeek Harness v0.1: DeepSeek Abre o Código do Seu Harness de Agentes
Horas após lançar o DeepSeek-V4-Pro-0813, a DeepSeek lançou o Harness v0.1 em Developer Preview — o framework de agentes em código aberto com licença MIT que utiliza para avaliar os seus próprios modelos. A imprensa internacional rapidamente o descreveu como um rival aberto do Claude Code e do OpenAI Codex. Eis o que ele realmente é, o que os primeiros testes práticos revelaram e o que os desenvolvedores de APIs devem reter.
Atualização · 2026-08-20: O Harness deu os seus primeiros passos multimodais — o rc.7 (17 de ago.) adicionou anexos duráveis de imagem ao MCP/ACP; o rc.8 (19 de ago.) adicionou requisições nativas de imagem configuráveis para adaptadores DeepSeek e entrada de imagem para /goal e /plan. Os modelos V4 da DeepSeek permanecem apenas em texto. Leia o resumo de acompanhamento →
O DeepSeek Harness (dsh) é um harness de agentes gratuito, com licença MIT, executado localmente — e é agnóstico em relação ao modelo.
Anunciado pela conta oficial no X da DeepSeek em 13 de ago. de 2026 (21:02 UTC+8) e publicado em
github.com/deepseek-ai/deepseek-harness.
Tudo — ferramentas, sandbox, sessões, UI — é um plugin intercambiável no sistema de plugins Cordis. Inicie-o com
npx @deepseek-ai/dsh web (Web UI em 127.0.0.1:3080).
Trata-se de um developer preview v0.1 com mudanças incompatíveis prometidas — avalie-o, mas ainda não aposte nele em produção.
O que foi lançado, segundo fontes oficiais
| Item | Detalhe |
|---|---|
| O quê | DeepSeek Harness v0.1 — Developer Preview de um harness de agentes em código aberto (dsh) |
| Quando | Anunciado em 2026-08-13 às 21:02 (UTC+8) no X; repositório tornado público na mesma noite |
| Licença | MIT |
| Arquitetura | "Tudo é um plugin" no Cordis; ferramentas / sandbox / sessões / UI totalmente substituíveis |
| Execução | npx @deepseek-ai/dsh web → Web UI local em 127.0.0.1:3080 |
| Ressalva de status | Iteração rápida; "HAVERÁ ALTERAÇÕES QUE QUEBRAM A COMPATIBILIDADE" (README) |
| Integração com a documentação oficial | O changelog da API da DeepSeek indica que os benchmarks públicos do V4-Flash foram executados no "minimal mode" do Harness; a barra lateral da documentação agora inclui links para a documentação do harness |
Na mesma noite, o DeepSeek-V4-Pro-0813 entrou em GA no app/web/API com suporte nativo à Responses API e adaptação ao Codex — consulte o nosso resumo de lançamento do 0813; a alteração de preços para horário de pico/fora de pico entra em vigor em 16 de ago., às 16:00 UTC.
O que diz a cobertura internacional
- VentureBeat abordou o lançamento diretamente: um "rival de código aberto do Claude Code" lançado junto com o V4-Pro na API "com preços mais altos" — a história de dois lados da semana: ferramentas mais baratas, tokens topo de linha mais caros.
- The Decoder destaca a arquitetura e a linhagem: "todos os recursos são plugins intercambiáveis" no recém-lançado sistema Cordis; logs de sessão persistentes registram cada prompt, chamada de ferramenta e resultado, com execuções que podem ser retomadas, ramificadas e reproduzidas; o modo minimal mantém apenas um shell e um editor de arquivos — a configuração que a própria DeepSeek usa para execuções de benchmark. Também destaca que o líder do projeto é Cui Tianyi, que veio da Jane Street para a DeepSeek em março de 2026, e que a chamada de testadores atraiu 712 inscrições em três dias.
- 36Kr (English) publicou um teste prático noturno com uma tese contundente — "Não é apenas mais um Claude Code, veio para liquidar o Claude Code" — e conclusões concretas: quatro modos de trabalho (standard; PTC, onde o modelo escreve TypeScript que combina ~10 rodadas de chamadas de ferramentas em uma única execução; minimal para benchmarking; e um modo de criação para desenvolver novos modos); logs de trajetória append-only; 288 repositórios de plugins em 24 horas; hot-plugging de mais de 20 plugins sem nenhuma reinicialização via rastreamento de efeitos colaterais reversíveis do Cordis; e importação de sessões do Claude Code, opencode e Antigravity que "funcionou perfeitamente". Sua observação mais perspicaz: o modelo não tem posição privilegiada — "Os próprios modelos da DeepSeek não são exceção. São apenas mais um plugin."
- Pandaily chamou-o de possivelmente "o projeto open source de agentes mais ambicioso do ano", estruturando-o em torno da equação Model + Harness = Agent.
- Reddit (r/LocalLLaMA, r/DeepSeek) repercutiu o repositório imediatamente; discussões da comunidade destacam as compilações Desktop/CLI e o fato de que os benchmarks de agentes publicados pela DeepSeek rodam todos através deste harness.
- SCMP havia informado anteriormente que a DeepSeek "reforça IA agêntica com testes de harness" — contexto útil mostrando que este lançamento foi planejado, e não improvisado.
Por que isso importa para uma stack de modelos chineses
- O harness é gratuito; o custo está nos tokens. Com o V4-Pro migrando para preços de pico/fora de pico (fora de pico $0.66 de entrada / $1.98 de saída por 1M; pico em dobro; preço de cache-hit com o maior aumento — segundo a leitura do The Decoder sobre a página oficial de preços), a viabilidade econômica dos loops de agentes se desloca para modelos mais baratos e de pesos abertos para trabalho em massa. É exatamente aí que um gateway multimodelo compatível com a OpenAI se encaixa.
- Agnóstico a modelos por design. A camada de modelos é um plugin; plugins de roteamento da comunidade já existem. Apontar o
dshpara um endpoint compatível com a OpenAI (camadas DeepSeek, Qwen, GLM, Kimi) é o padrão pretendido, não um hack — verifique os termos do seu provedor e o suporte a chamadas de ferramentas por modelo. - Logs de trajetória são um grande avanço na depuração. Logs append-only com suporte a retomar/ramificar/reproduzir tornam execuções longas de agentes inspecionáveis — valioso quando você está fazendo testes A/B para ver qual modelo de ponta chinês lida melhor com tarefas no nível do repositório.
- A importação de sessões reduz o custo de migração. Se você tem histórico do Claude Code ou opencode, o teste prático da 36Kr mostra que é possível trazê-lo junto — algo que vale a pena saber antes da sua próxima decisão de harness.
- Não migre a produção ainda. Trata-se de um preview v0.1 com mudanças incompatíveis prometidas, e grande parte da experiência de uso atualmente depende de plugins da comunidade que evoluem rápido e têm qualidade irregular. Teste em sandbox, faça benchmarks e reavalie na v0.2+.
Fontes primárias
- github.com/deepseek-ai/deepseek-harness (repositório oficial: MIT, developer preview, Cordis, instruções de execução)
- DeepSeek no X — Anúncio do Developer Preview do Harness v0.1 (2026-08-13)
- Changelog da API da DeepSeek — V4-Pro-0813 GA, nota de benchmark em minimal mode do Harness, preços de 16 de ago.
- The Decoder — DeepSeek lança V4 Pro aprimorado, aumenta preços da API e abre o código de seu software de agentes
- VentureBeat — DeepSeek Harness é lançado como rival de código aberto do Claude Code
- 36Kr English — Após testar o DeepSeek Harness a noite toda (quatro modos, plugins, importação de sessões)
- Pandaily — Teste prático do DeepSeek Harness: Quatro modos de trabalho, Model + Harness = Agent
- SCMP — DeepSeek reforça IA agêntica com testes de harness (contexto pré-lançamento)
FAQ
O DeepSeek Harness é gratuito?
O harness em si é gratuito e licenciado sob MIT. Você paga pelos tokens do modelo — através da API da DeepSeek ou de qualquer provedor compatível com a OpenAI para o qual você o direcione.
Assassino do Claude Code?
Os testes práticos internacionais ficaram impressionados, mas são honestos: v0.1, mudanças incompatíveis prometidas, qualidade irregular dos plugins. É o primeiro harness aberto de um laboratório de ponta com estrutura interna de nível de benchmark — um concorrente credível, mas não uma substituição hoje.
Posso usá-lo com Qwen / GLM / Kimi?
Arquiteturalmente sim — o modelo é apenas mais um plugin e já existem plugins de roteamento. Verifique o suporte a chamadas de ferramentas e os termos de cada provedor; usuários da ChinaModelAPI devem confirmar os IDs dos modelos ativos no painel.
O que é o "minimal mode"?
Apenas shell + editor de arquivos, sem recursos extras — a configuração que a DeepSeek usa para avaliar o desempenho básico dos modelos. Use-o quando quiser números comparáveis entre modelos.