뉴스 / Model Watch · 툴링
DeepSeek Harness, 멀티모달 이미지 입력 추가 — 하네스는 눈을 얻었지만, 모델은 얻지 못했다
Harness v0.1을 오픈소스로 공개한 지 일주일 만에, DeepSeek는 에이전트 런타임에 이미지 입력을 도입한 두 개의 릴리스 후보(RC)를 출시했습니다: rc.7(영구 이미지 첨부) 및 rc.8(DeepSeek 어댑터를 위한 네이티브 이미지 요청, /goal 및 /plan용 이미지 입력). 해외 분석가들은 이 하네스를 "제2의 DeepSeek 모먼트"라고 부르고 있습니다. 이번에 실제로 추가된 기능과 여전히 텍스트 전용인 부분, 그리고 API 빌더들이 이를 어떻게 활용해야 하는지 자세히 정리했습니다.
DeepSeek Harness는 이제 엔드투엔드로 이미지를 전달할 수 있으며, 8월 21일부로 공식 DeepSeek 모델이 마침내 이를 읽을 수 있게 되었습니다.
공식 릴리스 노트에 따르면:
rc.7(8월 17일)은 PTC 모드에서의 중첩 이미지 전달과 함께 MCP 및 ACP에 영구 이미지 첨부 기능을 추가했습니다.
rc.8(8월 19일)은 DeepSeek 어댑터용 구성 가능한 네이티브 이미지 요청, /goal / /plan용 이미지 입력, @ 메뉴의 파일 & 세션 참조를 통해 멀티모달 지원을 확장했습니다.
발행 시점(8월 20일)에는 V4-Pro와 V4-Flash가 여전히 텍스트 전용이라는 한계가 있었으나, 8월 21일 DeepSeek는 Flash 제품군 최초의 공식 비전 모델인 deepseek-v4-flash-vision-exp를 출시했습니다 — 출시 브리핑 바로가기. V4-Pro는 여전히 텍스트 전용입니다.
rc.8은 npm next 태그에 배포되었으며(latest는 여전히 rc.7), 새로운 SQLite 스토리지 형식은 이전 세션과 호환되지 않습니다.
공식 출처 기준 출시 내역
| 항목 | 세부 내용 |
|---|---|
| rc.7 · 2026-08-17 12:01 UTC | MCP 및 ACP의 영구 이미지 첨부, PTC 모드의 중첩 이미지 전달 지원; 플러그인이 자체 설정 카드를 등록 가능; Codex 및 Claude Code 서브에이전트 작업이 Job Panel에 추가됨; DeepSeek 모델을 위한 새로운 low 추론 강도(reasoning effort) 옵션 추가(기본값은 high 유지); 영문 프리셋 "Code mode"가 "PTC mode"로 명칭 변경 |
| rc.8 · 2026-08-19 15:37 UTC | 멀티모달 확장: DeepSeek 어댑터용 구성 가능한 네이티브 이미지 요청, /goal / /plan용 이미지 입력, @ 메뉴의 파일 & 세션 참조(@LegGasai 및 @CreatixChu 기여); Claude Code & Codex 서브에이전트를 Profile Bundle로 필요에 따라 온디맨드 설치 가능; Windows PTY의 영구 PowerShell 지원; 동시 web_search; 종속성 다운로드 용량 감소; SQLite 백엔드 속도 향상 및 용량 축소 — 스토리지 형식 호환 불가; "DeepSeek Harness"가 브랜드 가이드라인과 함께 등록 상표로 선언됨 |
| 주요 수정 사항 | rc.8은 대용량 이미지나 과도하게 누적된 이미지 페이로드로 인해 발생하는 모델 요청 실패(이미지 사용량이 많은 에이전트 루프에서 정확히 발생하는 실패 유형)를 수정하고, 요청 형식 차이나 누락된 추론 콘텐츠로 인해 일부 커스텀 OpenAI 호환 게이트웨이에서 발생하던 오류를 수정했습니다. |
| npm 채널 (08-20 확인 기준) | latest → 0.1.0-rc.7; next → 0.1.0-rc.8. 일반 npx @deepseek-ai/dsh는 여전히 rc.7로 확인되며, rc.8을 사용하려면 npx @deepseek-ai/dsh@next를 지정해야 합니다. |
| 리포지토리 모멘텀 | 167,928 스타 / 17,953 포크 (GitHub API, 2026-08-20 확인 기준) — 8월 17일 Turing Post 발행 당시 인용된 149,000+개에서 증가 |
배경: Harness v0.1은 V4-Pro 정식 출시(GA)와 함께 8월 13일 오픈소스로 공개되었습니다. 아키텍처(Cordis 기반의 everything-is-a-plugin 구조, 4가지 작업 모드, MIT 라이선스)에 대한 자세한 내용은 v0.1 출시 브리핑을 참조하세요.
구분: 하네스 파이프라인 vs. 모델 역량
- 멀티모달화된 것은 런타임이지 모델이 아닙니다. 현재 dsh에 이미지를 붙여넣으면 MCP/ACP 툴 호출 간에 이미지가 유지되고, PTC 모드 프로그램을 통해 전달되며,
/goal및/plan계획 명령에 함께 포함될 수 있습니다. 이는 v0.1에서 누락되었던 실질적인 파이프라인 구조입니다. 출시 첫 주 초기 리뷰어들이 해당 스택을 비판했던 이유도 바로 텍스트 전용 모델이 두 줄짜리 시각적 버그를 추적하지 못했기 때문이었습니다. - DeepSeek 자체 API 모델은 발행 시점에 여전히 텍스트 전용이었으나, 하루 뒤 비전 기능을 확보했습니다. 2026년 8월 21일, DeepSeek는 동일한 가격으로 Flash 제품군의 실험적 비전 모델인 deepseek-v4-flash-vision-exp를 공식 출시했습니다. V4-Pro는 여전히 텍스트 전용입니다. 발행 당시 변경 로그에는 8월 13일 V4-Pro GA 발표 이후 비전 관련 항목이 전혀 없었으며, Hugging Face의 V4-Pro 주요 토론에서는 "Qwen과 Kimi를 포함해 다른 모든 중국 플래그십 모델이 현재 갖추고 있는 네이티브 멀티모달 기능"이 부족하다는 불만이 제기되기도 했습니다. 이번 Flash 모델 출시가 바로 그 공백을 메운 것입니다.
- 공식 문서에는 의도된 사용 패턴이 명시되어 있습니다. 리포지토리의 트러블슈팅 표에 따르면, 전송 전 이미지가 거부되는 경우 모델이 "이미지 모달리티를 선언하지 않은 상태"이므로,
$DSH_HOME/settings.yaml의 모델 항목에input: [text, image]를 추가하여 해결할 수 있습니다. 즉, DeepSeek 어댑터나 OpenAI 호환 엔드포인트를 통해 실제로 비전 기능을 갖춘 모델에 대해 이미지 요청을 활성화하라는 의미입니다. - 비전 기능의 공백은 이미 플러그인을 통해 메워지고 있었습니다. modlens(자칭 dsh 최초의 비전 플러그인)를 사용하면 텍스트 전용 세션에 이미지를 붙여넣고 구조화된 JSON 증거(OCR, 레이아웃, 시맨틱)를 반환받을 수 있으며, 이는 다양한 비전 엔진 풀(무료 Gemini 키, Antigravity CLI 또는 모든 OpenAI 호환 엔드포인트; README에서는 DashScope 호환 모드를 통한 Qwen-VL 시연)로 라우팅됩니다. 유사한 커뮤니티 도구로는 agent-vision-toolkit(이미지 Q&A, 긴 스크린샷 OCR, UI 복원, GUI 자동화)과 dsh-vision-router가 있습니다. 이들은 DeepSeek와 무관한 커뮤니티 프로젝트이므로 품질에는 차이가 있을 수 있습니다.
해외 미디어의 평가
- Turing Post(8월 17일)는 영미권에서 가장 날카로운 분석을 내놓았습니다: "DeepSeek is having its second DeepSeek moment." 그들의 주장에 따르면, DeepSeek는 R1을 통해 모델의 해자(moat)를 약화시켰으며, Harness(MIT 라이선스, 발행 당시 스타 149K+개)를 통해 "모두가 다음 해자로 주목하기 시작했던 계층"인 에이전트 실행 계층을 개방하고 있습니다. 또한 Cordis의 뿌리가 현재 DeepSeek에 재직 중인 Shigma의 챗봇 프레임워크 Koishi에 있음을 짚으며, Koishi에서 4년간 겪었던 플러그인 수명 주기 문제가 결국 에이전트 런타임의 문제와 맞닿아 있었음을 설명합니다.
- 출시 첫 주 언론 보도(v0.1 브리핑에서 다룸): VentureBeat는 dsh를 "Claude Code의 오픈소스 경쟁자"로 평가했고, The Decoder는 아키텍처 및 프로젝트 리드인 Cui Tianyi(전 Jane Street)를 집중 조명했으며, 36Kr은 밤샘 핸즈온을 통해 24시간 만에 288개의 플러그인 리포지토리가 등장했음을 확인했고, Pandaily는 이를 'Model + Harness = Agent' 공식으로 정리했습니다.
- rc.7/rc.8 릴리스 자체는 첫 48시간 동안 주류 언론보다는 주로 변경 로그 추적자들과 플러그인 생태계에서 다루어졌습니다. 서드파티 가이드(chat-deep.ai, dshdocs.com, freedom.tech)는 하루 만에 "영구 이미지 첨부" 항목을 기록했습니다. 이 소식을 제대로 파악하려면 헤드라인이 아닌 릴리스 노트를 확인해야 합니다.
- X(구 Twitter)에서는 프로젝트 발표 스레드(@deepseek_ai, 8월 13일)와 메인테이너인 @tianyi의 게시물이 여전히 공식 채널로 통하며, modlens 개발자인 @liustack 역시 X에 가장 먼저 릴리스 노트를 공개합니다. 이는 생태계의 중심축이 블로그가 아닌 리포지토리와 X에 형성되어 있는 현상과 일치합니다.
이것이 중국 모델 스택에 중요한 이유
- 하네스는 무료이지만, 이미지 토큰이 새로운 변수입니다. V4-Pro의 피크/오프피크 요금제(The Decoder의 공식 요금 페이지 분석 기준: 100만 토큰당 오프피크 입력 $0.66 / 출력 $1.98, 피크 입력 $1.32 / 출력 $3.96)를 고려할 때, 에이전트 루프의 비용은 이미지가 어디서 처리되는가에 따라 크게 달라집니다. 텍스트 모델이 코딩 루프를 주도하는 동안 비전 서브 호출을 저렴한 비전 지원 모델로 라우팅하는 것은 바로 dsh의 플러그인 모델 계층이 구축된 본래 목적이자 핵심적인 멀티 모델 패턴입니다.
- rc.8의 게이트웨이 수정 사항은 릴레이 사용자에게 직접적인 관련이 있습니다. 이번 릴리스는 요청 형식 차이로 인해 실패하거나 추론 콘텐츠가 누락되던 커스텀 OpenAI 호환 게이트웨이 문제를 수정했습니다. 이는 퍼스트파티 키 대신 서드파티 엔드포인트로 dsh를 연결할 때 흔히 겪는 버그 유형입니다. 하네스 문제를 의심하기 전에 rc.8 환경에서 사용 중인 엔드포인트를 먼저 테스트해 보세요.
- 호환성을 깨뜨리는 변경 주기(breaking-change)가 실제로 적용되고 있습니다. v0.1에서 호환성이 깨지는 변경을 예고한 바 있으며, rc.8에서 실제로 적용되었습니다(SQLite 스토리지 형식 호환 불가). dsh 버전을 고정하고, 세션 데이터를 업그레이드 경로에서 분리하며, 각 rc 버전이 업데이트될 때마다 재검증하세요 — 안정적인 0.1.0 버전을 향한 개발이 여전히 빠르게 진행 중입니다.
- 브랜딩이 공식화되었습니다. rc.8 릴리스 노트에서는 "DeepSeek Harness"가 브랜드 가이드라인과 함께 등록된 상표임을 명확히 밝혔습니다. 플러그인 개발자 및 도구 제작자는 파생 프로젝트의 이름을 짓기 전에 이를 확인해야 합니다.
- 독립 프로젝트 안내. dsh는 DeepSeek의 오픈소스 프로젝트입니다. ChinaModelAPI는 해당 프로젝트나 DeepSeek와 공식적인 관계가 없는 독립적인 OpenAI 호환 릴레이입니다. 실질적인 연계점은 모델에 구애받지 않는 하네스가 멀티 모델 라우팅의 자연스러운 클라이언트가 된다는 점이며, 비전 지원 모델 ID를 연결하기 전에 제공업체의 대시보드에서 실시간으로 확인해야 합니다.
주요 출처
- GitHub — deepseek-ai/deepseek-harness 릴리스 (rc.7 및 rc.8 노트, CN/EN)
- npm — @deepseek-ai/dsh dist-tags (latest = rc.7, next = rc.8, 2026-08-20 확인)
- deepseek.com/harness — 공식 개발자 프리뷰 페이지
- DeepSeek API 변경 내역 — 2026-08-13 이후 비전 항목 없음 (V4 모델의 텍스트 전용 상태)
- Turing Post — FOD#163: DeepSeek, 두 번째 DeepSeek 모먼트를 맞이하다 (2026-08-17)
- VentureBeat — DeepSeek Harness, Claude Code의 오픈소스 대항마로 출시 (출시 주간)
- The Decoder — 개선된 V4 Pro, 인상된 API 가격, 오픈소스화된 에이전트 소프트웨어 (가격 세부사항)
- GitHub — liustack/modlens (dsh용 커뮤니티 비전 플러그인, MIT)
- DeepSeek Code 디렉터리 — agent-vision-toolkit 플러그인 프로필 (커뮤니티)
- Hugging Face 토론 — V4-Pro의 네이티브 멀티모달리티 격차 (커뮤니티)
FAQ
dsh가 이제 이미지를 읽을 수 있나요?
하네스는 이미지를 전달(붙여넣기, 유지, 포워딩, 계획 수립에 활용)할 수 있습니다. 이미지를 읽고 이해하는 작업은 여전히 모델에서 이루어집니다. V4-Pro/V4-Flash는 텍스트 전용이므로, 어댑터 설정이나 OpenAI 호환 엔드포인트를 통해 비전 단계를 비전 지원 모델로 연결해야 합니다.
rc.8은 어떻게 사용해 볼 수 있나요?
npx @deepseek-ai/dsh@next를 실행하면 됩니다 — latest 태그는 여전히 rc.7로 확인됩니다. rc.8의 SQLite 스토리지 형식은 이전 세션과 호환되지 않으므로, 새로 설치한 후 공급자 설정을 다시 추가하세요.
Vision-Exp가 출시되었는데, V4-Pro는 어떤가요?
deepseek-v4-flash-vision-exp는 2026년 8월 21일에 출시되었습니다 — 출시 브리핑에서 가격, 빠른 시작 가이드, 제한 사항을 확인할 수 있습니다. V4-Pro 비전 지원 여부는 아직 발표되지 않았습니다.
자체 게이트웨이를 사용하는 경우는 어떤가요?
지원되며 한층 더 안정화되었습니다 — rc.8은 커스텀 OpenAI 호환 게이트웨이에서 발생하던 요청 형식 및 누락된 추론 관련 오류를 수정했습니다. 이미지를 수용하는 모델에 input: [text, image]를 선언하면 dsh가 이미지를 네이티브로 전송합니다.