DeepSeek Harness 上手实测:官方开源 Agent 框架,V4.1 Flash 能看懂图片了

DeepSeek 官方开源的 Agent 框架 DeepSeek Harness(命令行叫 dsh)今天发布了 v0.1.5-rc.1,核心变化就一条:新的 DeepSeek V4.1 Flash 模型能直接看懂图片,而且已经是新会话的默认模型。
老张今天上午看到 Release 就装上了,随手把之前生成的一张抖音封面图丢进对话框,问了句「认识么」。
它不仅读出了图里的主标题、副标题、橙色促销标签,连配图显示器屏幕里的 PyTorch 代码都一行一行念了出来——import torch、loss.backward()、optimizer.step(),最后还顺嘴报出了文件名和 1080×1440 的尺寸。
先放张速览表:
| 项目 | 信息 |
|---|---|
| 项目名 | DeepSeek Harness(dsh) |
| 出品方 | DeepSeek AI 官方 |
| 定位 | 开源 Agent 框架,「一切皆插件」 |
| 开源协议 | MIT |
| GitHub Star | 21.7 万+(仓库创建不到一个月) |
| 最新版本 | v0.1.5-rc.1(2026-09-10 发布) |
| 安装命令 | npx @deepseek-ai/dsh web |
| 当前阶段 | 开发者预览,官方明说会有破坏性变更 |
它解决什么问题
现在用 Claude Code、Codex 这类工具,本质上是「模型 + 一个壳」。壳负责管会话、调工具、读写文件、跑子代理,模型只负责思考。
这个壳,就是 harness。
以前 harness 都是模型能力之外的「民间手艺」,各家自己攒。现在 DeepSeek 官方下场,自己写了一个,而且整个架构建立在「一切皆插件」上,由 Cordis 驱动,还配了篇论文讲设计思路(A Programming Paradigm for Spatiotemporal Composability)。
模型公司亲自下场做 harness,等于官方亲自示范:我的模型能力,应该这样用。
这件事本身就比某个功能更新值得关注。
v0.1.5-rc.1 更新了什么
这个版本今天(9 月 10 日)凌晨刚发,是 0.1.5 系列首个候选版。老张挑几条和普通用户关系最大的:
- DeepSeek-V41-Flash 适配器上线,支持文本、图片输入,新会话默认就用它;
- Web 端支持上传任意类型文件,文件和图片混排在同一预览区,后台上传有进度、能取消;
- 右侧 Sidebar 大改:多标签、分栏、全屏,Markdown、代码、HTML、PDF、图片都能直接预览;
- 子代理支持消息排队、编辑、单条 Steer,可继续对话;
- 动态修改系统提示词不破坏 KV Cache(模型需声明支持,V4.1 Flash 就支持);
- 所有出站请求遵循
HTTP_PROXY/HTTPS_PROXY等代理环境变量,国内网络环境友好; - 内置斜杠命令说明支持中文,随界面语言即时切换。
还有一条容易被翻过去的:可选子代理插件的内置运行时升级到了 Codex 0.153.4 和 Claude Code 2.1.263。也就是说,这个壳可以把 Codex 和 Claude Code 当子代理跑。格局很大。
实测:V4.1 Flash 看图能力
老张的测试方法很粗糙:装好之后,直接把一张之前给抖音做的竖版封面图拖进对话框,问「认识么」。
图里东西不少:主标题、副标题、一个橙色降价标签,配图是一个桌面场景,显示器屏幕里还有一段代码。
结果如下:

它逐项拆了出来——主标题、副标题、橙色标签的文案全对;屏幕里的代码认出是 PyTorch 训练循环风格;最后连图片文件名里的日期和「douyin-cover」、1080×1440 的竖版尺寸都报出来了。
一次工具调用,没有废话。
图片理解进了默认模型,意味着这个壳从「只能读代码文本」变成「能看截图、看设计稿、看报错界面」。对运维来说最实用的场景:直接截一张 Grafana 监控图或者报错弹窗丢给它问。
安装:真就一行命令
前置条件只有一个:装好 Node.js。然后:
npx @deepseek-ai/dsh web
默认在 http://127.0.0.1:3080 起 Web UI,本机会自动用默认浏览器打开页面。想只起服务不弹浏览器,加 --no-open。
想从源码跑也行:
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
老张走的是 npx 路线,从执行命令到浏览器里看到对话界面,中间没有遇到任何要排障的环节。对一个还在预览阶段的项目,这个顺的程度有点反常。
老张评价
亮点说完了,泼两盆冷水。
第一,开发者预览阶段,官方原话是「未来将出现破坏兼容性的变更」。插件 API 这个版本就改了好几处,写插件的要有心理准备。生产环境别上。
第二,它毕竟是个壳,模型能力要配 API。壳免费开源,模型调用照常计费。
但方向是对的。官方做 harness 有个天然优势:KV Cache 友好这类能力,需要模型和壳两头配合,第三方壳永远慢半拍。这次「动态系统提示词不破坏 KV Cache」就是例子。
适合谁,不适合谁
适合:
- 想第一时间体验 V4.1 Flash 图片理解能力的人;
- 关注 Agent 工具链、想研究官方 harness 设计的开发者;
- 受够了某些工具图片支持磨磨蹭蹭的用户。
不适合:
- 要找稳定生产工具的团队(等正式版);
- 不想碰命令行的纯小白(虽然只要一行命令)。
🎯 老张建议
- 想体验的今天就装,
npx @deepseek-ai/dsh web一行命令,试完图片识别再决定留不留; - 重点关注「图片理解 + 默认模型」这个组合,监控截图、报错界面直接丢给它,是运维场景最容易立刻见效的用法;
- 插件开发者先别重仓,预览期 API 变动频繁,等 0.1.5 正式版再动手不迟。
💬 互动话题
- 你用过 Claude Code 或 Codex 吗,会考虑换成 DeepSeek 官方这个壳试试吗?
- 图片理解进默认模型后,你第一个想丢给它看的图是什么?报错截图还是监控大盘?
- 模型厂商亲自下场做 harness,你觉得对第三方 Agent 工具是利好还是利空?
🔗 关注老张
公众号:老张聊运维 小程序:观简国学 个人博客:https://www.shanwaiyun.top/