让 DeepSeek Harness 看懂图片:多模态模型直连与视觉插件两种方式
给原版 DeepSeek 贴图只会收到报错——它是纯文本模型。B站课程的两种真实解法,本文逐帧复现:接入 Z.ai 的 GLM 视觉模型,或安装内置免费视觉模型的 Vision Router 识图插件。
最近更新: 2026-09-17
在刚装好的 DeepSeek Harness 里贴一张图,回复来得很快——也很扫兴:「当前模型不支持图片」。这不是设置出了错:DeepSeek 自家的两个模型都是文本模型,只接收文字输入,截图、照片、图表一律碰壁。
本页逐帧拆解博学谷 B站课程「视觉及多模态插件」一集:演示者实测了两条互不依赖的路线——换接其他平台的多模态模型、给 Harness 装视觉插件——我们为每一步留了截图,每张图都能跳回源视频的对应秒数。
30 秒结论
让 DSH 处理图片有两条路。路线一:换模型——在 设置→模型 里添加提供方,演示选了 Z.ai(智谱 GLM),新注册账号送的资源包就够用,发图选 GLM-5V-Turbo 这类视觉模型。路线二:装插件——在插件市场装 dsh-vision-router,它内置免费视觉模型,原来的 DeepSeek 文本模型照用,识图交给插件。
两条路的终点一样:那张之前被拒的标题栏截图被完整读出——左侧 DeepSeek 鱼形 logo、中间「探索未至之境」、右侧预览版标签。插件并不神秘:它背后调用的同样是多模态模型。

让 DSH 识图的两种方式,七步走完
- 1
先在原版 DSH 里贴图,看它如何拒绝
演示者截了 DSH 自己的标题栏——左边 logo、中间「探索未至之境」——贴进输入框,选着 DeepSeek-V4-Pro 问「图片中有什么」。等来的是一条报错气泡:当前模型不支持图片。DeepSeek 内置的两个模型是文本模型,只收文字,来回切换也没用。

第一次尝试:标题栏截图配上最直白的问题。跳到视频 0:23 处 
原版 DeepSeek 模型只收文字——图根本没被处理。跳到视频 0:33 处 - 2
打开 设置→模型,添加能看图的提供方
点左下角设置进入「模型」,在内置 DeepSeek 旁可以添加模型提供方:amazon-bedrock、openai、google、minimax……本集选 z-ai(智谱 Z.ai,GLM 系列老家),它需要 TokenPlan 套餐,或者用新号领免费额度。

目录很长;本集滚到最底下选了 z-ai(智谱 GLM)。跳到视频 1:41 处 - 3
免费拿一把 API 密钥,回到 DSH 粘贴保存
课程讲义里的链接直达智谱 BigModel 控制台:用新手机号注册即送资源包(在 财务→资源包 里能看到,体验完全够用)。在 API Key 页创建密钥,名字随便填;复制回 DSH 的 ZAI 提供方表单粘贴,点保存——Z.ai 的模型立刻解锁。

新手机号送资源包,密钥本身一步就能创建。跳到视频 3:01 处 
粘贴、保存,接入就完成了。跳到视频 3:13 处 - 4
切到 GLM 视觉模型,把图再发一遍
再开模型选择器,DeepSeek 下面多了一个 z-ai 分组。注意:视觉能力跟着单个模型走,不是跟提供方走——演示先选 GLM-5.2,照样报不支持;换成 GLM-5V-Turbo 后图片直接发出。回答把截图逐项读出:左侧黑色鱼形 logo、中间「探索未至之境」、右侧预览版标签。

提供方接好了——但要挑对模型,不是每个 GLM 都看得见图。跳到视频 3:23 处 
路线一跑通:视觉模型一口气读出 logo、文字和标签。跳到视频 4:00 处 - 5
在插件市场安装 Vision Router 识图插件
第二条路保留你的文本模型。打开 设置→插件市场,选「视觉与多模态」分类,本集装的是排头位的 dsh-vision-router:它为 DSH 提供识图能力,最关键的是内置免费视觉模型,不用再去任何平台申请密钥。点安装,确认。

dsh-vision-router 就是本集的选择:免费视觉模型,零额外密钥。跳到视频 5:13 处 - 6
重启 DSH,再看插件的视觉设置
安装完会提示重启。演示者不点重启按钮(他之前点出过问题),而是在终端 Ctrl+C 停掉、重新执行启动命令,再刷新浏览器。设置→插件 里多出了 Vision Router(图片识别):可以给它指定识图模型,内置的免费兜底模型和次数限制让轻度使用不花钱。

重启后插件出现在设置里——免费兜底模型含在内,无需密钥。跳到视频 6:10 处 - 7
选带视觉标识的模型变体,再问一次
仍然用纯文本的 DeepSeek-V4-Pro,打开模型选择器:插件多挂了一组同名的 DeepSeek 条目,带视觉标识——同样的模型,外加自动识图。选它,把同一张标题栏截图再贴进去问「图片中有什么」。这次回答把图拆成三块:左侧金鱼形 logo、中间文字、右侧预览版标签——DSH 能看见图了。

同名新能力:插件的变体给 DeepSeek-V4-Pro 加上了识图。跳到视频 6:45 处 
路线二同样跑通——文本模型没换,读图的是插件的视觉模型。跳到视频 7:18 处
DSH 识图常见问题
模型、密钥、费用和重启——本集真正回答过的问题。
怎么让 dsh 看懂图片(识图)?
开箱不能——内置 DeepSeek 模型是纯文本,第一步的报错就是证据。两条路:一是接入多模态提供方(演示用 Z.ai,发图选 GLM-5V-Turbo);二是装 Vision Router 插件,由它把图片转给视觉模型——包括内置的免费模型——你继续用原来的文本模型聊天。
GLM 密钥和视觉插件要花钱吗?
不用。用新手机号注册智谱 BigModel 即送资源包,演示里在 财务→资源包 确认过额度够体验;Vision Router 插件本身内置免费视觉模型,兜底路线零成本。重度使用才需要 TokenPlan 套餐或自己的密钥。
为什么 GLM-5.2 仍然拒图,GLM-5V-Turbo 却可以?
因为视觉能力属于单个模型,不属于提供方。Z.ai 目录里文本模型(GLM-4.7、GLM-5.1、GLM-5.2…)和 GLM-5V 视觉家族混在一起。选到文本模型照样弹「当前模型不支持图片」;选 GLM-5V-Turbo,输入框立刻收图。
插件要求重启,直接点它的重启按钮行吗?
可以,但演示者没点——他之前点重启出过问题。他的做法:终端里 Ctrl+C 停掉 dsh,重新执行启动命令,再刷新浏览器,插件就出现在 设置→插件 里。如果你点了按钮且出了问题,直接让 dsh 自己修。
相关 DeepSeek Harness 指南
从挑视觉插件到换模型——顺手多读几篇。
来源与署名
本页截图取自下方 B站课程,著作权归创作者所有——每张图都链接回拍摄的确切秒数。
