catalog / media-vision
设计、媒体与视觉
我们精选列表中所有「设计、媒体与视觉」插件,与 GitHub 同步。
Harness 的多模态能力:视觉工具箱、OCR、图像生成、设计画布与媒体处理。它们给智能体装上眼睛和速写板,作为工具供应商注册,模型可以在任务中途随时调用。
同步自我们的 GitHub 列表 · 目录更新于 2026-09-16
509 个插件
modlens
作者 liustack
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
agent-vision-toolkit
作者 anionex
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
dsh-vision-router
作者 ysr666
为纯文本 DeepSeek Harness 智能体提供「视觉」能力,内置免密钥视觉链路与像素级视觉工具,一条命令安装,无需 Python。
dsh-vision-toolkit
作者 anionex
[dsh]为纯文本模型设计更强大的视觉工具箱:一行安装使用、粘贴图片直接识别、多张图片问答、截图到前端UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
dsh-image-gen
作者 shanliuling
直接在 DeepSeek Harness 对话中生成图片,无需切换外部工具。
dsh-openpencil
作者 zseven-w
连接 DeepSeek Harness 与 OpenPencil,让智能体创建、编辑、预览和验证可交互的多页面设计画布。
dsh-video-lens
作者 dundunhan
让纯文本 DSH 代理理解本地视频:帧提取加视觉描述与语音转写,提供商可配置
dsh-vision
作者 oil-oil
为 DeepSeek Harness 提供接近原生的图像理解能力。
dsh-imagegen
作者 dickpy
Web UI AI 生图插件:OpenAI 兼容端点文生图/图生图,历史跨设备同步
dsh-comfyui
作者 fandc520
一个基于DeepSeek-Harness的ComfyUI插件
patentradar
作者 yuc16
专利侵权分析系统 —— 输入专利公开号,产出竞品侵权分析报告;同时打包成 skill,可被任意 agent(dsh, codex, claudecode 等) 调用。
dsh-design-qa
作者 sunxin-ai
为 DeepSeek Harness 提供设计还原度质检:让纯文本模型评审实现与设计稿的匹配度,附带基准测试数据。
dsh-vision-complete
作者 yts1919
给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。
picturereader
作者 jing-hy
DSH 插件:为纯文本模型提供像素转文字的图片读取,含图像扫描、OCR 工具与图片阅读技能,纯本地运行。
dsh-vision
作者 william-jin-cmu
dsh 插件:给纯文本 DeepSeek 加视觉——view_image 工具桥接任意 OpenAI 兼容 VLM(默认智谱免费档,实测 4 厂商 10 模型)
dsh-design-mode
作者 kaichencurry
DeepSeek Harness 智能体图像设计模式:无限画布、ask_user 澄清、图像工具、批注与提供方路由。
dsh-media-skills
作者 mjorgin
DeepSeek Harness 免费的图片读取与生成技能包:支持粘贴图片识别、DeepSeek-V4-Flash-Vision / GLM-4V-Flash / SenseNova / Gemini 多模型自动容灾切换,以及 Kolors 文生图,仓库内无需任何 API Key。
deepseek-visionary
作者 xlight
使用 DeepSeek 官方多模态视觉模型让你的 Agent 不再眼瞎(支持 DSH、Zed、OpenCode、Codex、Claude Code、Cursor、Claude Desktop)
dsh-plugin-aigc-canvas
作者 huanlinoto
provider-agnostic AIGC HTTP 桥 + 无限画布 + ffmpeg 后处理,13 个工具含画布连边/reroll/媒体编辑 | Provider-agnostic AIGC HTTP bridge + infinite canvas + ffmpeg post-processing; 13 tools incl. canvas linking/reroll/media-edit
dsh-visual-plugin
作者 jyh20030112
为纯文本模型装上眼睛:图片转发给任意 OpenAI 兼容视觉模型,结果展示在右侧面板
dsh-vision-proxy
作者 flyvhidbwo
DeepSeek Harness 插件:DeepSeek Pro 大脑 + 自动识图。GUI 附加图片默认经官方 deepseek-v4-flash-vision-exp 原生识图,转译成文字后交给 DeepSeek 作答(纯文本的 V4-Pro 也能看图);支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容 VLM,无 key 自动探测本地 Ollama;安装时有一问式确认
dsh-vision-opencode
作者 poiuyjie
通过任意视觉模型把图片自动转成文本,纯文本模型无需切换即可看图
dsh-ocr-plugin
作者 crazy222123
本地 OCR 插件:RapidOCR 快速识别加 DeepSeek-OCR-2/llama.cpp 深度识别,发 API 前先转文本
dsh-vision
作者 linenxi-ctrl
为 DeepSeek Harness 增加外挂识图模型:圆形鲸鱼按钮、发送图片识图自动回传、模型自主截图+识图工具、多协议自动适配、小白一键安装(未装 Node.js 自动下载)
dsh-bilibili
作者 czx2244
B 站视频分析:元数据、字幕(ASR 兜底)、评论、弹幕与关键帧。
dsh-mmx-bridge
作者 welsione
一个工具 = MiniMax 全部多模态能力:DSH 纯文本模型看图/画图/生视频/说话/唱歌/翻唱/搜索/查额度 | One mmx_bridge tool = all MiniMax multimodal (VLM/image/video/speech/music/cover/search/quota) for DeepSeek Harness (DSH)
dsh-chat-imagine
作者 corrinehu
在 DSH 聊天窗口自动调用生图工具(API 渠道,或本机 CLI:已支持mmx / codex / agy)并展示图片,也支持利用对应 CLI 识别图片。
dsh-image2-draw
作者 junelearn
DeepSeek Harness Image2 生图插件,通过第三方 OpenAI Images 兼容接口调用 gpt-image-2,只需配置 baseURL 和 API Key。 | Image2 generation plugin for DeepSeek Harness via third-party OpenAI Images-compatible APIs.
dsh-mermaid
作者 aks1st
在 DSH Web 会话中把 Mermaid 代码围栏渲染为 SVG 图表 | Render Mermaid code fences as SVG diagrams in DSH Web messages
dsh-windows-ocr
作者 maxwell-feng
Windows 端 OCR 识别插件,为 DeepSeek Harness 提供图像文字提取能力。
