让 dsh 学会画图:img2img-studio 安装与多通道出图实操

img2img-studio 技能能画什么、怎么装、设置面板怎么配,MiniMax 兜底链与 ChatGPT 网页账号额度怎么用——插件作者本人的 295 秒实录,12 步截图逐步走。

最近更新: 2026-10-04

MiniMax 海螺生图通道卡带着三级兜底徽标,与 ChatGPT 网页出图账号额度区同处一块 dsh 设置面板,本页要配的就是这套多通道布局
一块面板、两条供给路线:左边是带兜底档位的 API 通道,右边是 ChatGPT 网页账号额度——dsh 生图配置的心脏。

dsh 能画图吗?能——给它装上 img2img-studio 这个 Agent Skill,它就能同时走 API 通道和 ChatGPT 网页账号出图。本页是插件作者本人 295 秒演示的 12 步截图实录(他把这期视频定位成「在 dsh 里复刻 Codex 的生图体验」):装技能与设置面板、读懂 MiniMax 兜底卡、把免费网页额度排上队,然后在会话里直接生图、涂抹改图、返修海报。每一帧导出前都对照源录屏的水印、烧录字幕与任务栏逐一复核过。

本页管「画图」。如果你想让 dsh「看图」——描述、提取、识别——那是配套识图技能的活,详见识图攻略页。 dsh 识图实操

TL;DR

  • ▸img2img-studio 是 GitHub 用户 Dogwind221 的 MIT Agent Skill(★5):L1 识图 → Step0 路由门(通道/风格/细化需求)→ 多供应商生成。硬性要求只有 Node.js 18+,核心脚本零第三方依赖。
  • ▸通道按序降级:ChatGPT 网页账号先画(免费档也在内),codex-cli 顶你自己的订阅,再往后是 API 链——DashScope 默认,MiniMax、Z.AI、豆包、OpenAI 兼容端点垫后。额度类错误不重试,直接切下一通道。
  • ▸免费额度是一等公民:面板按账号追踪套餐档位(Free/Plus/5x/20x)和 24 小时滚动台账。视频里的账号 1 显示额度 3、已用 0 张;up 主口播估计免费网页出图每天约 5 张——他自己的口径,有时效。
  • ▸改图都在会话里完成:贴一张参考图(JSON 附件 chip 随行)、开口要图、在涂抹编辑器里圈改、再把演示海报返修一轮——下面每张截图都深链回作者实录。

12 步实操

安装:从作者的 GitHub 装进 dsh

  1. 1

    装之前先认识作者的 GitHub

    视频开场停在 GitHub 上 Dogwind221 的主页——也就是 B 站频道 Dogwindi 背后的账号(同一人两个名字;技能仓库是 img2img-studio,并不存在「dsh-image-studio」这个仓库)。这里有两支仓库要认识:img2img-studio(★5、MIT、TypeScript,2026-10-04 API 实查 pushed 2026-09-17)和给纯文本模型补视力的配套仓库 dsh-vision-skill(★1)。仓库现行描述比很多转述都长:「图生图工作室 Agent Skill」,覆盖 L1 识图、Step0 路由门、多供应商生成、电商套图与含 zine 风格的照片艺术。

    GitHub 上 Dogwind221 的主页同列 img2img-studio、dsh-vision-skill 与 file-intake 三个仓库,本次安装的出处全在这里
    插件作者的 GitHub 主页——本页用到的两支仓库都在一个账号下。去源视频看 1:00
  2. 2

    装技能:拖进去,或复制到 skills 目录

    实录演示的是实测路径:仓库拖进 dsh 的文件缓存对话框,就地完成安装。README(下方逐字引用)给的是手动等价做法——把文件夹复制进 Agent 的 skills 目录。硬性要求只有 Node.js 18+,生图脚本本身零第三方依赖。

    $Copy-Item -Recurse -Force "img2img-studio" "$env:USERPROFILE\.agents\skills\"
    dsh webui 文件缓存对话框确认拖入的 img2img-studio 仓库,旁边的 GitHub 仓库页仍在同屏可查
    把仓库拖进 dsh,文件缓存对话框接管一切——不碰终端也能装。去源视频看 0:24
  3. 3

    装自带插件,补齐面板与编辑器

    技能本体纯命令行就能出图,但本页会用到的设置面板和涂抹编辑器来自仓库自带的 dsh-img2img-config 插件——README 的说法是「一个包装两个面」。会话里置顶的发布说明(即本帧)把 clone 与装配步骤写成了一条长消息,README 的确切命令在下方。

    $$plugin = "$env:USERPROFILE\.agents\skills\img2img-studio\plugins\dsh-img2img-config"
    $node "$plugin\scripts\build.mjs"
    $dev_install_package "$plugin"
    img2img-studio 在 dsh 会话里发出的发布长消息,把 clone 与插件装配步骤逐条写成安装书证
    作者自己的安装说明就置顶在会话里:clone 仓库、构建自带插件、装配进 profile。去源视频看 4:24

配置:识图与生图设置面板

  1. 4

    找到「设置 → 识图与生图」

    在实录使用的 dsh webui(127.0.0.1:3080,本地构建)里,设置打开后是一个双段弹窗:识图器(dsh.vision.skill)管看图,生图模块(img2img.studio)管画图。这一帧截到弹窗顶部两段 Enabled 状态——第 3 步那支可选插件的两个面都注册上了。

    DeepSeek Harness 设置弹窗顶部把识图器与生图模块两段状态同时点亮为 Enabled
    设置 → 识图与生图:识图技能与生图模块各占一段状态。去源视频看 1:46
  2. 5

    读懂 MiniMax 卡:兜底档位、模型链、Base URL

    主图帧值得慢慢读。作者的 MiniMax 海螺卡挂着紫色「三级·兜底」徽标——整条链的最后兜底,欠费自动关停——旁边还有 Key 未配置的行内提示。模型链串起八枚 chips:image-01、qwen-image-3.0-pro、qwen-image-3.0、wan2.7-image-pro、gpt-image-2、glm-image、doubao-seedream-5.0-260120、Qwen3.8-Max。点 × 删除、输入后回车添加;Base URL 指向 api.minimaxi.com/v1,「+ 添加生图通道」还能再长出一张卡。

    生图通道卡把 MiniMax 海螺标为三级兜底,模型链 chips 从 image-01 一直排到 Qwen3.8-Max,下方是 Base URL 输入框
    排在最后,欠钱最先被关:一张卡写尽兜底哲学。去源视频看 2:30
  3. 6

    探测余额,然后保存——面板会替你写 .env

    面板底部两个按钮收尾:「探测全部余额」(标签里就带「欠费自动关停」说明)和「保存配置」。保存不是走形式:按 README 的说法,面板会把 GEN_PROVIDER_ORDER、各供应商 Key 和 IMG_CHATGPT_WEB_ACCOUNTS 直接写回技能的 scripts/.env,识图配置写回识图技能自己的 .env——两支技能谁也不依赖谁也能活。

    识图与生图面板底部把探测全部余额按钮、欠费自动关停说明与保存配置收进同一操作条
    把余额全探一遍再保存——顺序和 Key 会写回技能的 .env 文件。去源视频看 3:56
  4. 7

    把 ChatGPT 网页账号排进免费额度

    另一条供给路线完全不需要 API Key。ChatGPT 网页出图区按账号标注套餐档位——免费、Plus、5x、20x——实录里的账号 1 读作「免费 Free · 额度 3 · 已用 0 张」,按 24 小时滚动计。凭据填进去后可自动探测档位,也可以用「登记 1 张」手动记账;免费账号额度用完后,链路会自动切到下一通道。

    ChatGPT 网页出图账号区列出免费 Free 档的账号 1:额度 3、已用 0 张、按 24 小时滚动计
    免费档、额度 3、零已用——整条通道链设计出来先烧的就是这份免费额度。去源视频看 2:56

出图与改图:生图、涂抹、封面返修

  1. 8

    递给 dsh 一张图:贴图加 JSON chip

    生图从对话开始。往输入框里贴一张参考图,消息会同时带上图片和 JSON 附件 chip——这正是图生图请求需要的输入。README 还补了个进阶细节:DSH 0.1.5+ 的消息内嵌归一化只读副本路径,多数参考图拿来即用;要满画质就把路径指向本地原图。

    对话框输入框同时挂着贴入图片与 JSON 附件 chip,图生图请求的输入就此就绪
    一贴一挂——接下来就像在 ChatGPT 里一样,把图「说」出来。去源视频看 1:34
  2. 9

    第一张图出炉——弹窗里留了回执

    「生成了第一张」弹窗保留着这次完成的出图记录——通道链真的画出东西的回执。更爱终端?README 的快速开始就两条命令(见下方):先列已配置的供应商(不泄露密钥),再带提示词、尺寸和输出目录生成。

    $node "$env:USERPROFILE\.agents\skills\img2img-studio\scripts\generate_image.mjs" --list-providers
    $node "$env:USERPROFILE\.agents\skills\img2img-studio\scripts\generate_image.mjs" --prompt "红色苹果白底产品图" --size 1:1 --output-dir out
    「生成了第一张」弹窗里的出图记录,是通道链真实画出一张图后的回执
    「生成了第一张」——弹窗留下记录,哪条通道干的活一查便知。去源视频看 2:50
  3. 10

    用涂抹编辑器就地改图

    输入框上方是自带编辑器的工具条:标记、抠图、涂抹擦除、改尺寸。实录把画笔用在一张海报上,边涂要改的区域边调属性工具栏。改完回填输入框,下一步请求自动带着标好的图走。

    涂抹编辑器的画笔与属性工具栏正压在一张海报上,dsh 会话内直接改图的现场
    先涂后说:标好的图会自动跟着改图请求走。去源视频看 1:16
  4. 11

    在会话里返修封面海报

    视频里的实测题:作者那张「小白如何用其他 agent 安装 DeepSeek Harness」海报被再次送上手术台——请求消息把引用 chip 和目标海报图卡排在同一条里。按 README 的说法,编辑器产出的标记/掩码请求走专门的工作流落地(改尺寸、去背景、擦除、局部改)。

    封面改图请求消息把引用 chip 与目标海报图卡排在同一条会话里
    实测的小白鼠是作者自己那张「装 dsh」海报——再合适不过的试验品。去源视频看 3:12
  5. 12

    作者想让你知道的两件事

    收尾帧「两件你应该知道的事」:其一,视频里呈现的 dsh 版本节奏与官网当前展示并不同步——以实际发布为准;其二,技能的工具流文档在基础调修后会当天提交。两句都是 up 主本人口播口径——插件作者亲自收尾,再合适不过。

    收尾帧列出「两件你应该知道的事」:dsh 版本节奏口径与工具流文档当天提交的承诺
    作者用版本节奏与文档承诺收尾——装之前值得听完这两句。去源视频看 4:50

常见问题

装生图技能之前值得先弄清楚的问题。

这支 dsh 生图插件支持哪些生图服务?

按 README(2026-10-04 经 GitHub API 复查):ChatGPT 网页账号以 image 2.5 跑一级优先,codex-cli 顶你自己的订阅;API 通道覆盖 DashScope qwen-image(默认)、OpenAI 兼容端点(gpt-image-2)、Z.AI GLM-Image、豆包 Seedream、MiniMax 海螺 image-01,以及本地 chatgpt-web 类服务。视频面板里的 MiniMax 卡还挂着从 image-01 到 Qwen3.8-Max 的八枚模型 chips。

需要自备 API Key 吗?

不一定。ChatGPT 网页模式烧账号额度、不要 Key;DashScope 零配置即可起步(自动复用识图技能的 Key,或自己设 DASHSCOPE_API_KEY)。每条专属 API 通道确实各要一份凭据:MINIMAX_API_KEY、ZAI_API_KEY、豆包的 ARK_API_KEY、OpenAI 兼容的 IMG_API_KEY。面板会对未配置的 Key 给行内提示,余额探测则告诉你哪些通道真的活着。

免费额度有多少?

网页通道就是免费便车。实录里账号 1 挂在免费 Free 档、24 小时滚动窗口、额度 3、已用 0 张;up 主补充免费网页出图每天约 5 张、每周末还有赠送——他自己的口径,有时效。README 说得更保守:免费档本地不设上限,服务端开始拒绝就自动切下一通道(额度类错误不重试,--skip-exhausted 还能跳过已用尽的付费账号)。

它和集合里的其他 dsh 生图插件有什么区别?

差别在形态与供给路线。img2img-studio 是 Agent Skill——markdown 工作流加零依赖脚本——自带插件只补设置面板与编辑器,不是传统 web 插件包;供给上是「API 通道 + ChatGPT 网页账号池」双路线。/collections/image-generation 目录里收着别的选择:dsh-image-gen 的对话生图、vox-director 视频生成、ComfyUI 本地管线。去那边货比三家,回这边安装。

中文提示词和图里的中文文字支持吗?

支持。README 快速开始的示例本身就是中文提示词(「红色苹果白底产品图」);API 通道里 README 特别点名 Z.AI GLM-Image 的中文文字渲染强(但该通道不支持参考图)。ChatGPT 网页模式和 DashScope 也都吃中文提示词;出图前整套路由门就是用你的语言对话完成的。

生成的图能商用吗?

技能代码是 MIT,但 README 里就有两条注意。其一,照片艺术的 zine-gathered 风格源自 Zeejay0 的个人非商业授权风格作品——该风格商用需原作者授权。其二,各供应商条款管各自产出:走 ChatGPT 网页账号自动化出图烧的是你自己的账号,注意 OpenAI 使用条款;要把 API 供应商渲染的图拿去卖,先查它的商用条款。

我的模型是纯文本的,还能画吗?

能,靠配套技能。dsh-vision-skill 是条件依赖而非硬前置:多模态模型有 read_image 就原生看参考图,纯文本模型才走识图技能的多模型降级链。两支技能放同一个 skills 目录,生图脚本还能复用识图的 Key——README 写明的零配置路径。只有「Key 已配好、只做文生图」的情况两支都不用装。

相关攻略

dsh 图像与插件这条线上的其余攻略。

来源与署名

全部 12 帧取自插件作者本人的屏幕实录,每张图以 ?t= 秒数深链回原片对应时刻。画面为插件作者本人录制,此处以其 B 站频道名(Dogwindi)与 GitHub 账号(Dogwind221)双重署名——视频与仓库互证为同一人。仓库事实已于 2026-10-04 经 GitHub API 复查。

DSH Plugins 是独立的 DeepSeek Harness 插件市场,与 DeepSeek 官方无关,也不代表官方背书。第三方插件未经安全审计,安装前请审查源码。

每周获取最新的 DeepSeek Harness 插件,绝不滥发。