DeepSeek Harness 模型切换指南
把 NVIDIA NIM、Anthropic 或本地 Ollama 接成自定义 Provider,在会话中途随时切换模型——七个步骤全部来自两支完整视频实测,逐帧截图核对。
最近更新: 2026-09-11
DeepSeek Harness 开箱即接官方 DeepSeek API,但 Models 面板从不挑 Provider:内置条目覆盖 Amazon Bedrock、Anthropic、Azure OpenAI、Cloudflare、DeepSeek、Fireworks、GitHub Copilot、Google、Groq、HuggingFace、Kimi、MiniMax 等,而自定义 Provider 表单则接受任何 OpenAI 兼容端点——NVIDIA NIM 的密钥、公司网关,或你自己机器上的 Ollama。
本指南跟随两支完整实测视频:Leon van Zyl 把 Ollama(http://localhost:11434/v1)注册为自定义 Provider,搭配专门裁剪的 Local Models 预设,并用 qwen3.8:latest 验证切换;Vassity 生成 NVIDIA NIM 密钥,把 Base URL 指向 integrate.api.nvidia.com/v1,添加 MiniMax 3,又在本地拉取 gemma4:12b。12 张截图、7 个步骤、每条命令都摆在眼前。
七步完成模型切换
- 1
打开 Settings → Models:两个添加入口
Models 面板是总控台:DeepSeek 条目在密钥生效后亮起绿点,每个已连接的 Provider 各占一张卡片。内置 Provider 收在下拉列表里——amazon-bedrock、anthropic、azure-openai-responses、cerebras、cloudflare-ai-gateway、deepseek、fireworks、github-copilot、google、groq、huggingface、kimi-coding、minimax 等;不在名单里的,走正下方的 Custom provider 表单:一个小写的 Provider ID、显示名、Base URL、协议和 API key。

Models 面板的两个入口:内置 Provider 下拉,和下方的自定义表单。在视频 10:50 处观看 
还没填任何内容——需要的字段全在这一屏。在视频 11:00 处观看 - 2
接入内置 Provider:贴上 API key
在下拉里选中 Provider,粘贴密钥,点 Apply——输入框的占位提示写得很清楚:留空则回退到环境变量认证。密钥来自 Provider 自己的控制台:Vassity 在 NVIDIA 账户的 API key 页面生成密钥、按项目命名、设 12 个月有效期,并立刻复制——离开该页面就再也看不到了。Customize settings 保持折叠即可,除非你要覆盖默认值。

一个 key 覆盖该 Provider 下的所有模型,不用逐个配置。在视频 4:20 处观看 - 3
把 Provider 指向任何 OpenAI 兼容端点
展开 Customized settings,Base URL 字段让整个面板变成万能适配器:NVIDIA NIM 填 https://integrate.api.nvidia.com/v1,任何讲 OpenAI chat-completions 方言的服务同理。下方的自定义模型目录接受 Model ID + Display name 组合:Vassity 直接从 NVIDIA 模型列表复制 MiniMax 3 的 ID,起个显示名,点 Apply。空行会报 "Model ID is required",填上或删掉即可。

Base URL 是关键:任何 OpenAI 兼容端点都照此办理。在视频 4:40 处观看 - 4
本地 Ollama 也只是一个自定义 Provider
从 ollama.com 安装 Ollama,按自己的硬件拉模型——Leon 跑 qwen3.8(约需 16 GB 显存),Vassity 从 ollama.com 模型库挑了 gemma4:12b,两人都用 ollama list 确认。回到 DeepSeek Harness 填 Custom provider 表单:Provider ID 必须小写(填 "Oll" 会被 "Start with a lowercase letter…" 拦下),Display name 随意——写 Ollama,Base URL 填 http://localhost:11434/v1,API protocol 保持 openai-completions,API key 随便填个占位字符串即可:照抄 ollama。
$ollama pull qwen3.8$ollama list
先挑一个你的硬件跑得动的标签,再复制去执行 pull 命令。在视频 11:30 处观看 
表单会在非法 ID 惹麻烦之前把它拦下来。在视频 11:52 处观看 
Ollama 说 OpenAI 方言——协议保持默认即可。在视频 11:20 处观看 - 5
Fetch available models:勾选要暴露的模型
点 Fetch available models,Harness 会查询端点上已下载的全部模型——Vassity 拉到了 qwen3.8 和 gemma4,点 add selected 把想要的加入目录。显示名完全自由:可以堆多个模型,命名为 agent one、agent two、agent three 都行。Create provider 保存卡片,旁边的绿点表示连接正常。

拉取到的模型落在这个列表里——命名随意,然后创建 Provider。在视频 12:50 处观看 - 6
在会话中随时切换模型
无需重启、无需新会话:输入框右下角的选择器按 Provider 分组列出全部模型——DeepSeek、nvidia、Ollama——对话中途即可在云端与本地之间跳转。加号按钮的命令菜单里,/model 也能从键盘直达同一选择器。模型与模式互不干扰:Leon 在他的 Local Models 预设(在 creator mode 中禁用 Ralph loop 与 sub-agents 插件后创建)下新开会话,再从同一下拉里选中 qwen3.8。

分组跟着 Provider 走,对勾标出正在使用的模型。在视频 7:20 处观看 
本地拉取的模型无需重启,就能和云端模型同场竞技。在视频 13:30 处观看 
给本地模型配上裁剪过工具列表的预设,跑得更稳。在视频 11:40 处观看 - 7
验证切换结果,顺手设好推理力度
最省事的冒烟测试就是问它自己:Leon 的本地模型回答 "I'm qwen3.8:latest — a coding agent running inside DeepSeek Harness (DSH)"。会话标题旁显示当前预设徽章(Local Models),输入框下方显示当前模型名。发出第一条消息前,还可以把推理力度(reasoning effort)从 low 调到 max——Leon 保持 high。

让 agent 自报家门——最省事的冒烟测试。在视频 12:00 处观看
模型切换常见问题
关于 Provider、API key 与会话中途切换的简短回答。
每个模型都要单独配 API key 吗?
不用——每个 Provider 一把 key,而不是每个模型一把。在 Provider 卡片上贴一次,该 Provider 下的所有模型(比如 NVIDIA NIM 上的 MiniMax 3)就都能选了。Ollama 更是根本不需要真 key:随便填个 ollama 之类的占位字符串即可。
内置 Provider 和自定义 Provider 有什么区别?
内置 Provider 出现在下拉列表里,只需要 API key——DeepSeek、Anthropic、Google、Groq 等等。自定义 Provider 留给其他一切:你提供小写的 provider ID、Base URL 和 API 协议,NVIDIA NIM、OpenAI 兼容网关和本地 Ollama 都是这么接进来的。
自定义 Provider 为什么保存不了?
先检查 Provider ID:必须以小写字母开头,且只能含小写字母、数字和连字符——表单会直接拒绝大写 ID,而且 Harness 还把它用作凭据名称。显示名则完全自由。
云端模型和本地模型能同时配置吗?
能。两支视频都让 DeepSeek、NVIDIA NIM 和 Ollama 并存;会话选择器按 Provider 分组,从 DeepSeek-V4-Pro 换到 gemma4:latest 只是一次点击的事,对话中途也能换。
Ollama 该选哪个 API 协议?
保持 openai-completions——这正是 Ollama /v1 端点说的方言。同一下拉里还有 openai-responses 和 anthropic-messages,留给基于这两类 API 的端点。
会话开始后还能换模型或调推理力度吗?
模型可以——选择器(或 /model 命令)能在对话中途切换。推理力度随模型一起设置,从 low 到 max 任选;Leon 保持 high。预设则作用于新会话——发出第一条消息前,在同一个下拉里挑一个即可。
相关指南
更多 DeepSeek Harness 实测教程
来源与致谢
本指南所有截图均来自这两支公开视频。每张图都能跳回视频中的精确时刻——想听完整讲解,值得一看。
