DeepSeek Harness 语音插件:对 AI 说、听 AI 说,8 步实拍
两支 B 站实测短片、八个截图核对步骤:在 Web UI 勾选语音输入(本地转写),按 Ctrl+Alt+V 说话变文字,再用 dsh-plugin-tts 插件让回复用你挑的音色读出来。
最近更新: 2026-09-23

两个场景、两支短片。第一支里,up主对着 DeepSeek Harness Web UI 说话,话音落地就变成输入框里的文字,全程不离开本机;第二支里,另一位 up主给回复装上了嗓子——dsh-plugin-tts 把模型的回答读出声。两支视频都没有字幕,下文引用的每一条界面文案都是逐帧读出来的,每一步都配原始截图。
画面里的一切都跑在本机 Web UI(录屏中为 127.0.0.1:3080)上。语音输入靠的是本地转写插件 Real-WangLe/dsh-voice-local,语音播报靠 1624318455 的 dsh-plugin-tts;两条产品线还有更多同类插件,都收在语音合集里。
先看结论
- ▸语音输入就是一个勾选框:「语音输入(本地转写,音频不出本机)」,不需要任何 API Key。
- ▸Ctrl+Alt+V 默认开麦/停麦,片中口述支持自定义;说话时文字一句一句实时落进输入框。
- ▸dsh-plugin-tts 用微软 Edge TTS 免费音色朗读回复,语速/音调/音量滑杆可调,播放时显示粉色「发音中」徽标。
语音进、语音出,逐步实拍
对 AI 说——本地语音输入
- 1
打开输入框语音浮层,勾选本地转写
在 DeepSeek Harness Web UI 的输入框工具条上点麦克风位,浮层里有语音输入总开关——原文写着「语音输入(本地转写,音频不出本机)」——还有「键盘输入自动关闭麦克风」,一开始打字就自动还麦。片中两项都勾着,而且浮层开着不关也照常识别。

浮层近景:本地转写已勾选、自动还麦已开启、快捷键一目了然。去视频 0:34 处看 - 2
按 Ctrl+Alt+V 开麦,边说边看文字上屏
浮层的快捷键一行默认显示 Ctrl+Alt+V,片中口述支持自定义;录音时麦克风位变成红色按钮,识别文字一句一句往输入框里落,再按一次停麦,整段话就留在输入框里等你发送或改写。

实时听写:麦克风还是红的,文字已经一句句到位。去视频 1:24 处看 - 3
隐私条款就写在插件 README 里,用前读一遍
视频后段展示的仓库 Real-WangLe/dsh-voice-local 写得很直白:录音与转写都在本机完成、不依赖云端 API/API Key;SenseVoice 引擎 CPU 推理,中文自动标点,支持中/英/日/韩/粤多语言。安装一行命令:dsh plugin --profile web add dsh-voice-local,首次点麦克风会自动下载约 230MB 的 SenseVoice 模型。

插件 README:全程本地、无需 API Key、SenseVoice 引擎、一行安装。去视频 2:02 处看 - 4
Windows 上转写一直是空的?先看这个 issue
仓库 issue #1(录制时仍为 Open)记录了 v0.3.0 的 Windows 特供缺陷:Silero VAD 守门误判后 speechMs 恒为 0,/transcribe 一直返回空文本,而模型明明 ready。报告者用调试证据排除了音量和阈值设置——Windows 下遇到空白转写,先查这个 issue 再怀疑麦克风。

录制时仍 Open:v0.3.0 在 Windows 上返回空转写。去视频 1:50 处看
听 AI 说——TTS 语音播报
- 5
在 dsh-plugin-tts 设置里选免费的 Edge TTS 音色
Web UI 设置 → 插件 → 语音,TTS 提供商下拉选 Edge TTS:免密在线音色、开箱即用。片中选了「晓晓(zh-CN-XiaoxiaoNeural)」,语速/音调/音量是 −50% 到 +50% 的滑杆,「运行诊断」一键检查在线合成、本地 RVC 服务和模型加载。

TTS 提供商选 Edge TTS,免费的晓晓音色已就位。去视频 0:40 处看 - 6
想用自己的嗓音?走 RVC 自定义音色
把提供商切到「自定义音色(RVC)」,插件指向本地转换服务(默认 http://127.0.0.1:4892);填入自己训练的 .pth 模型和可选 .index 索引,或从共享仓库一键下载现成音色包——片中浏览的就是作者自己的 1624318455/rvc-for-tts 音色仓。

自定义音色路线:本地 RVC 服务,用自己的 .pth 模型或共享音色包。去视频 0:08 处看 - 7
试听一句,看粉色「发音中」徽标亮起
在「试听测试」里输入「你好,这是一个语音测试。」点播放——朗读进行时浮层里飘着粉色「发音中」徽标,页脚注明由 node-edge-tts 驱动。

试听测试:一句话、一次点击,「发音中」徽标随即亮起。去视频 0:56 处看 - 8
发出消息,让回复自己开口
片中问了一句「你是谁」,回复文本落定后自动开始朗读:消息工具条出现停止按钮,粉色「发音中」徽标跟着播放走。听完点一下停止,就能继续打字。

实播态:Edge TTS 朗读期间,回复自带停止按钮。去视频 1:08 处看
常见问题
画面带出来、但画面本身不回答的问题。
语音输入要联网吗?音频会不会传到云端?
转写不用联网。设置项原文「本地转写,音频不出本机」,README 也写明录音与转写都在本机完成、不依赖云端 API/API Key;SenseVoice 模型约 230MB,下载一次后 CPU 就能跑。
Ctrl+Alt+V 快捷键能改吗?
可以。浮层里 Ctrl+Alt+V 只是默认值,片中明确说支持自定义;按一下开麦、再按一下停麦。
朗读回复要花钱或填 Key 吗?
Edge TTS 免密、免费、开箱即用(晓晓等在线音色);想换成自己的音色再走本地 RVC 路线,「运行诊断」会帮你检查两条链路是否就绪。
Windows 上说话没有文字出来怎么办?
v0.3.0 有一个已知 issue(录制时仍 Open):Silero VAD 打断后 speechMs=0,/transcribe 返回空文本。先去仓库看 issue 进展,别急着重装麦克风驱动。
相关阅读
语音这条线的其余站点,以及背后的上手指南。
来源与署名
两支素材都来自 B 站,分属两位创作者,各自署名;每张截图都能深链到视频对应秒。想挑更多语音插件? 去语音插件合集逛逛
