DeepSeek Harness 语音插件:对 AI 说、听 AI 说,8 步实拍

两支 B 站实测短片、八个截图核对步骤:在 Web UI 勾选语音输入(本地转写),按 Ctrl+Alt+V 说话变文字,再用 dsh-plugin-tts 插件让回复用你挑的音色读出来。

最近更新: 2026-09-23

DeepSeek Harness Web UI 输入框里的语音麦克风变成红色录音按钮,开麦待说,说话即可转写上屏。
录音态:输入框工具条上的麦克风位变成红色停止按钮。

两个场景、两支短片。第一支里,up主对着 DeepSeek Harness Web UI 说话,话音落地就变成输入框里的文字,全程不离开本机;第二支里,另一位 up主给回复装上了嗓子——dsh-plugin-tts 把模型的回答读出声。两支视频都没有字幕,下文引用的每一条界面文案都是逐帧读出来的,每一步都配原始截图。

画面里的一切都跑在本机 Web UI(录屏中为 127.0.0.1:3080)上。语音输入靠的是本地转写插件 Real-WangLe/dsh-voice-local,语音播报靠 1624318455 的 dsh-plugin-tts;两条产品线还有更多同类插件,都收在语音合集里。

先看结论

  • 语音输入就是一个勾选框:「语音输入(本地转写,音频不出本机)」,不需要任何 API Key。
  • Ctrl+Alt+V 默认开麦/停麦,片中口述支持自定义;说话时文字一句一句实时落进输入框。
  • dsh-plugin-tts 用微软 Edge TTS 免费音色朗读回复,语速/音调/音量滑杆可调,播放时显示粉色「发音中」徽标。

语音进、语音出,逐步实拍

对 AI 说——本地语音输入

  1. 1

    打开输入框语音浮层,勾选本地转写

    在 DeepSeek Harness Web UI 的输入框工具条上点麦克风位,浮层里有语音输入总开关——原文写着「语音输入(本地转写,音频不出本机)」——还有「键盘输入自动关闭麦克风」,一开始打字就自动还麦。片中两项都勾着,而且浮层开着不关也照常识别。

    DeepSeek Harness 语音输入浮层:本地转写勾选框、键盘自动还麦勾选框与 Ctrl+Alt+V 快捷键行同框展示。
    浮层近景:本地转写已勾选、自动还麦已开启、快捷键一目了然。去视频 0:34 处看
  2. 2

    按 Ctrl+Alt+V 开麦,边说边看文字上屏

    浮层的快捷键一行默认显示 Ctrl+Alt+V,片中口述支持自定义;录音时麦克风位变成红色按钮,识别文字一句一句往输入框里落,再按一次停麦,整段话就留在输入框里等你发送或改写。

    DeepSeek Harness 输入框边说边转写进行中:红色录音按钮未熄,转写出的中文段落已经一句句落进输入框。
    实时听写:麦克风还是红的,文字已经一句句到位。去视频 1:24 处看
  3. 3

    隐私条款就写在插件 README 里,用前读一遍

    视频后段展示的仓库 Real-WangLe/dsh-voice-local 写得很直白:录音与转写都在本机完成、不依赖云端 API/API Key;SenseVoice 引擎 CPU 推理,中文自动标点,支持中/英/日/韩/粤多语言。安装一行命令:dsh plugin --profile web add dsh-voice-local,首次点麦克风会自动下载约 230MB 的 SenseVoice 模型。

    dsh-voice-local 的 GitHub README:DeepSeek Harness 录音与转写全程本机离线完成、不依赖云端 API,并附一行安装命令。
    插件 README:全程本地、无需 API Key、SenseVoice 引擎、一行安装。去视频 2:02 处看
  4. 4

    Windows 上转写一直是空的?先看这个 issue

    仓库 issue #1(录制时仍为 Open)记录了 v0.3.0 的 Windows 特供缺陷:Silero VAD 守门误判后 speechMs 恒为 0,/transcribe 一直返回空文本,而模型明明 ready。报告者用调试证据排除了音量和阈值设置——Windows 下遇到空白转写,先查这个 issue 再怀疑麦克风。

    dsh-voice-local 仓库 issue #1:Windows 上 v0.3.0 的 Silero VAD 返回 speechMs=0,导致 DeepSeek Harness 转写永远为空。
    录制时仍 Open:v0.3.0 在 Windows 上返回空转写。去视频 1:50 处看

听 AI 说——TTS 语音播报

  1. 5

    在 dsh-plugin-tts 设置里选免费的 Edge TTS 音色

    Web UI 设置 → 插件 → 语音,TTS 提供商下拉选 Edge TTS:免密在线音色、开箱即用。片中选了「晓晓(zh-CN-XiaoxiaoNeural)」,语速/音调/音量是 −50% 到 +50% 的滑杆,「运行诊断」一键检查在线合成、本地 RVC 服务和模型加载。

    DeepSeek Harness 的 dsh-plugin-tts 设置弹窗:Edge TTS 提供商、晓晓音色下拉框与语速/音调/音量滑杆组。
    TTS 提供商选 Edge TTS,免费的晓晓音色已就位。去视频 0:40 处看
  2. 6

    想用自己的嗓音?走 RVC 自定义音色

    把提供商切到「自定义音色(RVC)」,插件指向本地转换服务(默认 http://127.0.0.1:4892);填入自己训练的 .pth 模型和可选 .index 索引,或从共享仓库一键下载现成音色包——片中浏览的就是作者自己的 1624318455/rvc-for-tts 音色仓。

    DeepSeek Harness 的 dsh-plugin-tts 弹窗 RVC 路线:本地转换服务地址、原声音色下拉框与 .pth 模型路径字段。
    自定义音色路线:本地 RVC 服务,用自己的 .pth 模型或共享音色包。去视频 0:08 处看
  3. 7

    试听一句,看粉色「发音中」徽标亮起

    在「试听测试」里输入「你好,这是一个语音测试。」点播放——朗读进行时浮层里飘着粉色「发音中」徽标,页脚注明由 node-edge-tts 驱动。

    DeepSeek Harness 的 TTS 试听框:测试语句、播放按钮,以及 dsh-plugin-tts 朗读时亮起的粉色发音中徽标。
    试听测试:一句话、一次点击,「发音中」徽标随即亮起。去视频 0:56 处看
  4. 8

    发出消息,让回复自己开口

    片中问了一句「你是谁」,回复文本落定后自动开始朗读:消息工具条出现停止按钮,粉色「发音中」徽标跟着播放走。听完点一下停止,就能继续打字。

    DeepSeek Harness 聊天回复正被 dsh-plugin-tts 朗读:消息工具条出现停止按钮,粉色发音中徽标悬浮在对话上方。
    实播态:Edge TTS 朗读期间,回复自带停止按钮。去视频 1:08 处看

常见问题

画面带出来、但画面本身不回答的问题。

语音输入要联网吗?音频会不会传到云端?

转写不用联网。设置项原文「本地转写,音频不出本机」,README 也写明录音与转写都在本机完成、不依赖云端 API/API Key;SenseVoice 模型约 230MB,下载一次后 CPU 就能跑。

Ctrl+Alt+V 快捷键能改吗?

可以。浮层里 Ctrl+Alt+V 只是默认值,片中明确说支持自定义;按一下开麦、再按一下停麦。

朗读回复要花钱或填 Key 吗?

Edge TTS 免密、免费、开箱即用(晓晓等在线音色);想换成自己的音色再走本地 RVC 路线,「运行诊断」会帮你检查两条链路是否就绪。

Windows 上说话没有文字出来怎么办?

v0.3.0 有一个已知 issue(录制时仍 Open):Silero VAD 打断后 speechMs=0,/transcribe 返回空文本。先去仓库看 issue 进展,别急着重装麦克风驱动。

相关阅读

语音这条线的其余站点,以及背后的上手指南。

来源与署名

两支素材都来自 B 站,分属两位创作者,各自署名;每张截图都能深链到视频对应秒。想挑更多语音插件? 去语音插件合集逛逛

DSH Plugins 是独立的 DeepSeek Harness 插件市场,与 DeepSeek 官方无关,也不代表官方背书。第三方插件未经安全审计,安装前请审查源码。

每周获取最新的 DeepSeek Harness 插件,绝不滥发。