DeepSeek Harness 語音外掛實測:對 AI 說話、聽 AI 朗讀
兩支 B 站實測短片、八個截圖核對步驟:在 Web UI 勾選語音輸入(本地轉寫),按 Ctrl+Alt+V 說話變文字,再用 dsh-plugin-tts 外掛讓回覆用你挑的音色唸出來。
最近更新: 2026-09-23

兩個場景、兩支影片。第一支裡,創作者對著 DeepSeek Harness Web UI 說話,話音落地就變成輸入框裡的文字,全程不離開本機;第二支裡,另一位創作者幫回覆裝上嗓子——dsh-plugin-tts 把模型的回答唸出聲。兩支影片都沒有字幕,下文引用的每一條介面文案都是逐格讀出來的,每一步都附原始截圖。
畫面裡的一切都跑在本機 Web UI(錄影中為 127.0.0.1:3080)上。語音輸入靠的是本地轉寫外掛 Real-WangLe/dsh-voice-local,語音播報靠 1624318455 的 dsh-plugin-tts;兩條產品線還有更多同類外掛,都收在語音合輯裡。
先看結論
- ▸語音輸入就是一個勾選框:「语音输入(本地转写,音频不出本机)」,不需要任何 API Key。
- ▸Ctrl+Alt+V 預設開麥/停麥,影片裡口述支援自訂;說話時文字一句一句即時落進輸入框。
- ▸dsh-plugin-tts 用微軟 Edge TTS 免費音色朗讀回覆,語速/音調/音量滑桿可調,播放時顯示粉色「發音中」徽標。
語音進、語音出,逐步實拍
對 AI 說——本機語音輸入
- 1
打開輸入框語音浮層,勾選本地轉寫
在 DeepSeek Harness Web UI 的輸入框工具列上點麥克風位,浮層裡有語音輸入總開關——原文寫著「语音输入(本地转写,音频不出本机)」——還有「键盘输入自动关闭麦克风」,一開始打字就自動還麥。片中兩項都勾著,而且浮層開著不關也照常辨識。

浮層近景:本地轉寫已勾選、自動還麥已開啟、快捷鍵一目瞭然。到影片 0:34 處看 - 2
按 Ctrl+Alt+V 開麥,邊說邊看文字上屏
浮層的快捷鍵一行預設顯示 Ctrl+Alt+V,片中口述支援自訂;錄音時麥克風位變成紅色按鈕,辨識文字一句一句往輸入框裡落,再按一次停麥,整段話就留在輸入框裡等你送出或改寫。

即時聽寫:麥克風還是紅的,文字已經一句句到位。到影片 1:24 處看 - 3
隱私條款就寫在外掛 README 裡,用前讀一遍
影片後段展示的儲存庫 Real-WangLe/dsh-voice-local 寫得很直白:錄音與轉寫都在本機完成、不依賴雲端 API/API Key;SenseVoice 引擎 CPU 推理,中文自動標點,支援中/英/日/韓/粵多語言。安裝一行指令:dsh plugin --profile web add dsh-voice-local,首次點麥克風會自動下載約 230MB 的 SenseVoice 模型。

外掛 README:全程本機、無需 API Key、SenseVoice 引擎、一行安裝。到影片 2:02 處看 - 4
Windows 上轉寫一直是空的?先看這個 issue
儲存庫 issue #1(錄製時仍為 Open)記錄了 v0.3.0 的 Windows 特有缺陷:Silero VAD 把關誤判後 speechMs 恆為 0,/transcribe 一直回傳空文字,而模型明明 ready。回報者用除錯證據排除了音量與閾值設定——Windows 下遇到空白轉寫,先查這個 issue 再懷疑麥克風。

錄製時仍 Open:v0.3.0 在 Windows 上回傳空轉寫。到影片 1:50 處看
聽 AI 說——TTS 語音播報
- 5
在 dsh-plugin-tts 設定裡選免費的 Edge TTS 音色
Web UI 設定 → 插件 → 语音,TTS 供應商下拉選 Edge TTS:免金鑰線上音色、開箱即用。片中選了「晓晓(zh-CN-XiaoxiaoNeural)」,語速/音調/音量是 −50% 到 +50% 的滑桿,「运行诊断」一鍵檢查線上合成、本機 RVC 服務和模型載入。

TTS 供應商選 Edge TTS,免費的晓晓音色已就位。到影片 0:40 處看 - 6
想用自己的嗓音?走 RVC 自訂音色
把供應商切到「自定义音色(RVC)」,外掛指向本機轉換服務(預設 http://127.0.0.1:4892);填入自己訓練的 .pth 模型和可選 .index 索引,或從共享儲存庫一鍵下載現成音色包——片中瀏覽的就是作者自己的 1624318455/rvc-for-tts 音色庫。

自訂音色路線:本機 RVC 服務,用自己的 .pth 模型或共享音色包。到影片 0:08 處看 - 7
試聽一句,看粉色「發音中」徽標亮起
在「試聽測試」裡輸入「你好,這是一個語音測試。」點播放——朗讀進行時浮層裡飄著粉色「發音中」徽標,頁尾註明由 node-edge-tts 驅動。

試聽測試:一句話、一次點擊,「發音中」徽標隨即亮起。到影片 0:56 處看 - 8
送出訊息,讓回覆自己開口
片中問了一句「你是誰」,回覆文字出來後自動開始朗讀:訊息工具列出現停止按鈕,粉色「發音中」徽標跟著播放走。聽完點一下停止,就能繼續打字。

播放實況:Edge TTS 朗讀期間,回覆自帶停止按鈕。到影片 1:08 處看
常見問題
畫面帶出來、但畫面本身不回答的問題。
語音轉寫會不會把我的聲音上傳雲端?
不會。設定項原文「本地转写,音频不出本机」,README 也寫明錄音與轉寫都在本機完成、不依賴雲端 API/API Key;SenseVoice 模型約 230MB,下載一次後 CPU 就能跑。
轉寫支援哪些語言?
影片展示的 dsh-voice-local 用 SenseVoice 引擎,中文自動標點,支援中/英/日/韓/粵多語言;你的 DeepSeek Harness 對話語言不受限制。
安裝會不會很麻煩?
一行指令 dsh plugin --profile web add dsh-voice-local 就裝好語音輸入,重啟 dsh web 後生效;朗讀則是 dsh-plugin-tts,同樣走外掛市場或指令安裝。
朗讀音色可以換嗎?
可以。Edge TTS 免費音色直接下拉換(片中用晓晓);想用自己訓練的嗓音,切到 RVC 自訂音色路線,指向本機轉換服務與 .pth 模型即可。
延伸閱讀
語音這條線的其餘站點,以及背後的上手指南。
來源與署名
兩支素材都來自 B 站,分屬兩位創作者,各自署名;每張截圖都能深鏈到影片對應秒。想挑更多語音外掛? 去語音外掛合輯逛逛
