DeepSeek Harness 語音外掛實測:對 AI 說話、聽 AI 朗讀

兩支 B 站實測短片、八個截圖核對步驟:在 Web UI 勾選語音輸入(本地轉寫),按 Ctrl+Alt+V 說話變文字,再用 dsh-plugin-tts 外掛讓回覆用你挑的音色唸出來。

最近更新: 2026-09-23

DeepSeek Harness Web UI 輸入框裡的語音麥克風變成紅色錄音按鈕,開麥待說,說話即可轉寫上屏。
錄音狀態:輸入框工具列上的麥克風位變成紅色停止按鈕。

兩個場景、兩支影片。第一支裡,創作者對著 DeepSeek Harness Web UI 說話,話音落地就變成輸入框裡的文字,全程不離開本機;第二支裡,另一位創作者幫回覆裝上嗓子——dsh-plugin-tts 把模型的回答唸出聲。兩支影片都沒有字幕,下文引用的每一條介面文案都是逐格讀出來的,每一步都附原始截圖。

畫面裡的一切都跑在本機 Web UI(錄影中為 127.0.0.1:3080)上。語音輸入靠的是本地轉寫外掛 Real-WangLe/dsh-voice-local,語音播報靠 1624318455 的 dsh-plugin-tts;兩條產品線還有更多同類外掛,都收在語音合輯裡。

先看結論

  • 語音輸入就是一個勾選框:「语音输入(本地转写,音频不出本机)」,不需要任何 API Key。
  • Ctrl+Alt+V 預設開麥/停麥,影片裡口述支援自訂;說話時文字一句一句即時落進輸入框。
  • dsh-plugin-tts 用微軟 Edge TTS 免費音色朗讀回覆,語速/音調/音量滑桿可調,播放時顯示粉色「發音中」徽標。

語音進、語音出,逐步實拍

對 AI 說——本機語音輸入

  1. 1

    打開輸入框語音浮層,勾選本地轉寫

    在 DeepSeek Harness Web UI 的輸入框工具列上點麥克風位,浮層裡有語音輸入總開關——原文寫著「语音输入(本地转写,音频不出本机)」——還有「键盘输入自动关闭麦克风」,一開始打字就自動還麥。片中兩項都勾著,而且浮層開著不關也照常辨識。

    DeepSeek Harness 語音輸入浮層:本地轉寫勾選框、鍵盤自動還麥勾選框與 Ctrl+Alt+V 快捷鍵列同框展示。
    浮層近景:本地轉寫已勾選、自動還麥已開啟、快捷鍵一目瞭然。到影片 0:34 處看
  2. 2

    按 Ctrl+Alt+V 開麥,邊說邊看文字上屏

    浮層的快捷鍵一行預設顯示 Ctrl+Alt+V,片中口述支援自訂;錄音時麥克風位變成紅色按鈕,辨識文字一句一句往輸入框裡落,再按一次停麥,整段話就留在輸入框裡等你送出或改寫。

    DeepSeek Harness 輸入框邊說邊轉寫進行中:紅色錄音按鈕未熄,轉寫出的中文段落已經一句句落進輸入框。
    即時聽寫:麥克風還是紅的,文字已經一句句到位。到影片 1:24 處看
  3. 3

    隱私條款就寫在外掛 README 裡,用前讀一遍

    影片後段展示的儲存庫 Real-WangLe/dsh-voice-local 寫得很直白:錄音與轉寫都在本機完成、不依賴雲端 API/API Key;SenseVoice 引擎 CPU 推理,中文自動標點,支援中/英/日/韓/粵多語言。安裝一行指令:dsh plugin --profile web add dsh-voice-local,首次點麥克風會自動下載約 230MB 的 SenseVoice 模型。

    dsh-voice-local 的 GitHub README:DeepSeek Harness 錄音與轉寫全程本機離線完成、不依賴雲端 API,並附一行安裝指令。
    外掛 README:全程本機、無需 API Key、SenseVoice 引擎、一行安裝。到影片 2:02 處看
  4. 4

    Windows 上轉寫一直是空的?先看這個 issue

    儲存庫 issue #1(錄製時仍為 Open)記錄了 v0.3.0 的 Windows 特有缺陷:Silero VAD 把關誤判後 speechMs 恆為 0,/transcribe 一直回傳空文字,而模型明明 ready。回報者用除錯證據排除了音量與閾值設定——Windows 下遇到空白轉寫,先查這個 issue 再懷疑麥克風。

    dsh-voice-local 儲存庫 issue #1:Windows 上 v0.3.0 的 Silero VAD 回傳 speechMs=0,導致 DeepSeek Harness 轉寫永遠為空。
    錄製時仍 Open:v0.3.0 在 Windows 上回傳空轉寫。到影片 1:50 處看

聽 AI 說——TTS 語音播報

  1. 5

    在 dsh-plugin-tts 設定裡選免費的 Edge TTS 音色

    Web UI 設定 → 插件 → 语音,TTS 供應商下拉選 Edge TTS:免金鑰線上音色、開箱即用。片中選了「晓晓(zh-CN-XiaoxiaoNeural)」,語速/音調/音量是 −50% 到 +50% 的滑桿,「运行诊断」一鍵檢查線上合成、本機 RVC 服務和模型載入。

    DeepSeek Harness 的 dsh-plugin-tts 設定彈窗:Edge TTS 供應商、晓晓音色下拉選單與語速/音調/音量滑桿組。
    TTS 供應商選 Edge TTS,免費的晓晓音色已就位。到影片 0:40 處看
  2. 6

    想用自己的嗓音?走 RVC 自訂音色

    把供應商切到「自定义音色(RVC)」,外掛指向本機轉換服務(預設 http://127.0.0.1:4892);填入自己訓練的 .pth 模型和可選 .index 索引,或從共享儲存庫一鍵下載現成音色包——片中瀏覽的就是作者自己的 1624318455/rvc-for-tts 音色庫。

    DeepSeek Harness 的 dsh-plugin-tts 彈窗 RVC 路線:本機轉換服務位址、原聲音色下拉選單與 .pth 模型路徑欄位。
    自訂音色路線:本機 RVC 服務,用自己的 .pth 模型或共享音色包。到影片 0:08 處看
  3. 7

    試聽一句,看粉色「發音中」徽標亮起

    在「試聽測試」裡輸入「你好,這是一個語音測試。」點播放——朗讀進行時浮層裡飄著粉色「發音中」徽標,頁尾註明由 node-edge-tts 驅動。

    DeepSeek Harness 的 TTS 試聽框:測試語句、播放按鈕,以及 dsh-plugin-tts 朗讀時亮起的粉色發音中徽標。
    試聽測試:一句話、一次點擊,「發音中」徽標隨即亮起。到影片 0:56 處看
  4. 8

    送出訊息,讓回覆自己開口

    片中問了一句「你是誰」,回覆文字出來後自動開始朗讀:訊息工具列出現停止按鈕,粉色「發音中」徽標跟著播放走。聽完點一下停止,就能繼續打字。

    DeepSeek Harness 聊天回覆正被 dsh-plugin-tts 朗讀:訊息工具列出現停止按鈕,粉色發音中徽標懸浮在對話上方。
    播放實況:Edge TTS 朗讀期間,回覆自帶停止按鈕。到影片 1:08 處看

常見問題

畫面帶出來、但畫面本身不回答的問題。

語音轉寫會不會把我的聲音上傳雲端?

不會。設定項原文「本地转写,音频不出本机」,README 也寫明錄音與轉寫都在本機完成、不依賴雲端 API/API Key;SenseVoice 模型約 230MB,下載一次後 CPU 就能跑。

轉寫支援哪些語言?

影片展示的 dsh-voice-local 用 SenseVoice 引擎,中文自動標點,支援中/英/日/韓/粵多語言;你的 DeepSeek Harness 對話語言不受限制。

安裝會不會很麻煩?

一行指令 dsh plugin --profile web add dsh-voice-local 就裝好語音輸入,重啟 dsh web 後生效;朗讀則是 dsh-plugin-tts,同樣走外掛市場或指令安裝。

朗讀音色可以換嗎?

可以。Edge TTS 免費音色直接下拉換(片中用晓晓);想用自己訓練的嗓音,切到 RVC 自訂音色路線,指向本機轉換服務與 .pth 模型即可。

延伸閱讀

語音這條線的其餘站點,以及背後的上手指南。

來源與署名

兩支素材都來自 B 站,分屬兩位創作者,各自署名;每張截圖都能深鏈到影片對應秒。想挑更多語音外掛? 去語音外掛合輯逛逛

DSH Plugins 是獨立的 DeepSeek Harness 外掛市集,與 DeepSeek 官方無關,也不代表官方背書。第三方外掛未經安全稽核,安裝前請審查原始碼。

每週取得最新的 DeepSeek Harness 外掛,絕不濫發。