面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
安装
# npm 包(预构建)
dsh plugin --profile web add dsh-ears
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:WizisCool/dsh-ears
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
https://github.com/user-attachments/assets/1363768e-a393-44bd-a008-1ce2055cac41
dsh-ears 为 DeepSeek Harness 提供语音输入与 LLM 润色整理能力。支持浏览器 Web Speech、本地 Whisper 以及主流语音识别(ASR)API 服务。
安装
前置依赖:DeepSeek Harness >=0.2.0-rc.1,以及 Node.js ^22.19.0 || >=24.0.0。
通过 npm 安装
Web UI:
dsh plugin --profile web add dsh-ears
桌面端:在插件管理界面中安装。桌面端独占名为 desktop 的 profile,dsh 命令不会管理它,因此没有对应的命令行写法。dsh-ears 不需要单独的桌面端构建,两个界面加载同一个 web 客户端包。
仍在使用 dsh 0.1.x? dsh-ears
0.4.1要求 dsh>=0.2.0-rc.1,dsh 会直接拒绝在旧版本上安装。请继续使用对应的旧版本线:# dsh 0.1.2–0.1.6 dsh plugin --profile web add "dsh-ears@<0.4.0" # dsh 0.1.7(dsh-ears 0.4.0 要求 dsh 0.1.7-rc.2 及以后) dsh plugin --profile web add "dsh-ears@<0.4.1" # dsh 0.1.1 dsh plugin --profile web add "dsh-ears@<0.3.0"
从源码安装
git clone https://github.com/WizisCool/dsh-ears.git
cd dsh-ears
pnpm use:platform
pnpm install
pnpm build
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD
pnpm use:platform 将 node_modules 切换到当前平台的 native 依赖树(Windows / Linux 各自独立),首次克隆和跨平台切换后都需要运行。
安装完成后刷新 Web UI,输入框右侧会显示麦克风图标。
更新
dsh plugin --profile web add dsh-ears
add 会从 npm 拉取最新版本,任何已装版本都可以直接运行。更新后需要重启 dsh web 加载新的服务端代码,再刷新 Web UI;也可以在设置页的"关于"面板检查新版本。
卸载
dsh plugin --profile web remove dsh-ears
卸载后刷新 Web UI。
使用
- 点击麦克风图标,或按下
Ctrl+Shift+Space(可在设置页更改) - 开始说话
- 再次按下快捷键或点击麦克风,停止录音并开始转写
- 开启润色后,原始转写会先写入草稿,润色完成后再更新,期间的手动编辑会被保留
- 检查内容后手动发送
转写结果始终写入可编辑草稿,不会自动发送。如果所选后端尚未就绪,麦克风图标会变灰,悬停即可查看原因。
识别后端
| 后端 | 工作方式 | 需要什么 |
|---|---|---|
| Web Speech | 浏览器实时识别 | 默认后端;Chromium 内核浏览器 |
| 本地 Whisper | 录音结束后本地转写 | 在设置页下载 GGML 模型 |
| Groq | Groq Whisper API | API key |
| Deepgram | 预录音频或实时音频流 | API key、模型名(如 nova-3) |
| 阿里云百炼 | DashScope 同步转写 | API key、模型名;单次最长 300 秒 |
| 腾讯云 | 录音文件识别或实时语音识别 | AppID、SecretID、SecretKey、engine_type |
| 小米 MiMo | 语音识别 API,支持标准 API 或 Token Plan | API key、模型名(如 mimo-v2.5-asr);Token Plan 需选择区域集群 |
| 硅基流动 (CN) | 语音转写 API | API key、模型名(如 FunAudioLLM/SenseVoiceSmall) |
| 火山引擎 | 录音文件识别(大模型)或单向流式语音识别 | API key(新版控制台 X-Api-Key)、资源 ID |
| 自定义 OpenAI 兼容 | 发送到指定 /audio/transcriptions 端点 |
端点地址、API key、模型名 |
本地 Whisper:基于
@fugood/whisper.node本地运行 whisper.cpp,无需 Python、FFmpeg 或外部依赖。支持在设置页下载管理 GGML 模型(tiny(默认)至turbo),并可选default(自动)、vulkan或cuda加速。火山引擎:仅支持新版控制台的 API Key(
X-Api-Key)鉴权(不支持旧版 AppID + Access Token),可在控制台 API Key 管理页面获取。
润色
默认开启。提供方和模型都留空时使用 dsh 的默认 Agent 模型(包括默认推理设置);也可以从 dsh 已配置的模型中选择。LLM 凭据复用 dsh 现有配置。支持设置推理强度。
默认提示词会删除口头禅、修正 ASR 错字、处理自我纠正和口头列举。可在设置页自定义提示词或查看默认内容。润色失败或取消时保留原始转写。
设置
安装后在 Web UI 的设置页出现 dsh-ears 面板,分为四个标签页:
| 标签页 | 可配置项 |
|---|---|
| 常规 | 设置页显示名称、语音快捷键开关与组合键、提示音开关、最长录音时间(1–600 秒,默认 120 秒) |
| 识别 | 后端选择、语言、本地 Whisper 模型和加速方式、云服务提供方及各提供方凭据 |
| 润色 | 开关、LLM 提供方和模型、推理强度、自定义提示词(最长 4000 字) |
| 关于 | 版本号、许可证、dsh 兼容范围、检查更新 |
已知限制
- Web Speech 后端依赖浏览器实现,音频可能被发送到浏览器厂商的服务端处理,不是完全的本地/离线方案。
- 百炼单次录音最长 300 秒。
- Deepgram Flux 系列模型需要 Listen V2 协议,当前不支持。
- 本地 Whisper 单次音频限制 24 MB,转写超时 120 秒。
- 加速方式(
default/vulkan/cuda)在首次 native 加载后锁定,切换需重启dsh web。
本地开发
pnpm use:platform
pnpm install
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD
pnpm check # 类型检查
pnpm test # 运行测试
pnpm build # 构建
pnpm dev:config # 构建并生成 HMR 配置
pnpm dev:web # 启动 dsh web
开发时在另一个终端运行 pnpm dev:watch 实时重编译。
修改前端 UI 代码只需刷新浏览器;修改服务端、设置注册、Remote 或 schema 代码需重启 dsh web 再刷新。
文档
License
友链
- LINUX DO — 新的理想型社区
Star History
链接
同类插件
PolinniZhong/dsh-omi-voice★ 74
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
PensiveFei/dsh-voice-scribe★ 34
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
1624318455/dsh-plugin-tts★ 21
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
PerryLink/dsh-talk★ 16
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
qishuilalala/dsh-voice-mode#dsh-voice-mode★ 15
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。
beiyege-01/dsh-voice-ai-girlfriend-plugin★ 12
Web UI 语音 AI 女友:FunASR 麦克风语音输入、Qwen3-TTS 语音回复、数字人动画窗、QQ 双向聊天(文本/语音/图片推送,经 NapCat)。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。