输入框麦克风语音输入:浏览器 Web Speech API 实时转写(Chrome/Edge),多语言切换与可选自动发送,零依赖零密钥。
安装
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:0nt-one/dsh-voice-input
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
语音输入客户端插件(client plugin)——给 DeepSeek Harness Web GUI 的聊天输入框工具行加一个麦克风按钮:点击开始说话,浏览器 Web Speech API(Chrome / Edge 内置,免费、无需 API 密钥)把语音实时转成文字填入输入框。
功能
- 麦克风按钮位于输入框工具行右侧(发送按钮左侧,
conversation.input.right插槽) - 点击开始/停止聆听;聆听时按钮红色脉冲,上方浮层实时显示转写中间结果
- 每段识别完成的最终文本自动追加到输入框草稿,可继续编辑后发送
- 浮层内可一键切换识别语言:中文 / English / 自动
- 可选自动发送:
localStorage设置dsh-voice-input-web.autoSend = "1"后,一段语音识别完成即自动发送 - 零依赖、零密钥、无服务端改动;识别完全在浏览器本地进行
与其他方案对比
| 方案 | 转写方式 | 依赖 | 成本 |
|---|---|---|---|
| 本插件(Web Speech API) | 浏览器系统语音服务 | 无 | 免费 |
| dsh-voice | agent 工具(OpenAI 兼容 ASR) | 需 ASR API key | STT 收费 |
| dsh-voice-input(SenseVoice) | 本地离线转写 | 需模型/服务 | 免费、离线 |
安装
方式一:npm 包(推荐)
dsh plugin --profile web add dsh-voice-input-web
方式二:离线安装(GitHub 源码)
将本包放入 web profile 的 node_modules:
~/.dsh/profiles/web/node_modules/dsh-voice-input-web/在
~/.dsh/profiles/web/cordis.patch.yml追加:- insert: - id: dsh-voice-input-web name: 'dsh-voice-input-web'重启
dsh --profile web,浏览器刷新页面。按钮出现在输入框工具行。
安装后插件 id / 包目录名 / localStorage key 统一使用
dsh-voice-input-web(dsh-voice-input在 npm 上已被同名 SenseVoice 方案占用)。
配置(localStorage)
| key | 值 | 默认 | 说明 |
|---|---|---|---|
dsh-voice-input-web.lang |
zh-CN / en-US / auto |
zh-CN |
识别语言 |
dsh-voice-input-web.autoSend |
"1" / "0" |
"0" |
识别完成后自动发送 |
兼容性
- 需要 Chrome / Edge(或任何支持
webkitSpeechRecognition的浏览器);Firefox 不支持 Web Speech API,会显示提示 - 页面需在
localhost/127.0.0.1或 HTTPS 下访问(浏览器安全限制) - 语音识别需要联网(由浏览器调用系统语音服务)
License
MIT
链接
同类插件
PolinniZhong/dsh-omi-voice★ 74
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
PensiveFei/dsh-voice-scribe★ 34
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
1624318455/dsh-plugin-tts★ 21
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
WizisCool/dsh-ears★ 21
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
PerryLink/dsh-talk★ 15
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
qishuilalala/dsh-voice-mode#dsh-voice-mode★ 15
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。