输入框麦克风语音输入:浏览器 Web Speech API 实时转写,自动去重/续听、智能标点,支持语言与自动发送设置。
安装
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:QT-Chen/dsh-mic-input
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
DeepSeek Harness (DSH) Web GUI 的麦克风语音输入插件 —— 纯浏览器实现,零服务端、零密钥。
English version: README.md
纯 Client 插件,在 DSH Web GUI 输入框工具行右侧添加一个麦克风按钮:点击开始/停止录音,语音实时转写进输入框。全部通过浏览器内置的 Web Speech API 完成:
- Microsoft Edge → 微软 Azure 语音服务
- Google Chrome → 谷歌/Chrome 语音服务
零服务端、零 API Key、零模型下载。音频只交给浏览器自带的语音服务,插件本身不落盘、不上传。
功能
- 输入框工具行麦克风按钮(发送按钮左侧):点击开始/停止;录音时红色脉动光圈
- 实时转写:边说边把中间结果填进输入框
- 文字不重复:草稿永远基于录音开始时的输入框内容重建,并自动去重 interim 回显前缀(修复 Web Speech 插件常见的"重复文字"问题)
- 静默自动续听:浏览器停顿约 1.5 秒断连后自动重连续听(最多 6 次),长句不会被切断
- 智能标点(默认开启):句末自动补全——
吗/呢结尾补?,吧/啊/呀/哦/嘛/啦/哇/哈结尾补!,其余补。(英文补.);可选:自动补全 / 保留原样 / 去除 - 语言选择:跟随系统 / 中文(zh-CN)/ English(en-US)——语言匹配错误是识别跑偏的头号原因
- 识别后自动发送(可选):说完自动提交
- 设置入口:设置 → 通用 → 语音输入
- 错误可见:权限被拒、网络错误等以中/英文提示显示在按钮悬停处
安装
dsh plugin --profile web add github:QT-Chen/dsh-mic-input
或从 npm 安装(预构建产物,无需构建授权):
dsh plugin --profile web add dsh-mic-input
重启 dsh web(或刷新页面),点输入框右侧的麦克风按钮即可。首次使用浏览器会请求麦克风权限,允许即可(127.0.0.1 / localhost 属安全上下文,可用)。
提示:从 GitHub 源码安装时,pnpm ≥ 10 可能要求一次
allowBuilds构建授权;npm 安装则无需此步骤。
使用建议
- 录音即开始一个会话;再点一次按钮停止,转写文字保留在输入框中(勾选"自动发送"才会自动提交)
- 识别乱码时先检查语言设置——说的语言和设置的语言不一致是常见原因
- 识别质量取决于浏览器自带引擎(Edge 走微软、Chrome 走谷歌,两者可能有明显差异)
隐私
无服务端、无存储:音频由浏览器语音服务(微软/谷歌)处理,只有最终文字进入 DSH。插件本身不写盘。
License
MIT
链接
同类插件
PolinniZhong/dsh-omi-voice★ 74
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
PensiveFei/dsh-voice-scribe★ 34
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
WizisCool/dsh-ears★ 22
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
1624318455/dsh-plugin-tts★ 21
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
qishuilalala/dsh-voice-mode#dsh-voice-mode★ 15
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。
PerryLink/dsh-talk★ 13
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。