Web UI 语音输入:输入框一键麦克风按钮,基于 Web Speech API 语音转文字填入草稿,可选识别后自动发送。
安装
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:NewDaNew/dsh-voice-input
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
给 DeepSeek Harness Web 的输入框加一个麦克风按钮:点一下,说话,语音自动变成文字填进输入框,可开启「识别后自动发送」。
语音在本地浏览器识别(Web Speech API):不上传语音、不需要 API Key、不用服务器参与。
🚀 最快安装(一条命令,约 1 分钟)
打开 PowerShell,粘贴回车:
irm https://raw.githubusercontent.com/NewDaNew/dsh-voice-input/main/install.ps1 | iex
脚本会自动完成:定位 DSH 目录 → 下载插件 → 写入配置,全程不用手动改任何文件。
然后做两步:
- 重启 dsh web:结束当前
dsh web进程,重新运行dsh web - 刷新浏览器:输入框右侧出现 🎤 按钮,点它说话即可
不放心执行远程脚本?可以先用手动安装,或先把
install.ps1下载下来看一眼再运行。
📦 手动安装(不想跑脚本)
- 下载本仓库 ZIP(Code → Download ZIP)并解压
- 打开 PowerShell,进入解压目录,运行:
powershell -ExecutionPolicy Bypass -File install.ps1 - 重启
dsh web→ 刷新浏览器
纯手动(连脚本都不用)
- 把整个仓库(含
package.json)复制到$env:DSH_HOME\profiles\node_modules\@local\dsh-plugin-voice-input(DSH_HOME默认C:\Users\你的用户名\.dsh) - 编辑
$env:DSH_HOME\profiles\web\cordis.patch.yml,末尾追加:- insert: - id: voice-input name: '@local/dsh-plugin-voice-input' - 重启
dsh web→ 刷新浏览器
🎙️ 怎么用
| 操作 | 效果 |
|---|---|
| 点 🎤 | 开始聆听(说完自动停止,按钮上方实时显示转写),结果自动填入输入框 |
| 再点一次 🎤 | 立即停止,把当前内容提交到输入框 |
| 点 ⚙️(🎤 右侧小箭头) | 设置:识别后自动发送、识别语言(自动 / 中文 / English) |
✅ 要求
- DSH
0.1.0-rc.6+(webprofile) - Chrome / Edge(支持 Web Speech API);不支持的浏览器按钮会自动禁用
🔧 注意事项
- 未进入会话(hero 状态)时不显示麦克风按钮
- 消息提交/裁定阶段按钮暂时禁用
- 识别语言默认跟随浏览器语言(中文系统自动用 zh-CN)
🧩 原理(给开发者)
- DSH client plugin:
package.json声明dsh.client(platform=web,inject 依赖 runtime 与 ui-conversation),exports["./client"]指向浏览器端 bundle - DSH 的 client-modules 把它注入
window.__DSH_BOOT__,前端通过/plugins/@local/dsh-plugin-voice-input/client.js加载 - 插件在
apply(ctx)中用ctx.slots.inject("conversation.input.right", …)把按钮注册到输入框右侧工具栏,识别结果通过inputActions.setDraft()写入草稿
链接
同类插件
PolinniZhong/dsh-omi-voice★ 74
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
PensiveFei/dsh-voice-scribe★ 34
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
1624318455/dsh-plugin-tts★ 21
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
WizisCool/dsh-ears★ 21
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
qishuilalala/dsh-voice-mode#dsh-voice-mode★ 15
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。
PerryLink/dsh-talk★ 14
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。