基于全双工语音模型的 DSH 网页端中文语音交互:边听边说、随时插话,用语音输入和修改任务、提交请求、管理会话、回答 DSH 的问题,并简短播报任务完成结果。
安装
# npm 包(预构建)
dsh plugin --profile web add dsh-duet
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:YuMS/dsh-duet
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
只用语音,就能操作 DeepSeek Harness(DSH)。
duet,意为「二重奏」。这里的 duet 使用全双工语音模型,可以边听边说, 让你与 DSH 的交流不必一人一句地等待。
说出需求、修改输入、发送任务、切换会话——把键盘上的操作交给声音。 任务完成后,duet 会简短播报结果,让你不用一直盯着屏幕。
你可以随时插话、补充或纠正。处理任务之外,也可以聊聊天。
目前处于试用阶段,duet 语音服务可以免费使用。
安装
已验证兼容 DSH 0.1.5-rc.2 和 0.1.6-alpha.2。
安装并打开 DeepSeek Harness:
npm install -g @deepseek-ai/dsh
dsh web
在另一个终端为 Web profile 安装插件,再重启 DSH:
dsh plugin --profile web add dsh-duet
dsh web
也支持 DSH 的 GitHub 插件安装方式:dsh plugin --profile web add github:YuMS/dsh-duet。
两种方式任选其一。
使用
duet 支持两种模式。
| 按钮 | 模式 | 用途 |
|---|---|---|
| 喇叭 | 播报模式 | 任务完成后,进行简短的播报 |
| 双向箭头 | 交互模式 | 开口操作 DSH、自由聊天,也可以在回复过程中插话 |
目前支持的语音操作
| 操作 | 你可以这样说 |
|---|---|
| 输入内容 | “输入,帮我整理一下这周的计划” |
| 修改内容 | “把这周改成下周” |
| 清空输入框 | “清空输入框” |
| 发送任务 | “发送”“提交” |
| 新建会话 | “新建一个会话,叫旅行计划” |
| 切换会话 | “切换到第二个会话”“切换到旅行计划” |
| 重命名会话 | “把当前会话改名为周末安排” |
| 分叉会话 | “从当前会话分叉一个新会话” |
| 归档会话 | “归档这个会话” |
| 回答 DSH 的问题 | “选第二个”“用中文就好” |
| 自由聊天 | “什么是全双工语音交互?” |
麦克风与隐私
duet 通过服务器提供语音服务。根据所使用的功能,以下信息会上传至服务器,用于理解语音、执行会话操作、生成回复和语音播报:
- 交互模式开启期间,麦克风采集的交互音频。
- 交互所需的会话信息,例如会话标识、名称、运行状态和当前会话名称。
- 交互所需的输入框内容、任务结果。
请勿在交互中提供密码、密钥等敏感内容。
目前仅支持中文。
许可证
Copyright 2026 YuMS。本项目采用 Apache License 2.0。 第三方图标的许可声明见 HEROICONS-LICENSE.txt。
链接
同类插件
PolinniZhong/dsh-omi-voice★ 73
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
PensiveFei/dsh-voice-scribe★ 33
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
WizisCool/dsh-ears★ 20
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
1624318455/dsh-plugin-tts★ 18
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
qishuilalala/dsh-voice-mode#dsh-voice-mode★ 12
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。
Alan2Z/dsh-speak★ 11
零外部依赖、事件驱动、无需额外模型、不消耗任何 token的语音播报插件。使用系统自带自然语音进行播报,支持win/mac双平台;最终回复、审批与提问提醒、可选事件播报(回合结束/命令完成/目标变更/工具出错/待办更新)、最终回复可重播、双语言可视化设置。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。