dsh 的对话式语音前端 Agent:通过 ByteDance Duplex 自然对话,把语音请求委派给后台任务,并用语音回报异步结果。
安装
# npm 包(预构建)
dsh plugin --profile web add @wayneyu430227/dsh-voice-agent
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:WayneYu430/dsh-voice-agent#path:/packages/voice-app
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
English | 中文
voice profile 的 patch-layer bundle。它叠加在 dsh-base 和 dsh-web-app 之上,挂载与 provider 无关的语音 seam、字节 Duplex provider、普通文本 Agent consumer、专用浏览器 WebSocket 以及麦克风/播放客户端界面。新语音对话会在当前 Workspace 或 Session 目录中创建全新的普通未分组来源 Session,并把 provider transport 挂接到该 Session;来源不加入 Workspace 成员表,以免被标准 blank Session 流程复用。每个已接受委派会新建独立的普通 Task Session,并由紧凑卡片链接,root 持有的音频在跳转期间持续运行。插件自有的浏览器历史索引从侧栏展示已保存的 Voice Session,无需 Host 或 Workspace 专用元数据。通过 DUPLEX_API_KEY 凭据引用配置 Duplex 访问密钥。
模型体验
语音 profile 组合
模型看到什么
语音发起的工作只以已接受的 realtime_delegation 信封与准确 id 更新到达全新 Task Agent。只有该 Task Agent 收到作用域内的 send_voice_message 后台工具,用于发送 STATUS 与 COMPLETE;桥接层直接创建目标,因此不增加 project 列举工具。Duplex frontend Agent 拥有语音对话,只看到自身的三个编排工具。
Token 影响
已接受的委派文本、普通任务执行与后台回报调用都会消耗文本模型 token;Duplex 另行花费 provider token 处理语音对话和任务摘要。
KV Cache 影响
只有已接受的 command 扩展独立 Task Agent 历史;Voice Session 文本与 frontend 对话不改变其请求前缀。
已知限制与后续工作
- 随附的首个 provider 是 Duplex;service seam 与 provider 无关,因此后续可增加 Realtime/Live provider 而不修改 assistant consumer。
- 原始音频与 provider 对话状态仍限于当前进程;已完成或打断的 utterance 文本与任务链接会持久保存。
- 筛选后的语音历史索引只属于当前浏览器;清除站点数据不会删除底层 Session。
- 浏览器客户端界面面向 dsh Web UI:它由复制而来的 dsh client tsdown 预设构建,并通过 dsh web 运行时的
window.__ModuleLoader__契约加载。服务端包与传输无关,但麦克风/播放 UI 不是独立浏览器插件。
链接
同类插件
PolinniZhong/dsh-omi-voice★ 75
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
PensiveFei/dsh-voice-scribe★ 35
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
1624318455/dsh-plugin-tts★ 24
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
WizisCool/dsh-ears★ 22
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
ppy-web/dsh-plugin-xiaomi-mimo-tts★ 19
为 DSH Web 添加 Xiaomi MiMo 语音朗读,支持助手消息朗读、PCM 流式播放、预置与自定义音色、浏览器语音兜底、播放控制和可选 UI 音效。
PerryLink/dsh-talk★ 17
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。