语音五工具:edge-tts 免费微软神经语音合成、OpenAI 兼容 ASR 转写、音色清单、批量音色试听与健康自检。
安装
# npm 包(预构建)
dsh plugin --profile web add dsh-voice
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:STARDUSTLC666/dsh-voice
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
dsh-voice
你的 agent 会说话了:edge-tts 微软神经语音免费无限量 + Whisper 转写。
DSH(DeepSeek Harness)语音双件套插件:让 agent 会说话、能听懂。
- voice_tts:文字转语音,走 edge-tts 协议(微软 Edge 朗读服务,免费无限量,22+ 常用音色)
- voice_stt:语音转文字,走 OpenAI 兼容 ASR 接口(Groq / OpenAI / 自定义端点)
- voice_list:音色清单
- voice_preview:音色试听,用一段样例文本批量生成短 MP3,挑音色不用盲选
- voice_health:配置自检,体检 TTS 音色 / ASR 密钥 / 接口地址 / 代理(不联网)
兼容性
验证宿主:官方源码构建的 Harness 0.2.0-rc.1(commit 407e65c8)+ Node 24.16.0(2026-09-28)。55 项插件测试在隔离环境全部通过;同一个宿主里 18 个插件共同加载,注册 5 个工具,工具 schema 与健康检查契约通过。本轮未启用真实端口与外部服务。
安装
dsh plugin --profile web add dsh-voice
卸载
dsh plugin --profile web remove dsh-voice
卸载后重启 Web 服务。如需彻底清理,可再手动删除自己 profile cordis.patch.yml 中覆盖的插件行。
配置
voice_tts 零配置可用;voice_stt 需要 ASR 密钥:
- id: voice
name: 'dsh-voice'
config:
asrEngine: groq # groq | openai | custom
asrModel: whisper-large-v3-turbo # groq 的 whisper 模型
# asrApiKey: gsk_... # 推荐改用环境变量 DSH_VOICE_ASR_KEY
ttsVoice: zh-CN-XiaoxiaoNeural # 默认音色
# proxyUrl: http://127.0.0.1:7890 # ASR 接口需要特殊代理时启用
工具一览
| 工具 | 作用 | 关键参数 |
|---|---|---|
voice_tts |
文字合成 MP3(免费) | text 必填;voice/rate/pitch/output 可选 |
voice_stt |
音频转文字 | audio 必填;engine/model/language/prompt/output 可选 |
voice_list |
常用音色清单 | 无 |
voice_preview |
音色试听:批量生成短样例 MP3 | voices(≤8 个)/ text / outputDir 可选 |
voice_health |
配置自检(不联网) | 无 |
示例
voice_tts { text: 今天的 AI 早报来了 } # 晓晓女声,输出 voice_output.mp3
voice_tts { text: hello, voice: en-US-AriaNeural } # 英文女声
voice_stt { audio: E:\audio\meeting.mp3, language: zh } # 转写会议录音
voice_list {}
voice_preview { voices: [zh-CN-XiaoxiaoNeural, en-US-AriaNeural] } # 生成两个试听样例
voice_health {} # 自检 TTS / ASR / 代理配置
硬核细节
- edge-tts 协议直连:Sec-MS-GEC 令牌按官方 DRM 算法本地生成(SHA256(Windows 文件时间 + TrustedClientToken),5 分钟窗口),WS 传输用
ws库 + permessage-deflate 压缩 + 可选 HTTP CONNECT 代理隧道 - 零 API 成本:TTS 完全免费;STT 只花你选的 ASR 接口的钱
- 文本 ≤5000 字符、音频 ≤25MB 前置校验;输出同名自动加序号
- 协议对齐开源 edge-tts 当前版本(7.x),不依赖过时的令牌端点
开发
pnpm install
pnpm test # 构建 + 离线单元测试(使用模拟的 TTS/ASR)
pnpm test:integration # 显式联网,调用真实 edge-tts;网络或断言失败均报错
License
MIT
版本记录
- 0.3.4(2026-09-18):修复代理路径 STT 上传
[object FormData]、25MB 校验在读入之后、输出目录不存在白烧一次合成、默认输出落宿主 cwd;exec.signal全程透传、preview 改 3 路并发。测试 55 项。
链接
同类插件
PolinniZhong/dsh-omi-voice★ 74
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
PensiveFei/dsh-voice-scribe★ 34
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
1624318455/dsh-plugin-tts★ 21
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
WizisCool/dsh-ears★ 21
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
qishuilalala/dsh-voice-mode#dsh-voice-mode★ 15
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。
PerryLink/dsh-talk★ 14
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。