-
Web UI 语音输入:按停顿分段的听写与语音消息,各自拥有独立的服务商回退链(Deepgram、Groq、HuggingFace、本地 whisper.cpp 或 OpenAI 兼容接口)。
语音与音频安装 ▾
-
在 DeepSeek Harness 网页 UI 中朗读智能体回复,采用服务商回退链(OpenAI、ElevenLabs、Google、Azure、Groq、Deepgram、OpenRouter、Edge、Piper、eSpeak),某个服务商失败或被限流时自动切换到下一个,而不是直接静音。
语音与音频安装 ▾
-
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。
语音与音频安装 ▾
-
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
语音与音频安装 ▾
-
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
语音与音频安装 ▾
-
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
语音与音频安装 ▾
-
为 DSH Web 添加 Xiaomi MiMo 语音朗读,支持助手消息朗读、PCM 流式播放、预置与自定义音色、浏览器语音兜底、播放控制和可选 UI 音效。
语音与音频安装 ▾
-
面向 DeepSeek Harness Web 的 AI 音频插件 —— 多厂商 TTS、音乐、音效与音色设计,含侧边栏面板、模型对比、资源库与 Agent 工具。
语音与音频安装 ▾
-
语音五工具:edge-tts 免费微软神经语音合成、OpenAI 兼容 ASR 转写、音色清单、批量音色试听与健康自检。
语音与音频安装 ▾
-
agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。
语音与音频安装 ▾
-
零外部依赖、事件驱动、无需额外模型、不消耗任何 token的语音播报插件。使用系统自带自然语音进行播报,支持win/mac双平台;最终回复、审批与提问提醒、可选事件播报(回合结束/命令完成/目标变更/工具出错/待办更新)、最终回复可重播、双语言可视化设置。
语音与音频安装 ▾
-
基于全双工语音模型的 DSH 网页端中文语音交互:边听边说、随时插话,用语音输入和修改任务、提交请求、管理会话、回答 DSH 的问题,并简短播报任务完成结果。
语音与音频安装 ▾
-
DSH Web 的语音对话模式:点一下麦克风进入全屏通话,边说边听,AI 回复边生成边朗读。界面中英双语,适配明暗主题,支持语速调节与音色切换。
语音与音频安装 ▾
-
为 DSH 提供持续语音对话,支持免提监听、按住说话、语音识别、TTS 语音回复和后台 Agent 任务委派。
语音与音频安装 ▾
-
多对话并行的声音提醒 + 对话直达:当前对话当/当当(crisp 清脆档),其他对话叮/叮叮(soft 柔和档)+ 右上角小卡片,点一下直达对应对话。
语音与音频安装 ▾
-
输入框话筒旁的扬声器按钮——单击翻到「你最新提问的开头」并闪烁光标,从那里读到最新回复结尾(走 dsh-tts,回退浏览器语音);按住右滑可在页面上挑选任意朗读起点,按住上滑调出竖式混音台,分别控制页内媒体音量与系统输出音量。
语音与音频安装 ▾
-
对话结束语音播报(会话名、轮数、结果),回复生成时实时逐句朗读;内置 edge-tts,零第三方依赖。
语音与音频安装 ▾
-
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
语音与音频安装 ▾
-
将本地高性能 TTS 引擎 GSV-TTS-Lite 实时接入 DeepSeek Harness:语音预设、自动朗读、引擎配置助手、朗读按钮与设置面板。
语音与音频安装 ▾
-
豆包式语音对话插件:聊天框麦克风按钮(按住说话)语音转文字并自动发送,AI 回复自动朗读。可选 LLM 转述精简(长回复压缩成口语再播,跟随当前对话模型)、朗读前清洗 markdown/emoji/特殊符号、Edge TTS 多种音色、静音自动结束时长可调,设置嵌入 DSH 自带设置弹窗(voice chat 类目)。
语音与音频安装 ▾
-
输入框上的单手、免键盘输入:鼠标在输入框按住、说话、松手,文字直接进草稿;上滑取消,不留半句。不用去瞄麦克风按钮,也不用记快捷键,手始终不用离开输入区——另一只手正忙的时候,这一点才是关键。识别完全在本机完成(SenseVoice + sherpa-onnx),无需 API key,音频不出本机。
语音与音频安装 ▾
-
DSH Web GUI 的个人语音通话助手:可拖拽悬浮球通话面板、浏览器端 VAD(停顿自动发送)、FunASR HTTP 或流式语音识别、MiniMax / OpenAI 兼容 TTS 语音回复、可开关的唤醒词模式(沉默自动休眠),以及把任务分发给独立子代理会话并跟踪进度、停止与完成播报。
语音与音频安装 ▾
-
浏览器 Web Speech API 语音输入:零服务端、零密钥、零模型下载(Edge=Azure 语音、Chrome=Google 语音)。
语音与音频安装 ▾
-
基于 uisfx 的语义化 UI 音效:任务开始/成功/失败、不同按钮情景 cue,设置页即时试听,12 种音色包,Host 持久化,并提供 `ctx.uisfx` 服务给其他插件。
语音与音频安装 ▾
安装
# npm 包(预构建) dsh plugin --profile web add <npm-package> # GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试) dsh plugin --profile web add github:owner/repo
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
收录你的插件
给 awesome-dsh-plugin 提一个 PR:在 data/plugins/ 下新增一个 YAML 文件就是完整投稿,README 与本站会自动重新生成。也请为你的仓库打上 dsh-plugin topic。