Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。
安装
# Release 预构建包
dsh plugin --profile web add "https://github.com/baisama-cloud/dsh-stt-input/releases/download/v0.1.0/dsh-stt-input-0.1.0.tgz"
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:baisama-cloud/dsh-stt-input
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本。请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
中文 · English
dsh-stt-input
DeepSeek Harness (DSH) Web GUI 的语音输入插件。
点击输入框旁的 🎤 麦克风按钮开始说话,再点一次停止,识别文字自动填入输入框。 识别引擎与模型可在 设置 → 语音输入 中选择。
功能
- 两种识别引擎
- 浏览器本地识别 — 使用浏览器自带的 Web Speech API(
SpeechRecognition, Chrome/Edge)。零配置、无需 API Key,边说边把中间结果写进输入框。 - API 识别 — 用
MediaRecorder录音,通过任意 OpenAI 兼容/v1/audio/transcriptions接口(OpenAI、Groq、自定义)转写。
- 浏览器本地识别 — 使用浏览器自带的 Web Speech API(
- 模型可选 —
whisper-1(OpenAI)、whisper-large-v3、whisper-large-v3-turbo、distil-whisper-large-v3-en(Groq),或自定义模型名。 - 可配置 — 服务预设(OpenAI / Groq / 自定义)、API Base URL、API Key、 识别语言、写入方式(追加到输入框 / 替换输入框内容)。
- 实时状态条 — 输入框下方显示录音计时、识别中状态与错误信息。
- 隐私 — API Key 仅保存在页面内存中,不落盘、不打日志;非密钥配置通过
localStorage在刷新后保留。
安装
打包 tarball 后安装到你的 DSH web profile(与其他 dsh-* 插件一致):
pnpm pack
# 把 dsh-stt-input-*.tgz 复制到 web profile 并添加依赖,
# 例如在 ~/.dsh/profiles/web 下:pnpm add ../path/to/dsh-stt-input-0.1.0.tgz
# 然后重启 `dsh web`。
插件注册了三个界面位:
- 输入框工具行的麦克风按钮(
conversation.input.left) - 输入框下方的状态条(
conversation.composer.dock) - 设置页(
settings.section→ 语音输入)
使用
- 打开 设置 → 语音输入 选择引擎。
- 浏览器本地识别:无需其他配置(Chrome/Edge)。
- API 识别:选择预设(OpenAI 或 Groq)、模型,并粘贴 API Key。
Groq 的
whisper-large-v3目前免费。
- 点击输入框旁的 🎤 开始录音,说话,再点一次停止。识别文字进入输入框,回车发送。
浏览器本地引擎依赖 Chrome/Edge 的 Web Speech API;Firefox 请使用 API 引擎。
工作原理
┌──────────┐ 点击🎤 ┌───────────────┐
│ 客户端 │ ─────────────▶ │ MediaRecorder │ (api 引擎)
│ (浏览器) │ │ SpeechRecog. │ (browser 引擎)
└──────────┘ └──────┬────────┘
▲ ▼
│ setDraft(text) base64 音频 (JSON)
│ POST /stt-input/transcribe
│ │
┌─────┴──────┐ ┌───────▼────────┐
│ 输入框 │ ◀──────────│ Host (Node) │
└────────────┘ {ok,text} │ fetch → /v1/ │
│ audio/transcr.│
└────────────────┘
客户端(lib/client.js)录音后把 base64 JSON POST 到宿主路由
/stt-input/transcribe;宿主(lib/index.js)解码音频并以
multipart/form-data 上传到 ${baseUrl}/v1/audio/transcriptions
(使用 Node ≥ 18 的全局 fetch / FormData / Blob)。
License
MIT
链接
同类插件
Zhangbo-cn/dsh-voice-input-plugin★ 6
输入框麦克风:点击持续监控、按住对话;浏览器语音识别逐字上屏,回复由 host Edge TTS 边生成边朗读,朗读时暂停识别防回声,点击可停止。
1624318455/dsh-plugin-tts★ 5
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
3274375092/dsh-voice★ 4
语音输入插件:对着麦克风说话,识别后的文字作为普通聊天消息发送(本地模型或浏览器语音识别)。
CAOGGL/dsh-ding★ 4
对话完成提醒:Agent 空闲(idle)时播放提示音并弹 Windows 原生通知,可配 ding.mp3、音量与防抖节流。
huguangyu666/dsh-plugin-notify★ 4
通知出口:agent 主动通过桌面通知 / 中文语音 / 音效(炸裂、胜利、警报)联系你,60 秒确认窗口后语音呼叫,音量增强,设置面板。
radres/dsh-plugin-call-me★ 4
通过 CallKit 打电话到你的手机:`call_me` 与 `text_me` 工具,并可在回合结束或等待审批时来电,语音回答转写后送回会话。