字幕优先的视频转录,支持 SRT 导出与可取消任务控制;字幕不可用时回退到 faster-whisper `large-v3`。
安装
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:zeshuochen/dsh-watch-video
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
面向 DeepSeek Harness 的字幕优先视频转录插件。优先读取字幕;字幕不可用时使用 faster-whisper large-v3,并生成摘要与 SRT。插件不调用外部 LLM,也不保留原视频。
核心能力
- 支持 HTTP(S) 视频地址,使用
yt-dlp获取媒体。 - 字幕优先;必要时下载音频并用 Whisper 转录。
- 输出
transcript.txt、transcript.json、transcript.srt、summary.md和metadata.json。 - 支持任务取消、状态查询、任务列表和转录并发限制。
- 支持 Windows、Linux、macOS;任务超时会清理整个进程树。
- 只保留转录所需音频与派生产物,不保留原视频。
- DSH 重启后会按
staleJobAfterMs将过期的 running 任务恢复为interrupted,并清理不完整产物。默认阈值为 6 小时,异常心跳会保守跳过。
子进程输出按流独立进行有界保留:stdout 保留前缀,stderr 保留末尾;限制按 UTF-8 字节计算,并持续 drain 两个流。超时、取消或输出超限会终止整个进程树,并返回有限的诊断信息。maxOutputBytes 优先于旧配置名 outputLimitBytes。
安装依赖
需要 Node.js 20+、Python 3.10+、yt-dlp 和 ffmpeg。在项目目录运行:
npm install
python -m pip install -r requirements.txt
powershell -ExecutionPolicy Bypass -File scripts/bootstrap.ps1
npm run doctor
首次真正使用 Whisper fallback 时,faster-whisper 会下载 large-v3 模型,需要数 GB 磁盘空间。测试和打包检查不会下载模型或访问真实站点。
DSH 工具
dsh_watch_video:提交视频转录任务。dsh_watch_video_status:查询单个任务状态。dsh_watch_video_list:列出当前进程中的任务。dsh_watch_video_cancel:取消运行中的任务。
任务查询和取消是当前 Node 进程内能力;DSH 重启后,旧 jobId 不再可查询。
安全边界
只接受不含凭证和控制字符的 HTTP(S) 地址;不绕过登录、付费墙、DRM 或平台限制。外部进程使用参数数组和 shell: false。请确认你对内容拥有访问、下载、转录和保存权限。
验证
npm test
npm run typecheck
npm run pack:check
npm run verify:pack
node scripts/doctor.mjs --files-only
完整配置、产物协议、取消语义和平台边界见 README.zh.md。
链接
同类插件
PolinniZhong/dsh-omi-voice★ 75
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
PensiveFei/dsh-voice-scribe★ 35
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
1624318455/dsh-plugin-tts★ 24
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
WizisCool/dsh-ears★ 22
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
ppy-web/dsh-plugin-xiaomi-mimo-tts★ 19
为 DSH Web 添加 Xiaomi MiMo 语音朗读,支持助手消息朗读、PCM 流式播放、预置与自定义音色、浏览器语音兜底、播放控制和可选 UI 音效。
PerryLink/dsh-talk★ 17
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。