给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。
安装
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:jyh20030112/dsh-visual-plugin
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
DeepSeek Harness 插件。
特性
- 原生图片理解 —— 上传图片始终走 DSH 原生附件与模型链路;插件不再配置或调用独立视觉模型。
- 可复制的图片历史 —— 右侧面板在图片缩略图旁记录当前 DSH 模型的最终回答,支持展开历史和一键复制。
- 插件自有视频上传 —— 支持 MP4、M4V、MOV、AVI、MPG/MPEG、MKV 和 WebM;扩展名、文件签名与 FFprobe 结果必须一致。
- 视频场景解析 —— 统一转为 H.264/yuv420p MP4,通过 PySceneDetect 提取关键帧,再将有序、带时间戳的图片交给当前 DSH 视觉模型。
- 右侧面板 —— 在图片/视频视图间切换,直接播放标准化视频,并将选中视频写入会话草稿。
- 视频高级设置 —— 可在插件设置卡中调整上传大小、存储配额、时长、输出尺寸、FPS、CRF 和关键帧数量。
工作原理
图片 → DSH 原生附件 → 当前视觉模型 → 最终回答
→ /vision-bridge/recent → 面板缩略图 + 可复制描述
视频 → 容器校验 → H.264/yuv420p 标准化 → PySceneDetect
→ 带时间戳关键帧 → DSH 原生图片附件 → 当前模型回答
插件不会改写模型消息,也不会调用私有视觉接口。发送图片或询问视频前,请在 DSH 中选择支持图片输入的模型。
快速开始
视频功能需要宿主机预先安装 FFmpeg/FFprobe >= 6.1(同一主版本,含 libx264)和 PySceneDetect >= 0.7.1 < 0.8:
ffmpeg -version
ffprobe -version
python -m pip install 'scenedetect[opencv]>=0.7.1,<0.8'
scenedetect version
插件不会自动下载或执行安装脚本。缺少依赖时图片功能仍可用,设置页会列出视频依赖问题。
dsh plugin --profile web add dsh-visual-plugin # 或:github:jyh20030112/dsh-visual-plugin
若使用本地 DeepSeek Harness 源码开发,请改为链接本地插件目录:
cd /absolute/path/to/dsh-visual-plugin
npm run bootstrap
dsh plugin --profile web add link:/absolute/path/to/dsh-visual-plugin
bootstrap 会自动查找同级或祖先目录旁的 Harness 检出。其他布局请显式指定:
HARNESS=/absolute/path/to/deepseek-harness npm run bootstrap
重启 dsh web 后:
打开 设置 → 插件 → 插件配置,展开 视觉媒体 卡片。通过 侧边栏 开关控制右侧面板,并按需调整视频解析高级设置。
在 DSH 中选择支持图片输入的模型;插件不再提供单独的视觉模型配置。
发送图片。当前模型会原生回答,图片面板会记录缩略图和最终回答,方便复制。
点击输入框旁的 上传视频。处理完成后在右侧选择 视频 播放;点击 在会话中提问 只会写入草稿,确认后再发送。
视觉模型
图片与视频关键帧均由 DSH 当前选择的视觉模型理解。模型提供方、接口和凭据统一由 DSH 管理,插件不再重复配置。
卸载
dsh plugin --profile web remove dsh-visual-plugin
重启 dsh web。该命令会在 profile 内转发执行 pnpm remove,bundle 层列表会自动同步移除该插件。
项目结构
src/
index.ts 原生图片历史、video_describe 工具、设置与 HTTP 路由
config.ts 视频解析高级设置与运行时策略
video/ 上传、容器探测、转码、场景检测、关键帧与 HTTP Range 播放
client/ 图片/视频面板、上传控件、高级设置、文案与样式
cordis.patch.yml bundle 补丁层
构建
npm run bootstrap && npm run typecheck && npm run build # 需要本地 harness 检出
预构建 lib/ 已提交,使用者无需构建。
CI/CD
ci.yml 在每次 push/PR 校验产物与打包内容;release.yml(tag v*)校验版本、打包、创建 GitHub Release 并发布到 npm。
相关资源
- DeepSeek Harness —— 本插件所扩展的宿主框架。
- PySceneDetect —— 用于选择视频关键帧的场景检测工具。
- awesome-dsh-plugin —— 收录本插件的 DSH 插件精选列表。
友情链接
致谢
- HsiangNianian — 感谢开发过程中的帮助与建议。
- tingfeng347 — 感谢构建稳定性修复与本地 harness 开发环境的完善。
- dsh-auto-continue — 网络错误等异常导致请求被中断时自动发送「继续」恢复的 DSH 插件(错误分类、自适应退避、浏览器通知),很好用的搭配。
许可证
链接
同类插件
zhu1090093659/dsh-web-ui#packages/dsh-tool-describe-image★ 8121
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
liustack/modlens★ 4063
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
ysr666/dsh-vision-router★ 1125
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
Anionex/dsh-vision-toolkit★ 884
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
dickpy/dsh-imagegen★ 93
面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。
fandc520/dsh-comfyui★ 89
让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。