视觉桥:纯文本 DeepSeek 也能收图(单独发、图文混发均可),快速小识图模型后台描述,对话框里图还在、模型只见文字;纯插件,卸载即复原。
安装
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:balue8246-maker/dseyesopen
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
无感、自动、快速、真插件——仿佛 DeepSeek 真能看图了。
- 挂 DeepSeek(无识图能力)照样发图:单独发、图文混发都行
- 图片自动交给快速小识图模型(
glm-4.6v-flashx,识一张约 0.001 元)后台描述 - 描述不进对话框:对话框里你发的图原样还在,后台 DeepSeek 处理的是转成的文字描述
- 真插件:拔掉即恢复原样,不留痕迹
安装
dsh plugin --profile web add file:/path/to/dseyesopen
重启 dsh web。
配置 API Key(3 步,2 分钟)
- 打开 open.bigmodel.cn,手机号/微信注册
- 控制台 → API 密钥 → 创建新密钥 → 复制
- dsh → 模型设置页 →
Zhipu GLM Vision→ 粘贴密钥
glm-4.6v-flashx 是极低价付费档,账号里充几块钱就够用很久(如遇高峰限流,免费档 glm-4.6v-flash 可作备选)。密钥也可以放进环境变量 ZHIPU_API_KEY。
粘贴截图:Cmd+V 直接成图
dsh 原生 composer 本身支持图片粘贴成真附件(无需 modlens / 无需 patch 配置)。 与 dsDragPasteALL 同时安装时,需使用其 1.0.1+ 版本: 1.0.0 会在 document 捕获阶段劫持所有"带文件"的粘贴(包括截图), 导致 Cmd+V 只插入路径文本、不再成为图片附件。 1.0.1 起纯图片粘贴(截图/复制的图片)一律放行给 dsh 原生流程成图, 本插件据此自动识别;只有非图片文件粘贴才走 dragpasteall 路径反查。
工作原理
用户发图(单独/混发)
→ 服务端图片预检:dseyesopen 运行时包装 deepseek adapter 的 resolveModel,
声明 image 输入模态 → 放行(纯内存包装,不写任何 dsh 文件)
→ llm/stream 瀑布:拦下发往 deepseek-official 且含图片的调用
→ image 块交给 glm-4.6v-flash 识别 → 原地替换为文字描述
→ DeepSeek 收到纯文字,会话历史与 UI 保持"用户发了图片"原样
识别结果按 attachmentId+上下文缓存;识别失败注入降级文字,回合不崩溃。
卸载
dsh plugin --profile web remove dseyesopen
拔掉即恢复原样:
- adapter 包装随插件 fiber 消失(内存态,无文件残留)
- 自动写入的
zhipu-visionsettings 条目由 disposer 清理
诊断
对话中可调用工具:
dseyesopen_status— 查看凭证配置、路由、输入模态、缓存状态dseyesopen_selfcheck— 端到端自检:给一个本地图片路径,真实跑一次识别
注意
- 识图模型默认
zhipu-vision / glm-4.6v-flashx(极低价付费档,OCR/截图/图表强;免费档 glm-4.6v-flash 作备选) - 付费档稳定性好;若临时换回免费档,高峰时段偶有 429 限流,失败会降级为文字提示,不影响对话
- dsh 升级后图片预检包装会自动重建(监听 adapter 更新事件),无需手动维护
链接
同类插件
zhu1090093659/dsh-web-ui#packages/dsh-tool-describe-image★ 6885
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
liustack/modlens★ 3868
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
ysr666/dsh-vision-router★ 1070
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
Anionex/dsh-vision-toolkit★ 853
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
fandc520/dsh-comfyui★ 51
让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。
dickpy/dsh-imagegen★ 50
面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。