输入框贴图自动识别:由 OpenAI 兼容视觉模型转成文字描述后,再交给纯文本 DeepSeek 模型处理。
安装
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:ximengxiaolan/dsh-vision-bridge
GitHub 来源的插件在安装时会在你的机器上执行构建脚本。请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
让纯文本模型(DeepSeek V4 / V4-Flash)在对话里"看见"图片:在输入框直接粘贴图片并发送,插件自动调用一个 OpenAI 兼容的视觉模型(VLM)把图片识别成文字描述,再把描述喂给 DeepSeek 继续处理。
会话中图片照常显示;只有发给模型的内容变成文字。
原理
DSH 对纯文本模型会在提交时拒绝图片(MODEL_DOES_NOT_SUPPORT_IMAGES)。本插件打通两个官方扩展点:
- 准入放行:给
ctx.llm.resolveModelInfo打补丁,声明当前模型支持image输入,让图片附件能进入会话。 - 发模型前转换:包装
llm.streamWithRegistration,每次请求发往模型前扫描所有消息中的图片块,调用配置的 VLM 生成文字描述,替换成:
[用户附上的图片已由视觉模型自动识别(qwen-vl-max)]
<描述内容>
如果路由到的模型原生支持图片,则放行原图、不做转换。
安装
# 前置:dsh CLI 与 pnpm
dsh plugin --profile web add dsh-vision-bridge
# 或从 git 安装:
dsh plugin --profile web add https://github.com/<your-name>/dsh-vision-bridge
安装后重启 profile(dsh web)。
配置
唯一需要的是一个 OpenAI 兼容多模态模型(/chat/completions + image_url),例如阿里云百炼 qwen-vl-max、智谱 GLM-4V 等。
环境变量:
$env:VISION_API_KEY = "sk-..."
$env:VISION_BASE_URL = "https://dashscope.aliyuncs.com/compatible-mode/v1"
$env:VISION_MODEL = "qwen-vl-max"
$env:VISION_LANG = "zh" # zh | en
或在 profile 的 cordis.patch.yml 中配置(优先于环境变量):
- id: dsh-vision-bridge
config:
apiKey: 'sk-...'
baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1'
model: 'qwen-vl-max'
lang: zh
timeoutMs: 180000
enabled: true
使用
重启后直接在输入框粘贴图片并发送即可。DeepSeek 会基于视觉模型的描述继续处理。
说明
- 同一张图片(按 attachmentId)在同一进程内缓存描述,重复发送不重复计费。
- VLM 调用失败时降级为
[图片识别失败: 原因],对话不会中断。 - 子智能体会话(subagent)仍受 DSH 内核限制,不支持贴图。
License
MIT
链接
同类插件
liustack/modlens★ 1199
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
Anionex/dsh-vision-toolkit★ 308
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。
zhaoolee/notes★ 138
将 DSH 对话导出为锤子便签风格 PNG,或在配置的账号工作区中新建和更新 Markdown 便签。
liustack/modsearch★ 85
纯文本 agent 的联网搜索桥:搜索网页与 X,返回结构化 JSON 证据(search/fetch/引用)。
Lum1104/dsh-browser★ 80
Chrome 侧边栏扩展,让 DSH 直接操控你的浏览器,无需视觉能力。
taxueseek/argo★ 69
专为 agent 打造的搜索工具:多语言,覆盖中文/英文/学术/代码/购物/金融/新闻/百科。