给 DeepSeek Harness 的纯文本模型补上免费识图:`vision` 工具直连智谱 GLM 视觉 API 描述/OCR 图片文件(glm-4v-flash 降级链),无需任何外部 CLI。
安装
# npm 包(预构建)
dsh plugin --profile web add dsh-vision-free-eyes
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:314857493/dsh-vision#path:/packages/vision-tool
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
给 DeepSeek Harness(DSH)的纯文本模型补上免费「眼睛」:一个分析已知本地图片路径的
vision(image, question) 工具,
直连智谱 GLM 免费视觉 API(glm-4v-flash → glm-4.6v-flash → glm-4.1v-thinking-flash 自动降级链),
不依赖任何额外安装的 CLI。完整说明见仓库根目录的
README。
安装(发布后)
dsh plugin --profile web add dsh-vision-free-eyes
或在 profile 的 cordis.patch.yml 中追加:
- insert:
- id: dsh-vision-free-eyes
name: dsh-vision-free-eyes
前提
- DSH
0.1.0-rc.8、0.1.1-rc.1或0.1.1-rc.2。 - 必须:智谱 GLM 免费 key,环境变量
GLM_API_KEY或ZHIPU_API_KEY(open.bigmodel.cn 注册即得,格式id.secret;Windows 也可setx,插件自动读注册表)。 - 出站 HTTPS 到
open.bigmodel.cn。
插件通过 DSH 注入的 tools 服务注册标准 ToolDefinition,不安装或直接导入
@deepseek-ai/dsh-tools 等官方运行时包。
权限与证据边界
- 只读取调用者明确给出的一个绝对图片路径,并只向固定的智谱 HTTPS 端点发送图片字节。
- 只读取 GLM 环境变量;Windows 环境变量缺失时使用固定参数执行系统自带的只读
reg query, 不使用 shell 字符串,也不记录或持久化 Key。 - 无 npm 运行依赖和安装期生命周期脚本;只新增
dsh-vision-free-eyesEntry ID,不写 DSH Profile 或替换官方组件。完整边界见 SECURITY.md。 - 已验证三个声明版本的一次性 Web Profile 安装、配置合成、冷启动和卸载;rollback、真实用户 Profile、带真实 GLM Key 的端到端结果、Windows 运行和独立安全审计仍未验证。下一验收门槛是 推送固定 Commit 后取得公开 CI 运行记录;这些低层证据不会被表述成真实 Profile 或安全审计通过。
使用
告诉模型单个图片文件的已知绝对路径即可,例如:"看一下 D:\xxx\screenshot.png"。默认 image 模式使用
完整 GLM 视觉语言模型理解图片并回答 question;只有用户明确要求逐字提取时才用 mode="ocr"。
no_cache=true 可跳过进程内结果缓存。
工具会在联网前强制检查绝对路径、单文件类型和图片文件魔数;目录、相对路径以及非 png/jpeg/webp/gif/bmp 内容会直接拒绝。模型不应在调用前用 shell 预检路径;目录错误是停止条件, 即使目录里似乎只有一张图片也不会自行遍历,不会把普通本地文件伪装成图片上传。 图片理解会保持用户问题的范围和详细程度,只陈述能够确认的可见事实,并区分总数、当前项与 额外/折叠项等计数语义;简要概述不会逐项转写正文,界面分析也会区分地址栏、搜索框等区域。 单一事实问题只返回所问事实和必要限定,不主动附加未经询问的元素位置或上下文。
该工具不会自动解析 GUI 粘贴/上传附件,也不应遍历 DSH 附件目录猜测图片路径。GUI 贴图请使用 「… + 自动识图」路由;路由已经提供图片描述时,模型应直接使用描述,不要再次调用本工具。 输出为图片内容的纯文字描述,不附加内部耗时标记。
配置
| config | 默认 | 说明 |
|---|---|---|
apiKeyEnv |
GLM_API_KEY / ZHIPU_API_KEY |
GLM key 的环境变量名(可传数组) |
no_cache |
false |
跳过进程内结果缓存,强制重新请求 |
限制
- 单图 ≤ 15MB;支持 png/jpg/jpeg/webp/gif/bmp。
- 不支持 PDF(
doc模式已移除);图片字节会上传到智谱服务器。
链接
同类插件
liustack/modlens★ 4096
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
ysr666/dsh-vision-router★ 1129
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
Anionex/dsh-vision-toolkit★ 887
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
dickpy/dsh-imagegen★ 98
面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。
fandc520/dsh-comfyui★ 90
让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。
sunxin-ai/dsh-design-qa★ 44
给纯文本模型的设计稿保真判定:`deepseek_vision` 工具从任意 OpenAI 兼容视觉路由借来一只眼,让模型判断实现与设计稿是否一致——并附上支撑该判定的基准(4 组夹具、23 处注入缺陷、逐格原始输出)与其依赖的提问纪律。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。