Agent 可调用的视觉工具:通过你配置的任意 OpenAI 兼容视觉端点描述本地图片,支持多模型交叉核对,不内置任何密钥。
安装
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:TZHR-invest/dsh-plugins#path:/packages/dsh-vision
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
给 dsh agent 注册 vision 工具:把本地图片发送到你配置的 OpenAI 兼容视觉模型端点返回文字描述——用于当前会话模型不支持图像输入的场景。
插件没有任何内置默认值:provider、凭据、模型全部在安装时由你配置。未配置完整时插件正常加载但不会注册 vision 工具(日志提示缺项),不会影响宿主。
安装(配置在安装时完成)
cd dsh-vision-install
# 方式 A:交互式——直接运行,按提示逐项输入 baseURL / 模型 / 凭据
bash install.sh --restart
# 方式 B:参数式——一键传参(适合脚本化/重复部署)
bash install.sh --restart \
--vision-base-url https://opencode.ai/zen/go/v1 \
--vision-api-key-env OPENCODE_GO_API_KEY \
--vision-model mimo-v2.5 \
--vision-models mimo-v2.5,qwen3.8-max,kimi-k3 \
--vision-max-tokens 2000
安装参数(--vision-*)
| 参数 | 必填 | 说明 |
|---|---|---|
--vision-base-url |
✅ | OpenAI 兼容 chat/completions 端点(任何厂商) |
--vision-model |
✅ | 默认视觉模型 |
--vision-api-key |
二选一 | 直接填 API key |
--vision-api-key-env |
二选一 | 环境变量名(也尝试 ~/.dsh/.credentials.yaml 同名键) |
--vision-models |
可选 | cross_check=true 时的核对模型列表(逗号分隔) |
--vision-max-tokens |
可选 | 不配则请求不带 max_tokens |
未提供参数且是交互终端 → 引导式逐项询问; 未提供参数且非交互 → 写入空配置(工具不注册),可重跑传参,或编辑
~/.dsh/profiles/web/cordis.patch.yml的 dsh-vision config 段。
使用(agent 内)
vision image_path=/tmp/shot.png
vision image_path=/tmp/shot.png question="图里有什么文字?"
vision image_path=/tmp/shot.png model=gpt-4o
vision image_path=/tmp/shot.png cross_check=true # 需安装时配置了 --vision-models
安全说明
- 插件不含任何内置密钥;密钥只来自你的安装参数/环境/凭据文件
- 凭据文件
~/.dsh/.credentials.yaml权限建议chmod 600
常见问题
- 工具不出现:日志有
[dsh-vision] 未配置 ...——重跑 install.sh 传--vision-*参数后重启 - 凭据解析失败:
apiKey或apiKeyEnv(含凭据文件同名键)至少其一 - 端点不兼容:确认 baseURL 是 OpenAI 兼容的
/chat/completions,鉴权Authorization: Bearer - reasoning 模型输出为空:配置
--vision-max-tokens 2000以上
链接
同类插件
liustack/modlens★ 4063
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
ysr666/dsh-vision-router★ 1125
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
Anionex/dsh-vision-toolkit★ 884
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
dickpy/dsh-imagegen★ 93
面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。
fandc520/dsh-comfyui★ 89
让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。
sunxin-ai/dsh-design-qa★ 44
给纯文本模型的设计稿保真判定:`deepseek_vision` 工具从任意 OpenAI 兼容视觉路由借来一只眼,让模型判断实现与设计稿是否一致——并附上支撑该判定的基准(4 组夹具、23 处注入缺陷、逐格原始输出)与其依赖的提问纪律。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。