为 DSH 上的纯文本模型提供视觉插件:通过分层证据记忆与缓存,实现图片理解与生成的原生交互及 GUI 自动化。
安装
# npm 包(预构建)
dsh plugin --profile web add dsh-mindseye
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:kanchengw/dsh-mindseye
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README

面向 DeepSeek Harness 的意图驱动视觉、生图和可视浏览器自动化插件。
MindsEye 是 DeepSeek Harness 的插件,为纯文本模型提供图片理解、图片生成和可选的浏览器自动化能力,同时保留 DSH 会话作为主要用户交互界面。
核心能力
图片理解
- 保留 DSH 原生图片附件,不要求用户手动选择本地文件。
- 图片轮自动挂载视觉工具;纯文本轮只保留一个激活入口,需要看图时再挂载。
mindseye_read_image支持通用视觉问答,以及 OCR、布局、图表、颜色和像素差异等专项任务。mindseye_ground返回目标在原图中的像素边界框,可用于点击、裁剪等后续操作。- 支持单图和多图读取,并返回图片、证据、答案和调用元数据等结构化结果。
图片生成与编辑
mindseye_generate_image将用户的生图要求发送到已配置的生图路由。mindseye_edit_image将 DSH 图片附件和编辑要求发送到已配置的图像编辑路由。- 生成图片以 DSH 原生附件形式返回,并直接显示在会话中。
- 生图不会自动保存到项目,也不会自动执行回验。
浏览器自动化
启用 gui.enabled 后,MindsEye 会打开独立的可见 Chrome 或 Edge 浏览器会话。GUI 工具支持打开页面、截图、等待、点击、输入、按键、滚动和关闭会话。
遇到验证码、登录或权限确认时,任务会暂停在 DSH 原生提问卡片上。用户可以:
- 接管可见浏览器并完成操作;
- 如果验证可能已经完成,跳过第一页交接问题;
- 放弃当前任务。
用户选择继续后,MindsEye 会重新检查页面状态,确认恢复后再把控制权交还给模型。浏览器使用独立会话,不接管用户已有的 Chrome 或 Edge profile。每次浏览器动作后都必须重新截图,避免继续使用已经失效的元素引用或坐标。
工具
| 工具 | 用途 |
|---|---|
mindseye_plan |
提取当前用户要求,并准备后续工具使用的意图上下文。 |
mindseye_read_image |
回答一张或多张图片的问题,并提取专项视觉证据。 |
mindseye_ground |
定位目标并返回像素边界框。 |
mindseye_generate_image |
根据用户要求生成图片。 |
mindseye_edit_image |
编辑用户提供的图片附件。 |
mindseye_vision_activate |
在纯文本轮挂载视觉工具。 |
mindseye_gui_open / snapshot / wait |
打开浏览器会话并观察当前页面。 |
mindseye_gui_click / type / keypress / scroll |
执行带页面状态校验的浏览器动作。 |
mindseye_gui_close |
关闭当前浏览器会话。 |
记忆工具是可选的,提供显式的 DSH 操作,用于存储、读取、搜索和比较图片相关记录。
配置
可以通过 DSH 设置卡或插件配置管理 MindsEye。
vision.routes:分别配置understand、extract和locate路由。vision.fallbacks:视觉调用的备用路由。image.generate:有序的图片生成路由。image.edit:有序的图片编辑路由。gui.enabled:启用可见浏览器工具,默认关闭。gui.browser:auto、chrome或edge。gui.restrictHosts:设为true时启用主机白名单。gui.allowedHosts:启用白名单后允许访问的主机。gui.maxSteps与gui.timeoutMs:单次浏览器运行的步数和超时限制。
视觉路由支持 OpenAI-compatible Chat Completions 或 Responses API。图片路由支持 JSON 和 multipart 请求体,可以独立配置不同的图片服务商。
数据与安全
- 支持图片的模型继续接收 DSH 原生图片块;纯文本降级路径只使用当前粘贴操作创建的隔离临时文件。
- 只有 MindsEye 工具实际调用视觉服务商时,图片字节和问题内容才会发送给对应服务商。
- 凭据来自 DSH Credentials、环境变量或插件设置,并只发送给匹配的服务商。
- 只有明确启用浏览器自动化时,插件才会启动本地 Chrome 或 Edge 子进程;它不使用用户现有浏览器 profile,也不执行下载后的代码。
- 浏览器访问可以限制为明确配置的主机白名单。
安装
npm install dsh-mindseye
npx @deepseek-ai/dsh plugin --profile web add dsh-mindseye
安装后重启 DSH Web,然后在 MindsEye 设置卡中至少配置一条视觉路由。未配置的专项视觉路由在有可用通用理解路由时会自动回退。
开发
pnpm install
pnpm test
pnpm typecheck
pnpm build
链接
同类插件
liustack/modlens★ 4100
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
ysr666/dsh-vision-router★ 1128
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
Anionex/dsh-vision-toolkit★ 887
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
dickpy/dsh-imagegen★ 99
面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。
fandc520/dsh-comfyui★ 94
让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。
sunxin-ai/dsh-design-qa★ 44
给纯文本模型的设计稿保真判定:`deepseek_vision` 工具从任意 OpenAI 兼容视觉路由借来一只眼,让模型判断实现与设计稿是否一致——并附上支撑该判定的基准(4 组夹具、23 处注入缺陷、逐格原始输出)与其依赖的提问纪律。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。