免费视觉识别插件:自适应切块长文档识别,支持历史收藏与 MD/Word/长图/Excel 导出。
安装
# npm 包(预构建)
dsh plugin --profile web add aura-vision
# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:Ck-epsilon/aura-vision
装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。
README
免费视觉识别插件(DeepSeek Harness web profile 永久插件)。设计语言 Aura:宛如天生如此,若有似无。
特性
- 免费通道:智谱 GLM-4V-Flash(免费档)优先;可配置任意 OpenAI 兼容多模态接口;Pollinations 匿名兜底。
- 长文档识别:glm-4v-flash 输出上限 1024 tokens(API 实测)——自适应网格切块(单块目标 1100px、最多 3×3、8% 重叠)逐块识别突破上限,切块模式用逐块纯转录提示词;>3200px 温和归一。
- Aura UI:高透毛玻璃(55% 底色 + 28px 模糊)、三星机身式小圆角、深浅主题自洽配对(CSS
light-dark())、若有似无的次级信息。 - 历史:缩略图 + 原图分离存储;收藏、过滤、删除、清空;导出 Markdown(原图内嵌 base64,单文件自包含)。
- 结果导出:MD / Word(.doc) / PNG 长图 / Excel(含表格时);双击预览图与详情图全屏放大;清除图片联动清除结果。
安装(永久)
# 推荐:npm 安装
dsh plugin --profile web add aura-vision
# 或从 GitHub:
dsh plugin --profile web add "github:Ck-epsilon/aura-vision"
# 或本地路径:
dsh plugin --profile web add "file:<绝对路径>"
其他机器使用前提:本机已 npm login(仅发布者需要);使用者只需装好 dsh 并执行第一条命令。重启 dsh 后生效:任意会话输入框右侧出现「识图」按钮。数据存 <workspaceRoot>/.aura-vision/(随工作区可迁移),key 存本机凭证库。
开发经验
完整开发经验教训见配套文档 LESSONS.md(运行时契约、深浅主题、模型实证法、大图策略、迭代纪律、陷阱速查表)。
兼容性
已在 DeepSeek Harness 0.1.0-rc.7 与 0.1.0-rc.8(web profile)验证。
常见问题
- 安装/升级后按钮没反应、key 保存不上? dsh 在启动时装载插件,安装或升级后需重启 dsh 一次(1.0.0 的 RPC 端点发现 bug 已在 1.0.1/1.0.2 修复)。重启后输入框右侧出现「识图」按钮即为生效。
- 识别长文档很慢? 大图会切块逐块顺序调用(免费档防限流),块数越多耗时越长,属预期。
- 结果被截断? glm-4v-flash 输出上限 1024 tokens(免费模型硬限制);插件已用自适应切块 + 转录优先提示词缓解,更完整结果请配置更长输出的模型并设为当前。
- 换机器后历史还在吗? 历史随工作区
<workspaceRoot>/.aura-vision/迁移;key 存各机凭证库,需在新机器重新填写一次。 - 图片会发给谁? 仅发给当前所选后端(智谱或你配置的接口),本机不向任何第三方上传。
- 如何卸载?
dsh plugin --profile web remove aura-vision。
架构
lib/host.js:宿主半边——AuraVisionService extends TypertRemoteService(命名空间aura-vision),方法经@Remote标记由网关 SRC 模式直连(无需构建期描述符)。lib/client.bundle.js:浏览器半边——window.__ModuleLoader__.load工厂产物,ctx.connection.rpc.call('/api', 'aura-vision/<method>', { args })调用宿主。cordis.patch.yml:bundle 补丁层,一行注册双半边。
License
MIT
链接
同类插件
liustack/modlens★ 4172
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
ysr666/dsh-vision-router★ 1137
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
Anionex/dsh-vision-toolkit★ 888
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
fandc520/dsh-comfyui★ 102
让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。
dickpy/dsh-imagegen★ 100
面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。
sunxin-ai/dsh-design-qa★ 44
给纯文本模型的设计稿保真判定:`deepseek_vision` 工具从任意 OpenAI 兼容视觉路由借来一只眼,让模型判断实现与设计稿是否一致——并附上支撑该判定的基准(4 组夹具、23 处注入缺陷、逐格原始输出)与其依赖的提问纪律。
社区评论
评论公开保存在 GitHub Discussions。加载评论会连接 GitHub 和 Giscus;发表内容需要 GitHub 账号。