Awesome DeepSeek Harness Plugin

DeepSeek Harness(dsh)插件精选列表。

收录 110 个插件 · 什么是 DeepSeek Harness?↗

dsh-market —— 在 DeepSeek Harness 里直接逛并安装本列表全部插件
  1. liustack/modlens

    4076 86,589

    为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

    视觉与多模态
    安装 ▾
  2. 为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

    视觉与多模态
    安装 ▾
  3. 让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。

    视觉与多模态
    安装 ▾
  4. 面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。

    视觉与多模态
    安装 ▾
  5. 将图片交给所选的视觉模型处理(自动改写、显式工具或混合模式),使纯文本聊天模型也能处理包含图片的对话。

    视觉与多模态
    安装 ▾
  6. 增强 DSH 原生图片查看体验,支持指针中心缩放、拖动、画廊、下载、键盘操作和图片区域备注。

    视觉与多模态
    安装 ▾
  7. 让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。

    视觉与多模态
    安装 ▾
  8. 多引擎文生图(OpenAI Images 与智谱 CogView 预设):按会话配额、引擎故障切换、凭证安全配置,结果卡片支持重新生成。

    视觉与多模态
    安装 ▾
  9. 通过 inspect_image 工具将本地图片或 HTTP(S) 图片链接发送至配置的 OpenAI 兼容视觉端点,并将文字结果带回对话。

    视觉与多模态
    安装 ▾
  10. 本地 Windows 引擎(Windows.Media.Ocr)识别附加图片:只把识别出的文字发送给模型,图片字节不进入上下文;视觉直通可选开启。

    视觉与多模态
    安装 ▾
  11. 让纯文本模型也能处理聊天贴图,提供原生视觉体验,支持批量看图,走内置 OpenAI 兼容识图工具 analyze_image;具备视觉能力的模型不受影响。

    视觉与多模态
    安装 ▾
  12. 免费视觉插件:纯文本模型看图 / OCR / UI / 报错分析,优先免费模型(千问 Qwen3-VL-Flash、豆包、DeepSeek-OCR),设置界面可配置。

    视觉与多模态
    安装 ▾
  13. 本地 Tesseract 识别附加图片:只把识别出的文字发送给模型,图片字节不进入上下文;视觉直通可选开启。

    视觉与多模态
    安装 ▾
  14. DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经官方 deepseek-v4-flash-vision-exp 原生识图转译,再交给纯文本的 DeepSeek 作答(纯文本 V4-Pro 也能看图);支持任意 OpenAI 兼容 VLM 与本地 Ollama 作为备选。

    视觉与多模态
    安装 ▾
  15. 视觉语言网关:注册支持图片输入的 DeepSeek provider 路由,图片先由可配置 VL 模型(默认 Qwen-VL)描述成文字再发送。

    视觉与多模态
    安装 ▾
  16. 为纯文本 DSH 模型增加可配置识图能力:开启后图片消息先由任意 OpenAI 兼容视觉模型转写为文字描述,再交给主模型处理;设置页可配置 Base URL、Model ID 与密钥,并可选择密钥的鉴权方式(OpenAI / Anthropic / Gemini / Azure 风格请求头);未填写密钥时会在发起请求前明确提示。

    视觉与多模态
    安装 ▾
  17. 给纯文本模型的"读图"能力:图片降分辨率+降色深+结构/色彩指纹渲染成文本网格喂回对话,模型像多模态一样自主缩放、取样、OCR 读图;纯本地零外部模型依赖,附读图方法论 skill 与可选 PaddleOCR。

    视觉与多模态
    安装 ▾
  18. 为纯文本 DeepSeek 提供原生图片上传体验:在 Web GUI 粘贴/拖入图片即以缩略图附件进入会话,发送前由 host 用免费智谱 GLM-4V-Flash 视觉 API(glm-4v-flash 降级链)读取并替换为文字描述,DeepSeek 据此回答,原图保留在聊天历史中。

    视觉与多模态
    安装 ▾
  19. DSH 版 Codex Appshots:全局快捷键精准捕获当前工作窗口,零摩擦挂载至 Composer 作为上下文向 Agent 提问。

    视觉与多模态
    安装 ▾
  20. 给 DSH Desktop 用的窗口截图,支持 macOS 和 Windows:macOS 按两边 Command、Windows 按两边 Ctrl(或点输入框旁相机)捕获当前前台窗口并附加到会话,同时把 VoiceOver 风格的辅助功能树注入为隐藏上下文。

    视觉与多模态
    安装 ▾
  21. 把手机相机变成 dsh 会话的实时取景与拍照输入,经局域网或 USB 直连。

    视觉与多模态
    安装 ▾
  22. 纯文本路由的本地 OCR 兜底:会话模型明确声明不接受图片时,把附件的图片存入本地缓存并注入路径,模型调 ocr_image 用 PP-OCRv5 + ONNX Runtime 在纯 CPU 上离线识别,无需 API key,图片不出本机;模型能看图时静默。

    视觉与多模态
    安装 ▾
  23. 通过模式化提示分析对话图片(描述、UI、文档、定位、拓扑等),将含坐标原语(框、点、引用)的结构化证据以文本注入上下文,会话级缓存跨回放与压缩复用。

    视觉与多模态
    安装 ▾
  24. 纯文本 DeepSeek 的识图插件:默认走豆包 Web(零成本、免 API key,经 Windows CDP 桥接驱动已登录 Chrome),另有反重力额度(flash/pro)与 Gemini 降级通道;档位自动升级、视觉证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

    视觉与多模态
    安装 ▾
  25. DSH 轻量截图插件:轻——零依赖零二进制;摆——一键全屏、窗口排版、悬停吸附截取被遮挡窗口;自助——Agent 可自助截屏,传路径不传图,路径通用,接上 modlens(选装)一步读出结构化内容。

    视觉与多模态
    安装 ▾
  26. 把文本、识图和生图 API 组合成一个 Mix 模型并按对话内容自动路由:纯文本走聊天模型,用户图片和 Agent 截图走识图模型,后续可继续追问同一张图;还支持图片生成与编辑及会话级调用记录。

    视觉与多模态
    安装 ▾
  27. 在设置中配置多个生图供应商,对话通过 image_generate 调用当前选中的模型;图片保存到工作区 generate/image,并在对话中内联显示。

    视觉与多模态
    安装 ▾
  28. 让纯文本 DeepSeek 代理在同一会话内读图:委派给视觉子代理,发送时自动把图片转为文件路径。

    视觉与多模态
    安装 ▾
  29. 纯文本 DeepSeek 的识图工具包:模型可主动调用的 `vision` 工具、deepseek/opencode-go 包装适配器(v4 flash/pro)、反重力额度(默认,flash/pro)/ 任意 OpenAI 兼容 VLM / Gemini / 本地 Ollama 通道、证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

    视觉与多模态
    安装 ▾
  30. 在准入前把提示词里的图片换成视觉模型的文字分析,因此任何模型(包括纯文本模型)都能读图且会话不切换模型;另提供 describe_image 工具处理图片路径。

    视觉与多模态
    安装 ▾
  31. 为 DeepSeek Harness 接入 Labnana 图片生成:文生图 / 图生图 / 精准编辑,含积分预估、余额查询与网页设置界面。

    视觉与多模态
    安装 ▾
  32. 为 DSH 上的纯文本模型提供视觉插件:通过分层证据记忆与缓存,实现图片理解与生成的原生交互及 GUI 自动化。

    视觉与多模态
    安装 ▾
  33. 给纯文本模型的设计稿保真判定:`deepseek_vision` 工具从任意 OpenAI 兼容视觉路由借来一只眼,让模型判断实现与设计稿是否一致——并附上支撑该判定的基准(4 组夹具、23 处注入缺陷、逐格原始输出)与其依赖的提问纪律。

    视觉与多模态
    安装 ▾
  34. 本地生成图像/配音/音乐/音效并听写,同一性锁定:角色、动物、道具与配音角色定妆定声一次,之后每次调用复用同一份参考;退化产物(接近纯色的图、静音的音频)被拒绝而不是当成成功返回;生成的台词可以听写回文字,好让吞掉结尾的克隆暴露出来。空闲时引擎卸载显存,生图与听写也可改指向任意 OpenAI 形状的 API 而不用本地 Vulkan 后端。

    视觉与多模态
    安装 ▾
  35. 给在线模型装上本地双手:koboldcpp_run 与 koboldcpp_vision 工具把重复的文本与视觉(OCR、图像分析、对比)劳动交给本地 KoboldCpp(llama.cpp)服务器,并按需拉起与管理服务器生命周期。

    视觉与多模态
    安装 ▾
  36. 视觉模型路由:把附加图片经可配置模型(15+ OpenAI 兼容与 Anthropic 供应商)转译为文字,对话仍由 DeepSeek 作答。

    视觉与多模态
    安装 ▾
  37. 给 DeepSeek Harness 的纯文本模型补上免费识图:`vision` 工具直连智谱 GLM 视觉 API 描述/OCR 图片文件(glm-4v-flash 降级链),无需任何外部 CLI。

    视觉与多模态
    安装 ▾
  38. 注册 `deepseek-vision` 路由:Web GUI 直接粘贴图片,由免费智谱 GLM 视觉模型转译为文字后,再交给 DeepSeek 适配器作答。

    视觉与多模态
    安装 ▾
  39. DeepSeek Harness 视觉能力全家桶:vision_understand 工具(OpenAI 兼容视觉 API,默认免费智谱 GLM-4V-Flash)+ 粘贴/拖拽/按钮三入口识图。

    视觉与多模态
    安装 ▾
  40. 把重复的文本与视觉(OCR、图像分析、对比)劳动交给本地运行的 Unsloth Desktop(Unsloth Studio)服务器:unsloth_run 与 unsloth_vision 两个工具,纯 HTTP 客户端,不拉起也不持有任何进程。

    视觉与多模态
    安装 ▾
  41. 为纯文本 DeepSeek Harness 主模型搭视觉桥:自动从已配置模型中挑选多模态模型,通过 vision 工具把图片描述以纯文本返回。

    视觉与多模态
    安装 ▾
  42. 为任意 DSH 路由装上眼睛:Web 输入框贴图按意图自动聚焦分析,视觉子代理代读工作区图片,原图可随时物化编辑。

    视觉与多模态
    安装 ▾
  43. 将聊天图片交给固定的 OpenAI 兼容视觉模型,把事实性观察交给当前主模型,并在事件回放、上下文压缩和重启时复用会话内观察。

    视觉与多模态
    安装 ▾
  44. 图片转文字输入插件:粘贴/拖拽图片自动转为结构化文字描述发送,给纯文本 LLM 提供图片输入接管(OpenAI 兼容视觉 API)。

    视觉与多模态
    安装 ▾
  45. 在 DSH Web 聊天界面内联渲染粘贴/上传的图片,并让纯文本模型“看见”图片:visual_review 工具优先调用任意 OpenAI 兼容多模态 API,未配置时回退本机 Qwen3-VL。

    视觉与多模态
    安装 ▾
  46. 纯文本路由的透明图片护栏:贴图不再 400 卡死会话,附带 vision_analyze 工具(OCR/PDF/docx/pptx/视频)。

    视觉与多模态
    安装 ▾
  47. 面向纯文本 DeepSeek 的视觉 MCP + DSH 插件:analyze_image / analyze_clipboard / compare_images / vision_status 四个工具、可视化配置页、默认免费 GLM-4.6V-Flash、结果缓存与限流容错,Key 不入日志。

    视觉与多模态
    安装 ▾
  48. 纯文本模型双层识图:优先本地快速 OCR(RapidOCR,离线),不足时回落视觉模型(modlens)。

    视觉与多模态
    安装 ▾
  49. `describe_image` 视觉桥:经 opencode Zen API(凭据 `OPENCODE_GO_API_KEY`,免费线路优先、付费兜底)把图片发给 mimo-v2.5、返回文字描述给纯文本模型,原生格式直发,SVG/TIFF/HEIC 等格式经 ImageMagick 自动转码。

    视觉与多模态
    安装 ▾
  50. 一个截图工具,外加两个默认关闭的自动截图时机。需要模型支持图片输入。

    视觉与多模态
    安装 ▾
  51. DeepSeek 视觉桥接:注册原生 LLM provider,聊天内粘贴的图片自动由视觉模型(pi-ai/llama.cpp 上的 Qwen3-VL)转成文字描述后交给纯文本 DeepSeek 作答——图片准入、路由与会话压缩全部走 harness 原生机制,带 LRU 描述缓存与 503 重试。

    视觉与多模态
    安装 ▾
  52. 免费视觉识别插件:自适应切块长文档识别,支持历史收藏与 MD/Word/长图/Excel 导出。

    视觉与多模态
    安装 ▾
  53. 在 DSH 聊天窗口自动调用生图工具(API 渠道,或本机 CLI:已支持 mmx / codex / agy)并展示图片,也支持利用对应 CLI 识别图片。

    视觉与多模态
    安装 ▾
  54. 视觉桥:贴图先经 deepseek-v4-flash-vision-exp 转写为文字,再交给纯文本的 deepseek-v4-pro 回答,零第三方依赖。

    视觉与多模态
    安装 ▾
  55. 让 dsh 通过 grok2api 的 API 获得生成图片与视频能力。

    视觉与多模态
    安装 ▾
  56. 面向 DSH 的全模态工作站:analyze_image 走有序多卡片 VLM 故障转移链;六个视觉工具箱工具(局部放大、色调采样、像素比对、OCR、元素检测、内联展示)共用同一套图片来源解析;generate_image 支持 OpenAI/DashScope/ComfyUI 协议;多卡片异步 generate_video 配 /build-video-tool 构建器;speak/clone_voice 语音合成覆盖七家供应商;全部由一个自动保存的设置页驱动。

    视觉与多模态
    安装 ▾
  57. 纯文本 dsh 模型的识图插件:粘贴图片自动由你配置的多模态模型转成文字——透明孪生路由、模型可自主调用识图工具、无内置密钥与中转。

    视觉与多模态
    安装 ▾
  58. 发送前把请求中的历史图片裁剪至保留张数,并从上游 400 错误解析单次图片上限、按更少张数降级重试,保证含图会话不被图片数量限制打断。

    视觉与多模态
    安装 ▾
  59. macOS 场景感知探针:拉模型零轮询的 look 工具,读取最前非自身窗口(应用信息、AX 标题/选中文本、按需本地 OCR),支持召唤热键按下瞬间抓取快照注入对话。

    视觉与多模态
    安装 ▾
  60. describe_image 模型工具:让纯文本模型通过视觉语言模型获得图像理解能力。

    视觉与多模态
    安装 ▾
  61. 面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

    视觉与多模态
    安装 ▾
  62. 给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。

    视觉与多模态
    安装 ▾
  63. 给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。

    视觉与多模态
    安装 ▾
  64. 接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。

    视觉与多模态
    安装 ▾
  65. 一站式 AI 影视创作工作站,作为 DSH 全局浮层面板运行,不占用对话框:生图(文生图 / 图生图 / 多图合成,1K–4K、8 种宽高比)、生视频(文生视频 / 图生视频,4–12 秒、支持首帧控制)、短剧(导入 .txt/.md/.json 剧本自动拆解分镜,故事板预览与批量生成)与提示词专家工作区。零运行时依赖。

    视觉与多模态
    安装 ▾
  66. 外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。

    视觉与多模态
    安装 ▾
  67. 为 DeepSeek Harness 原生视觉模型 deepseek-v4-flash-vision-exp 提供高清识图:将图片准入上限提升至 32 MiB / 8192 px / 600 张,并新增 highres_read 工具,将大图切为整图与 800x800 分块后经宿主 read_image 注入模型。

    视觉与多模态
    安装 ▾
  68. 基于 MiniMax 的多模态插件:实时语音通话模式(流式对话、悬浮胶囊 UI)、语音模式与麦克风语音输入,并提供图像/视频/音乐/语音生成与视觉检查工具。

    视觉与多模态
    安装 ▾
  69. 让纯文本模型也能看图:消息中出现图片占位符时模型调用 vision_describe 工具,插件把本轮图片引用与提问一起转交给多模态视觉模型识别,主模型失败时自动用备用模型重试。配置在设置页完成并通过官方 settings API 持久化到 settings.yaml,热重载不丢。

    视觉与多模态
    安装 ▾
  70. 面向视觉模型的内容感知 PDF 读取插件:逐页分析图(矢量与栅格)、表格、公式风险与双栏排版,基于内容识别进行混合提取,图表/公式页渲染成高 DPI 区域裁切。提供低清预览以理解页面概况并支持指定选区获取高清渲染。功能包装为多个工具供Agent使用。

    视觉与多模态
    安装 ▾
  71. 将会话图片转交可配置视觉服务,并向符合条件的 DeepSeek Harness 模型路由返回纯文本分析。

    视觉与多模态
    安装 ▾
  72. 基于 macOS Vision Framework 的全本地识图插件:`ocr_image`(文字提取,表格结构+坐标)与 `view_image`(场景/人脸/二维码);web 输入框可直接粘贴多张图片,图片永不离开你的 Mac。

    视觉与多模态
    安装 ▾
  73. DeepSeek Harness 统一绘图路由器:自动识别任意 OpenAI 兼容接口的绘图模型,提供 draw_image 和 draw_list_sources 工具,支持商汤、阶跃、Agnes、千问、Flux、SD、Imagen 等。

    视觉与多模态
    安装 ▾
  74. 增强版视觉工具箱:14 个像素级视觉工具(看图问答/定位/检测/裁剪/像素比对/OCR/长截图OCR/矢量化/取色/抠图/截图/展示/落盘/网页截图),单一 OpenAI 兼容端点驱动,桥接标记极简、规则下沉系统提示,带内容安全识别与限流自动重试。

    视觉与多模态
    安装 ▾
  75. 让 AI 助手看见并操作真实安卓手机:phone_look(视觉+UI 树融合判读)、点击/滑动/输入、截图——经 adb,适用于任何 MCP 客户端。

    视觉与多模态
    安装 ▾
  76. GPT Image 2 `image_gen`:默认复用 Codex 订阅 OAuth,也可显式使用 API Key;显影卡片、最多 3 张 API 实时局部图、持久附件回放/灯箱/下载、纯文本模型输出和受限的凭据安全请求。

    视觉与多模态
    安装 ▾
  77. 在 DSH 网页中用 AI 操控鸿蒙手机:实时 H.264 投屏、触控与系统按键、hilog 日志,并让模型读屏、定位 UI 控件,再执行点击/长按/按键/输入。

    视觉与多模态
    安装 ▾
  78. 在纯文本 DeepSeek 线路上开放贴图准入,用视觉 sidecar 把附件转成文字,原生视觉模型不改写。

    视觉与多模态
    安装 ▾
  79. Agent 可调用的视觉工具:通过你配置的任意 OpenAI 兼容视觉端点描述本地图片,支持多模型交叉核对,不内置任何密钥。

    视觉与多模态
    安装 ▾
  80. 让任意 DSH 模型都能识图:提供 vision/OCR/定位/裁剪四件套工具,内置病理、细胞、解剖、临床与科研统计图等专业预设。

    视觉与多模态
    安装 ▾
  81. 视觉桥:纯文本 DeepSeek 也能收图(单独发、图文混发均可),快速小识图模型后台描述,对话框里图还在、模型只见文字;纯插件,卸载即复原。

    视觉与多模态
    安装 ▾
  82. 控制已登录的网页版 ChatGPT 生成图片并下载到本地。

    视觉与多模态
    安装 ▾
  83. 为纯文本 DeepSeek 路由提供视觉桥接:通过可配置的 OpenAI Responses、Chat Completions 或 Anthropic Messages 端点分析附件与本地图片,同时保持支持图片的路由走原生路径。

    视觉与多模态
    安装 ▾
  84. 结构化视觉证据(OCR/版面/语义)+ USB 摄像头拍摄工具,支持"拍-看-改"调试闭环;后端支持 Ollama、DeepSeek、小米。

    视觉与多模态
    安装 ▾
  85. DSH 双引擎截图:思灵桌面壳内,全局快捷键/托盘打开全屏框选浮层(多显示器、逐屏像素级抓帧),选区定格后工具条就地画红框,一次确认送进输入框;纯 DSH(浏览器)下由输入框相机按钮经 getDisplayMedia 捕获屏幕,复用同一套单阶段框选+标注遮罩。均走官方附件通道。

    视觉与多模态
    安装 ▾
  86. 极简的原生视觉能力增强,支持免费的智谱模型或本地千问视觉模型。

    视觉与多模态
    安装 ▾
  87. 输入框贴图自动识别:由 OpenAI 兼容视觉模型转成文字描述后,再交给纯文本 DeepSeek 模型处理。

    视觉与多模态
    安装 ▾
  88. 屏幕截图与外部视觉识别:take_screenshot、list_windows、analyze_image、view_image 四个工具,可配置 GPT 视觉通道(gpt-5.5 / gpt-5.6-sol / gpt-5.6-terra),API Key 经凭据服务存储,带设置卡片;view_image 在 Web 对话中显示截图,模型上下文只保留文字。

    视觉与多模态
    安装 ▾
  89. 复用 DeepSeek 网页端识图模式给纯文本模型补上看图能力:deepseek_vision 工具调用本地 deepseek-vision-cli 浏览器自动化(手动登录助手、自动开启深度思考、用后自动关窗),把图片描述以文字返回给模型。

    视觉与多模态
    安装 ▾
  90. 通感编码器(Synesthesia Encoder):调用视觉模型把图片翻译成紧凑的结构化空间文字(画布/元素/百分比坐标),让纯文本 LLM 获得像素级看图能力(`mm_vision` 工具)。

    视觉与多模态
    安装 ▾
  91. 本地优先的结构化视觉插件:图片交给本地 OpenAI 兼容 VLM,返回 JSON 证据(摘要、逐字 OCR、版面区域、实体/关系、配色、显式不确定项),带反幻觉回退与可选粘贴/上传桥;零云端成本,图片不出本机。

    视觉与多模态
    安装 ▾
  92. DeepSeek Harness 图像理解插件:8 种分析模式(描述、OCR、图表取数、UI 评审、目标检测、对比、代码生成、诊断),支持任意 OpenAI/Anthropic 兼容视觉 API,内置免费视觉模型与限流自动切换。

    视觉与多模态
    安装 ▾
  93. 纯文本模型的透明多模态路由:每一次模型调用里的每张图片先由你自己配置的多模态理解模型全量转述(逐字 OCR、数据、不确定区、防注入),vision_relook 定点复看,图片类报错自动转述重试。不内置端点、不借登录态。

    视觉与多模态
    安装 ▾
  94. 为纯文本 DeepSeek 模型提供按需视觉:上传图片后,模型通过 view_image 工具调用任意 OpenAI 兼容视觉端点(默认 Qwen/DashScope)。

    视觉与多模态
    安装 ▾
  95. 视觉增强的 DeepSeek 适配器:由视觉模型把图片描述成文字,纯文本 DeepSeek 模型再基于描述推理。

    视觉与多模态
    安装 ▾
  96. DSH 一体化视觉创作工具链:提示词反推与审计优化,多供应商生图,支持异步后台出图。

    视觉与多模态
    安装 ▾
  97. 面向模型的 image_describe(识图)工具(DashScope OpenAI 兼容接口,qwen3.7-flash)+ 粘贴桥:纯文本模型会话里粘贴的图片在发送时自动转为文件路径并在聊天记录中回显,不再触发图片准入拦截。自带 DASHSCOPE_API_KEY;端点/模型/预算可配置,重定向防护 HTTP 客户端,所有 Agent 预设均可用。

    视觉与多模态
    安装 ▾
  98. 纯文本 DeepSeek 的聊天识图插件:view_image 工具转发任意 OpenAI 兼容 VLM(本地 Ollama 或云端),对话框粘贴/拖拽的图片自动改写为 view_image 路径标记供模型查看。

    视觉与多模态
    安装 ▾
  99. 通过已配置的 DSH Provider 或 OpenAI 兼容端点提供图片输入与识别。

    视觉与多模态
    安装 ▾
  100. 面向模型的图像生成工具,提供可配置通道和标准化图像参数。

    视觉与多模态
    安装 ▾
  101. 为 DSH 纯文本模型补充视觉能力:识图技能(图片理解/OCR/文档解析,竞速池→自定义通道→本地)+ 幂等宿主补丁,让图片消息能送达模型侧。

    视觉与多模态
    安装 ▾
  102. macOS 与 Windows 上的 agent 截屏:一个工具截屏并把图片本身返回给模型,无需再调第二次。Windows 上整段连拍在同一个引擎进程内完成;macOS 上常驻助手把区域截图降到 13ms、变化检测降到 23ms。另有一个仅 macOS 的工具:报告屏幕录制授权状态,并直接打开用于修复的系统设置面板。

    视觉与多模态
    安装 ▾
  103. 苹果设备端 Vision 工具:本地 OCR(含中文)、图像分类、人脸检测、文档版面分析与综合描述,100% 离线、无需 API key,支持长截图切片。

    视觉与多模态
    安装 ▾
  104. DSH 的本地微信 OCR 工具:`wechat_ocr_recognize` 针对本地图片路径返回识别文本和引擎的结构化结果。

    视觉与多模态
    安装 ▾
  105. DSH 的本地 Windows 11 OneOCR 工具:`oneocr_recognize` 返回 OCR 文本,以及包含行/词多边形、置信度、旋转角度和手写体样式的结构化结果。

    视觉与多模态
    安装 ▾
  106. 按需自动把 DeepSeek 路由切到视觉模型:flash 主会话直接切(A),pro 保持深推理并交给视觉子代理读图(B),子代理恒切,含失败回退,无需手动切模型。

    视觉与多模态
    安装 ▾
  107. 一句话,让灵感从想法变成大片。在 DeepSeek Harness 中直接用自然语言调用可灵 AI,支持文生图、图生图、文生视频、图生视频、参考图创作、任务跟踪和结果预览。

    视觉与多模态
    安装 ▾
  108. 让纯文本模型也能看图:发图自动用视觉模型描述(默认提示词),描述不足时对话模型自动生成更具体的提示词重新解析;系统模型/自定义双模式 + GUI 可视化配置、Key 脱敏安全、针对 DSH 0.1.0-rc.6 的宿主小补丁(见仓库 README)。

    视觉与多模态
    安装 ▾
  109. 为纯文本模型装上本地眼睛:eyes_render 在 Web 界面画布上绘制文字/图形/Mermaid,eyes_paste 接收用户粘贴的图片,eyes_ocr 用 Windows 自带 OCR 离线读文字,eyes_analyze 把像素解析成结构化数据,全程无需视觉模型。

    视觉与多模态
    安装 ▾
  110. 让纯文本模型拥有视觉:describe_image 工具调用 dsh 模型列表中的视觉模型描述图片,走 harness 自身的 LLM 运行时。

    视觉与多模态
    安装 ▾
没有匹配的插件。

安装

# npm 包(预构建)
dsh plugin --profile web add <npm-package>

# GitHub 源码(首次需按提示配置 allowBuilds 构建授权后重试)
dsh plugin --profile web add github:owner/repo

装任何插件都等于在你的机器上跑第三方代码,权限和你本人一样大——能读你的文件、用你的凭据、访问网络,工具审批管不到它。GitHub 来源的插件还会在安装时执行构建脚本——pnpm 默认拦截,所以安装可能停在 ERR_PNPM_GIT_DEP_PREPARE_NOT_ALLOWED 或 ERR_PNPM_IGNORED_BUILDS;dsh 会打印出需要添加的确切键名,把它加进该 profile 的 pnpm-workspace.yaml 的 allowBuilds 下,重跑一次即可装上。放行构建本身就是一次信任判断:请只安装可信来源,并尽量锁定 commit(github:owner/repo#sha)。

收录你的插件

给 awesome-dsh-plugin 提一个 PR:在 data/plugins/ 下新增一个 YAML 文件就是完整投稿,README 与本站会自动重新生成。也请为你的仓库打上 dsh-plugin topic。