dsh-vision
文件与数据 活跃维护

dsh-vision

kaaaaahn/dsh-vision

依托macOS Vision框架实现本地OCR识别,搭配ollama qwen3-vl模型完成图像语义描述,同时提供图片上传桥接能力,全本地运行无需上传数据,调用简单高效

1
Stars 标星
0
Forks 分支
1
Watchers 关注
0
Open Issues
JavaScript
主要语言
MIT
开源协议
40 KB
仓库大小
1 个月前
最后推送
一键安装扩展 / 插件指令
dsh plugin --profile web add github:kaaaaahn/dsh-vision
git clone https://github.com/kaaaaahn/dsh-vision.git
git clone git@github.com:kaaaaahn/dsh-vision.git
README.md main

@zenk/vision

DSH 本地视觉插件:对话框里直接粘贴截图,AI 就能看到并分析,图片不出本机。

特性

  • OCR 带像素坐标(macOS Vision):识别文字并给出位置,UI 定位直接按坐标说
  • 语义理解(ollama + qwen3-vl):看懂画面布局、元素与异常区域
  • 零配置:自动检测环境、按内存选模型(8G→2b / 16~32G→4b / 32G+→8b)、缺 ollama 自动安装
  • 渐进可用:模型后台下载(1.8~5.7GB)期间 OCR 已可用
  • 全本地:免费、离线、图片不出 Mac

安装

dsh plugin --profile web add "github:kaaaaahn/dsh-vision#v0.3.1"

重启 DSH 生效。桌面端把 --profile web 换成 --profile desktop

插件市场条目(添加来源 https://kaaaaahn.github.io/dsh-vision/catalog/source.json)依赖 npm 发布,目前暂未上线,请使用上方 GitHub 命令安装。

首次使用会自动下载模型(后台进行),期间 OCR 已可用;环境细节见 docs/ollama-setup.md

使用

  • 直接粘贴图片发送,AI 自动分析并回复
  • 或让 AI 调用 vision_analyze(file_path=..., describe=true) 分析本地文件(describe 开启语义描述)

文档

仓库结构

├── lib/
│   ├── index.js              # 插件入口:vision_analyze + vision_setup + 图片桥接 + guard
│   └── vision_analyze.swift  # OCR + ollama 语义描述脚本(随包分发)
├── catalog/                  # DSH Community Market 目录源
├── docs/
│   ├── ollama-setup.md       # 环境准备参考
│   ├── troubleshooting.md    # 常见问题 FAQ
│   └── PUBLISHING.md         # 维护者内部文档(发布流程)
└── package.json

License

MIT