标签主题词 (Topic)

# image-understanding

探索包含 image-understanding 主题特性的所有开源仓库、扩展插件与智能体组件。

dsh-visionary
zhuiyueya

作为大模型工具链轻量插件,可自动将对话中的上传图片转为OCR识别文本与视觉模型生成的内容描述,再输入纯文本大模型,无需改动模型本身即可让其具备图片理解能力。

dsh-vision-link
sprainJinyu

可在对应推理框架中为纯文本模型补充图像理解能力,完整保留原有路由配置规则,无需改动模型调用链路即可实现图文混合场景的内容解析,降低多模态接入门槛。

dsh-llm-vision
1710782766

给纯文本大模型补全视觉识别与文字提取能力,内置普通/关键两种模式的图像描述、OCR文字提取工具,支持输入自动预处理、请求失败自动重试,且本地持久化缓存结果减少重复请求。

支持纯文本会话按需启用视觉识别能力,图片自动转为标识标记,调用vision_describe工具即可将图片与对应问题发送至兼容OpenAI的视觉模型,无需改造原有会话流程,轻量易集成。

提供图像理解与OCR能力,将截图、文档等视觉信息转为结构化文本,同时持久化保存视觉证据,让纯文本模型在后续对话中可随时回溯图像内容,轻量集成即可获得多模态扩展。

dsh-free-vision
FuzzySoul

为DSH(DeepSeek Harness)量身打造的视觉插件,现已支持agent调用图片显示/Vision plugin for DSH(DeepSeek Harness),support Proactive Image Display.

轻量级插件,借助兼容OpenAI的视觉语言模型端点,自动把图片转成文字描述,让纯文本模型获得看图能力。无需训练,配置好端点即可直接调用。

dsh-vision-proxy
Flyvhidbwo

DeepSeek Harness 插件:DeepSeek 大脑 + 自动识图。GUI 附加图片自动经 OpenAI 兼容 VLM 转译成文字后交给 DeepSeek 作答;支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容端点...

glm4v-vision-mcp
ethanweave

视觉理解MCP基于GLM-4.6V模型,支持图像识别、OCR文字提取与图表数据解析,通过标准MCP协议桥接主流AI客户端,开箱即用并输出结构化结果。

dsh-eye-vision
AlloyPlane

OpenAI兼容多模态接口,为纯文本模型扩展图像理解、OCR与UI分析能力,自动识别图片中的文字与界面元素,输出结构化结果,无需更换模型即可处理图片输入,集成现有工作流。

dsh-vision
oil-oil

轻量级图像理解模块,以低开销实现接近原生的识别精度与延迟,支持多种图像输入格式,接口设计直观,数行代码即可接入现有系统。

dsh-AuthInOne
Stormycry-cryp

支持服务商认证与登录、模型切换、图片回退,统计令牌与成本消耗,并支持同端口热重启网络服务。插件自包含,无需繁琐配置。