标签主题词 (Topic)

# vlm

探索包含 vlm 主题特性的所有开源仓库、扩展插件与智能体组件。

dsh-vision-bridge
shenhuanageshei

会话截图路由插件,支持视觉模型直接内联处理截图内容,文本模型自动调用VLM-read读取会话画面,适配tool、auto两种运行模式,无需手动配置路由逻辑。

dsh-omni-workstation
huashenglian

轻量级全模态工作站插件,可让模型同时支持视频、图片、语音的输入输出,还能直接调用ComfyUI完成图像生成,实现任意模态内容的互通处理。

dsh-plugin-vision
aijunjiang

内置11类主流视觉模型预设,支持OpenAI兼容视觉模型快速接入智能体,可勾选对应能力项自动注入实时提示词,无需复杂配置即可高效扩展视觉能力。

dsh-visionary
zhuiyueya

作为大模型工具链轻量插件,可自动将对话中的上传图片转为OCR识别文本与视觉模型生成的内容描述,再输入纯文本大模型,无需改动模型本身即可让其具备图片理解能力。

dsh-mingmu
Lab-sku

作为轻量级视觉桥接工具,可在无内置视觉能力的模型接收图像时自动调用视觉模型完成内容识别,无需额外配置,部署便捷,可无缝接入现有大模型调用流程

dsh-llm-vision
1710782766

给纯文本大模型补全视觉识别与文字提取能力,内置普通/关键两种模式的图像描述、OCR文字提取工具,支持输入自动预处理、请求失败自动重试,且本地持久化缓存结果减少重复请求。

可通过analyze_image接口将图片自动转发至任意OpenAI兼容视觉端点,为仅支持文本输入的模型补全图像识别能力,无需修改模型本体即可实现图文混合输入处理。

作为dsh-vlm-bridge bundle插件,内置vision_analyze工具可让纯文本LLM代理调用SenseNova VLM读取图像内容,支持Schemastery配置与统一凭证管理,无需额外改造即可让纯文本模型实现图像理解。

支持纯文本会话按需启用视觉识别能力,图片自动转为标识标记,调用vision_describe工具即可将图片与对应问题发送至兼容OpenAI的视觉模型,无需改造原有会话流程,轻量易集成。

vision_kit
Seom-ingit

可从数学题图表中自动提取向量、矩阵、几何类结构化信息,内置维度一致性校验与几何自检机制,搭配视觉插件即可快速赋予AI agent数学辅导能力,解析结果准确可靠。

dsh-minimal-vision
Flora233333

支持DSH极简模式下的视觉分析能力,保留灰测所需首轮干净上下文,可隐藏冗余上下文,提供按需Bash工作流,简化极简模式下的开发辅助流程

dsh-sight
Fu3rte

内置免费且低成本的视觉语言模型预设,让纯文本模型直接获得图像理解能力,支持一次提交多张图片批量分析,轻量接入即可扩展多模态功能。