探索包含 multimodal 主题特性的所有开源仓库、扩展插件与智能体组件。
支持在Web编写器直接粘贴图片,将图像识别任务委派至Kimi、MiniMax视觉路由处理,图像数据仅在隔离上下文中流转,主会话无图片字节残留。
作为轻量级视觉桥接工具,可在无内置视觉能力的模型接收图像时自动调用视觉模型完成内容识别,无需额外配置,部署便捷,可无缝接入现有大模型调用流程
原生支持图像理解与生成,内置分层证据记忆缓存机制,还可完成GUI自动化操作,直接扩展纯文本模型的视觉交互能力,开箱即用无需额外适配。
提供多模态图像理解能力,内置8种覆盖不同场景的分析模式,可对接任意OpenAI、Anthropic兼容的视觉端点,部署简单无需复杂配置,调用流畅适配多种开发需求。
零配置多模态视觉路由工具,可自动发现本地可用视觉模型,优先本地推理保障数据隐私,无可用本地模型时自动切换远程视觉服务,无需手动配置参数即可快速接入多源视觉能力。
可在dsh框架内接入智谱GLM视觉模型,提供glm_vision工具调用能力,让DeepSeek等文本模型直接获得图片理解能力,轻松处理多模态相关任务,无需额外复杂配置。
支持OpenAI Vision API与豆包CDP双后端接入的跨平台视觉桥接插件,内置结果缓存机制,配置灵活,可快速为应用集成多源视觉识别能力,无需额外适配工作。
给纯文本大模型补全视觉识别与文字提取能力,内置普通/关键两种模式的图像描述、OCR文字提取工具,支持输入自动预处理、请求失败自动重试,且本地持久化缓存结果减少重复请求。
整合Qwen视觉理解、语音转文字、文生图三类多模态能力,提供统一规范的调用接口,无需复杂配置即可快速接入使用,开发部署简单高效。
该插件适配DashScope平台的Kimi大模型,支持kimi-k3的图片输入、思考推理与工具调用能力,无构建步骤,开箱即用,可快速集成至大模型应用框架。
依托GLM-4V-Flash多模态能力,可将输入图像自动转为文本描述输入非多模态模型,轻量接入即可让无图像处理能力的模型支持图像相关推理、问答任务,调用成本低且延迟可控。
可通过analyze_image接口将图片自动转发至任意OpenAI兼容视觉端点,为仅支持文本输入的模型补全图像识别能力,无需修改模型本体即可实现图文混合输入处理。