探索包含 multimodal 主题特性的所有开源仓库、扩展插件与智能体组件。
轻量级视觉能力拓展插件,可快速为开发工具与大模型应用接入图像识别、内容理解等多模态处理能力,开箱即用无需复杂配置,兼容主流开发框架与工作流。
提供图像查看工具,兼容本地Ollama及各类OpenAI兼容视觉大模型,作为聊天图像附件桥接,支持粘贴、拖拽上传图片,让原本仅支持文本交互的模型可直接识别图像内容。
支持给纯文本模型新增视觉识别能力,采用类Codex聊天框拖拽交互,用户上传的图片会自动分流至已配置的视觉模型转文字,v4版本无需切换模型即可直接完成识图,操作流畅便捷。
支持DeepSeek无需切换模型即可自动路由视觉理解与图像生成能力,兼容Gemini及所有OpenAI兼容后端,可调用GPT-4o、通义千问VL、GLM-4V等多类模型,直接完成对应任务。
提供模型可直接调用的视觉工具集,内置OpenAI兼容、Gemini、本地Ollama等多类VLM通用通道与包装适配器,可快速为纯文本大模型扩展视觉理解能力,开箱即用无需复杂配置。
支持纯文本会话按需启用视觉识别能力,图片自动转为标识标记,调用vision_describe工具即可将图片与对应问题发送至兼容OpenAI的视觉模型,无需改造原有会话流程,轻量易集成。
支持将Grok订阅接入目标平台作为ACP子代理,可为原生图像功能扩展音频、视频处理工具,开箱即用无需额外配置。
轻量级模型配置插件,在创建自定义模型时可手动勾选所需能力配置,如图片输入、上下文长度等选项,操作简单直观,无需复杂代码即可完成模型能力定制。
支持调用外部视觉模型解析各类图片内容,输出带坐标标注的纯文本视觉原语,无需改动原有文本模型架构,即可让纯文本模型在对话中直接识别图片、截图与文档类视觉内容。
轻量级多模态转文本与跨视觉桥接插件,提供动态多模态到文本的投射能力,支持跨模型视觉数据互通,可无缝衔接不同模态处理与文本分析流程,部署简单兼容主流多模态开发框架。
融合视觉识别能力,依托智能模型路由技术,自动适配调用DeepSeek模型执行编码任务,轻量接入无需复杂配置,开发者可快速获得精准智能编码辅助
可从数学题图表中自动提取向量、矩阵、几何类结构化信息,内置维度一致性校验与几何自检机制,搭配视觉插件即可快速赋予AI agent数学辅导能力,解析结果准确可靠。