探索包含 vision-language-model 主题特性的所有开源仓库、扩展插件与智能体组件。
支持高分辨率图像自适应切片处理,内置L1-L6全流程管线,覆盖快速通道、显著性检测、自适应分块等环节,可对接视觉大模型的高清图输入需求,配置简单高效。
原生视觉证据桥接工具,可直接为纯文本推理模型接入原生图片附件能力,内置严格的多图校验机制,无需额外复杂配置即可让纯文本模型稳定支持带校验的图像输入。
PaddleOCR-VL与Qwen构建的视觉模型适配插件,可快速为Codex、DeepSeek Harness等开发框架接入图像识别能力,无需复杂配置即可完成模型部署与调用,轻量易用适配主流开发场景。
支持DeepSeek无需切换模型即可自动路由视觉理解与图像生成能力,兼容Gemini及所有OpenAI兼容后端,可调用GPT-4o、通义千问VL、GLM-4V等多类模型,直接完成对应任务。
支持纯文本会话按需启用视觉识别能力,图片自动转为标识标记,调用vision_describe工具即可将图片与对应问题发送至兼容OpenAI的视觉模型,无需改造原有会话流程,轻量易集成。
轻量插件将会话图像自动送往可插拔视觉API,识别结果回传主模型,保持原有对话链路不变,无需迁移模型即可获得视觉能力。
提供图像理解与OCR能力,将截图、文档等视觉信息转为结构化文本,同时持久化保存视觉证据,让纯文本模型在后续对话中可随时回溯图像内容,轻量集成即可获得多模态扩展。
轻量级视觉桥,自动将贴图经LLM/Stream转为VL文字描述,消除内容不支持报错;内置view_image/ocr_image视觉工具,原生多模态路由自动跳过,零依赖。
支持流式真实思考链,跨轮次无感重看,以像素级证据与SVG图元呈现判断依据,兼容OpenAI/Anthropic/Responses协议,让纯文本模型秒懂图像。
支持跨平台计算机视觉操控,保留原始像素并记录严格证据,内置健康检查实现故障自动转移,同时精确核算Token用量,保障每次操作可审计、可追溯。
轻量级视觉辅助工具,集成图像识别与目标检测能力,支持实时画面分析。提供简洁接口,可快速接入自定义视觉模型,多模态开发调试操作直观易上手。
免费托管的视觉侧车,自动捕获并持久保存会话中的视觉证据。无需自建服务器,零配置接入,为每次交互提供可追溯、可验证的视觉记录,开箱即用。