标签主题词 (Topic)

# multimodal

探索包含 multimodal 主题特性的所有开源仓库、扩展插件与智能体组件。

轻量级视觉语言网关插件,直接粘贴图像即可自动识别并输出文本。依托多模态模型,实现视觉内容到文本的无缝转换,操作简单,即贴即用。

dsh-vision
54xkeee

Vision for DeepSeek Harness: Doubao Web by default (zero-cost, no API key), Antigravity IDE quota (flash/pro), any IDE C...

dsh-visual-plugin
jyh20030112

自动将用户图像转发至任意OpenAI兼容视觉模型,识别结果实时呈现在Web UI右侧面板,无需改动现有聊天链路,纯文本模型即刻获得视觉能力。

dsh-vision-proxy
Flyvhidbwo

DeepSeek Harness 插件:DeepSeek 大脑 + 自动识图。GUI 附加图片自动经 OpenAI 兼容 VLM 转译成文字后交给 DeepSeek 作答;支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容端点...

visual-review
wang-bool

轻量级插件,支持图像上传与识别,让对话具备多模态理解。发送图片即可自动识别并参与对话,交互直观高效。

dsh-see-image
tiefeiyu

图像描述插件,可调用任意OpenAI兼容的视觉模型,如GitHub Copilot、Ollama、vLLM等,直接对图片生成文字说明,即插即用,部署简单。

text-llm-vision
shaoqiuyuavailable

自动识别图像场景,在视觉插件处理前将请求分流至匹配的引擎,覆盖对话、界面、表格与代码。基于场景感知决策,支持动态切换后端,让多模态分发更精准。

自动拦截图像输入流,透明完成缩放、格式归一化与增强,并按视觉任务动态路由至最优处理节点。零侵入接入现有流程,无需改动业务代码,即插即用,简化多模型图像调用链路。

dsh-open-eyes
hyper-dsh-plugins

轻量级视觉委托工具,为纯文本模型扩展图像处理能力,内置 OpenAI Responses、Chat Completions 与 Anthropic Messages 原生适配器,接入简单,路由灵活,体验流畅

dsh-vision-mix
haiziyao

通过固定Mix模型,自动分流视觉识别与图像生成任务,无需动态切换模型。统一接口简化调用,推理稳定高效,适合偏好确定性路由的开发者。

sidesight
ZhuXinAI

CLI-first vision sidecar for text-only coding agents. Analyze screenshots, diagrams, charts, UI diffs, and videos with O...

轻量级视觉工具包,让纯文本AI代理直接读取图片、截图与图表,自动提取关键信息并转成结构化描述,即插即用,无需重新训练即可获得完整视觉理解能力。