标签主题词 (Topic)

# multimodal

探索包含 multimodal 主题特性的所有开源仓库、扩展插件与智能体组件。

Zero-core-change vision capability for DeepSeek Harness: the describe_image tool + profile bundle, installable via 'dsh ...

dsh-vision-relay
junhongchashui

零修改接入视觉能力,支持云端与本地Ollama双后端自动切换,纯文本模型粘贴图片即读,ModLens v2风格结构化证据输出,兼顾效率与可解释性。

浏览器扩展侧边栏,实时读取当前页面上下文,内置视觉桥接支持图像识别,配合语音输入,全程无需切换页面即可与AI对话。

轻量级视觉桥,自动将贴图经LLM/Stream转为VL文字描述,消除内容不支持报错;内置view_image/ocr_image视觉工具,原生多模态路由自动跳过,零依赖。

dsh-vision
reimu-create

为纯文本模型接入视觉能力,通过视觉模型自动解析图片内容并转化为文本输入。采用表面替换机制,不修改原始对话记录,缓存友好,保持人类可读的交互流程。

GrassVison
moduqishi

支持流式真实思考链,跨轮次无感重看,以像素级证据与SVG图元呈现判断依据,兼容OpenAI/Anthropic/Responses协议,让纯文本模型秒懂图像。

dsh-xiapan-media
dongsheng123132

Native vision, gpt-image-2 and Seedance plugins for DeepSeek Harness via Xiapan Cloud

deepseek-vision-mcp 给 DeepSeek(及其他纯文本大模型)装上「眼睛」 的开源 MCP Server。 DeepSeek 系列模型是纯文本模型,无法直接识别图片。本项目的思路是: 通过 MCP Serv...

提供图像描述、OCR识别、VQA问答、UI布局解析与剪贴板分析,自动提取屏幕或图片中的文字、结构与视觉信息,直接输出结构化结果,便于智能代理理解界面和文档内容。

dsh-mmx-bridge
welsione

一个工具 = MiniMax 全部多模态能力:DSH 纯文本模型看图/画图/生视频/说话/唱歌/翻唱/搜索/查额度 | One mmx_bridge tool = all MiniMax multimodal (VLM/image/vide...

会话内直接粘贴截图或图片,视觉模型逐字转写报错、代码与界面,再由大模型处理;需要配图时自动调用文生图后端生成并显示对话中,全程无感

轻量级插件,借助兼容OpenAI的视觉语言模型端点,自动把图片转成文字描述,让纯文本模型获得看图能力。无需训练,配置好端点即可直接调用。