标签主题词 (Topic)

# multimodal

探索包含 multimodal 主题特性的所有开源仓库、扩展插件与智能体组件。

dsh-gemini-multimodal
RealAlexandreAI

支持为原本仅支持文本输入的模型扩展视觉、听觉等多模态感知能力,将图像、音频的识别处理委托给Gemini模型,无需改动原有模型即可直接实现多模态输入理解。

dsh-mmroute
jmxsxwyzjdwl

为模型路由提供全链路图片模态调度能力,可无缝嵌入agent工作流,无需额外配置即可完成多模态请求的路由分发,保障图片类任务的高效流转。

作为轻量级图像输入回退插件,原生支持多模态模型检测,可无缝对接火山引擎方舟视觉能力,无需额外适配即可为无原生图像输入支持的框架补全图像处理流程,部署简单易集成。

dsh-guide-dog
AtropinolTT

Guide Dog for DSH — MiniMax multimodal plugin: image/video/music/speech generation & vision tools, voice mode, voice...

dsh-voice
zhuiyueya

Voice for DeepSeek Harness(dsh) — speech-to-text input + read-aloud TTS for text-only DeepSeek, zero API key.

直接上传或粘贴图片,自动调用 OpenAI 兼容视觉 API 生成英文描述,随后将描述喂给纯文本模型继续推理。轻量桥接层,让不具备视觉能力的模型也能读懂图片内容。

以纯配置方式提供OpenAI兼容视觉模型的统一接入层,零代码声明端点与密钥,一行切换多模态后端。自动处理请求格式化、响应解析与超时重试,模型接入无需改动业务代码。

支持直接粘贴图片,自动触发四个视觉模型同步识别并比对结果,内置OCR提取文字,通过文本桥自动填充输入框,省去手动复制的繁琐。查看不同模型的识别差异更直观。

dsh-plugins
zjcdkj

轻量级插件为编码模型

mimo-vision
wulusai2333

DeepSeek Harness (DSH) native plugin — describe_image tool: a vision bridge (image → mimo-v2.5 → text description) over ...

零依赖Python CLI,为纯文本LLM提供OCR、表格、公式识别与PDF转Markdown,优先调用免费多模态API,国内网络直连、免代理,快速让模型看懂图像与文档。

dsh-design-qa
sunxin-ai

为纯文本模型添加视觉通道,自动判断前端实现是否匹配设计稿,内置多组基准测试量化判定准确率,一键运行生成结构化报告。