标签主题词 (Topic)

# multimodal

探索包含 multimodal 主题特性的所有开源仓库、扩展插件与智能体组件。

ark-cli
volcengine

提供终端内调用火山引擎Ark能力的轻量命令行工具,输入提示词即可一条命令完成多模态内容生成、AI问答、模型端点部署,无需手动配置API密钥,开箱即用。

提供统一的视觉理解、图像生成全链路多模态能力,采用模块化插件架构,可灵活适配不同开发需求,开箱即用特性大幅降低多模态功能集成成本,助力开发者快速落地相关应用。

兼容各类主流大语言模型接口,可快速切换不同模型完成调用,无需额外改造现有业务代码,开箱即用降低多模型集成门槛,灵活匹配不同业务下的模型调用需求

orchestral
orchestral-media

TypeScript多媒体生成代理构建库,支持文生图、视频、语音音频等生成管线,具备能力化模型路由、自动跨模型降级特性,可简化多模态生成流程的搭建与调用。

该工具作为视觉能力桥接组件,可让仅支持文本输入的文本模型直接解析图像内容,无需额外训练或修改模型,轻量部署后只需传入图像即可获取对应识别结果,接入流程简单高效。

dsh-vision
zoahdev

Give DeepSeek Harness eyes: analyze images with an OpenAI-compatible vision model via a vision_analyze tool.

dsh-visionary
zhuiyueya

作为大模型工具链轻量插件,可自动将对话中的上传图片转为OCR识别文本与视觉模型生成的内容描述,再输入纯文本大模型,无需改动模型本身即可让其具备图片理解能力。

dsh-agnes-omni
wumu1111111

该插件集成图像理解、文生图、图生图三大核心模块,搭配视觉桥接能力可直接在对话中发送图片,无需跳转额外工具即可完成跨模态交互,使用流程自然顺畅,操作门槛低。

dsh-vision-bridge
TwistedRiCen

原生视觉证据桥接工具,可直接为纯文本推理模型接入原生图片附件能力,内置严格的多图校验机制,无需额外复杂配置即可让纯文本模型稳定支持带校验的图像输入。

作为dsh的媒体管控组件,可精准聚合多维度媒体预算,基于确定性算法生成安全的请求量预估值,避免预算超支与请求异常波动,保障投放流程稳定可控

dsh-vision-link
sprainJinyu

可在对应推理框架中为纯文本模型补充图像理解能力,完整保留原有路由配置规则,无需改动模型调用链路即可实现图文混合场景的内容解析,降低多模态接入门槛。

dsh-multimodal
SCT192221

轻量多模态插件,原生支持文本、图片等多模态内容输入输出,交互流畅接近原生应用体验,部署无额外依赖,开箱即用可快速嵌入现有业务链路。