标签主题词 (Topic)

# multimodal

探索包含 multimodal 主题特性的所有开源仓库、扩展插件与智能体组件。

作为DSH插件,可为纯文本聊天模型接入Ollama本地部署的qwen3-vl:8b视觉大模型,直接生成图像描述,同时优化显存占用降低运行开销,无需依赖云端服务即可实现本地图像理解能力。

dsh-iris
mokuyoaxis

支持多供应商路由调度,可一站式完成媒体生成与视觉理解任务,集成Iris工作台简化操作流程,开箱即用无需复杂配置。

轻量级自定义模型视觉开关配置插件,支持为自定义模型快速声明图像输入能力,可直接写入llm-pi-ai配置文件,完美适配0.1.x版本,操作简单无需额外复杂配置。

支持快速检测自定义大模型 harness 的推理能力与图像输入支持情况,可直观输出能力判定结果,无需复杂配置即可完成模型能力探测。

dsh-plugin-vision
aijunjiang

内置11类主流视觉模型预设,支持OpenAI兼容视觉模型快速接入智能体,可勾选对应能力项自动注入实时提示词,无需复杂配置即可高效扩展视觉能力。

TokenLab原生协议打造的模型提供商,支持多模态工具调用与异步任务执行能力,开箱即用无需复杂配置,可快速接入大模型应用流程。

dsh-llm-multimodal
xiaokaizhou

轻量级聊天场景插件,基于OpenAI兼容API,可直接在对话交互中调用图像、视频生成类工具,无需复杂配置即可快速接入多模态生成能力,适配主流生成式AI服务接口。

支持自动识别并配置大模型推理强度、输入模态等能力,作为llm-pi-ai的功能插件,是前代推理能力配置组件的升级版本,无需手动调整参数即可匹配各类主流大模型的最佳运行配置。

支持输入任意专利公开号,自动生成结构化的竞品侵权分析报告,同时打包为标准可调用skill,可被Codex、Claude Code等各类agent直接集成,无需复杂配置即可快速获取专利侵权风险研判结果。

dsh-periscope
lmh-2026

可自动识别请求是否携带图片,纯文本请求直连DeepSeek V4-Flash/V4-Pro,带图请求自动路由至官方视觉模型,无需手动切换模型配置,使用过程无需额外操作。

视觉插件提供结构化OCR证据提取与USB摄像头视觉闭环能力,封装analyze_image、capture_image两类核心接口,支持Ollama、DeepSeek、小米三类后端无缝切换,调用轻量无需复杂配置。

支持统一接入 Image2 与 Nano Banana 四款图像生成模型,覆盖文生图、多参考图编辑、2K/4K 输出、顺序批量任务,默认模型持久化与脱敏 Key 配置省心易用。