标签主题词 (Topic)

# image-to-text

探索包含 image-to-text 主题特性的所有开源仓库、扩展插件与智能体组件。

modlens
liustack

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, ge...

支持直接粘贴图片,自动触发四个视觉模型同步识别并比对结果,内置OCR提取文字,通过文本桥自动填充输入框,省去手动复制的繁琐。查看不同模型的识别差异更直观。

视觉插件提供结构化OCR证据提取与USB摄像头视觉闭环能力,封装analyze_image、capture_image两类核心接口,支持Ollama、DeepSeek、小米三类后端无缝切换,调用轻量无需复杂配置。

deepseek-visual-plugin
zhangzhimou78-code

轻量级视觉能力拓展插件,可快速为开发工具与大模型应用接入图像识别、内容理解等多模态处理能力,开箱即用无需复杂配置,兼容主流开发框架与工作流。

dsh-plugins
zjcdkj

轻量级插件为编码模型

sidesight
ZhuXinAI

CLI-first vision sidecar for text-only coding agents. Analyze screenshots, diagrams, charts, UI diffs, and videos with O...

dsh-auto-vision
NormanFxxkingRockwell

DeepSeek Harness 视觉桥:自动发现你已配置的多模态模型,给纯文本主模型装上 vision 工具,识别结果以纯文本返回。零配置,一条命令安装。

支持纯文本模型绕过图像准入限制,自动将图像块改写为本地路径,通过OCR或视觉描述能力完成图像内容的读取与输出,无需模型本身具备多模态能力,开箱即用。