探索包含 dsh 主题特性的所有开源仓库、扩展插件与智能体组件。
在对话流接缝处调用Gemini Flash,自动将用户附带的图片实时转为文字描述,同时开放describe_image工具供纯文本模型调用,无需更换模型即可获得视觉理解。
支持将截图和本地图片经MindSee转成文字,让对话模型能看图作答。安装即可使用,无需额外配置,自动提取图像信息并融入上下文,强化多模态交互。
支持导入PDF、Word、Excel、PPT等文档构建知识库,提问时AI自动检索并回答,同时标注答案来源文档。全局共享,即装即用。
DeepSeek Harness 的 Codex 扩展:粘贴识图、生图/改图,本机 Codex CLI 子代理干活
提供持久化TBox与ABox领域知识,支持类型化声明、断言与推理查询,在schema约束下保证数据一致性,让代理知识可复用、可演进。
Zero-core-change vision capability for DeepSeek Harness: the describe_image tool + profile bundle, installable via 'dsh ...
自动判断任务难度并路由到已配置模型,内置困难/普通/简单三档分级,视觉任务走独立路由通道,全套自动运行,无需手动切换模型。
轻量级视觉桥接插件,感知主模型无法处理图片时,自动转发给本地Umi-OCR完成识别,全程无需外部API密钥,数据保留在本地,兼容现有模型链路,即插即用。
集成DDGS和Tavily双搜索源,配合Firecrawl实现网页内容精准提取。搜索结果与抓取内容结构化返回,支持灵活配置,让智能体实时获取网络信息,处理链路清晰可控。
依托苹果与微软系统内置文字识别引擎,按需本地识别图片文字,全程离线运行。无需上传数据,保护隐私,响应迅速,轻量插件设计,方便集成。
零修改接入视觉能力,支持云端与本地Ollama双后端自动切换,纯文本模型粘贴图片即读,ModLens v2风格结构化证据输出,兼顾效率与可解释性。
浏览器扩展侧边栏,实时读取当前页面上下文,内置视觉桥接支持图像识别,配合语音输入,全程无需切换页面即可与AI对话。