探索包含 deepseek-harness 主题特性的所有开源仓库、扩展插件与智能体组件。
支持微信、QQ、钉钉、飞书、Telegram 统一接入智能体,扫码授权即可对话,图片与文件互传,智能体可直接读取 PDF、DOCX、XLSX 及纯文本内容
轻量插件将会话图像自动送往可插拔视觉API,识别结果回传主模型,保持原有对话链路不变,无需迁移模型即可获得视觉能力。
以纯配置方式提供OpenAI兼容视觉模型的统一接入层,零代码声明端点与密钥,一行切换多模态后端。自动处理请求格式化、响应解析与超时重试,模型接入无需改动业务代码。
内容寻址构建工件、事实、动作与报告的血缘图谱,每个节点由哈希唯一标识,支持溯源查询与依赖分析,轻量集成,为审计与调试提供完整可追溯链路。
为无原生识图能力的模型提供图像识别,优先调用阿里云qwen3.5-omni-plus,失败自动切换智谱glm-4.6v-flash。由claude-vision-skill移植,开箱即用。
支持直接粘贴图片,自动触发四个视觉模型同步识别并比对结果,内置OCR提取文字,通过文本桥自动填充输入框,省去手动复制的繁琐。查看不同模型的识别差异更直观。
支持跨平台计算机视觉操控,保留原始像素并记录严格证据,内置健康检查实现故障自动转移,同时精确核算Token用量,保障每次操作可审计、可追溯。
PicGo内核,在对话面板内直接上传图片与文件至自选图床,无需切换窗口。支持多图床配置,粘贴后自动上传并返回链接,提升写作与分享效率。
支持通过Zotero本地API检索文献库,读取元数据与全文,列出附件并下载PDF,同时管理笔记。全程本地交互,无需云端同步,便于自动化脚本直接获取文献资料。
deepseek-vision-mcp 给 DeepSeek(及其他纯文本大模型)装上「眼睛」 的开源 MCP Server。 DeepSeek 系列模型是纯文本模型,无法直接识别图片。本项目的思路是: 通过 MCP Serv...
提供图像描述、OCR识别、VQA问答、UI布局解析与剪贴板分析,自动提取屏幕或图片中的文字、结构与视觉信息,直接输出结构化结果,便于智能代理理解界面和文档内容。
把PaddleOCR封装成AI可调用的原生工具,提供图形化界面配置参数,实现多语言文字识别、版面分析与图像文本提取,让模型调用更简单顺畅。