探索包含 benchmark 主题特性的所有开源仓库、扩展插件与智能体组件。
提供智能研究代理的反欺骗防护机制,内置突破性研究循环框架、防误导检查清单、声明极性校验门控与工程规则集,降低代理被错误信息诱导的概率,保障研究结论可靠性。
本报告呈现GLM-5.3-Flash适配J-Space认知套件的能力实现基准,涵盖认知推理、空间理解等维度的测试数据,提供可复用的评估框架,方便开发者快速验证模型在该场景下的适配效果。
覆盖Host与Web端的全场景性能诊断能力,可自动执行重复插件隔离操作,同时提供故障场景下的安全恢复机制,无需人工干预即可保障应用运行稳定。
支持按供应商、模型、会话粒度采集大模型调用延迟与缓存命中数据,输出精准量化指标,方便开发者快速定位性能问题,轻量接入无需复杂配置,实时反馈调用性能表现。
原生适配Codex、Claude Code、DeepSeek Harness等开发环境,覆盖提示词、RAG、智能体、工作流场景,提供实证评估与全链路可观测能力,开箱即用。
集成系统化测试方法论、10套可复用QA技能与可复现基准测试集,可直接适配Claude Code等各类Agent,覆盖需求分析、用例设计、缺陷定位等全流程测试环节,开箱即用即可让AI具备资深测试工程师的工作能力。
提供有实证支撑的类型感知评分能力,可自动检测插件的类型合规性、代码质量等核心指标,输出可视化质量评分卡,无需复杂配置即可快速完成插件质量评估。
封装知识库加载检索、基准价格查询、风险评估等通用能力,为知设DSH生态插件提供统一基础功能支撑,避免重复开发,保障各插件逻辑一致性,降低插件开发与维护成本。
轻量级量化基准测试插件,可一键复现ml-quant-trading协议v1的标准测试流程,支持量化策略效果标准对比验证,无需手动配置复杂环境,开箱输出可复现的基准测试数据。
本地运行的盲审竞技场,支持同任务隔离工作树执行、共享统一验证规则,先完成结果评审再公示,从机制上保障评审公平性与结果可信度,全程本地部署无外部依赖。
基础设施,可将分散的SKILL.md文件自动聚合为结构化、可检索的智能体技能语料库,配套内置检索与评估工具链,开箱即可完成技能库搭建与效果验证。
dsh-excel-chat — talk to Excel in DeepSeek Harness: create, edit, repair, and verify spreadsheets by conversation (cells...