探索包含 llm-evaluation 主题特性的所有开源仓库、扩展插件与智能体组件。
提供成对A/B评测能力,支持真实运行时交叉重复运行、校验器自检、单变量实验臂配置与回归校验,可快速完成模型组件的对比评估与质量验证。
支持带证明的纠错学习流程,具备显式采用、范围限定召回、可重建交付特性,集成度高易上手,可快速完成学习内容的结构化纠错与可靠交付。
证据门控机制实现智能代理任务完成校验,配套全流程可信代码验证能力,可自动拦截异常执行路径,保障代理输出结果的可信度与合规性,显著降低人工核验成本。
原生适配Codex、Claude Code、DeepSeek Harness等开发环境,覆盖提示词、RAG、智能体、工作流场景,提供实证评估与全链路可观测能力,开箱即用。
提供受控请求面回放与回归校验能力,可精准复现线上请求场景,自动比对响应结果差异,支持回归用例灵活编排,帮助开发者快速定位接口变更引发的异常问题。
提供可复现的配对A/B实验能力,支持隔离实验运行环境,留存可审计的实验证据,内置确定性发布门禁机制,保障插件迭代验证过程可回溯、结果可信赖。
本地运行的盲审竞技场,支持同任务隔离工作树执行、共享统一验证规则,先完成结果评审再公示,从机制上保障评审公平性与结果可信度,全程本地部署无外部依赖。
支持多编码模型并排对比,依托隔离Git工作树避免环境冲突,可实时查看模型运行追踪痕迹,对比结果可直接采纳复用到项目,操作流程直观高效,使用门槛低。
基础设施,可将分散的SKILL.md文件自动聚合为结构化、可检索的智能体技能语料库,配套内置检索与评估工具链,开箱即可完成技能库搭建与效果验证。
Sovereign, agent-driven LLM evaluation harness forked from deepseek-harness (dsh) — Cordis plugin architecture, EntheAI ...
Open evaluation datasets, test cases, and metrics for DSH plugins.
提供面向开发者的自主迭代智能体操作系统,仅提供任务评级指令与预期结果约束,不将评级标准写入智能体成功契约,内置面试门控机制保障迭代可靠性。