dsh-llm-eval
其他 活跃维护

dsh-llm-eval

satan9394/dsh-llm-eval

提供忠实度、相关性校验、测试集检测、幻觉识别及回归守护能力,参考agents项目设计逻辑,可快速接入LLM开发链路,完成模型效果的全流程量化评测

0
Stars 标星
0
Forks 分支
0
Watchers 关注
0
Open Issues
JavaScript
主要语言
MIT
开源协议
5 KB
仓库大小
1 个月前
最后推送
一键安装扩展 / 插件指令
dsh plugin --profile web add github:satan9394/dsh-llm-eval
git clone https://github.com/satan9394/dsh-llm-eval.git
git clone git@github.com:satan9394/dsh-llm-eval.git
README.md main

dsh-llm-eval

LLM 评估:忠实度/相关性/正确性/完整性维度、测试集构建、幻觉专项检测、
回归守护。

受 wshobson/agents(38k★ MIT)
的 llm-application-dev/llm-evaluation 技能启发,改编为 DSH
中文原创精简版。

安装

dsh plugin --profile web add dsh-llm-eval
# 或本地开发:dsh plugin --profile web add link:E:\DeepSeek_Harness\workspace\2026_08_15\plugins\dsh-llm-eval
# 重启 dsh web 生效

使用

对 agent 说"评估这个 LLM 应用 / 检测幻觉",llm-eval 技能输出
评估报告(维度/测试集/通过率/失败模式)。

结构

dsh-llm-eval/
├── index.js           # 注册 skills/ 到 ctx.skills
├── cordis.patch.yml   # bundle patch 层
├── package.json       # dsh.bundle manifest
└── skills/llm-eval/SKILL.md

License

MIT。原创精简改编,灵感来自 wshobson/agents(MIT)。