DeepEval

DeepEval

像 pytest 一样给 LLM 应用写 50+ 评估指标

核心功能

DeepEval 是 Confident AI 开源的 LLM 评估框架(Apache 2.0),提供 50+ 研究级指标:忠实度、幻觉、相关性、工具正确性、偏见、毒性等,覆盖 RAG、智能体、单/多轮与安全。它与 pytest 原生集成做 CI/CD 质量门禁,可接 Confident AI 平台补看板与协作。

功能亮点

指标齐全

忠实度幻觉工具正确性等

pytest 风

评估当单测跑进 CI

合成数据

少量种子生成多用例

接平台

Confident AI 补看板协作

适用场景

• RAG 忠实度评测
• 智能体工具调用校验
• 上线前 CI 自动评估

安装配置

bash
pip install deepeval,写测试用例用 assert_test 断言指标阈值;可选 deepeval login 连 Confident AI 云看板。仓库:github.com/confident-ai/deepeval。

使用方法

bash
1) pip install deepeval,构造 LLM 输入输出组成 test_case
2) 选指标如 FaithfulnessMetric(threshold=0.5),用 assert_test 断言是否达标
3) 把评估脚本当 pytest 跑,分数不达标即阻断合并(CI 质量门禁)
4) 用内置演进技术从少量种子生成数百条多轮测试用例
5) 接 Confident AI 平台做在线评估、生产追踪与团队协作

关键指标

尚未核验对标产品,此处只列本工具自身指标,不做对比结论。

指标DeepEval
价格免费
开源
上手难度进阶

相关工具

优点

  • 开源指标覆盖最广
  • pytest 集成贴合工程流
  • 智能体工具正确性专属指标
  • 合成数据省人工标注

缺点

  • 指标需调 LLM 评估产生额外费用
  • 大批量多轮评估较慢且贵
  • 协作看板需 Confident AI 云
  • 分数依赖评判模型质量