核心功能
DeepEval 是 Confident AI 开源的 LLM 评估框架(Apache 2.0),提供 50+ 研究级指标:忠实度、幻觉、相关性、工具正确性、偏见、毒性等,覆盖 RAG、智能体、单/多轮与安全。它与 pytest 原生集成做 CI/CD 质量门禁,可接 Confident AI 平台补看板与协作。
功能亮点
指标齐全
忠实度幻觉工具正确性等
pytest 风
评估当单测跑进 CI
合成数据
少量种子生成多用例
接平台
Confident AI 补看板协作
适用场景
• RAG 忠实度评测
• 智能体工具调用校验
• 上线前 CI 自动评估
安装配置
bash
pip install deepeval,写测试用例用 assert_test 断言指标阈值;可选 deepeval login 连 Confident AI 云看板。仓库:github.com/confident-ai/deepeval。
使用方法
bash
1) pip install deepeval,构造 LLM 输入输出组成 test_case 2) 选指标如 FaithfulnessMetric(threshold=0.5),用 assert_test 断言是否达标 3) 把评估脚本当 pytest 跑,分数不达标即阻断合并(CI 质量门禁) 4) 用内置演进技术从少量种子生成数百条多轮测试用例 5) 接 Confident AI 平台做在线评估、生产追踪与团队协作
关键指标
尚未核验对标产品,此处只列本工具自身指标,不做对比结论。
指标DeepEval
价格免费
开源是
上手难度进阶
相关工具
优点
- 开源指标覆盖最广
- pytest 集成贴合工程流
- 智能体工具正确性专属指标
- 合成数据省人工标注
缺点
- 指标需调 LLM 评估产生额外费用
- 大批量多轮评估较慢且贵
- 协作看板需 Confident AI 云
- 分数依赖评判模型质量