Ragas

Ragas

开源RAG评估框架,忠实度与上下文精度等参考指标覆盖全链路

核心功能

面向RAG、Agent与工作流应用的Python评估框架,指标既含LLM评判也有传统算法。支持合成测试集生成、CI/CD集成,可搭配LangChain、LlamaIndex使用,提供prompt对比、简单RAG、多步工作流与Agent评估等教程。

功能亮点

RAG多维指标

上下文精度/召回、忠实度等覆盖检索与生成全链路

合成测试数据

自动生成覆盖多样场景的测试集,免人工标注

Agent评估

主题贴合、工具调用准确率等Agent场景专属指标

框架无缝集成

与LangChain、LlamaIndex及观测工具搭配使用

自定义模型 / 模型接入

多厂商支持

默认OpenAI评分,教程覆盖Anthropic、Gemini与本地Ollama,OpenAI兼容API可用base_url接入。

接入方式
  • OPENAI_API_KEY 环境变量(默认)
  • ANTHROPIC_API_KEY + provider="anthropic"
  • GOOGLE_API_KEY + provider="google"
  • base_url="http://localhost:11434/v1" 接Ollama
  • llm_factory 配 provider="openai" 与 client
支持模型
gpt系列(默认)claude-3-5-sonnetgemini-2.0-flashOllama本地模型(如mistral)
bash
换国产/自建模型,用 OpenAI 兼容 client 传给 llm_factory:
from openai import OpenAI
from ragas.llms import llm_factory
client = OpenAI(api_key="sk-xxx", base_url="https://dashscope.aliyuncs.com/compatible-mode/v1")
llm = llm_factory("qwen-max", provider="openai", client=client)

适用场景

• RAG检索与生成质量评估
• 提示词/模型对比选型
• Agent工具调用准确率
• 生成合成测试数据集

安装配置

bash
pip install ragas
免安装直接跑:uvx ragas quickstart rag_eval

使用方法

bash
pip install ragas 后执行 ragas quickstart rag_eval 生成项目骨架,在 evals.py 中改 load_dataset() 加测试用例,export OPENAI_API_KEY=sk-xxx 后 python evals.py 运行,结果存 CSV 至 evals/experiments/。

关键指标

尚未核验对标产品,此处只列本工具自身指标,不做对比结论。

指标Ragas
价格免费
开源
上手难度进阶
Token 消耗

相关工具

优点

  • 指标覆盖全面文档完善
  • 支持本地模型与国产API
  • 测试集生成省时省力
  • Apache 2.0开源活跃

缺点

  • LLM评判产生token成本
  • 概念体系需学习成本
  • 深度定制要写Python