核心功能
面向RAG、Agent与工作流应用的Python评估框架,指标既含LLM评判也有传统算法。支持合成测试集生成、CI/CD集成,可搭配LangChain、LlamaIndex使用,提供prompt对比、简单RAG、多步工作流与Agent评估等教程。
功能亮点
RAG多维指标
上下文精度/召回、忠实度等覆盖检索与生成全链路
合成测试数据
自动生成覆盖多样场景的测试集,免人工标注
Agent评估
主题贴合、工具调用准确率等Agent场景专属指标
框架无缝集成
与LangChain、LlamaIndex及观测工具搭配使用
自定义模型 / 模型接入
多厂商支持
默认OpenAI评分,教程覆盖Anthropic、Gemini与本地Ollama,OpenAI兼容API可用base_url接入。
接入方式
- OPENAI_API_KEY 环境变量(默认)
- ANTHROPIC_API_KEY + provider="anthropic"
- GOOGLE_API_KEY + provider="google"
- base_url="http://localhost:11434/v1" 接Ollama
- llm_factory 配 provider="openai" 与 client
支持模型
gpt系列(默认)claude-3-5-sonnetgemini-2.0-flashOllama本地模型(如mistral)
bash
换国产/自建模型,用 OpenAI 兼容 client 传给 llm_factory:
from openai import OpenAI
from ragas.llms import llm_factory
client = OpenAI(api_key="sk-xxx", base_url="https://dashscope.aliyuncs.com/compatible-mode/v1")
llm = llm_factory("qwen-max", provider="openai", client=client)适用场景
• RAG检索与生成质量评估
• 提示词/模型对比选型
• Agent工具调用准确率
• 生成合成测试数据集
安装配置
bash
pip install ragas 免安装直接跑:uvx ragas quickstart rag_eval
使用方法
bash
pip install ragas 后执行 ragas quickstart rag_eval 生成项目骨架,在 evals.py 中改 load_dataset() 加测试用例,export OPENAI_API_KEY=sk-xxx 后 python evals.py 运行,结果存 CSV 至 evals/experiments/。
关键指标
尚未核验对标产品,此处只列本工具自身指标,不做对比结论。
指标Ragas
价格免费
开源是
上手难度进阶
Token 消耗高
相关工具
优点
- 指标覆盖全面文档完善
- 支持本地模型与国产API
- 测试集生成省时省力
- Apache 2.0开源活跃
缺点
- LLM评判产生token成本
- 概念体系需学习成本
- 深度定制要写Python