promptfoo

promptfoo

开源LLM提示词评测与回归测试CLI,支持多模型对比与红队安全扫描

核心功能

以测试驱动方式开发LLM应用:用YAML声明式配置测试用例与断言,自动对比多提示词×多模型的输出矩阵。支持60+模型供应商、本地模型与自定义API,内置缓存与并发加速,可集成GitHub Action进CI/CD,并内置自动化红队扫描安全漏洞。

功能亮点

矩阵对比视图

多提示词×多模型交叉评测输出矩阵,快速定位最优组合

红队安全扫描

自动扫描50+漏洞类型,覆盖越狱注入与合规风险

本地私有运行

评测在本机执行直连LLM,数据不出本地

缓存并发加速

内置缓存与并发、热重载,评测反馈毫秒级

自定义模型 / 模型接入

多厂商支持

原生支持OpenAI等60+供应商与Ollama本地模型,可用环境变量或config.apiBaseUrl接入任意OpenAI兼容端点。

接入方式
  • OPENAI_API_KEY/ANTHROPIC_API_KEY 环境变量认证
  • providers 配置:- openai:chat:gpt-5.4
  • 自定义端点:config.apiBaseUrl + apiKey
  • 本地模型:- ollama:chat:llama3.3
  • 自定义脚本:- file://custom_provider.py
支持模型
openai:chat:gpt-5.4claude-opus-4-6gemini-2.5-proollama:chat:llama3.3azureopenai:自定义部署名deepseek:deepseek-r1
bash
在 config 中加 OpenAI 兼容端点即可换国产/自建模型:
providers:
  - id: openai:chat:qwen-max
    config:
      apiBaseUrl: https://dashscope.aliyuncs.com/compatible-mode/v1
      apiKey: YOUR_KEY
本地可用 Ollama:
  - id: ollama:chat:qwen2.5

适用场景

• 上线前提示词与模型选型对比
• LLM应用安全漏洞自动扫描
• CI流水线自动回归测试
• RAG管线事实性与相关性评估

安装配置

bash
npm install -g promptfoo
不装全局也可:npx promptfoo@latest init --example getting-started

使用方法

在 promptfooconfig.yaml 中声明 prompts、providers 与 tests,运行 promptfoo eval 执行评测,promptfoo view 打开网页对比结果,promptfoo redteam run 执行红队扫描。

关键指标

尚未核验对标产品,此处只列本工具自身指标,不做对比结论。

指标promptfoo
价格免费
开源
上手难度入门
Token 消耗

相关工具

优点

  • 纯本地运行,数据私有安全
  • 声明式配置,一次定义多次运行
  • 60+供应商与自定义API支持
  • 开源免费,社区活跃

缺点

  • 复杂断言需写代码扩展
  • 多概念组合学习曲线
  • 需自备各模型API密钥

相关角色任务