核心功能
以测试驱动方式开发LLM应用:用YAML声明式配置测试用例与断言,自动对比多提示词×多模型的输出矩阵。支持60+模型供应商、本地模型与自定义API,内置缓存与并发加速,可集成GitHub Action进CI/CD,并内置自动化红队扫描安全漏洞。
功能亮点
矩阵对比视图
多提示词×多模型交叉评测输出矩阵,快速定位最优组合
红队安全扫描
自动扫描50+漏洞类型,覆盖越狱注入与合规风险
本地私有运行
评测在本机执行直连LLM,数据不出本地
缓存并发加速
内置缓存与并发、热重载,评测反馈毫秒级
自定义模型 / 模型接入
多厂商支持
原生支持OpenAI等60+供应商与Ollama本地模型,可用环境变量或config.apiBaseUrl接入任意OpenAI兼容端点。
接入方式
- OPENAI_API_KEY/ANTHROPIC_API_KEY 环境变量认证
- providers 配置:- openai:chat:gpt-5.4
- 自定义端点:config.apiBaseUrl + apiKey
- 本地模型:- ollama:chat:llama3.3
- 自定义脚本:- file://custom_provider.py
支持模型
openai:chat:gpt-5.4claude-opus-4-6gemini-2.5-proollama:chat:llama3.3azureopenai:自定义部署名deepseek:deepseek-r1
bash
在 config 中加 OpenAI 兼容端点即可换国产/自建模型:
providers:
- id: openai:chat:qwen-max
config:
apiBaseUrl: https://dashscope.aliyuncs.com/compatible-mode/v1
apiKey: YOUR_KEY
本地可用 Ollama:
- id: ollama:chat:qwen2.5适用场景
• 上线前提示词与模型选型对比
• LLM应用安全漏洞自动扫描
• CI流水线自动回归测试
• RAG管线事实性与相关性评估
安装配置
bash
npm install -g promptfoo 不装全局也可:npx promptfoo@latest init --example getting-started
使用方法
在 promptfooconfig.yaml 中声明 prompts、providers 与 tests,运行 promptfoo eval 执行评测,promptfoo view 打开网页对比结果,promptfoo redteam run 执行红队扫描。
关键指标
尚未核验对标产品,此处只列本工具自身指标,不做对比结论。
指标promptfoo
价格免费
开源是
上手难度入门
Token 消耗中
相关工具
优点
- 纯本地运行,数据私有安全
- 声明式配置,一次定义多次运行
- 60+供应商与自定义API支持
- 开源免费,社区活跃
缺点
- 复杂断言需写代码扩展
- 多概念组合学习曲线
- 需自备各模型API密钥