提示工程

Prompt Engineering

什么是 提示工程?

提示工程是设计和优化 AI 提示词的技术。通过精心设计的提示词,可以引导 AI 模型生成更准确、更有用的输出。

核心特点

  • 提升输出质量
  • 减少幻觉
  • 控制输出格式
  • 优化成本

应用场景

  • 对话系统优化
  • 内容生成
  • 代码生成
  • 数据分析

技术架构

关键组件

Prompt Template

提示词模板

Few-shot Examples

少样本示例

Chain of Thought

思维链

Output Parser

输出解析器

相关技术对比

提示工程 vs 直接提问

优点

  • ✓ 简单
  • ✓ 快速

缺点

  • ✗ 输出不稳定
  • ✗ 质量差

提示工程 vs 微调模型

优点

  • ✓ 效果好
  • ✓ 稳定

缺点

  • ✗ 成本高
  • ✗ 需要数据

提示工程 工具

21 个工具

promptfoo

promptfoo

开源

开源LLM提示词评测与回归测试CLI,支持多模型对比与红队安全扫描

LLM评测提示词工程红队演练回归测试开源
LangSmith

LangSmith

LangSmith: Tracing:端到端调用链可视化。

观测评测
Helicone

Helicone

一行代理即可获得 LLM 追踪、缓存与成本分析

LLM 可观测AI 网关成本分析
Langfuse

Langfuse

开源

Langfuse: Tracing:生成/检索全链路追踪与成本统计。

开发LLM
Ragas

Ragas

开源

开源RAG评估框架,忠实度与上下文精度等参考指标覆盖全链路

RAG评估LLM评测开源
OpenAI Evals

OpenAI Evals

开源

OpenAI Evals: 基准注册库(Registry):大量已注册 eval(按 YAML 声明、数据存于 `evals/registry/data/`)。

提示工程评测观测
DeepEval

DeepEval

开源

像 pytest 一样给 LLM 应用写 50+ 评估指标

LLM 评估测试框架CI 质量门禁
TruLens

TruLens

开源

开源LLM应用评估与追踪框架,OTel原生,Agent与RAG专项评测

LLM评估追踪RAG
OpenTelemetry

OpenTelemetry

开源

CNCF开源可观测性标准,统一采集追踪、指标与日志三类信号

可观测性追踪指标
OpenAI Cookbook

OpenAI Cookbook

开源

OpenAI Cookbook:OpenAI Cookbook

提示工程评测观测
Anthropic Cookbook

Anthropic Cookbook

开源

Anthropic Cookbook(Claude Cookbooks):Anthropic Cookbook(Claude Cookbooks)

提示工程评测观测
PromptPerfect

PromptPerfect

一键把草稿提示词改写成更清晰高效的版本

提示词工程提示词优化多模型
FlowGPT

FlowGPT

FlowGPT: Prompt 库:分类检索与分享提示词。

提示工程评测观测
PromptBase

PromptBase

买卖经过审核的 ChatGPT/Midjourney 等提示词

提示词市场买提示词创作者变现
OpenRouter

OpenRouter

一个 API Key 调用 300+ 模型,按量计费无订阅

模型网关API 聚合多模型
Together AI

Together AI

托管开源与开放权重模型,按 token 计费

开源模型推理平台按量计费
OpenAI Playground

OpenAI Playground

OpenAI官方调试台,调参对话并一键生成调用代码

OpenAI提示词调试API测试
Anthropic Console

Anthropic Console

Claude官方开发者控制台,Workbench调参评估一键出码

Claude提示词调试API测试
PromptLayer

PromptLayer

带版本、发布标签与评估的提示词 CMS

提示词管理LLM 可观测评估
Humanloop

Humanloop

提示词管理+评估+监控的企业级平台(已停服)

提示词管理LLM 评估已停服
Weights & Biases

Weights & Biases

实验追踪 + LLM 应用可观测的一体平台

实验追踪LLM 可观测MLOps

当前展示精选 Top 20(已验证 + 高评分优先)