Weights & Biases

Weights & Biases

实验追踪 + LLM 应用可观测的一体平台

提示工程AI 开发免费增值闭源

核心功能

Weights & Biases 是 AI 开发平台,传统强项是机器学习实验追踪与模型注册。Weave 把同一套能力延伸到 LLM 应用:追踪每次调用、检索与智能体步骤,做评估、打分与生产监控,并支持护栏拦截有害输出。2025 年 5 月被 CoreWeave 收购,对个人开发者免费。

功能亮点

实验追踪

记录超参、指标与模型血缘

Weave 追踪

端到端捕获 LLM 调用与步骤

评估打分

自定义评分与 LLM 裁判

生产护栏

拦截提示注入与有害输出

适用场景

• 训练实验对比与复现
• LLM 应用调试与评估
• 生产质量与成本监控

安装配置

bash
pip install wandb 后 wandb.login() 启用实验追踪;用 weave.init("项目名") 与 @weave.op 装饰器为函数加追踪,在 wandb.ai 看板查看。

使用方法

bash
1) pip install wandb weave 并登录,wandb.init 记录训练超参与指标
2) 在 LLM 应用里 weave.init 并用 @weave.op 装饰调用函数
3) 每个请求的输入、输出与元数据自动入库,在 Weave 看板看调用链
4) 用评估集跑评分函数或 LLM-as-judge,对比不同提示词与模型
5) 配置 Guardrails 拦截提示注入,生产监控里看成本、延迟与质量回归

关键指标

尚未核验对标产品,此处只列本工具自身指标,不做对比结论。

指标Weights & Biases
价格免费增值
开源
上手难度进阶

相关工具

优点

  • 实验追踪能力业界标杆
  • Weave 在已有工作流上无缝叠加
  • 可视化与协作强,跨职能友好
  • 个人免费,学术永久免费

缺点

  • 纯 LLM 场景功能略重偏复杂
  • 按席位与用量计费,大团队偏贵
  • 无现成开源,自托管仅企业
  • 学习曲线对非 ML 团队较陡