Llama

Llama

Meta 开源大语言模型系列,覆盖多尺寸多模态旗舰模型

核心功能

Llama 是 Meta 的开放权重大模型系列。家族覆盖 Llama 2、3、3.1(405B)、3.2(视觉)与 Llama 4 Scout/Maverick 混合专家架构,上下文最高 10M token。官方提供 llama-models 下载 CLI 与 Hugging Face 权重。

功能亮点

开放权重

模型权重在社区许可下开放,可自由自托管部署。

多尺寸家族

从 1B 到 405B 及 MoE 架构,覆盖边缘到数据中心。

超长上下文

Llama 4 支持 1M 至 10M token,适配长文档与长程任务。

多模态能力

3.2 视觉与 4 系列支持图像输入与原生工具调用。

逻辑图谱

    flowchart LR
    A[本地/云端部署] --> B[Tokenizer 分词]
    B --> C[Transformer 推理]
    C --> D[自回归生成]
    D --> E[应用集成]

适用 / 不适用场景

✓ 适用
  • 私有化本地部署与离线场景
  • 微调定制行业专属模型
  • 科研实验与模型蒸馏
  • 对数据主权要求高的机构
✗ 不适用
  • 无 GPU 的轻量运行环境
  • 需要官方托管 API 的团队
  • 非技术用户开箱即用
  • 依赖实时联网检索的任务

自定义模型 / 模型接入

开源权重

Llama 即模型本身,权重免费:官网或 Hugging Face(meta-llama)下载,本地用 transformers、vLLM、Ollama 运行。

接入方式
  • llama-model download --source meta 下载权重
  • huggingface-cli download meta-llama 拉取
  • transformers 加载 Hugging Face 权重推理
  • vLLM 与 Ollama 等引擎本地运行
  • 云端厂商一键托管 API 化
支持模型
Llama 3.2 1B/3BLlama 3.3 70BLlama 3.1 8B-405BLlama 3.2-VisionLlama 4 ScoutLlama 4 Maverick
bash
安装依赖并下载权重
pip install llama-models
llama-model download --source meta --model-id Llama-4-Scout-17B-16E-Instruct

或用 Hugging Face 加载
huggingface-cli download meta-llama/Llama-4-Scout-17B-16E-Instruct --local-dir ./llama4

transformers 推理
from transformers import Llama4ForConditionalGeneration, AutoTokenizer

适用场景

• 私有化部署企业应用
• 本地推理与量化部署
• RAG 与多模态应用开发
• 学术研究与微调

安装配置

bash
pip install llama-models,然后 llama-model list 查看可用模型,llama-model download --source meta --model-id CHOSEN_MODEL_ID(需先在 llama.com 申请签名 URL);也可用 huggingface-cli download meta-llama/... 拉取权重

使用方法

下载权重后以 torchrun 运行官方推理脚本(Llama 4 全精度需至少 4 张 GPU),或用 FP8/Int4 量化降内存后单双卡运行;生产部署推荐借助 Llama Stack 工具链,或直接使用 transformers 加载 Hugging Face 权重。

关键指标

尚未核验对标产品,此处只列本工具自身指标,不做对比结论。

指标Llama
价格免费
开源
上手难度专家

相关工具

同类工具

优点

  • 权重开放生态庞大
  • 家族覆盖面广
  • 官方工具链完善
  • 社区适配广泛

缺点

  • 大尺寸模型硬件门槛高
  • 许可对商用有限制
  • 部分能力依赖配套工具