Ollama

Ollama

一条命令在本机下载并运行开源大模型

核心功能

Ollama 让开源大模型在 macOS、Windows、Linux 上开箱即用,一条 ollama run 即可完成下载与对话。它底层基于 llama.cpp,提供 11434 端口 REST API 和 Python、JS 库,也能一键接入 Claude Code 等工具。

功能亮点

开箱即跑

ollama run gemma4 会自动拉取权重并进入交互对话,无需配置

本地接口

本机 11434 端口暴露 /api/chat,像调云 API 一样调本地模型

交互式菜单

直接输入 ollama 会打开菜单,选模型或启动编码工具集成

云端直连

模型名加 :cloud 后缀就改用云端算力,本机跑不动也能用

逻辑图谱

    flowchart LR
    A[本地模型拉取] --> B[量化加载到内存]
    B --> C[本地推理服务]
    C --> D[API 与客户端调用]
    D --> E[离线私有运行]

适用 / 不适用场景

✓ 适用
  • 本地离线运行大模型
  • 隐私敏感数据不出本机
  • 开发者自部署与调试
  • 量化模型试用
  • 内网 Agent 后端
✗ 不适用
  • 无 GPU/内存不足的机器
  • 需要最新闭源旗舰模型
  • 零命令行基础的用户
  • 大规模并发线上服务(需配合编排)

自定义模型 / 模型接入

本地模型

本地运行时,可拉library现成模型,也能用Modelfile的FROM导入自有GGUF或Safetensors权重;内置/v1端点兼容OpenAI客户端。

接入方式
  • 拉取运行:ollama pull <model>后ollama run <model>
  • 导入GGUF:Modelfile写FROM /path/to/file.gguf
  • 导入Safetensors:FROM指向权重目录后ollama create
  • 量化:ollama create --quantize q4_K_M mymodel
  • OpenAI兼容:base_url设本机11434端口的/v1/路径
支持模型
GemmaLlama系列Mistral/MixtralPhi3Qwen3/Qwen3-VLgpt-oss自导入GGUF权重
bash
把自有GGUF权重(含国产模型量化文件)导入Ollama
新建Modelfile,内容为
FROM /path/to/file.gguf
在Modelfile所在目录构建并运行
ollama create my-model
ollama run my-model
若权重是Safetensors目录,FROM改为指向该目录
FROM /path/to/safetensors/directory
需要压缩体积时在构建阶段量化
ollama create --quantize q4_K_M mymodel
用OpenAI官方客户端接入本地服务
client = OpenAI(base_url='http://localhost:11434/v1/', api_key='ollama')

适用场景

• 在笔记本上离线试用开源模型
• 给内网应用提供本地推理接口
• 让编码工具改用本地模型省钱
• 隐私数据不出本机的问答场景

安装配置

bash
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows(PowerShell)
irm https://ollama.com/install.ps1 | iex

# Docker 官方镜像:ollama/ollama

# 客户端库
pip install ollama
npm i ollama

使用方法

bash
ollama                    # 打开交互菜单
ollama run gemma4         # 下载并与模型对话
ollama run gemma4:cloud   # 使用云端模型
/bye                      # 退出对话

curl http://localhost:11434/api/chat -d '{
  "model": "gemma4",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

关键指标

尚未核验对标产品,此处只列本工具自身指标,不做对比结论。

指标Ollama
价格免费
开源
上手难度入门

相关工具

同类工具

优点

  • 安装脚本一条命令搞定,模型下载与显存分配等细节全部自动处理
  • REST API 固定在 11434 端口,OpenAI 生态客户端稍作适配即可复用
  • 官方维护 ollama-python 与 ollama-js,业务代码里只需两三行调用
  • macOS、Windows、Linux 上命令完全一致,团队环境统一成本低

缺点

  • 输出质量与速度取决于本机显存内存,大参数模型在普通笔记本上很慢
  • 模型文件动辄数 GB 到数十 GB,磁盘占用与首次下载耗时都很可观
  • 对采样、量化等运行参数的精细控制不如直接使用 llama.cpp 灵活
  • 带 :cloud 的模型要联网走 Ollama 官方服务,已不属于纯本地运行

相关角色任务