核心功能
Ollama 让开源大模型在 macOS、Windows、Linux 上开箱即用,一条 ollama run 即可完成下载与对话。它底层基于 llama.cpp,提供 11434 端口 REST API 和 Python、JS 库,也能一键接入 Claude Code 等工具。
功能亮点
开箱即跑
ollama run gemma4 会自动拉取权重并进入交互对话,无需配置
本地接口
本机 11434 端口暴露 /api/chat,像调云 API 一样调本地模型
交互式菜单
直接输入 ollama 会打开菜单,选模型或启动编码工具集成
云端直连
模型名加 :cloud 后缀就改用云端算力,本机跑不动也能用
逻辑图谱
flowchart LR
A[本地模型拉取] --> B[量化加载到内存]
B --> C[本地推理服务]
C --> D[API 与客户端调用]
D --> E[离线私有运行]适用 / 不适用场景
✓ 适用
- 本地离线运行大模型
- 隐私敏感数据不出本机
- 开发者自部署与调试
- 量化模型试用
- 内网 Agent 后端
✗ 不适用
- 无 GPU/内存不足的机器
- 需要最新闭源旗舰模型
- 零命令行基础的用户
- 大规模并发线上服务(需配合编排)
自定义模型 / 模型接入
本地模型
本地运行时,可拉library现成模型,也能用Modelfile的FROM导入自有GGUF或Safetensors权重;内置/v1端点兼容OpenAI客户端。
接入方式
- 拉取运行:ollama pull <model>后ollama run <model>
- 导入GGUF:Modelfile写FROM /path/to/file.gguf
- 导入Safetensors:FROM指向权重目录后ollama create
- 量化:ollama create --quantize q4_K_M mymodel
- OpenAI兼容:base_url设本机11434端口的/v1/路径
支持模型
GemmaLlama系列Mistral/MixtralPhi3Qwen3/Qwen3-VLgpt-oss自导入GGUF权重
bash
把自有GGUF权重(含国产模型量化文件)导入Ollama 新建Modelfile,内容为 FROM /path/to/file.gguf 在Modelfile所在目录构建并运行 ollama create my-model ollama run my-model 若权重是Safetensors目录,FROM改为指向该目录 FROM /path/to/safetensors/directory 需要压缩体积时在构建阶段量化 ollama create --quantize q4_K_M mymodel 用OpenAI官方客户端接入本地服务 client = OpenAI(base_url='http://localhost:11434/v1/', api_key='ollama')
适用场景
• 在笔记本上离线试用开源模型
• 给内网应用提供本地推理接口
• 让编码工具改用本地模型省钱
• 隐私数据不出本机的问答场景
安装配置
bash
# macOS / Linux curl -fsSL https://ollama.com/install.sh | sh # Windows(PowerShell) irm https://ollama.com/install.ps1 | iex # Docker 官方镜像:ollama/ollama # 客户端库 pip install ollama npm i ollama
使用方法
bash
ollama # 打开交互菜单
ollama run gemma4 # 下载并与模型对话
ollama run gemma4:cloud # 使用云端模型
/bye # 退出对话
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'关键指标
尚未核验对标产品,此处只列本工具自身指标,不做对比结论。
指标Ollama
价格免费
开源是
上手难度入门
相关工具
同类工具
优点
- 安装脚本一条命令搞定,模型下载与显存分配等细节全部自动处理
- REST API 固定在 11434 端口,OpenAI 生态客户端稍作适配即可复用
- 官方维护 ollama-python 与 ollama-js,业务代码里只需两三行调用
- macOS、Windows、Linux 上命令完全一致,团队环境统一成本低
缺点
- 输出质量与速度取决于本机显存内存,大参数模型在普通笔记本上很慢
- 模型文件动辄数 GB 到数十 GB,磁盘占用与首次下载耗时都很可观
- 对采样、量化等运行参数的精细控制不如直接使用 llama.cpp 灵活
- 带 :cloud 的模型要联网走 Ollama 官方服务,已不属于纯本地运行