← 返回文章列表
2026-08-21

Ollama 入门教程:30 分钟在本地跑起 AI 助手(无需 GPU)

Ollama 入门教程:30 分钟在本地跑起 AI 助手(无需 GPU)

储备文章 · 国内站 tool-market.cn · 2026-08-21 初稿 · 星数经 GitHub API 核验 2026-08-21

直接答案:Ollama(178,000★,MIT)是本地运行 AI 模型最简单的方式。一条命令就能跑起来——无需 GPU,无需复杂配置。截至 2026-08-21,支持 200+ 模型,包括 Llama 3.2、Qwen 2.5、Phi-3,最小模型只需 4GB 内存。

为什么要本地跑模型

云端 AI 服务方便,但你的数据会经过别人的服务器。每条提问、每个文档,都通过他们的 API。个人使用没问题,但企业数据、敏感文档,或者单纯想保护隐私,本地运行更合适。

以前的门槛很高。你需要 GPU、CUDA 驱动、Python 知识和数小时的配置。Ollama 改变了这一切。它把一切打包——模型运行器、推理引擎、API——装进一个安装包里。一条命令,你就能和运行在自己机器上的 AI 聊天。

Ollama 是什么

Ollama 是一个模型运行器。它通过简单的命令行和 HTTP API 下载、存储和提供 AI 模型。底层使用 llama.cpp 进行推理,意味着它可以在消费级硬件上高效运行。

它本身不是模型。Ollama 不构建 AI——它运行别人构建的 AI 模型。模型来自 Meta、Google、Microsoft 和开源社区。Ollama 只是让运行变得更简单。

安装(三分钟)

Ollama 支持 Windows、macOS 和 Linux。安装包只有一个文件。

Windows:从 ollama.com 下载安装包,双击安装。打开终端(CMD 或 PowerShell),输入 ollama run llama3.2 回车。Ollama 会下载模型(约 4.7GB),启动服务,打开聊天界面。搞定。

macOS:同样的流程。macOS 安装包针对 Apple Silicon 优化,在 M 系列芯片上运行效率很高。

Linux:使用 ollama.com 的一行脚本安装,或用包管理器。Linux 版本也支持 Docker,适合服务器部署。

系统要求:4GB 内存,5GB 磁盘空间,无需 GPU。8GB 内存可跑 7B 模型,16GB 可跑 13B 模型。全部跑在 CPU 上——只是比 GPU 慢。

可用的模型

Ollama 支持 200+ 模型。最常见的几类:

通用对话:Llama 3.2(Meta)、Qwen 2.5(阿里)、Phi-3(微软)、Gemma 2(Google)。这些是主力模型——聊天、推理、通用任务都能胜任。

代码生成:Codestral(Mistral)、StarCoder 2、DeepSeek-Coder。针对编程任务优化。

视觉理解:Llama 3.2 Vision、Qwen 2.5 VL、Phi-3.5 Vision。不仅能处理文本,还能分析图片。

轻量快速:Llama 3.2 1B、Qwen 2.5 0.5B、Phi-3.5 Mini。可在手机和低配笔记本上运行,适合快速任务,复杂推理不行。

常用命令

命令行很简单。以下是实际会用到的命令:

# 运行模型
ollama run llama3.2

# 查看已安装模型
ollama list

# 拉取新模型
ollama pull qwen2.5:7b

# 删除模型
ollama rm llama3.2:1b

# 带提示词运行
ollama run llama3.2 "用一段话解释量子计算"

# 启动 API 服务
ollama serve

搭配 Web 界面

命令行功能强大,但对普通用户不太友好。Open WebUI(148,000★)给你的本地 Ollama 提供一个 ChatGPT 风格的界面。

安装只需一条 Docker 命令:

docker run -d -p 3000:8080 -v open-webui:/app/data --name open-webui ghcr.io/open-webui/open-webui:main

然后打开 http://localhost:3000,就有了完整的聊天界面。支持多模型、文件上传、代码执行、对话管理。全部本地运行,对话永不离开你的机器。

本地 LLM 的局限

Ollama 和本地模型很强大,但有局限。

速度:CPU 上,即使是 7B 模型也比云端 API 慢。现代笔记本上预期 10-30 tokens/秒,云端 GPU 可达 50-100+ tokens/秒。聊天够用,实时应用不够。

质量:最好的本地模型(Llama 3.2 70B、Qwen 2.5 72B)接近云端质量。但需要 40GB+ 内存和快 CPU。大多数用户跑 3B-7B 模型,够用但不完美。

知识截止:本地模型没有实时互联网访问。Ollama 模型只知道训练时的知识,不知道昨天发生的事。需要当前信息时,搭配搜索工具或云端模型。

上下文窗口:大多数本地模型支持 8K-32K tokens 上下文。足够多数任务,但长文档分析、代码库理解需要 128K+,本地运行成本高。

说实话

Ollama 是正确选择,如果你想要私密、离线的 AI,不按 token 付费。不是正确选择,如果你需要绝对最好的推理能力(云端模型仍领先)或实时互联网访问(本地模型需要工具支持)。

甜点区:用 Ollama 处理私密对话、文档分析、重复性任务,这些场景隐私重要。用云端模型处理复杂推理、当前信息、速度关键的场景。它们不是竞争对手,是互补工具。

FAQ

需要 GPU 吗? 不需要。Ollama 可在 CPU 上运行。GPU 会更快,但不是必须的。1B 和 7B 模型在核显或普通笔记本 CPU 上都能流畅运行。

需要多少内存? 1B 模型 4GB,3B-7B 模型 8GB,13B 模型 16GB,70B 模型 32GB+。大多数 8GB 内存笔记本可以跑 3B-7B 模型。

能配合 LangChain 等框架使用吗? 可以。Ollama 的 API 兼容 OpenAI。任何能连接 ChatGPT API 的工具都能用 Ollama。把地址改成 http://localhost:11434/v1 即可。

模型免费吗? 免费。Ollama 本身是 MIT 许可,完全免费。模型有不同许可证——多数宽松(MIT、Apache),部分仅限研究。商业用途前请检查具体模型的许可证。

Ollama 和 llama.cpp 有什么区别? llama.cpp 是底层推理引擎。Ollama 是 llama.cpp 的封装,增加了模型管理、命令行和 API。可以把 llama.cpp 当作引擎,Ollama 当作整车。

星数核验了吗? 是,GitHub API 2026-08-21 核验:ollama/ollama 178,000+★(MIT)、open-webui/open-webui 148,000+★。数字每天都在变,最新值以仓库为准。

相关工具