Ollama 本地大模型部署完全教程:把 Llama3 / Qwen 跑在你自己的电脑上

适用人群:想免费、离线、隐私安全地用大模型的人;想在公司内网跑 AI 但不想数据出网的人;想折腾开源模型的玩家。 读完你能做到:装好 Ollama、用一行命令拉起 Llama 3 / 通义千问、在命令行和本地网页里对话、用 API 接自己的程序,并调好显存与性能。

一、原理背景

Ollama 是一个在本地运行大语言模型的工具,它把模型权重、运行环境、推理优化(基于 llama.cpp)打包好,让你不用懂 CUDA、不用配环境,一条命令就能把模型跑起来。

为什么要「本地跑」而不是用网页版 ChatGPT?三个理由:

  1. 免费且无限量:不用每次对话都算钱,本机算力随便用。
  2. 数据不出本机:聊天内容、公司文档全留在你电脑/服务器,适合敏感场景。
  3. 可私有化集成:Ollama 提供标准 API,能当成本地「模型服务」接进 Dify、自建客服、代码助手(见本系列 Cursor / Dify 教程)。

Ollama 支持上百种开源模型:Meta 的 Llama 3、阿里通义千问 Qwen、智谱 GLM、Mistral、Phi-3 等。它默认用 GGUF 量化格式,把几十 GB 的模型压缩到几 GB,让消费级显卡甚至纯 CPU 也能跑。

二、分步操作

步骤 1:安装 Ollama

  • mac

🔒 付费文档

支付 5 积分后即可解锁全部内容