Ollama 魔搭社区超简单的大模型本地部署方案

[!info] 阅读导览
1.1 开源小模型部署的优势 → 1.2 两种主流部署方法 → 1.3 显存需求快速估算 → 1.4 参数量、量化与位宽概念(魔搭社区实操) → 第 2 章 Ollama 安装与模型拉取实战

1. 小参数模型本地部署概述

随着大模型的不断发展,小参数模型的能力也在逐渐进步。就拿阿里开源的 Qwen3 来说,其中既有负责多模态的 Qwen3-VL 系列,也有专为代码优化的 Qwen3-Coder 系列等,这些不同使用场景中都有开源的小参数模型,方便我们本地部署。

1.1. 开源小模型部署的优势

  • 数据私有化:数据不出网,适合政企、学习或医院等对隐私要求高的场景。
  • 无网络依赖:离线即可使用,不依赖网络。
  • 成本大幅下降:本地推理成本降到最低(电费),比调用大模型 API 要省钱太多了。
  • 微调门槛低:小模型比起大模型所需的庞大的资源来说更适合微调,小模型微调之后在特定领域的能力可以媲美甚至超过大模型。(微调可以理解为:用单独领域的数据集对模型再次训练使其专业化)

1.2. 本地部署方法概述

在应用落地方面,比如一些 Agent 应用的落地,更离不开本地模型的部署。那说了这么多,如何正确地在本地部署一个大模型呢?我这里只推荐两种方法,这两种方法也是当下比较正确和常用的:

  • 通过 Ollama 工具快捷部署
  • 通过 vLLM 高性能推理框架部署

本篇文章先讲通过 Ollama 部署本地模型的方法。

1.3. 模型显存需求估算

这里我给大家一个可以快速估算的公式(最好自己电脑显存比这个结果多一些),如下图:

显存需求(GB)≈(参数量 P × 位宽 B)/ 8 × 1.2

比如下面这个模型,部署它大概需要的显存的计算逻辑为:(8×8)/8×1.2 = 9.6G,也就是 3060 12G 显卡就可以跑,而且这个多模态的小模型能力也是相当不错。

1.4. 模型参数量与位宽概念

1.4.1. 魔搭社区简介

链接:https://www.modelscope.cn/home

我们可以打开国内的模型市场——魔搭社区,然后搜索 Qwen3。

可以看到这些都有一个 xxB 的相关字样,比如 30B、8B、235B 这些字样,这些指的就是参数量,参数量越大就代表其掌握的知识越多,同时需要的显存越大!就比如图片上那个 235B 的模型需要的显存是 500 多 G。这么大的显存,部署成本是相当大的。

我们点进去一个 Qwen3-32B 的模型中,在右侧部分可以看到这个模型的系谱,其中可以找到量化这一个分类。

点击这个分类,可以看到当前模型的量化版本:

  • 所谓量化其实就是指的是让模型尽量不变笨的情况下,节省部署显存。
    • 比如刚刚说的 235B 的模型经过 4bit 量化后,需要的显存就从 500G 降为了 150G 左右。

通过上图圈起来的部分,可以看到 32B 参数的 Qwen3 文本对话模型的名称中包含 AWQ、FP8、GGUF、GPTQ 这些模型标识,对应的含义大家可以看下面这幅图:

其中:

  • AWQ 是阿里最推荐的量化方法,你可以看到 AWQ 量化后的模型下载量一般都是最多的。
  • 而 GGUF 的模型格式则是我们接下来要讲的 Ollama 主要支持的模型格式。这里要注意 Ollama 主要支持的是 GGUF 格式,而 vLLM 可以支持绝大多数的模型格式,所以企业应用中大都是使用 vLLM 部署模型,而 Ollama 多用于个人应用。
格式 / 量化方法 位宽 说明
AWQ 4bit(默认) 阿里最推荐,量化后下载量通常最多
GGUF 4bit(默认) Ollama 主要支持的模型格式
GPTQ-Int4 4bit 经典 GPTQ 量化
GPTQ-Int8 8bit 精度更高、显存占用更大
FP8 8bit 8bit 浮点格式

下面这些参数就代表了模型的位宽,比如 FP8 就是 8bit 的,GPTQ-Int4 就是 4bit 的,同理 GPTQ-Int8 也是 8bit 的,INT4 就是 4bit 的。默认的 AWQ 和 GGUF 方法则是 4bit 的位宽。

可能第一时间有点不好理解,所以我给大家总结一下:显存资源有限情况下,一般 vLLM 框架来说使用 AWQ 量化后即可,但如果你要使用 Ollama 就用 GGUF 格式的。

这时候大家根据上面的公式再次估算一次下面的模型需要的显存是多少呢?

模型的参数是 8B,所以 P 就是 8,GGUF 默认 Ollama 拉取的是 4bit 量化的版本,所以 Q 就是 4,那么最后的显存所需大概就是 4.8G。

2. Ollama 部署教程

我们拿装有 N 卡的 Windows 来举例子,Mac 和 Linux 的安装方法都差不多,大家可以查看官网,Ollama 的官网如下:

https://ollama.com/download

安装 Ollama 之前你需要确保你的 N 卡有英伟达的 CUDA 驱动,可以运行 nvidia-smi 来查看是否有类似下面的输出:

nvidia-smi

如果没有的话需要到官方下载最新的显卡驱动,没有 GPU 也没关系,因为 Ollama 可以将模型推理放在 CPU 上。驱动下载地址:

https://www.nvidia.cn/software/nvidia-app/

随后打开 Ollama 官网后,找到你要的版本点击下载即可。

你需要在 C 盘留足够的空间,因为 Ollama 默认会安装在 C 盘,模型文件也默认存放在 C 盘。当你安装好之后,可以输入 ollama -v 来查看是否安装成功,出现版本号就是安装成功了。

ollama -v

2.1. 设置模型存储路径

安装好了之后,我们需要设置一下模型文件默认存放的路径,不然你不设置他就把模型全放在 C 盘了。我们使用下面的命令设置 Ollama 的模型安装路径(需要先创建对应文件夹):

setx /M OLLAMA_MODELS "D:\Ollama\models"

或者通过 Ollama 最新版的前端界面设置模型安装路径也可以。

注意运行之后需要关闭 Ollama 后重新开一个命令行窗口,这样才会生效。

模型的安装也很简单,魔搭社区就支持 Ollama 的命令行一键下载模型,所以我们找一个 GGUF 格式的模型,复制这个网址。

然后运行下面的命令:

这里要注意的 Ollama run 后面的模型地址是我们刚刚复制的地址去掉 http:// 以及 models/ 的结果(对于 Qwen 来说)。

flowchart LR
    A[下载安装 Ollama<br>nvidia-smi 确认驱动] --> B[设置模型存储路径<br>setx /M OLLAMA_MODELS]
    B --> C[魔搭社区选 GGUF 模型<br>复制模型地址]
    C --> D[去掉 http:// 和 models/ 前缀<br>ollama run 拉取模型]
    D --> E[本地提问 / 前端界面<br>Open WebUI 可视化]

在任务管理器中可以看到,模型空闲时 CPU 和 GPU 占用都很低:

AI 在推理的过程中,可以看到 CPU 和 GPU 的使用率都明显地变高了。

除了在命令行通过 ollama run 进行模型提问之外,你可以直接在 Ollama 的前端界面中对自己部署的本地模型进行提问,当然你也可以使用 Open WebUI 等工具作为本地模型的可视化界面:

如果你想让 Ollama 下载不是默认 4bit 量化的模型的话,其实也很简单,还是在魔搭社区 GGUF 格式模型页面,可以看到不同的量化情况。

图片.png

比如我想让 Ollama 拉取 8bit 量化的,就在模型拉取地址中加上 :Q8_0 即可,就像下面这样:

图片.png

拉取命令为:

ollama run modelscope.cn/Qwen/Qwen3-8B-GGUF:Q8_0

至此,你已在本地完成 AI 部署,实现离线推理。但 Ollama 还能更强大,比如部署多模态模型、通过接口开放模型服务、灵活控制 CPU/GPU 分层加载、调整上下文与批量参数等。但是没关系,一切都是要循序渐进的来,这些我们在后续的文章会说。

[!success] 核心要点

  • 两种主流部署:Ollama(个人应用,GGUF 格式)与 vLLM(企业应用,支持绝大多数模型格式)
  • 显存估算公式:(参数量 × 位宽)/ 8 × 1.2,例如 8B 模型 4bit 量化 ≈ 4.8G 显存
  • 量化思路:显存有限优先 AWQ(vLLM)或 GGUF(Ollama);默认 4bit,可在地址后加 :Q8_0 拉取 8bit 版本
  • 关键步骤:nvidia-smi 确认驱动 → 安装 Ollama → setx /M OLLAMA_MODELS 改模型路径(需重开命令行生效)→ 魔搭复制地址并去掉前缀后 ollama run 拉取
  • 使用方式:命令行 ollama run、Ollama 前端界面、Open WebUI 可视化