您的当前位置:首页>全部文章>文章详情

本地部署大模型:Ollama 从安装到对话

果子发表于:2026-10-03 15:01:52浏览:0次TAG:

一、为什么选择 Ollama

Ollama 是目前最流行的本地大模型运行工具之一:安装简单、命令直观、跨平台(Windows/macOS/Linux),内置大量开源模型(LLaMA、Qwen、DeepSeek、Gemma 等),还自带本地 API 服务。

二、安装

到官网下载对应系统的安装包,双击安装即可。安装完成后,在终端输入 ollama --version 验证是否成功。

三、拉取并运行模型

# 拉取模型(以 qwen2.5 为例)
ollama pull qwen2.5

# 进入对话模式
ollama run qwen2.5

第一次会自动下载模型文件(几个 GB,视模型大小而定)。之后就能直接在命令行里和模型对话了。

四、常用命令

  • ollama list:查看已下载的模型。
  • ollama run 模型名:开始对话。
  • ollama rm 模型名:删除模型。
  • ollama pull 模型名:下载模型。

五、通过 API 调用

Ollama 默认在 http://localhost:11434 提供与 OpenAI 兼容的接口:

curl http://localhost:11434/api/generate -d '{"model":"qwen2.5","prompt":"你好"}'

也可以用它提供的 /v1/chat/completions 端点,直接复用 OpenAI SDK。

六、硬件要求

7B 模型(4bit 量化)大约需要 4~8GB 显存/内存,普通电脑也能跑;更大的模型(13B、70B)则需要更多显存。没有独显时也可用 CPU 运行,只是速度较慢。

七、小结

Ollama 让「本地跑大模型」的门槛降到极低。数据不出本机、免费、可离线,非常适合学习、开发原型和隐私敏感场景。