本地部署大模型:Ollama 从安装到对话
果子发表于:2026-10-03 15:01:52浏览:0次
一、为什么选择 Ollama
Ollama 是目前最流行的本地大模型运行工具之一:安装简单、命令直观、跨平台(Windows/macOS/Linux),内置大量开源模型(LLaMA、Qwen、DeepSeek、Gemma 等),还自带本地 API 服务。
二、安装
到官网下载对应系统的安装包,双击安装即可。安装完成后,在终端输入 ollama --version 验证是否成功。
三、拉取并运行模型
# 拉取模型(以 qwen2.5 为例)
ollama pull qwen2.5
# 进入对话模式
ollama run qwen2.5第一次会自动下载模型文件(几个 GB,视模型大小而定)。之后就能直接在命令行里和模型对话了。
四、常用命令
ollama list:查看已下载的模型。ollama run 模型名:开始对话。ollama rm 模型名:删除模型。ollama pull 模型名:下载模型。
五、通过 API 调用
Ollama 默认在 http://localhost:11434 提供与 OpenAI 兼容的接口:
curl http://localhost:11434/api/generate -d '{"model":"qwen2.5","prompt":"你好"}'也可以用它提供的 /v1/chat/completions 端点,直接复用 OpenAI SDK。
六、硬件要求
7B 模型(4bit 量化)大约需要 4~8GB 显存/内存,普通电脑也能跑;更大的模型(13B、70B)则需要更多显存。没有独显时也可用 CPU 运行,只是速度较慢。
七、小结
Ollama 让「本地跑大模型」的门槛降到极低。数据不出本机、免费、可离线,非常适合学习、开发原型和隐私敏感场景。

