Ollama 部署 Qwen2.5 的那些坑,我踩了一遍

张老师194 阅读

上个月想在公司内网搭一个本地问答服务,选型的时候图省事直接用了 Ollama。机器是 4090 24G,想着跑 14B 量化模型应该没问题,结果从装好到能稳定对外提供服务,折腾了整整两天。

先说结论:Ollama 本身够简单,但它的默认行为有几个点特别坑人。

第一个坑是默认只监听 127.0.0.1。本地 curl 测试一切正常,一部署到服务器上从别的机器访问就 connection refused。查了半天才想起来要设环境变量:

Bash
export OLLAMA_HOST=0.0.0.0

这个不改,后面全白搭。

第二个坑是模型并发。默认情况下 Ollama 会根据显存自动决定能同时跑几个请求,但如果你同时跑 32B 和 7B 两个模型,它会把显存切来切去,推理延迟直接翻倍。后来我固定只加载一个模型,用 OLLAMA_NUM_PARALLEL=1 强制串行,体验反而稳定很多。

再就是拉模型慢的问题。国内拉 Qwen 的仓库经常卡在某个进度,我试了换镜像源、开代理,最后发现直接去 ModelScope 下载 GGUF 文件再 ollama create 反而最快:

Bash
ollama create qwen2.5:14b -f ./Modelfile

Modelfile 里写 FROM 本地路径就行。

最后提醒一下,ollama serve 最好用 systemd 托管,不然 ssh 断了服务就没了。用久了你会发现,真正花时间的不是装模型,而是调那些默认参数。

如果想跑更大的模型又嫌 4090 不够,建议直接看下一篇文章,聊聊 GGUF 量化。

评论0

还没有评论,来抢沙发~