一个 GGUF 文件,怎么变成你能对话的本地助手?
它不会自己动起来。你要先确认服务,再写 Modelfile,让 Ollama 加载权重,最后用命令行和标准 HTTP 接口两条通道验证。下面 6 个动画关卡,带你把断网教室里的模型跑通!
M1
部署地图:从硬盘权重到对话助手
不要一上来就点软件。先看清数据去哪儿、谁在接手、哪一步会失败。下面这条链路就是今天的地基。
🛰️ 本地模型链路动画
GGUF 权重停在硬盘里不会说话;Modelfile 告诉 Ollama 如何装配它;Ollama 加载后才把能力暴露给命令行和兼容接口。点「播放完整链路」,看数据包经过每一站。
等待出发
链路锚点服务、权重、模型名是三件最容易被忽略的事;后面每一关都在检查其中一件。
M2
Modelfile:给裸权重写装配说明书
GGUF 只是模型本体。Ollama 还要知道权重在哪、风格多稳定、该用谁的身份回答。
📄 三行配置,三件事
FROM./models/Qwen3-8B-Q4_K_M.gguf
PARAMETERtemperature 0.7
PARAMETERnum_ctx 4096
SYSTEM"""你是中文教学助手"""
FROM 指向本地 GGUF 权重。路径相对 Modelfile 所在目录,文件名不能有中文或空格。
FROM 权重
PARAMETER
SYSTEM
Ollama
装配锚点文件名必须是 Modelfile;写成 Modelfile.txt,Ollama 不会把它当说明书。
M3
加载与命令行验证
导入成功不是“命令没报错”,而是模型真的注册进 Ollama,并能连续回答。
⚡ 硬盘到内存实验
GGUF
硬盘权重➜
?
已注册模型$ ollama -v
ollama version is 0.x.x
$ curl http://localhost:11434
Ollama is running
观察:如果只看“命令执行了”就以为成功,可能漏掉内存不足或模型名写错。一定要让 `ollama list` 和对话结果一起作证。
命令行锚点`ollama list` 里的名字,就是后面所有调用必须使用的名字。
M4
API 信使:把请求送到模型
命令行像私人对话,API 才证明其他应用也能按标准协议调用它。
✉️ OpenAI 兼容接口实验
先选一个模型名,再发送请求。故意试一次 `qwen3:8`,看错误长什么样;再改回 `qwen3:8b`,确认恢复正常。
🧑💻
应用请求🦙
Ollama🧠
qwen3:8b✉️
请求关键点
POST /v1/chat/completions
{ "model": "qwen3:8b" }
{ "model": "qwen3:8b" }
响应检查
等待发送请求…
API 锚点HTTP 不报错、JSON 有回复、model 字段一致,三项都要检查。
M5
故障门诊:让报错变成线索
不要先重装。先读报错,再判断是服务、路径、模型名还是能力文件断了。
🚑 五个常见病例
每张病例卡选择最直接的检查动作。全对后点亮 M5。
🃏
终局闪卡:6 张牌验收你的本节课
先回忆,再点击翻面。全部翻开后点亮终局关。
📦 课后任务卡
【任务】本地部署链路记录
- 记录 服务确认、Modelfile、ollama list、命令行回复、API 响应五步证据;
- 写清一次你遇到的真实报错:现象、判断依据、修复动作、最终结果;
- 高配机器可追加 qwen3-vl:8b 的图片理解验证;
- 下节课带到 WorkBuddy 接入练习中继续使用。
🎉 6 关全部点亮!你已经把 GGUF 权重一路接成可用的本地模型服务。带着这份部署记忆,下一课就能少踩很多坑。