实战:Mac 上跑本地大模型
Hermes 实战教程第12篇:Mac 本地模型。免费离线用 AI。
这篇教程教你如何在 Mac 上搭建一个完全本地、免费、私密的 AI 大模型服务器,并把它接入 Hermes Agent 使用。
为什么要在本地跑大模型?
想象一下:你家的电脑就是一个小型“AI 工厂”,所有对话数据都留在自己家里,不经过任何云端服务器。好处有三:隐私安全(数据不出门)、零成本(不用按 token 付费)、速度快(M 系列芯片跑起来飞快)。
第一步:选一个“发动机”(后端)
本地跑模型有两种主流方案,就像汽车有汽油版和电动版:
| 方案 | 安装方式 | 强项 | 模型格式 |
|---|---|---|---|
| llama.cpp | 终端一条命令 | 响应快、省内存 | GGUF |
| omlx | 图形界面 App | 生成速度快 | MLX |
新手推荐用 llama.cpp,它更通用、教程多、出问题好解决。
⚠️ 注意:本教程只适用于 Apple Silicon 芯片(M1 及以后版本)。Intel 版 Mac 也能跑,但速度会慢很多。
第二步:选一个“大脑”(模型)
推荐 Qwen3.5-9B,相当于一个聪明且不占地方的“小脑瓜”:
- 文件大小约 5.3 GB,占用内存约 10 GB
- 在 8GB 内存的 Mac 上也能跑
- 推理能力强,日常对话、写代码都够用
内存黄金法则:模型大小 + 上下文缓存 = 总内存需求。9B 模型本身约 5GB,加上 128K 上下文缓存约 4-5GB,总共 10GB 左右。
第三步:安装并启动(llama.cpp 方案)
1. 安装引擎
打开终端(Terminal),输入:
brew install llama.cpp
2. 下载模型
brew install huggingface-cli
huggingface-cli download unsloth/Qwen3.5-9B-GGUF Qwen3.5-9B-Q4_K_M.gguf --local-dir ~/models
💡 如果下载报 401/404 错误,先运行
huggingface-cli login登录账号。
3. 启动服务器
llama-server -m ~/models/Qwen3.5-9B-Q4_K_M.gguf \
-ngl 99 \
-c 131072 \
-np 1 \
-fa on \
--cache-type-k q4_0 \
--cache-type-v q4_0 \
--host 0.0.0.0
关键参数解释(记不住没关系,直接复制用就行):
-ngl 99:把模型全部丢给 GPU 加速-c 131072:上下文窗口 128K tokens(内存不够就调小)-fa on:开启闪存注意力,省内存又提速--cache-type-k/v q4_0:内存节省神器,把缓存压缩到 4-bit,能省约 75% 内存!
看到 server is listening on http://0.0.0.0:8080 就说明成功了。
4. 测试一下
curl -s http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "Qwen3.5-9B-Q4_K_M.gguf", "messages": [{"role": "user", "content": "你好!"}], "max_tokens": 50}'
能返回文字就说明一切正常!
第四步:接入 Hermes Agent
服务器跑起来后,在终端输入:
hermes model
选择 Custom endpoint,然后填上:
- Base URL:
http://localhost:8080 - 模型名:
Qwen3.5-9B-Q4_K_M.gguf
搞定!现在 Hermes 的所有对话都走本地模型了。
如果超时怎么办?
Hermes 会自动识别本地地址并放宽超时限制。如果还是超时(比如大上下文处理慢),在 .env 文件里加一行:
HERMES_STREAM_READ_TIMEOUT=1800
把超时从默认 120 秒延长到 30 分钟,足够应付绝大多数情况。
小结
本地跑大模型其实不难:装引擎 → 下模型 → 启动服务 → 接入 Hermes,四步搞定。llama.cpp 方案响应快、省内存,是目前最稳妥的选择。跑通之后,你就拥有一个完全私密、免费、随时可用的 AI 助手了!
下篇预告:如何给本地模型装上“记忆”和“工具”,让它从一个聊天机器人升级成能帮你干活的全能助理。敬请期待!
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/configuring-models