🤖HermesBlog
Hermes 实战教程 · 第12篇2026/8/9· Easy Understand Hermes Agent

实战:Mac 上跑本地大模型

Hermes 实战教程第12篇:Mac 本地模型。免费离线用 AI。

这篇教程教你如何在 Mac 上搭建一个完全本地、免费、私密的 AI 大模型服务器,并把它接入 Hermes Agent 使用。


为什么要在本地跑大模型?

想象一下:你家的电脑就是一个小型“AI 工厂”,所有对话数据都留在自己家里,不经过任何云端服务器。好处有三:隐私安全(数据不出门)、零成本(不用按 token 付费)、速度快(M 系列芯片跑起来飞快)。


第一步:选一个“发动机”(后端)

本地跑模型有两种主流方案,就像汽车有汽油版和电动版:

方案 安装方式 强项 模型格式
llama.cpp 终端一条命令 响应快、省内存 GGUF
omlx 图形界面 App 生成速度快 MLX

新手推荐用 llama.cpp,它更通用、教程多、出问题好解决。

⚠️ 注意:本教程只适用于 Apple Silicon 芯片(M1 及以后版本)。Intel 版 Mac 也能跑,但速度会慢很多。


第二步:选一个“大脑”(模型)

推荐 Qwen3.5-9B,相当于一个聪明且不占地方的“小脑瓜”:

  • 文件大小约 5.3 GB,占用内存约 10 GB
  • 在 8GB 内存的 Mac 上也能跑
  • 推理能力强,日常对话、写代码都够用

内存黄金法则:模型大小 + 上下文缓存 = 总内存需求。9B 模型本身约 5GB,加上 128K 上下文缓存约 4-5GB,总共 10GB 左右。


第三步:安装并启动(llama.cpp 方案)

1. 安装引擎

打开终端(Terminal),输入:

brew install llama.cpp

2. 下载模型

brew install huggingface-cli
huggingface-cli download unsloth/Qwen3.5-9B-GGUF Qwen3.5-9B-Q4_K_M.gguf --local-dir ~/models

💡 如果下载报 401/404 错误,先运行 huggingface-cli login 登录账号。

3. 启动服务器

llama-server -m ~/models/Qwen3.5-9B-Q4_K_M.gguf \
  -ngl 99 \
  -c 131072 \
  -np 1 \
  -fa on \
  --cache-type-k q4_0 \
  --cache-type-v q4_0 \
  --host 0.0.0.0

关键参数解释(记不住没关系,直接复制用就行):

  • -ngl 99:把模型全部丢给 GPU 加速
  • -c 131072:上下文窗口 128K tokens(内存不够就调小)
  • -fa on:开启闪存注意力,省内存又提速
  • --cache-type-k/v q4_0内存节省神器,把缓存压缩到 4-bit,能省约 75% 内存!

看到 server is listening on http://0.0.0.0:8080 就说明成功了。

4. 测试一下

curl -s http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "Qwen3.5-9B-Q4_K_M.gguf", "messages": [{"role": "user", "content": "你好!"}], "max_tokens": 50}'

能返回文字就说明一切正常!


第四步:接入 Hermes Agent

服务器跑起来后,在终端输入:

hermes model

选择 Custom endpoint,然后填上:

  • Base URLhttp://localhost:8080
  • 模型名Qwen3.5-9B-Q4_K_M.gguf

搞定!现在 Hermes 的所有对话都走本地模型了。


如果超时怎么办?

Hermes 会自动识别本地地址并放宽超时限制。如果还是超时(比如大上下文处理慢),在 .env 文件里加一行:

HERMES_STREAM_READ_TIMEOUT=1800

把超时从默认 120 秒延长到 30 分钟,足够应付绝大多数情况。


小结

本地跑大模型其实不难:装引擎 → 下模型 → 启动服务 → 接入 Hermes,四步搞定。llama.cpp 方案响应快、省内存,是目前最稳妥的选择。跑通之后,你就拥有一个完全私密、免费、随时可用的 AI 助手了!

下篇预告:如何给本地模型装上“记忆”和“工具”,让它从一个聊天机器人升级成能帮你干活的全能助理。敬请期待!

📖 官方文档

本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/configuring-models