我第一台跑 Ollama 的機器是 16GB 的 Mac mini M2。教學寫著「一條指令拉模型、本機就能聊」,我興沖沖執行了 ollama run llama3.1:8b,前五分鐘還挺順,第十分鐘風扇起飛,活動監視器裡記憶體壓力條直接變紅,連切個瀏覽器分頁都像在拖水泥。
後來我才明白:跑 Ollama 選 16G、24G 還是 32G,不是「越大越好」,而是「你的模型 + 上下文 + 背景程式」能不能在統一記憶體裡塞得下。 這篇把我踩過的坑、以及幫朋友選型時用的判斷框架都攤開,幫你少花冤枉錢、少熬幾個通宵。
為什麼記憶體比「有沒有獨顯」更先卡脖子?
在 Windows 遊戲本上,大家習慣看「顯存夠不夠」;在 Apple Silicon Mac 上,CPU 和 GPU 共享同一塊統一記憶體,Ollama 載入的模型權重、推理時的 KV Cache、以及 macOS 自己的快取,全都從這一塊裡劃。官方文件與社群實測都指向同一結論:模型越大、上下文越長,佔用的記憶體越多,和你在活動監視器裡看到的「記憶體」是同一池子。
很多人踩的第一個坑是:只看模型參數量,不看量化格式。 同樣是 7B,Q4_K_M 可能只要 4~5GB,Q8 或 FP16 可能直接翻倍。第二個坑是忽視「系統常駐」——macOS、瀏覽器、通訊軟體、IDE 輕鬆吃掉 4~6GB,16GB 機器留給模型的其實只剩 10GB 左右。第三個坑更隱蔽:以為 OOM 會直接報錯,實際上常常是「能跑但極慢」。 記憶體不夠時 macOS 會瘋狂 swap 到 SSD,tokens/s 從 30 掉到 3,你以為模型不行,其實是機器在拿硬碟當記憶體用。
16GB:能玩,但別當「正式環境」
16GB 不是完全不能跑 Ollama——小模型 + 短對話 + 關掉多餘背景,體驗可以接受。適合的場景很具體:3B~7B 的 Q4 模型、單次問答與郵件草稿、不接 Agent、不掛多個模型、上下文不超 16K。
我踩過的典型血淚場景:16GB 上同時開 Chrome(20+ 分頁)、VS Code、Docker Desktop,再跑 8B——不是當機,是「假死式流暢」。關掉 Docker 和一半分頁後速度立刻回來。
16GB 底線建議: 把 Ollama 當輕量助手,別指望穩定跑 14B 以上,更別在本機疊整套 Agent 棧。若 VPS 上已搭 Gateway 要對接家裡 Ollama,16GB 本機適合當小模型上游——可參考 OpenClaw 對接內網 Ollama 的排障指南。
24GB:2026 年個人開發者的「甜點位」
若只能選一檔長期用 Ollama,24GB 是我最常推薦給個人開發者的一檔。 7B~8B 可常駐記憶體並留足系統與 IDE 空間;14B Q4 多數場景能跑,寫程式、總結長文明顯優於 7B;8K~16K 上下文時 KV Cache 仍可控;還能同時跑 Ollama 與輕量向量庫或單一 Docker 服務。
24GB 不是讓你去硬啃 70B,而是在品質與成本之間取得平衡。很多人忽略:Apple 記憶體出廠焊死、不能後加,買 16GB 想「以後不夠再說」在 Mac 上行不通;24GB 是給未來一年模型升級的緩衝。
32GB:Agent、多模型與「我不想再算記憶體」
32GB 適合把本地 LLM 當基礎設施的人:長期跑 OpenClaw、LangGraph 等 Agent;多個 ollama pull 模型切換;上下文常 32K+ 或做 RAG;本機還跑 Docker Compose 整套 AI 棧——往往與 Docker 部署 AI 應用 綁在一起。
預算緊可考慮:輕量推理放 24GB 本機,重任務租雲端 Mac 或 VPS——邏輯同 學程式買 Mac 還是 Windows 的決策文。
選型決策表:別被電商文案帶節奏
| 主要用途 | 建議記憶體 | 原因 |
|---|---|---|
| 偶爾本機聊天、學 Ollama 指令 | 16GB(可接受) | 3B~7B Q4;接受關背景、短上下文 |
| 日常開發 + 本機 7B/8B 輔助寫碼 | 24GB(推薦) | 系統 + IDE + 模型同時在線 |
| 14B、較長文件、輕度 RAG | 24GB(最低)/ 32GB(從容) | 14B Q4 約 8~9GB,加 Cache 後 16GB 很擠 |
| Agent 棧 + Docker + 多模型 | 32GB | 元件多,峰值疊加快 |
| 70B 本機滿血推理 | 消費級別想了 | 考慮雲端 GPU 或 API |
五個立刻能用的調優手段
- 量化選對檔:優先 Q4_K_M 或 Q5;
ollama show <model> --modelfile看清體積。 - 限制上下文:
num_ctx聊天機器人 4K 往往夠,別預設 32K。 - 一次只留一個模型在記憶體:
ollama ps/ollama stop。 - 重背景遷走:Docker Desktop、Electron IM、Chrome 分頁是三大殺手。
- 看「記憶體壓力」而非「已用記憶體」。
更多參數見 Ollama Modelfile 文件。
三個「血淚」典型
血淚一:16GB 裝 7B + 嵌入模型 + Open WebUI,速度從 25 tokens/s 掉到 4。血淚二:32GB 仍跑 70B + 32K 上下文 + Chrome 全開,照樣 swap。血淚三:跨平台只比 GB 數,忽略 Mac 統一記憶體 與 MLX 生態。
收束:怎麼選不後悔?
三個問題:主要跑多大模型? 能不能接受用的時候關軟體? 記憶體能後加嗎?(Mac 不能。)我的結論:2026 年認真用 Ollama 做開發輔助,24GB 是性價比最高的起點;32GB 給 Agent 玩家;16GB 只適合輕量嘗鮮。
一句話:Ollama 門檻在軟體上很低,硬體卻卡在統一記憶體。先想清楚模型檔位和使用場景,再下單 16G / 24G / 32G。
本機 Ollama 要穩,雲端 Mac 也要對檔
跑 Ollama 的核心是統一記憶體夠不夠、頻寬跟不跟得上。Mac mini M4 的 24GB / 32GB 機型,在本機 7B~14B 推理上更省心。
若不想一次砸硬體,VPSSpark 雲 Mac 可按月訂閱,把記憶體檔位與使用場景分開規劃。