Первой машиной с Ollama у меня был Mac mini M2 на 16 ГБ. Туториалы обещали «одна команда — pull модели, чат локально», я запустил ollama run llama3.1:8b. Первые пять минут — отлично. На десятой минуте вентиляторы ревут, давление памяти в «Мониторинге системы» краснеет, переключение вкладок браузера — как таскать бетон.
Вывод: выбор 16, 24 или 32 ГБ для Ollama — не «чем больше, тем всегда лучше». Важно, влезают ли модель + контекст + фоновые приложения в unified memory. Здесь — ловушки, в которые я попал, и схема, по которой советую друзьям при покупке — чтобы меньше тратить деньги и ночей.
Почему RAM кусает раньше, чем «есть ли GPU?»
На игровых ноутбуках Windows одержимы VRAM. На Mac с Apple Silicon CPU и GPU делят один пул unified memory. Веса Ollama, KV-кэш при инференсе и кэши macOS — всё из одного котла. Доки и бенчмарки сообщества сходятся: больше модель и длиннее контекст — больше RAM, та же строка «Память» в «Мониторинге системы».
Ловушка №1: считают параметры, игнорируют квантизацию. 7B в Q4_K_M — ~4–5 ГБ; Q8 или FP16 легко удваивают. Ловушка №2: забывают про ОС — macOS, браузер, мессенджеры, IDE съедают 4–6 ГБ; на 16 ГБ модели остаётся ~10 ГБ. Ловушка №3 коварна: ждут явный OOM, а часто получают «работает, но адски медленно». Не хватает RAM — macOS свопит на SSD; tokens/s с 30 до 3 — вините модель, а диск притворяется памятью.
16 ГБ: поиграть можно, продакшен — нет
16 ГБ тянет Ollama — малые модели, короткие чаты, меньше фона — и вполне терпимо. Конкретные сценарии:
- Пробовать: 3B–7B Q4 вроде
llama3.2:3b,qwen2.5:7b-instruct-q4_K_M - Разовые Q&A, черновики писем, короткий перевод
- Без агентов, без нескольких загруженных моделей, контекст до ~16K
Моя классическая боль: Chrome (20+ вкладок), VS Code, Docker Desktop плюс 8B на 16 ГБ — без краша, «гладкая смерть», полсекунды на токен. Убил Docker и половину вкладок — скорость вернулась мгновенно.
Итог для 16 ГБ: Ollama как лёгкий ассистент. Не ждите стабильных 14B+, не складывайте локально OpenClaw, векторную БД и автоматизацию браузера. Gateway на VPS, домашний Ollama — upstream: 16 ГБ хватит как хост малых моделей — см. гайд по OpenClaw + шлюз Ollama.
24 ГБ: sweet spot 2026 для соло-разработчика
Если выбрать один tier надолго, 24 ГБ чаще всего рекомендую индивидуальным разработчикам. Практика:
- 7B–8B могут оставаться resident, OS и IDE дышат — не закрываете приложения каждый день
- 14B Q4 реалистичен во многих workflow; код и длинные саммари заметно лучше, чем 7B
- Контекст 8K–16K — рост KV-кэша под контролем
- Ollama плюс лёгкая векторная БД или один Docker-сервис — без «или-или»
24 ГБ не заставит 70B летать. Ценность — баланс качества и цены: Mac mini M4 24 ГБ дешевле 32 ГБ и спокойно тянет ежедневную разработку + локальный 8B/14B.
Легко упустить: память Apple припаяна — апгрейда потом нет. «Куплю 16 ГБ, посмотрю» на Mac — необратимая ошибка. 24 ГБ — запас на инфляцию моделей: в 2024 дефолт был 7B, в 2026 многие стартуют с 14B. Лишние 8 ГБ — страховка.
32 ГБ: агенты, несколько моделей, «не хочу считать RAM»
Кому 32 ГБ? Локальные LLM — инфраструктура, а не игрушка на выходные.
- Постоянно OpenClaw, LangGraph и подобные стеки, Ollama как upstream
- Несколько моделей
ollama pull(7B для кода, 14B для текста, маленький embed) - Контекст часто 32K+, или RAG с длинными документами в промпте
- Полный AI-стек Docker Compose — часто вместе с деплоем AI-приложений через Docker
32 ГБ не ускорит 70B, но снижает «налог закрой-открой». Самый медленный дебаг — не кривая конфигурация, а жизнь на обрыве памяти: сегодня ок, завтра Notion и Slack присоединились — и всё.
Жмёт бюджет? Лёгкий инференс на 24 ГБ локально, тяжёлое — cloud Mac или VPS. Та же логика, что аренда cloud Mac перед покупкой железа — см. Mac vs Windows для обучения программированию.
Таблица решений: игнорируйте маркетинг
| Основное использование | Tier RAM | Почему |
|---|---|---|
| Редкий локальный чат, изучение CLI Ollama | 16 ГБ (OK) | 3B–7B Q4; закрывать приложения, короткий контекст |
| Ежедневная разработка + локальный 7B/8B для кода | 24 ГБ (рекомендуется) | OS + IDE + модель онлайн вместе, стабильно |
| 14B, длинные документы, лёгкий RAG | 24 ГБ (мин) / 32 ГБ (комфорт) | 14B Q4 ~8–9 ГБ; с кэшем 16 ГБ тесно |
| Стек агентов + Docker + несколько моделей | 32 ГБ | Много компонентов; пики и фрагментация накапливаются |
| Полный локальный инференс 70B | Consumer tiers мимо | Cloud GPU или API; не давить RAM |
Пять настроек (дешевле апгрейда RAM)
Перед покупкой памяти — они дали мне полгода на 16 ГБ:
- Квантизация с умом: сначала Q4_K_M или Q5, не FP16;
ollama show <model> --modelfileдля размера. - Ограничить контекст:
num_ctxв Modelfile или API — для чатботов 4K часто хватает, не дефолт 32K. - Одна загруженная модель:
ollama ps, затемollama stopлишнего. - Урезать тяжёлый фон: Docker Desktop, Electron-IM, копилка вкладок Chrome — Safari или один профиль при инференсе.
- Смотреть давление памяти, не только «занято ГБ»: жёлтый/красный лучше предсказывает лаги.
Ещё ручки: документация Ollama Modelfile.
Три истории «кровь и слёзы», которые вижу снова и снова
История 1: «16 ГБ хватит, я только 7B.» — Добавил embed-модель + Open WebUI; три прожорливых процесса; 25 tokens/s → 4; виноват Wi‑Fi.
История 2: «Заплатил за 32 ГБ — непобедим.» — Всё равно квант ближе к FP16, контекст 32K, Chrome нараспашку; 70B свопит. Ёмкость модель не уменьшает.
История 3: «Windows 32 ГБ бьёт любой Mac 16 ГБ.» — Может, с VRAM NVIDIA — но на Mac для Ollama пропускная способность и sharing unified memory часто дают 16 ГБ Mac более стабильный 7B, чем многим 16 ГБ iGPU-ноутбукам. Сравнивайте платформы, не наклейки ГБ. Путь Apple unified memory Apple Silicon (MLX и т.д.) тоже важен.
Итог: выбрать без сожалений
Три быстрых вопроса:
- Какой размер модели реально крутите? Постоянно 7B/8B → 24 ГБ; игрушечный 3B → 16 ГБ терпимо; 14B+ или стеки → 32 ГБ.
- Будете закрывать приложения при инференсе? Если нет → не покупайте 16 ГБ.
- RAM можно докупить потом? На Mac — нет; недобор навсегда; на desktop Windows можно, но Ollama + CUDA — другая дорога.
Мой взгляд на 2026: серьёзный Ollama как dev-копilot — с 24 ГБ по цене/качеству; 32 ГБ для агентных, кто не хочет микроменеджить память; 16 ГБ только для лёгких экспериментов — с открытыми глазами. Не поклоняйтесь «больше RAM всегда побеждает», но не недооценивайте KV-кэш и длинный контекст — тихих монстров памяти.
В одну строку: порог входа в Ollama низкий; железо упирается в unified memory первым. Знайте tier модели и workflow до заказа 16 / 24 / 32 ГБ — сэкономите деньги и ночи с ревущими вентиляторами.
Стабильному локальному Ollama нужен правильный tier — и cloud Mac
Хорошо крутить Ollama — это достаточно unified memory и пропускной способности. Mac mini M4 в конфигурациях 24 / 32 ГБ спокойнее тянет локальный 7B–14B, чем слепленные коробки — тихо, экономно, можно оставлять включённым.
Не хотите большую ставку на железо или нужна чистая вторая машина для моделей и Xcode? Подписки VPSSpark cloud Mac позволяют разделить tiers: лёгкие эксперименты локально, агенты и очереди сборок — в облаке.