VPSSpark Блог
← Вернуться к дневнику

Горький опыт! Ollama: не выбирайте 16 / 24 / 32 ГБ наугад

Заметки о сервере · 2026.07.11 · ~12 мин чтения

Частый поиск: Ollama память · 16 24 32 ГБ · локальный LLM на Mac

MacBook с редактором кода—локальный Ollama и выбор объёма RAM
Ollama прост в установке; unified memory решает, какие модели реально летят.

Первой машиной с Ollama у меня был Mac mini M2 на 16 ГБ. Туториалы обещали «одна команда — pull модели, чат локально», я запустил ollama run llama3.1:8b. Первые пять минут — отлично. На десятой минуте вентиляторы ревут, давление памяти в «Мониторинге системы» краснеет, переключение вкладок браузера — как таскать бетон.

Вывод: выбор 16, 24 или 32 ГБ для Ollama — не «чем больше, тем всегда лучше». Важно, влезают ли модель + контекст + фоновые приложения в unified memory. Здесь — ловушки, в которые я попал, и схема, по которой советую друзьям при покупке — чтобы меньше тратить деньги и ночей.

Почему RAM кусает раньше, чем «есть ли GPU?»

На игровых ноутбуках Windows одержимы VRAM. На Mac с Apple Silicon CPU и GPU делят один пул unified memory. Веса Ollama, KV-кэш при инференсе и кэши macOS — всё из одного котла. Доки и бенчмарки сообщества сходятся: больше модель и длиннее контекст — больше RAM, та же строка «Память» в «Мониторинге системы».

Ловушка №1: считают параметры, игнорируют квантизацию. 7B в Q4_K_M — ~4–5 ГБ; Q8 или FP16 легко удваивают. Ловушка №2: забывают про ОС — macOS, браузер, мессенджеры, IDE съедают 4–6 ГБ; на 16 ГБ модели остаётся ~10 ГБ. Ловушка №3 коварна: ждут явный OOM, а часто получают «работает, но адски медленно». Не хватает RAM — macOS свопит на SSD; tokens/s с 30 до 3 — вините модель, а диск притворяется памятью.

~1×
Размер Q4-модели (грубо ГБ vs параметры)
4–6GB
Типичный macOS + повседневный фон
32K
Длинный контекст добавляет несколько ГБ KV-кэша

16 ГБ: поиграть можно, продакшен — нет

16 ГБ тянет Ollama — малые модели, короткие чаты, меньше фона — и вполне терпимо. Конкретные сценарии:

  • Пробовать: 3B–7B Q4 вроде llama3.2:3b, qwen2.5:7b-instruct-q4_K_M
  • Разовые Q&A, черновики писем, короткий перевод
  • Без агентов, без нескольких загруженных моделей, контекст до ~16K

Моя классическая боль: Chrome (20+ вкладок), VS Code, Docker Desktop плюс 8B на 16 ГБ — без краша, «гладкая смерть», полсекунды на токен. Убил Docker и половину вкладок — скорость вернулась мгновенно.

Итог для 16 ГБ: Ollama как лёгкий ассистент. Не ждите стабильных 14B+, не складывайте локально OpenClaw, векторную БД и автоматизацию браузера. Gateway на VPS, домашний Ollama — upstream: 16 ГБ хватит как хост малых моделей — см. гайд по OpenClaw + шлюз Ollama.

24 ГБ: sweet spot 2026 для соло-разработчика

Если выбрать один tier надолго, 24 ГБ чаще всего рекомендую индивидуальным разработчикам. Практика:

  • 7B–8B могут оставаться resident, OS и IDE дышат — не закрываете приложения каждый день
  • 14B Q4 реалистичен во многих workflow; код и длинные саммари заметно лучше, чем 7B
  • Контекст 8K–16K — рост KV-кэша под контролем
  • Ollama плюс лёгкая векторная БД или один Docker-сервис — без «или-или»

24 ГБ не заставит 70B летать. Ценность — баланс качества и цены: Mac mini M4 24 ГБ дешевле 32 ГБ и спокойно тянет ежедневную разработку + локальный 8B/14B.

Легко упустить: память Apple припаяна — апгрейда потом нет. «Куплю 16 ГБ, посмотрю» на Mac — необратимая ошибка. 24 ГБ — запас на инфляцию моделей: в 2024 дефолт был 7B, в 2026 многие стартуют с 14B. Лишние 8 ГБ — страховка.

32 ГБ: агенты, несколько моделей, «не хочу считать RAM»

Кому 32 ГБ? Локальные LLM — инфраструктура, а не игрушка на выходные.

  • Постоянно OpenClaw, LangGraph и подобные стеки, Ollama как upstream
  • Несколько моделей ollama pull (7B для кода, 14B для текста, маленький embed)
  • Контекст часто 32K+, или RAG с длинными документами в промпте
  • Полный AI-стек Docker Compose — часто вместе с деплоем AI-приложений через Docker

32 ГБ не ускорит 70B, но снижает «налог закрой-открой». Самый медленный дебаг — не кривая конфигурация, а жизнь на обрыве памяти: сегодня ок, завтра Notion и Slack присоединились — и всё.

Жмёт бюджет? Лёгкий инференс на 24 ГБ локально, тяжёлое — cloud Mac или VPS. Та же логика, что аренда cloud Mac перед покупкой железа — см. Mac vs Windows для обучения программированию.

Как tiers 16, 24 и 32 ГБ unified memory справляются с разными размерами моделей Ollama
Одна модель может быть плавной, на грани или в свопе — не только ёмкость, но и закрываете ли приложения и выбираете ли разумную квантизацию.

Таблица решений: игнорируйте маркетинг

Основное использование Tier RAM Почему
Редкий локальный чат, изучение CLI Ollama 16 ГБ (OK) 3B–7B Q4; закрывать приложения, короткий контекст
Ежедневная разработка + локальный 7B/8B для кода 24 ГБ (рекомендуется) OS + IDE + модель онлайн вместе, стабильно
14B, длинные документы, лёгкий RAG 24 ГБ (мин) / 32 ГБ (комфорт) 14B Q4 ~8–9 ГБ; с кэшем 16 ГБ тесно
Стек агентов + Docker + несколько моделей 32 ГБ Много компонентов; пики и фрагментация накапливаются
Полный локальный инференс 70B Consumer tiers мимо Cloud GPU или API; не давить RAM

Пять настроек (дешевле апгрейда RAM)

Перед покупкой памяти — они дали мне полгода на 16 ГБ:

  1. Квантизация с умом: сначала Q4_K_M или Q5, не FP16; ollama show <model> --modelfile для размера.
  2. Ограничить контекст: num_ctx в Modelfile или API — для чатботов 4K часто хватает, не дефолт 32K.
  3. Одна загруженная модель: ollama ps, затем ollama stop лишнего.
  4. Урезать тяжёлый фон: Docker Desktop, Electron-IM, копилка вкладок Chrome — Safari или один профиль при инференсе.
  5. Смотреть давление памяти, не только «занято ГБ»: жёлтый/красный лучше предсказывает лаги.

Ещё ручки: документация Ollama Modelfile.

Три истории «кровь и слёзы», которые вижу снова и снова

История 1: «16 ГБ хватит, я только 7B.» — Добавил embed-модель + Open WebUI; три прожорливых процесса; 25 tokens/s → 4; виноват Wi‑Fi.

История 2: «Заплатил за 32 ГБ — непобедим.» — Всё равно квант ближе к FP16, контекст 32K, Chrome нараспашку; 70B свопит. Ёмкость модель не уменьшает.

История 3: «Windows 32 ГБ бьёт любой Mac 16 ГБ.» — Может, с VRAM NVIDIA — но на Mac для Ollama пропускная способность и sharing unified memory часто дают 16 ГБ Mac более стабильный 7B, чем многим 16 ГБ iGPU-ноутбукам. Сравнивайте платформы, не наклейки ГБ. Путь Apple unified memory Apple Silicon (MLX и т.д.) тоже важен.

Итог: выбрать без сожалений

Три быстрых вопроса:

  1. Какой размер модели реально крутите? Постоянно 7B/8B → 24 ГБ; игрушечный 3B → 16 ГБ терпимо; 14B+ или стеки → 32 ГБ.
  2. Будете закрывать приложения при инференсе? Если нет → не покупайте 16 ГБ.
  3. RAM можно докупить потом? На Mac — нет; недобор навсегда; на desktop Windows можно, но Ollama + CUDA — другая дорога.

Мой взгляд на 2026: серьёзный Ollama как dev-копilot — с 24 ГБ по цене/качеству; 32 ГБ для агентных, кто не хочет микроменеджить память; 16 ГБ только для лёгких экспериментов — с открытыми глазами. Не поклоняйтесь «больше RAM всегда побеждает», но не недооценивайте KV-кэш и длинный контекст — тихих монстров памяти.


В одну строку: порог входа в Ollama низкий; железо упирается в unified memory первым. Знайте tier модели и workflow до заказа 16 / 24 / 32 ГБ — сэкономите деньги и ночи с ревущими вентиляторами.

Стабильному локальному Ollama нужен правильный tier — и cloud Mac

Хорошо крутить Ollama — это достаточно unified memory и пропускной способности. Mac mini M4 в конфигурациях 24 / 32 ГБ спокойнее тянет локальный 7B–14B, чем слепленные коробки — тихо, экономно, можно оставлять включённым.

Не хотите большую ставку на железо или нужна чистая вторая машина для моделей и Xcode? Подписки VPSSpark cloud Mac позволяют разделить tiers: лёгкие эксперименты локально, агенты и очереди сборок — в облаке.

Смотреть тарифы cloud Mac

Ограниченное предложение

Правильный объём RAM для Ollama

Облачный Mac 24/32 ГБ · Помесячно · Без сожалений о несъёмной памяти

На главную
Ограниченное предложение Смотреть тарифы