처음 Ollama를 돌린 기계는 16GB Mac mini M2였습니다. 튜토리얼은 「명령어 하나로 모델 pull, 로컬 채팅」이라고 했고, ollama run llama3.1:8b를 실행했죠. 처음 5분은 좋았습니다. 10분째엔 팬이 울부짖고, 활성 상태 보기의 메모리 압력이 빨갛게 변했으며, 브라우저 탭 전환이 콘크리트를 끄는 느낌이었습니다.
깨달은 점: Ollama용 16GB·24GB·32GB 선택은 「클수록 항상 좋다」가 아닙니다. 모델 + 컨텍스트 + 백그라운드 앱이 통합 메모리에 들어가느냐가 핵심입니다. 이 글은 제가 밟은 함정과, 지인에게 「뭐 사야 해?」라고 물을 때 쓰는 판단 기준을 정리합니다. 돈과 밤샘을 줄이려면.
「GPU 있어?」보다 RAM이 먼저 물어뜯는 이유
Windows 게이밍 노트북에서는 VRAM에 집착합니다. Apple Silicon Mac에서는 CPU와 GPU가 같은 통합 메모리 풀을 공유합니다. Ollama 가중치, 추론 시 KV 캐시, macOS 캐시——전부 여기서 나갑니다. 공식 문서와 커뮤니티 벤치마크도 같습니다: 모델이 크고 컨텍스트가 길수록 RAM을 더 먹는다. 활성 상태 보기의 「메모리」 줄과 같은 풀입니다.
함정 1: 파라미터 수만 보고 양자화는 무시. 7B도 Q4_K_M이면 ~4–5GB, Q8·FP16은 두 배 가까이. 함정 2: OS 잊기——macOS, 브라우저, 채팅, IDE만 4–6GB. 16GB 머신에 모델용으로 ~10GB. 함정 3은 은근함: OOM 에러를 기대하지만, 흔한 건 「돌아가긴 하는데 지옥처럼 느림」. RAM 부족 시 macOS는 SSD로 스왑. tokens/s가 30에서 3으로——모델 탓인 줄 알지만 디스크가 RAM인 척.
16GB: 돌릴 순 있지만, 프로덕션급은 아님
16GB로도 Ollama는 됩니다——작은 모델, 짧은 채팅, 백그라운드 줄이기면 괜찮습니다. 구체적 적합:
- 맛보기: 3B–7B Q4 (
llama3.2:3b,qwen2.5:7b-instruct-q4_K_M등) - 일회 Q&A, 메일 초안, 짧은 번역
- 에이전트 없음, 여러 모델 동시 로드 없음, 컨텍스트 ~16K 이하
제 전형적 고통 장면: Chrome(20+ 탭), VS Code, Docker Desktop, 16GB에서 8B——크래시는 없고 「매끄러운 죽음」, 토큰당 반 초. Docker와 탭 절반 끄면 속도 즉시 회복.
16GB 결론: Ollama를 가벼운 어시스턴트로. 14B+ 안정 운영 기대 말고, OpenClaw·벡터 DB·브라우저 자동화를 로컬에 쌓지 마세요. Gateway는 VPS, 집 Ollama는 업스트림이면 16GB는 소형 모델 호스트로 가능——OpenClaw + Ollama 게이트웨이 트러블슈팅 참고.
24GB: 2026년 솔로 개발자 스위트 스팟
장기 Ollama용으로 하나만 고르면, 24GB가 개인 개발자에게 가장 자주 추천하는 용량입니다. 실용 이유:
- 7B–8B 상주 + OS·IDE 여유——매일 앱 끄지 않아도 됨
- 14B Q4도 많은 워크플로에서 현실적. 코드·긴 요약은 7B보다 확실히 나음
- 8K–16K 컨텍스트면 KV 캐시 증가 관리 가능
- Ollama + 가벼운 벡터 DB 또는 Docker 1서비스——둘 중 하나 포기 강요 없음
24GB가 70B를 마법처럼 돌리진 않습니다. 가치는 품질과 비용 균형: Mac mini M4 24GB는 32GB보다 저렴하면서 일상 개발 + 로컬 8B/14B 추론을 편하게.
놓치기 쉬움: Apple 메모리는 납땜——나중에 업그레이드 불가. 「16GB 사고 보자」는 Mac에서 영구 실수. 24GB는 모델 팽창 보험——2024 기본은 7B, 2026엔 14B부터 시작하는 사람 많음. 추가 8GB는 보험료.
32GB: 에이전트, 다중 모델, 「RAM 세기 싫다」
32GB는 누구용? 로컬 LLM을 주말 장난감이 아니라 인프라로 보는 사람.
- 상시 OpenClaw, LangGraph 등 스택, Ollama를 업스트림 하나로
- 여러
ollama pull모델 (코드 7B, 글쓰기 14B, 작은 embed) - 컨텍스트 32K+ 일상, 또는 RAG로 긴 문서를 프롬프트에
- Docker Compose AI 스택 전체——Docker로 AI 앱 배포와 묶이는 경우 많음
32GB도 70B는 날지 않습니다. 줄어드는 건 「이거 닫고 저거 열기」 세금. 가장 느린 디버깅은 설정 오류가 아니라 메모리 절벽 위 생활——오늘은 됨, 내일 Notion·Slack 합류하면 죽음.
예산 빡빡? 가벼운 추론은 24GB 본체, 무거운 건 클라우드 Mac 또는 VPS. 하드 확정 전 클라우드 Mac 빌리는 것과 같은 논리——코딩 학습 Mac vs Windows도 참고.
결정표: 마케팅 문구 무시해도 됨
| 주 용도 | RAM | 이유 |
|---|---|---|
| 가끔 로컬 채팅, Ollama CLI 학습 | 16GB (OK) | 3B–7B Q4; 앱 닫고 짧은 컨텍스트 수용 |
| 일상 개발 + 로컬 7B/8B 코딩 보조 | 24GB (추천) | OS + IDE + 모델 동시 온라인, 안정감 |
| 14B, 긴 문서, 가벼운 RAG | 24GB (최소) / 32GB (여유) | 14B Q4 ~8–9GB; 캐시 포함 16GB 빡빡 |
| 에이전트 스택 + Docker + 다중 모델 | 32GB | 컴포넌트 많음; 피크·단편화 누적 |
| 70B 로컬 풀 추론 | 소비자급 포기 | 클라우드 GPU 또는 API; RAM 억지 금지 |
RAM 사기 전 5가지 튜닝 (더 쌈)
메모리 업그레이드 전에——16GB에서 6개월 연장한 방법:
- 양자화 현명히: Q4_K_M 또는 Q5 먼저, FP16 아님.
ollama show <model> --modelfile로 크기 확인. - 컨텍스트 상한: Modelfile·API에서
num_ctx——챗봇은 4K면 충분한 경우 많음, 기본 32K 불필요. - 한 번에 한 모델:
ollama ps후 불필요하면ollama stop. - 무거운 백그라운드 정리: Docker Desktop, Electron IM, Chrome 탭 hoarding——추론 중 Safari 또는 프로필 하나.
- 「사용 GB」보다 메모리 압력: 노랑·빨강 압력이 끊김 예측에 더 낫다.
더 많은 노브: Ollama Modelfile 문서.
자주 보는 「피와 눈물」 3편
1편: 「16GB면 돼, 7B만 돌려.」 — embed 모델 + Open WebUI 추가. 배고픈 프로세스 셋, 25 tokens/s → 4. Wi‑Fi 탓.
2편: 「32GB 냈으니 무적.」 — 여전히 FP16-ish, 32K 컨텍스트, Chrome 전개. 70B는 스왑. 용량이 모델을 줄이진 않음.
3편: 「Windows 32GB가 16GB Mac 이김.」 — NVIDIA VRAM이면 다른 이야기. Mac Ollama에선 통합 메모리 대역폭·공유 덕에 16GB Mac이 16GB iGPU 노트북보다 7B를 더 안정적으로 돌리기도. GB 스티커가 아니라 플랫폼 비교. Apple Apple Silicon 통합 메모리(MLX 등)도 중요.
정리: 후회 없이 고르기
세 가지 질문:
- 실제로 돌리는 모델 크기? 7B/8B 상시 → 24GB; 3B 장난 → 16GB 견딤; 14B+·스택 → 32GB.
- 추론 중 앱 닫을 수 있나? 아니면 → 16GB 사지 마.
- 나중에 RAM 업그레이드? Mac에선 불가——작게 사면 영구; 데스크톱 Windows는 추가 가능하지만 Ollama+CUDA는 다른 길.
2026년 제 견해: 진지한 Ollama 개발 코파일럿은 24GB부터 가성비; 메모리 마이크로매니징 거부하는 에이전트파는 32GB; 16GB는 가벼운 실험만——눈 뜨고. 「RAM 많으면 항상 승」 숭배 말고, KV 캐시·긴 컨텍스트——조용한 메모리 괴물——도 과소평가 금지.
한 줄로: Ollama 소프트웨어 문턱은 낮다; 하드웨어는 먼저 통합 메모리에 부딪힌다. 16 / 24 / 32 GB 주문 전 모델 tier와 워크플로를 알면 돈과 팬 비명의 밤을 아낀다.
안정적인 로컬 Ollama엔 맞는 tier——클라우드 Mac도
Ollama를 잘 돌리려면 충분한 통합 메모리와 대역폭이 필요합니다. Mac mini M4 24GB / 32GB 구성은 땜질 PC보다 로컬 7B–14B 추론을 더 차분히——조용, 저전력, 상시 가동 OK.
큰 하드웨어 베팅 피하고, 모델·Xcode용 두 번째 머신이 필요하면? VPSSpark 클라우드 Mac 구독으로 tier 분리——가벼운 실험은 로컬, 에이전트·빌드 큐는 클라우드.