| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
- 안드로이드
- MCP
- Android
- ai코딩
- claude code
- 카드 없이
- LLM
- Anthropic
- ChatGPT
- 로컬 llm
- GPT-5.6
- ai 뉴스
- cursor
- 무료 LLM
- Gemini
- 개발자
- OpenAI
- AI 코딩
- 무료 ai
- Android Studio
- 실무
- 오픈모델
- codex
- 바이브코딩
- 앤트로픽
- AI 에이전트
- 안드로이드 스튜디오
- Claude
- 홍드로이드
- 오픈웨이트
- Today
- Total
홍드로이드의 야매코딩
로컬 LLM 돌릴 PC 사양 — VRAM 얼마나 필요하고 견적은 얼마인가 (예산별 정리) 본문

얼마짜리가 필요한가
"내 PC에서 AI를 직접 돌린다"는 말은 멋있는데, 막상 알아보면 사양 이야기가 외계어입니다. VRAM, 양자화, 통합 메모리… 결국 궁금한 건 하나죠. "내가 쓰려는 모델을 돌리려면 얼마를 써야 하나." 계산식 하나로 정리하고, 예산대별 구성과 솔직히 안 사는 게 나은 경우까지 짚었습니다.
🎮 24GB면 대부분 해결 — 32B급까지 커버
🚀 32GB(RTX 5090)부터 45B급을 카드 한 장으로
🍎 맥은 통합 메모리 = VRAM — 128GB면 70B가 통째로
💸 결론: 대부분은 안 사는 게 이득 (아래 손익 계산)
딱 하나만 외우세요 — VRAM 계산식
모델은 보통 4비트로 압축(양자화)해서 돌립니다. 용량이 확 줄어드는 대신 품질 손실은 크지 않아서, 개인용 환경에서는 사실상 표준이에요. 이때 어림셈이 아주 간단합니다.
여기에 대화가 길어질수록 추가 메모리가 더 붙습니다. 그래서 계산값에 2~4GB 정도 여유를 두고 카드를 고르는 게 안전합니다. 딱 맞게 사면 긴 문서를 물릴 때 터집니다.
모델 크기별로 뭐가 필요한가
※ 4비트 양자화 기준 대략치입니다. 같은 크기라도 모델 구조와 양자화 방식에 따라 실제 사용량이 달라집니다.
예산별 구성
| 예산대 | 구성 | 돌아가는 크기 |
|---|---|---|
| 0원 | 지금 쓰는 PC·맥북 그대로 | 7B급 (느려도 동작) |
| 중고 GPU 추가 | 중고 24GB 카드 1장 + 기존 본체 | 32B급 |
| 신품 조립 | RTX 5090(32GB) + DDR5 64GB + NVMe | 45B급까지 단일 카드 |
| 맥 계열 | 통합 메모리 128GB 이상 구성 | 70B 통째로 (조용·저전력) |
| 멀티 GPU | 32GB 2장(64GB) 또는 전문가용 48GB | 70B 여유롭게 · 전력·소음 각오 |
※ 가격은 유통·환율·중고 시세에 따라 편차가 매우 큽니다. 구체적 금액은 구매 시점에 직접 확인하세요. 본체 외 파워·쿨링·케이스 여유도 함께 봐야 합니다(고성능 카드는 전원부와 발열이 병목).
· 저장장치 — 모델 파일이 큽니다. NVMe 여유 100~500GB
· CPU — 최신 8코어급이면 충분. GPU가 주역이라 과투자 불필요
· 파워·쿨링 — 상위 카드는 전력 요구가 큽니다. 여기서 아끼면 불안정해져요
윈도우 그래픽카드 vs 맥 통합 메모리
로컬 LLM에서 맥이 의외로 강한 이유가 있습니다. 맥은 시스템 메모리가 곧 VRAM이라, 메모리를 크게 주문하면 그만큼 큰 모델이 올라갑니다. 그래픽카드는 아무리 비싸도 카드에 붙은 메모리를 넘을 수 없고요.
| 구분 | 엔비디아 그래픽카드 | 맥 통합 메모리 |
|---|---|---|
| 속도 | 빠름 ✅ | 상대적으로 느림 |
| 담을 수 있는 크기 | 카드 VRAM에 갇힘 | 메모리만큼 ✅ |
| 전력·소음 | 높음 (팬 소리 큼) | 조용·저전력 ✅ |
| 개발 생태계 | CUDA 표준 ✅ | 호환 이슈 가끔 |
| 나중에 늘리기 | 카드 추가 가능 ✅ | 구매 후 증설 불가 ⚠️ |
정리하면 "빠르게 = 엔비디아 / 크게·조용히 = 맥"입니다. 다만 맥은 주문할 때 정한 메모리가 끝이라 나중에 못 늘립니다. 살 때 한 단계 위를 고르는 편이 후회가 적어요.
노트북으로도 되나요?
현실적인 답은 이렇습니다. 이동하며 가볍게 쓸 거면 노트북도 충분(7~14B급)하지만, 본격적으로 돌릴 거면 데스크톱이 압도적으로 유리합니다. 노트북에 큰돈을 쓰느니, 조용한 데스크톱을 두고 밖에서는 원격으로 붙는 구성이 비용 대비 낫습니다.
솔직히, 대부분은 안 사는 게 이득입니다
견적 글에서 할 말은 아니지만, 돈 계산을 해보면 답이 명확합니다. 고성능 구성에 수백만원을 쓰는 대신 그 돈을 구독이나 API에 넣으면 몇 년 치가 나옵니다. 게다가 하드웨어는 시간이 갈수록 가치가 떨어지고, 클라우드 모델은 계속 좋아지죠.
게다가 전기요금이 매달 별도로 붙고,
2년 뒤 중고가는 크게 떨어져 있습니다.
· 대량 반복 처리로 API 요금이 이미 크게 나오고 있다
· 인터넷 없는 환경에서 써야 한다
· 모델을 직접 손보는 학습·파인튜닝이 목적이다
· 게임·영상 편집 등 어차피 고성능 GPU가 필요했다
· "로컬이 더 좋을 것 같아서" → 같은 크기면 클라우드 상위 모델이 대체로 우세합니다
· "일단 사두면 쓰겠지" → 가장 흔한 후회 패턴. 먼저 무료로 써보고 판단하세요
순서를 제안하자면 ① 무료 API·무료 티어로 먼저 써보고 → ② 부족하면 구독 → ③ 그래도 한계가 명확할 때 하드웨어입니다. 3단계까지 가는 사람은 생각보다 적어요.
Apache 2.0 무료 공개. 위 계산식(30B × 0.6 ≈ 18GB)이 실제 17GB 양자화 버전과 맞아떨어진 사례입니다
· MiniMax H3 33B 영상 모델 — 다만 한국은 적용 지역에서 빠졌습니다
사양을 맞추기 전에 라이선스를 먼저 보셔야 하는 사례. 가중치를 받을 수 있다고 써도 되는 게 아닙니다
· Qwen3.8 오픈웨이트 — 공식은 아직 없고 다른 게 올라와 있습니다
받기 전에 주소부터 보셔야 하는 사례. 공개 예정 모델은 이름만 같은 파일이 먼저 돌아다닐 수 있습니다
자주 묻는 질문
무료 → 구독 → API → 하드웨어 4계단의 판단 기준을 정리했습니다. GPU는 가장 마지막 계단이고, 거꾸로 가는 게 제일 비쌉니다
그게 아니라면 무료 → 구독 → 하드웨어 순서를 지키세요.
출처·주의 — 2026년 8월 기준 로컬 LLM 하드웨어 가이드 자료들을 교차 확인해 정리했습니다(VRAM 어림셈, 카드별 용량, 통합 메모리 구성 등). VRAM 요구량은 모델 구조·양자화 방식·문맥 길이에 따라 달라지는 추정치이며, 실제 성능 수치는 환경마다 편차가 큽니다. 부품 가격은 유통·환율·중고 시세에 따라 크게 변동하므로 구매 시점에 직접 확인하세요. 본 글은 특정 제조사·판매처와 제휴 관계가 없습니다.
'AI & Vibe Coding' 카테고리의 다른 글
| 개발팀 AI 코딩 도구 비용 — 5명이면 월 얼마인가 (좌석제가 무너지고 있다) (0) | 2026.08.10 |
|---|---|
| 기업 AI 도입 비용 — 10명 팀이면 월 얼마인가 (좌석당 단가 비교) (0) | 2026.08.10 |
| AI 구독 어디에 돈 쓸까 — ChatGPT·클로드·커서·코파일럿 원가 비교 (2026년 8월) (1) | 2026.08.10 |
| Kimi K3 무료 API 받는 법 (카드 없이·8월 12일까지) — 2.8조 파라미터를 커서에 꽂기 (0) | 2026.08.10 |
| ChatGPT 무료 무제한 열렸다 — GPT-5.6 Luna 기본 탑재 (2026년 8월 변경점) (0) | 2026.08.10 |
