홍드로이드의 야매코딩

로컬 LLM 돌릴 PC 사양 — VRAM 얼마나 필요하고 견적은 얼마인가 (예산별 정리) 본문

AI & Vibe Coding

로컬 LLM 돌릴 PC 사양 — VRAM 얼마나 필요하고 견적은 얼마인가 (예산별 정리)

홍드로이드 2026. 8. 10. 21:33

🖥️ AI PC 견적 · 2026
내 PC로 LLM 돌리려면
얼마짜리가 필요한가
VRAM 계산식부터 예산별 실제 견적, 그리고 안 사는 게 이득인 경우까지.

"내 PC에서 AI를 직접 돌린다"는 말은 멋있는데, 막상 알아보면 사양 이야기가 외계어입니다. VRAM, 양자화, 통합 메모리… 결국 궁금한 건 하나죠. "내가 쓰려는 모델을 돌리려면 얼마를 써야 하나." 계산식 하나로 정리하고, 예산대별 구성과 솔직히 안 사는 게 나은 경우까지 짚었습니다.

📌 30초 요약
🧮 어림셈: 필요 VRAM(GB) ≈ 모델 크기(B) × 0.6 (4비트 기준)
🎮 24GB면 대부분 해결 — 32B급까지 커버
🚀 32GB(RTX 5090)부터 45B급을 카드 한 장으로
🍎 맥은 통합 메모리 = VRAM — 128GB면 70B가 통째로
💸 결론: 대부분은 안 사는 게 이득 (아래 손익 계산)

딱 하나만 외우세요 — VRAM 계산식

모델은 보통 4비트로 압축(양자화)해서 돌립니다. 용량이 확 줄어드는 대신 품질 손실은 크지 않아서, 개인용 환경에서는 사실상 표준이에요. 이때 어림셈이 아주 간단합니다.

4비트 양자화 기준 어림셈
필요 VRAM(GB) ≈ 파라미터(B) × 0.6
예) 70B 모델 → 70 × 0.6 = 약 42GB

여기에 대화가 길어질수록 추가 메모리가 더 붙습니다. 그래서 계산값에 2~4GB 정도 여유를 두고 카드를 고르는 게 안전합니다. 딱 맞게 사면 긴 문서를 물릴 때 터집니다.

모델 크기별로 뭐가 필요한가

7B — 가벼운 대화·요약
약 5GB
 
웬만한 게임용 그래픽카드(8GB)면 됩니다. 노트북 내장으로도 느리게나마 동작해요.
14B — 일반 작업 주력
약 9GB
 
12GB 카드면 편하게 돌아갑니다. 개인용으로 가장 무난한 지점이에요.
32B — 코딩용 실전 가성비 정점
약 20GB
 
24GB 카드(3090·4090·5080급)의 주 무대. 개인이 체감상 "쓸 만하다"고 느끼는 첫 구간입니다.
70B — 상위 품질
약 42GB
 
카드 한 장으로는 어렵습니다. 32GB 두 장, 24GB 두 장, 또는 대용량 통합 메모리를 가진 맥이 필요해요.

※ 4비트 양자화 기준 대략치입니다. 같은 크기라도 모델 구조와 양자화 방식에 따라 실제 사용량이 달라집니다.

예산별 구성

예산대 구성 돌아가는 크기
0원 지금 쓰는 PC·맥북 그대로 7B급 (느려도 동작)
중고 GPU 추가 중고 24GB 카드 1장 + 기존 본체 32B급
신품 조립 RTX 5090(32GB) + DDR5 64GB + NVMe 45B급까지 단일 카드
맥 계열 통합 메모리 128GB 이상 구성 70B 통째로 (조용·저전력)
멀티 GPU 32GB 2장(64GB) 또는 전문가용 48GB 70B 여유롭게 · 전력·소음 각오

※ 가격은 유통·환율·중고 시세에 따라 편차가 매우 큽니다. 구체적 금액은 구매 시점에 직접 확인하세요. 본체 외 파워·쿨링·케이스 여유도 함께 봐야 합니다(고성능 카드는 전원부와 발열이 병목).

💡 GPU 말고도 챙길 것
· 시스템 램 — 최소 16GB, 32GB 이상 권장 (모델 로딩 시 필요)
· 저장장치 — 모델 파일이 큽니다. NVMe 여유 100~500GB
· CPU — 최신 8코어급이면 충분. GPU가 주역이라 과투자 불필요
· 파워·쿨링 — 상위 카드는 전력 요구가 큽니다. 여기서 아끼면 불안정해져요

윈도우 그래픽카드 vs 맥 통합 메모리

로컬 LLM에서 맥이 의외로 강한 이유가 있습니다. 맥은 시스템 메모리가 곧 VRAM이라, 메모리를 크게 주문하면 그만큼 큰 모델이 올라갑니다. 그래픽카드는 아무리 비싸도 카드에 붙은 메모리를 넘을 수 없고요.

구분 엔비디아 그래픽카드 맥 통합 메모리
속도 빠름 ✅ 상대적으로 느림
담을 수 있는 크기 카드 VRAM에 갇힘 메모리만큼 ✅
전력·소음 높음 (팬 소리 큼) 조용·저전력 ✅
개발 생태계 CUDA 표준 ✅ 호환 이슈 가끔
나중에 늘리기 카드 추가 가능 ✅ 구매 후 증설 불가 ⚠️

정리하면 "빠르게 = 엔비디아 / 크게·조용히 = 맥"입니다. 다만 맥은 주문할 때 정한 메모리가 끝이라 나중에 못 늘립니다. 살 때 한 단계 위를 고르는 편이 후회가 적어요.

노트북으로도 되나요?

⚠️ 같은 이름이어도 노트북 GPU는 다릅니다
노트북용 그래픽카드는 이름이 같아도 VRAM과 전력 한도가 데스크톱보다 낮게 잡힙니다. 카탈로그의 모델명이 아니라 실제 VRAM 용량 숫자를 확인하세요. 게다가 배터리로 돌리면 성능이 크게 떨어지고, 장시간 추론은 발열로 속도가 내려갑니다.

현실적인 답은 이렇습니다. 이동하며 가볍게 쓸 거면 노트북도 충분(7~14B급)하지만, 본격적으로 돌릴 거면 데스크톱이 압도적으로 유리합니다. 노트북에 큰돈을 쓰느니, 조용한 데스크톱을 두고 밖에서는 원격으로 붙는 구성이 비용 대비 낫습니다.

솔직히, 대부분은 안 사는 게 이득입니다

견적 글에서 할 말은 아니지만, 돈 계산을 해보면 답이 명확합니다. 고성능 구성에 수백만원을 쓰는 대신 그 돈을 구독이나 API에 넣으면 몇 년 치가 나옵니다. 게다가 하드웨어는 시간이 갈수록 가치가 떨어지고, 클라우드 모델은 계속 좋아지죠.

🧾 손익 감각
고성능 PC 한 대 = 월 3만원 구독 기준 수년 치
게다가 전기요금이 매달 별도로 붙고,
2년 뒤 중고가는 크게 떨어져 있습니다.
✅ 그래도 사야 하는 경우
· 데이터를 밖으로 내보낼 수 없다 (의료·법률·사내 기밀) — 가장 확실한 이유
· 대량 반복 처리로 API 요금이 이미 크게 나오고 있다
· 인터넷 없는 환경에서 써야 한다
· 모델을 직접 손보는 학습·파인튜닝이 목적이다
· 게임·영상 편집 등 어차피 고성능 GPU가 필요했다
🚫 이런 이유면 다시 생각해보세요
· "구독료가 아까워서" → 회수까지 수년입니다
· "로컬이 더 좋을 것 같아서" → 같은 크기면 클라우드 상위 모델이 대체로 우세합니다
· "일단 사두면 쓰겠지" → 가장 흔한 후회 패턴. 먼저 무료로 써보고 판단하세요

순서를 제안하자면 ① 무료 API·무료 티어로 먼저 써보고 → ② 부족하면 구독 → ③ 그래도 한계가 명확할 때 하드웨어입니다. 3단계까지 가는 사람은 생각보다 적어요.

🆕 그래서 뭘 돌리면 되나 — 최신 사례
· 메타 Muse Glimmer 30B — 24GB 카드 한 장으로 돌리는 에이전트 모델
Apache 2.0 무료 공개. 위 계산식(30B × 0.6 ≈ 18GB)이 실제 17GB 양자화 버전과 맞아떨어진 사례입니다

· MiniMax H3 33B 영상 모델 — 다만 한국은 적용 지역에서 빠졌습니다
사양을 맞추기 전에 라이선스를 먼저 보셔야 하는 사례. 가중치를 받을 수 있다고 써도 되는 게 아닙니다

· Qwen3.8 오픈웨이트 — 공식은 아직 없고 다른 게 올라와 있습니다
받기 전에 주소부터 보셔야 하는 사례. 공개 예정 모델은 이름만 같은 파일이 먼저 돌아다닐 수 있습니다

자주 묻는 질문

Q. 그래픽카드 없이 CPU만으로도 되나요?
동작은 합니다. 램만 충분하면 작은 모델은 CPU로도 돌아가요. 다만 속도가 크게 느립니다. 글자가 한 자씩 떠오르는 수준이라, "되는지 구경"은 가능해도 실사용은 답답합니다. 일단 지금 PC에 설치해서 체감해보고 판단하는 걸 추천합니다.
Q. 중고 그래픽카드 사도 괜찮나요?
VRAM 용량 대비 가격으로 보면 중고 24GB 카드가 여전히 매력적입니다. 다만 채굴·장시간 연산에 혹사된 물건이 섞여 있고 보증이 없다는 게 위험이에요. 구매 후 부하 테스트를 꼭 돌려보고, 반품 조건을 확인하고 사세요.
Q. 카드 두 장을 꽂으면 VRAM이 그냥 합쳐지나요?
추론 목적에서는 모델을 나눠 올리는 방식으로 사실상 합쳐 쓸 수 있습니다. 다만 카드 사이 통신 때문에 속도는 단순히 두 배가 되지 않고, 메인보드 슬롯·파워 용량·케이스 공간·발열까지 전부 걸립니다. 초심자에게 권할 구성은 아니에요.
🗺️ 하드웨어를 지르기 전에 — 지출 순서 확인
· AI에 쓰는 돈 총정리 — 개인·개발자·회사별 지출 가이드
무료 → 구독 → API → 하드웨어 4계단의 판단 기준을 정리했습니다. GPU는 가장 마지막 계단이고, 거꾸로 가는 게 제일 비쌉니다
✨ 사양표보다 먼저 "왜 로컬인가"
보안·오프라인·대량처리 중 하나에 해당하면 확실한 투자입니다.
그게 아니라면 무료 → 구독 → 하드웨어 순서를 지키세요.

출처·주의 — 2026년 8월 기준 로컬 LLM 하드웨어 가이드 자료들을 교차 확인해 정리했습니다(VRAM 어림셈, 카드별 용량, 통합 메모리 구성 등). VRAM 요구량은 모델 구조·양자화 방식·문맥 길이에 따라 달라지는 추정치이며, 실제 성능 수치는 환경마다 편차가 큽니다. 부품 가격은 유통·환율·중고 시세에 따라 크게 변동하므로 구매 시점에 직접 확인하세요. 본 글은 특정 제조사·판매처와 제휴 관계가 없습니다.

Comments