로컬 AI를 처음 시작하면 모델 이름부터 암호처럼 보입니다.
7B, 13B, 27B, 70B… 도대체 B가 뭘까요?
결론부터 말하면 B는 Billion, 즉 10억을 뜻합니다. 7B 모델은 약 70억 개, 13B는 약 130억 개, 70B는 약 700억 개의 파라미터를 가진 모델이라는 뜻입니다.
파라미터 70억 개? AI 머릿속의 아주 작은 다이얼 70억 개
파라미터(parameter)는 AI가 학습 과정에서 조정한 숫자입니다. 하나하나는 작은 숫자지만 수십억 개가 모이면 언어의 패턴과 관계를 표현하는 거대한 모델이 됩니다.
그래서 7B에서 숫자 7은 단순한 버전 번호가 아닙니다. 대략적인 모델 규모와 필요한 메모리를 짐작하게 해주는 첫 번째 힌트입니다.

왜 7B 모델이 7GB가 아닌가요?
여기서 재미있는 계산이 시작됩니다.
FP16에서는 파라미터 하나를 저장하는 데 2바이트가 필요합니다. 따라서 가중치만 단순 계산하면:
- 7B × 2바이트 ≈ 14GB
- 13B × 2바이트 ≈ 26GB
- 70B × 2바이트 ≈ 140GB
그리고 실제 추론에는 모델 가중치만 필요한 것이 아닙니다. KV cache, 컨텍스트 길이, 런타임 버퍼 같은 추가 공간도 필요합니다. NVIDIA 역시 LLM의 GPU 메모리를 좌우하는 주요 요소로 모델 가중치와 KV cache를 설명합니다.
참고: NVIDIA – Mastering LLM Techniques: Inference Optimization
그런데 7B 모델을 8GB 그래픽카드에서도 돌린다는데요?
여기서 등장하는 비밀 무기가 양자화(Quantization)입니다.
FP16이 파라미터 하나를 16비트로 표현한다면, 8비트나 4비트로 줄여 저장할 수도 있습니다. 일종의 압축 이사입니다. 큰 가구를 조금 작게 접어 VRAM이라는 방 안에 넣는 셈입니다.
4비트라면 이론상 파라미터 하나가 약 0.5바이트이므로 7B 모델의 순수 가중치는 약 3.5GB 수준까지 줄어듭니다. 물론 실제 실행에는 추가 메모리가 필요합니다. NVIDIA도 4비트 양자화된 27B 모델의 가중치를 약 13.5GB로 설명하며 별도 오버헤드가 필요하다고 안내합니다.
참고: NVIDIA – Accelerating Larger LLMs Locally
그럼 내 그래픽카드는 어디까지 가능할까?
예를 들어 GeForce RTX 4070 Ti SUPER 16GB를 가지고 있다고 해보겠습니다. 16GB VRAM은 로컬 AI 입문용으로 꽤 재미있는 구간입니다.
| 모델 규모 | FP16 단순 가중치 | 4bit 단순 가중치 | 16GB GPU에서 |
|---|---|---|---|
| 7B | 약 14GB | 약 3.5GB | 4bit 매우 여유로운 편 |
| 13B | 약 26GB | 약 6.5GB | 4bit 현실적인 선택 |
| 27B | 약 54GB | 약 13.5GB | 4bit도 설정에 따라 빠듯 |
| 70B | 약 140GB | 약 35GB | 전체 GPU 적재는 어려움 |
표의 4bit 수치는 가중치만 단순 계산한 값입니다. 실제 필요한 VRAM은 모델 구조, 양자화 형식, 컨텍스트 길이, KV cache, 실행 프로그램에 따라 달라집니다.

16GB를 넘으면 끝인가요? 아닙니다
모델 전체가 VRAM에 들어가지 않아도 일부 레이어를 시스템 RAM과 CPU에 맡기는 GPU Offloading 방법이 있습니다. LM Studio나 llama.cpp 계열 도구에서 자주 만날 수 있습니다.
다만 “실행된다”와 “쾌적하다”는 다른 이야기입니다. VRAM에 모델이 잘 들어갈수록 일반적으로 GPU의 속도를 더 잘 활용할 수 있습니다.
이제 Hugging Face라는 AI 모델 창고에 가봅시다
로컬 AI를 하다 보면 결국 Hugging Face를 만나게 됩니다. 개발자 입장에서는 AI 모델이 진열된 거대한 앱스토어이자 GitHub 같은 공간이라고 생각하면 쉽습니다.

초보자가 모델을 고를 때 먼저 볼 것
- 모델 크기: 7B, 8B, 13B, 14B처럼 파라미터 규모를 확인합니다.
- 파일 형식: llama.cpp나 LM Studio를 쓴다면 GGUF가 편리합니다.
- 양자화: Q4_K_M 같은 4bit 계열은 용량과 품질의 균형 때문에 자주 선택됩니다.
- 라이선스: 상업적 이용 여부와 사용 조건을 반드시 확인합니다.
- Model Card: 어떤 용도로 만든 모델인지, 필요한 실행 방법이 무엇인지 읽어봅니다.
Hugging Face에서 가장 간단하게 다운로드하기
Python이 설치되어 있다면 터미널에서 Hugging Face CLI를 사용할 수 있습니다.
pip install -U huggingface_hub
그 다음 원하는 모델 저장소를 찾았다면 다음처럼 받을 수 있습니다.
hf download HuggingFaceH4/zephyr-7b-beta
특정 폴더에 저장하고 싶다면:
hf download HuggingFaceH4/zephyr-7b-beta --local-dir ./models/zephyr-7b
Hugging Face 공식 문서에 따르면 hf download는 단일 파일뿐 아니라 저장소 전체도 받을 수 있고, --local-dir로 저장 위치를 지정할 수 있습니다.
공식 가이드: Hugging Face – Downloading models
Python 코드로 모델 전체를 받고 싶다면?
from huggingface_hub import snapshot_download
snapshot_download(
repo_id="HuggingFaceH4/zephyr-7b-beta",
local_dir="./models/zephyr-7b"
)
snapshot_download()는 모델 저장소의 스냅샷을 내려받고 여러 파일을 병렬로 처리합니다. 필요한 파일만 선택하거나 제외하는 것도 가능합니다.
공식 가이드: Hugging Face Hub 다운로드 가이드
다운로드 버튼을 누르기 전에 파일 크기부터 보세요
70B라는 숫자를 보고 “일단 받아보자!”라고 누르면 SSD가 먼저 놀랄 수 있습니다.
모델 페이지의 Files and versions에서 실제 파일 크기를 확인하고, GGUF라면 Q4, Q5, Q8 등 어떤 양자화 파일인지 살펴보는 습관이 좋습니다.
정리: 모델 이름만 봐도 내 GPU와 궁합을 짐작할 수 있습니다
이제 모델 이름에 붙은 7B나 70B가 조금 다르게 보일 겁니다.
B는 모델의 덩치를 알려주는 표지판이고, 양자화는 그 덩치를 줄이는 압축 기술이며, VRAM은 모델이 올라가 일할 작업대입니다.
16GB VRAM 그래픽카드를 가지고 있다면 처음부터 70B를 붙잡기보다 7B~14B급 4bit 모델부터 시작해보는 것이 이해도 쉽고 속도도 즐길 만합니다. 이후 20B~30B급을 시험하면서 GPU Offload와 컨텍스트 길이가 성능에 어떤 영향을 주는지 직접 확인하면 로컬 AI가 갑자기 훨씬 재미있어집니다.
핑백: 로컬 AI는 왜 비싼 GPU가 필요할까? VRAM부터 쉽게 이해하기