앞선 두 글에서 우리는 두 가지를 알아봤습니다.
첫 번째는 왜 로컬 AI를 돌리려면 GPU와 VRAM이 중요한가였습니다. 두 번째는 7B, 13B, 70B가 무엇이고 모델 크기가 VRAM과 어떤 관계가 있는가였습니다.
이제 이론은 충분합니다. 이번에는 실제로 모델 하나를 내 PC 안으로 데려와 말을 걸어보겠습니다.
목표는 단순합니다. RTX 4070 Ti SUPER 16GB에서 인터넷 AI 서비스가 아닌, 내 그래픽카드가 직접 계산하는 LLM과 대화하기.

0. 지난 글을 먼저 보면 훨씬 쉽습니다
GPU와 VRAM 자체가 아직 낯설다면 먼저 왜 우리는 로컬 AI를 돌리기 위해 값비싼 그래픽카드를 사야 할까?를 읽어보세요.
7B, 13B와 Q4 같은 단어가 외계어처럼 보인다면 7B, 13B, 70B는 무슨 뜻일까?부터 이어서 읽으면 좋습니다.
1. 오늘 사용할 도구는 LM Studio입니다
명령 프롬프트부터 열 필요는 없습니다. 이번 글은 처음 로컬 LLM을 실행하는 사람을 기준으로 LM Studio를 사용합니다.
LM Studio는 Windows, macOS, Linux에서 로컬 LLM을 검색하고 내려받아 실행할 수 있는 프로그램입니다. 내부적으로 GGUF 모델을 llama.cpp 기반 런타임으로 실행할 수 있고, Hugging Face의 모델도 검색할 수 있습니다.
공식 사이트: LM Studio
Windows용 설치 프로그램을 받아 일반 프로그램처럼 설치하면 됩니다.
2. 설치가 끝났다면 Discover로 갑니다
LM Studio를 실행하면 여러 메뉴가 보입니다. 우리가 처음 갈 곳은 Discover입니다.

여기서 Qwen, Gemma, Llama, Mistral 같은 이름을 검색할 수 있습니다. LM Studio 공식 문서도 Discover 탭에서 모델을 검색하고 다운로드하는 방식을 기본 시작법으로 안내합니다.
3. 잠깐, GGUF가 뭐였죠?
Hugging Face에서 모델을 찾다 보면 파일 이름 끝에 .gguf가 붙은 것을 자주 만나게 됩니다.
GGUF는 로컬 추론에 널리 사용되는 모델 파일 형식입니다. 모델 정보와 텐서를 한 파일에 담을 수 있고 여러 양자화 형식을 지원합니다.
쉽게 표현하면 “로컬 LLM을 PC로 가져오기 좋게 포장한 여행가방” 정도로 생각해도 됩니다.
4. Q2, Q4, Q5… 또 숫자가 나왔습니다
같은 모델인데도 파일 목록에는 Q2_K, Q3_K_M, Q4_K_M, Q5_K_M, Q8_0 같은 이름이 여러 개 보입니다.
모델이 여러 개인 것이 아닙니다. 같은 모델을 얼마나 압축해서 저장했는가가 다른 것입니다.
Hugging Face 문서에서 Q4_K는 대략 4비트 계열의 block quantization이고, Q5_K와 Q6_K로 올라갈수록 weight당 사용하는 비트 수도 증가합니다.
일반적인 첫 실험에서는 Q4_K_M 계열이 용량과 품질 사이에서 출발점으로 많이 쓰입니다. LM Studio 역시 처음 선택할 때 4-bit 이상을 고려하도록 안내합니다.

5. RTX 4070 Ti SUPER 16GB라면 무엇부터 받아볼까?
처음부터 70B 모델을 고를 필요는 없습니다. 16GB VRAM이라면 우선 7B~14B급의 Q4 계열에서 시작하는 것이 편합니다.
예를 들어 7B~8B Q4 모델은 파일 크기가 대략 몇 GB 수준인 경우가 많아 16GB VRAM에서 상당한 여유를 확보할 수 있습니다. 14B급 Q4 모델도 충분히 현실적인 실험 대상입니다.
다만 파일 크기 = 실제 VRAM 사용량은 아닙니다. 모델 가중치 외에도 KV cache와 context length 등 추가 메모리가 필요하기 때문입니다.
6. 모델을 다운로드합니다
원하는 모델을 골랐다면 GGUF 버전과 양자화 수준을 확인하고 Download를 누릅니다.
여기서 초보자에게 권하고 싶은 습관이 하나 있습니다.
다운로드 버튼부터 누르지 말고 파일 크기를 먼저 보세요.
SSD 공간도 필요하고, 모델을 메모리에 올릴 때 RAM과 VRAM도 필요합니다. 4GB짜리 모델과 40GB짜리 모델은 이름은 비슷해 보여도 완전히 다른 손님입니다.
7. 이제 모델을 VRAM에 올려봅니다
다운로드가 끝났다면 Chat 화면으로 이동합니다. 모델 선택 메뉴에서 방금 받은 모델을 선택하면 LM Studio가 모델을 메모리에 로드합니다.
이 순간 지난 글에서 이야기했던 “VRAM이라는 책상 위에 AI 모델을 펼치는 과정”이 실제로 일어납니다.
LM Studio에서는 모델 로드 시 GPU 사용 정도와 context length 같은 설정을 조정할 수 있습니다. CLI에서는 GPU offload 비율을 지정하거나 모델을 실제로 올리지 않고 메모리 예상치를 계산하는 기능도 제공합니다.
8. GPU Offload는 무엇을 의미할까요?
모델의 연산 레이어를 가능한 만큼 GPU에 맡기는 것입니다.
16GB VRAM 안에 모델과 필요한 데이터가 충분히 들어간다면 GPU 쪽에 많이 올리는 것이 일반적으로 유리합니다. 모델이 너무 크다면 일부는 시스템 메모리와 CPU를 활용할 수 있습니다.
즉, VRAM 문 앞에서 경비원이 이렇게 묻는 셈입니다.
“16GB 안에 다 들어오실 수 있습니까?”
7B Q4 모델이라면 대체로 넉넉한 편입니다. 모델이 커지고 context를 길게 잡을수록 상황은 달라집니다.
9. 정말 GPU를 사용하고 있는지 확인해봅시다
Windows에서는 작업 관리자 → 성능 → GPU에서 전용 GPU 메모리 사용량을 확인할 수 있습니다.
조금 더 개발자스럽게 확인하고 싶다면 터미널에서 다음 명령을 실행합니다.
nvidia-smi
LM Studio에서 모델을 로드하기 전과 후의 VRAM 사용량을 비교해보세요. 숫자가 갑자기 올라간다면 우리가 앞선 두 글에서 계속 이야기했던 바로 그 장면입니다.
“모델이 VRAM에 올라갔다.”
10. 드디어 내 PC 안의 AI에게 첫 질문을 해봅니다
Chat 창에서 간단하게 입력해봅니다.
안녕. 너는 지금 인터넷 서버가 아니라
내 PC의 GPU에서 실행되고 있어.
한국어로 자기소개를 해줘.
답변이 나타난다면 성공입니다.
겉으로는 ChatGPT와 비슷한 채팅창이지만 구조는 완전히 다릅니다. 질문을 외부 AI 서버에 보내 답을 받아오는 것이 아니라, 다운로드한 모델의 추론을 내 PC가 수행하고 있습니다.
11. 인터넷을 끊어도 대화할 수 있을까?
모델과 필요한 런타임이 이미 준비되어 있다면 LM Studio는 로컬 모델을 오프라인으로 실행할 수 있습니다.
한 번 인터넷을 끊고 같은 질문을 해보세요. 답변이 계속 생성되는 경험은 로컬 AI의 개념을 이해하는 가장 빠른 실습 중 하나입니다.
12. 16GB VRAM에서 욕심을 조금 내보겠습니다
7B~8B Q4가 잘 돌아간다면 다음에는 12B~14B급을 시험해봅니다. 이후에는 Q5로 품질을 조금 올려보거나 context length를 바꿔 VRAM 사용량과 속도가 어떻게 변하는지 관찰해볼 수 있습니다.
중요한 것은 “가장 큰 모델”을 실행하는 것이 아닙니다.
내 하드웨어 안에서 모델 크기, 품질, 속도, context 길이의 균형점을 찾는 것이 로컬 AI의 재미입니다.
13. Hugging Face에서 찾은 모델 URL을 LM Studio에 넣을 수도 있습니다
앞선 글에서 Hugging Face에서 직접 모델을 찾는 방법을 알아봤습니다. LM Studio는 검색창에 Hugging Face의 모델 URL을 넣어 지원되는 모델을 찾을 수도 있습니다.
즉 흐름은 이렇게 연결됩니다.
Hugging Face에서 모델 발견 → GGUF 여부 확인 → Q4_K_M 등 양자화 선택 → LM Studio 다운로드 → GPU에 로드 → Chat.
처음에는 복잡해 보였던 단어들이 이제 하나의 파이프라인으로 연결됩니다.
14. 여기서 끝이 아닙니다. 로컬 AI를 API 서버로 만들 수 있습니다
LM Studio는 단순 채팅 프로그램만은 아닙니다. 로컬 모델을 REST API나 OpenAI 호환 방식의 endpoint로 제공할 수 있습니다.
이 말은 Python 프로그램이나 Node.js, 자동화 도구에서 내 PC의 로컬 LLM을 호출할 수 있다는 뜻입니다.
인터넷의 유료 LLM API를 호출하는 대신 localhost에서 내 모델을 호출하는 구조를 만들 수 있습니다.
바로 여기부터 로컬 AI는 재미있는 장난감에서 개발 도구로 변하기 시작합니다.
마무리: 이제 7B라는 숫자가 파일이 아니라 ‘실제로 움직이는 AI’가 되었습니다
처음에는 GPU 가격 이야기에서 시작했습니다.
왜 비싼 그래픽카드가 필요한지 알아봤고, VRAM이 왜 중요한지도 알아봤습니다. 다음으로 7B와 70B의 차이, FP16과 4bit 양자화, Hugging Face와 GGUF를 알아봤습니다.
그리고 이번에는 그 모델을 실제로 다운로드해 GPU 메모리에 올리고 말을 걸었습니다.
GPU → VRAM → 파라미터 → 양자화 → GGUF → Hugging Face → LM Studio → 로컬 LLM.
따로 놀던 단어들이 이제 하나의 그림으로 연결됩니다.
그런데 여기서 개발자라면 다음 질문이 생깁니다.
“잠깐. 이 모델을 채팅창에서만 쓰지 말고 Python 프로그램에서 호출하면 안 될까?”
됩니다.
다음 글에서는 LM Studio를 로컬 API 서버로 열고 Python에서 요청을 보내 나만의 로컬 AI 프로그램을 만들어보겠습니다.




















