오과장입니다. 이번 글은 Gemma 4 12B MTP를 RTX 4060 8GB급 노트북에서 현실적으로 돌릴 수 있는지에만 집중합니다. "12B 모델이 8GB VRAM에 들어간다"는 말은 맞을 때도 있지만, MTP 드래프트 모델, KV 캐시, 컨텍스트 길이까지 같이 보면 결론이 조금 달라집니다.
짧은 답변
RTX 4060 8GB 노트북에서도 Gemma 4 12B Q4 계열은 돌릴 수 있습니다. 다만 MTP까지 켜서 빠르게 쓰려면 "모델이 그냥 뜬다"보다 VRAM 배분이 더 중요합니다.
- 가벼운 채팅, 짧은 코드 보조: 가능
- 긴 컨텍스트 코딩 에이전트: 8GB VRAM만 믿으면 답답함
- 새로 산다면: GPU VRAM 8GB보다 시스템 RAM 32GB, SSD 1TB, 냉각 좋은 게이밍 섀시를 같이 봐야 함
- 여유 있게 오래 쓸 목적: RTX 4060 8GB보다는 RTX 5060/5070 8GB 이상 또는 16GB VRAM 모델을 우선 검토
이 도구가 뭔가요?
Gemma 4 12B는 Google 계열의 오픈 웨이트 모델을 로컬에서 쓰는 흐름 중 하나입니다. 여기서 다루는 조합은 Unsloth의 GGUF 패키지와 llama.cpp 서버, 그리고 MTP 드래프트 모델입니다. 쉽게 말하면 12B급 모델을 내 노트북에서 띄우고, 작은 보조 예측기가 다음 토큰 후보를 먼저 던져 속도를 끌어올리는 방식입니다.
용어 먼저 정리
VRAM은 GPU 전용 메모리입니다. 모델 본체, KV 캐시, MTP 드래프트 일부가 여기 들어갑니다.
CUDA는 NVIDIA GPU를 llama.cpp가 빠르게 쓰도록 해주는 실행 기반입니다. RTX 노트북은 이쪽이 핵심입니다.
GGUF는 llama.cpp에서 많이 쓰는 로컬 모델 파일 형식입니다. Q4, Q6, Q8 같은 이름은 압축 정도를 뜻합니다.
Quantization은 모델을 더 작은 비트로 줄이는 작업입니다. Q4는 가볍고, Q8은 무겁지만 원본에 더 가깝습니다.
MTP는 Multi-Token Prediction입니다. 작은 드래프트 모델이 여러 토큰을 미리 제안하고, 본 모델이 검증해 속도를 높입니다.
실사용 사례에서 나온 기준
최근 7일 안의 가장 직접적인 실사용 근거는 llama.cpp GitHub Discussion의 2026년 7월 6일 글입니다. 작성자는 RTX 5060 Laptop 8GB에서 Gemma 4 12B와 공식 MTP 드래프터를 테스트했고, MTP를 잘못 켜면 오히려 느려질 수 있지만 KV 예산을 조정하면 8GB에서도 의미 있는 속도 향상이 나온다고 정리했습니다. 같은 글에서 짧은 컨텍스트 기준 27.4 tok/s였던 기본 실행이 MTP Q6_K head 조합에서 약 40 tok/s로 올라갔고, 16k 컨텍스트에서도 33~37 tok/s 수준의 실제 채팅 속도를 봤다고 합니다.
여기서 중요한 포인트는 "8GB라서 된다/안 된다"가 아니라, 어떤 메모리를 포기하느냐입니다. 글쓴이는 드래프트를 넣겠다고 본 모델 레이어를 GPU에서 빼면 MTP 이득이 사라진다고 봤습니다. 반대로 parallel 값을 낮추고 KV 캐시를 줄여 드래프트 공간을 만들면 전체 레이어를 GPU에 유지할 수 있어 체감 속도가 좋아집니다.
또 다른 최근 근거는 2026년 7월 9일 전후의 omlx GitHub 이슈입니다. 해당 이슈는 Qwen/Ornith 계열 배치 출력 깨짐을 다루지만, 비교 행렬에서 gemma-4-12B-it qat-4bit는 batch 2~4 테스트가 깨끗하게 통과한 것으로 기록되어 있습니다. Mac/MLX 쪽 맥락이 섞여 있어 RTX 노트북 속도 판단의 직접 근거로 쓰긴 어렵지만, Gemma 4 12B QAT 4bit 자체가 최근 로컬 추론 실험에서 안정 비교군으로 쓰이고 있다는 점은 참고할 만합니다.
하드웨어 판단 카드
RTX 4060/5060 8GB, 시스템 RAM 16GB, SSD 여유 15~20GB. 짧은 채팅과 테스트용입니다.
RTX 4060/5060 8GB, 시스템 RAM 32GB, SSD 1TB, 전력 제한이 너무 낮지 않은 게이밍 노트북. 이 글의 구매 기준입니다.
VRAM 16GB 이상. 긴 컨텍스트, 여러 서버, 더 높은 quant를 함께 쓰려면 이쪽이 훨씬 편합니다.
맥 계열과 NVIDIA 계열의 체감 차이
NVIDIA 노트북의 장점은 CUDA와 llama.cpp CUDA 빌드가 성숙해 있고, GPU에 모델 레이어를 최대한 올렸을 때 토큰 생성 속도가 잘 나온다는 점입니다. 단점은 8GB VRAM 벽이 분명합니다. Windows에서는 VRAM을 넘겼을 때 바로 오류가 나지 않고 공유 메모리로 흘러가며 조용히 느려지는 경우가 있어, "실행은 됐는데 갑자기 굼뜬" 상태가 생깁니다.
맥 계열은 unified memory 덕분에 16GB, 24GB, 32GB 메모리를 좀 더 유연하게 쓰기 쉽습니다. 대신 같은 가격대에서 순수 CUDA 최적화 모델의 GPU 속도는 NVIDIA 게이밍 노트북이 더 낫게 나오는 경우가 많습니다. 그래서 Gemma 4 12B를 짧은 채팅, 문서 요약, 가벼운 코딩 보조로 쓸 거면 맥도 편하고, llama.cpp CUDA 플래그를 만지며 속도를 뽑고 싶다면 RTX 쪽이 낫습니다.
설치/세팅 흐름
- NVIDIA 드라이버를 최신 안정판으로 설치합니다. CUDA 실행이 목적이라면 Studio Driver를 우선 고려합니다.
- llama.cpp를 CUDA로 빌드합니다. 예시는
cmake -B build -DGGML_CUDA=ON흐름입니다. - Hugging Face에서
unsloth/gemma-4-12b-it-GGUF의 Q4 계열 본 모델과 MTP Q8_0 또는 Q6 계열 드래프트를 받습니다. - 처음에는 MTP 없이
llama-server -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -ngl 999 -fa on처럼 서버를 띄워 기준 속도를 봅니다. - 그 다음
--spec-type draft-mtp --spec-draft-n-max 2부터 켭니다. 8GB급에서는 n_max를 크게 올리는 것보다 VRAM 여유 확인이 먼저입니다. - 속도가 갑자기 떨어지면 작업 관리자의 전용 GPU 메모리와 공유 GPU 메모리를 봅니다. 공유 메모리가 늘면 컨텍스트, parallel, KV 형식부터 낮춥니다.
어디까지 낮추면 돌아가나
8GB VRAM 노트북에서는 욕심을 순서대로 줄이는 게 좋습니다. 먼저 컨텍스트를 4k~8k로 시작합니다. 그 다음 Q4 계열을 고르고, MTP는 Q8이 아니라 더 작은 드래프트 head가 가능한지 확인합니다. 그래도 느리면 parallel을 1로 두고, 브라우저나 게임 런처처럼 VRAM을 먹는 앱을 닫습니다. 마지막 수단은 일부 레이어 CPU/RAM 오프로딩인데, 이 단계부터는 "돌아간다"와 "쓸 만하다"가 갈라집니다.
처음 세팅하는 사람에게 가장 흔한 함정은 속도 비교를 너무 빨리 하는 겁니다. 첫 실행은 모델 다운로드, 캐시 생성, 백그라운드 인덱싱이 겹칠 수 있으니 같은 프롬프트를 두세 번 반복해 평균을 봐야 합니다. 또 전원 모드가 절전으로 잡힌 노트북은 GPU 전력 제한 때문에 같은 RTX 4060이라도 데스크 위 어댑터 연결 상태와 배터리 상태의 속도가 크게 다릅니다. 로컬 AI용으로 살 장비라면 팬 소음은 어느 정도 받아들이고, 조용함만 강조한 얇은 모델은 피하는 쪽이 낫습니다.
되는 것 / 어려운 것
짧은 질의응답, 한국어/영어 문서 요약, 코드 설명, 간단한 리팩터링 아이디어, 로컬 OpenAI 호환 서버 테스트.
수십만 토큰 컨텍스트, 여러 에이전트 동시 실행, Q8 본 모델과 긴 KV 캐시를 동시에 유지하는 작업, 노트북 배터리 상태에서의 지속 추론.
사도 되는 사람 / 보류할 사람
사도 되는 사람: 로컬 LLM을 배우고, 7B~12B급 모델을 자주 바꿔 돌리며, 게임/영상 작업도 같이 할 사람입니다. RTX 4060 8GB + 32GB RAM 노트북은 입문 장비로 아직 의미가 있습니다.
보류할 사람: 긴 코드베이스 전체를 먹이는 에이전트, 여러 모델 동시 실행, 고품질 비전/영상 모델까지 한 대로 처리하려는 사람입니다. 이 경우 16GB VRAM 이상 데스크톱 GPU나 상위 노트북을 기다리는 편이 낫습니다.
자주 하는 질문
Q. RTX 4060 8GB면 Gemma 4 12B를 무조건 쓸 수 있나요?
무조건은 아닙니다. Q4 계열과 짧은 컨텍스트는 가능성이 높지만, MTP와 긴 KV 캐시를 같이 쓰면 VRAM 배분을 조정해야 합니다.
Q. RAM 16GB 노트북은 어떤가요?
테스트는 가능하지만 추천은 32GB입니다. 모델 파일, 브라우저, IDE, OS 캐시까지 같이 보면 16GB는 금방 답답해집니다.
Q. MTP를 켜면 품질이 떨어지나요?
원리는 본 모델이 토큰을 검증하는 방식이라 품질 저하를 목표로 하는 기능은 아닙니다. 다만 설정이 과하면 속도 이득이 줄거나 메모리 압박이 커질 수 있습니다.
Q. RTX 4060과 RTX 5060 중 어느 쪽이 낫나요?
새 제품을 같은 가격에 산다면 RTX 5060 쪽을 보되, VRAM이 같은 8GB라면 결정적 차이는 아닙니다. 로컬 AI 용도는 GPU 세대보다 VRAM, RAM, 발열 제어가 같이 중요합니다.
출처와 근거
- Unsloth Gemma 4 12B GGUF MTP README - 2026년 7월 중 업데이트된 MTP 실행 명령과 llama.cpp 요구사항 확인
- llama.cpp Discussion #25357 - 2026년 7월 6일 RTX 5060 Laptop 8GB 실측과 KV 예산 조정 의견
- omlx GitHub Issue #2119 - 최근 배치 안정성 비교에서 gemma-4-12B-it qat-4bit가 안정 비교군으로 기록된 사례
- Unsloth Release Notes - Gemma 4 12B, Studio 업데이트, 재설치 안내 확인
구매 판단
이 글의 결론은 "RTX 4060 8GB 노트북을 로컬 AI 전용 머신처럼 과신하지 말자"입니다. 하지만 이미 게임용 노트북이 필요하고, 로컬 LLM도 배우고 싶다면 RTX 4060 8GB + RAM 32GB 구성은 아직 쓸모가 있습니다. 특히 Gemma 4 12B Q4, Qwen 7B/8B, 문서 요약용 서버를 바꿔가며 테스트하는 입문자에게는 가격과 성능의 균형이 나쁘지 않습니다.
구매할 때는 제품명에 RTX 4060만 있는지 보지 말고, 메모리가 32GB인지, SSD가 1TB 이상인지, FreeDOS인지 Windows 포함인지, 전력 제한이 지나치게 낮은 얇은 섀시인지까지 같이 보세요. Gemma 4 12B MTP는 8GB에서도 돌아갈 수 있지만, 쾌적함은 나머지 구성에서 갈립니다.