오과장입니다. 로컬 코딩 LLM을 돌리려고 그래픽카드를 볼 때, 이제 질문이 조금 바뀌었습니다. “24GB면 충분한가요?”에서 “MTP까지 켰을 때 32GB가 실제로 편한가요?”로 넘어왔습니다. 이번 글은 Qwen3.6-27B-MTP-GGUF 하나만 놓고, RTX 5090 32GB급 장비가 어떤 사람에게 현실적인지 최근 7일 안의 llama.cpp·Ollama 이슈와 공식 문서를 기준으로 정리합니다.

짧은 답변
RTX 5090 32GB는 Qwen3.6-27B-MTP-GGUF를 “그냥 켜보는” 수준이 아니라 긴 문맥과 MTP 옵션까지 실험하려는 사람에게 의미가 있습니다. 2026년 7월 7일 llama.cpp 이슈에서는 RTX 5090 32GB에서 Qwen3.6-27B-UD-Q4_K_XL을 MTP와 함께 실행하며 메모리 fitting이 MTP 컨텍스트를 약 500MiB 크게 잡는 문제를 보고했습니다. 같은 주에 수정 PR도 올라왔습니다.
반대로 RTX 5070 12GB는 “최신 세대니까 괜찮겠지”라고 보기 어렵습니다. 7월 5일 이슈에는 RTX 5070 12GB에서 MTP GGUF 모델 실행 중 CUDA 실패와 GPU lost from bus가 보고됐습니다. 결론은 단순합니다. Qwen3.6-27B-MTP를 로컬 코딩용으로 오래 굴릴 생각이면 12GB는 피하고, 24GB는 시작선, 32GB는 스트레스를 줄이는 권장선입니다.
이 도구가 뭔가요?
Qwen3.6-27B-MTP-GGUF는 Qwen 계열 27B급 오픈 웨이트 모델을 llama.cpp, Ollama, LM Studio 같은 로컬 실행기로 쓰기 쉽게 만든 GGUF 모델입니다. MTP는 Multi-Token Prediction의 줄임말로, 다음 토큰을 하나씩만 보는 대신 여러 후보를 함께 다뤄 생성 속도를 올리려는 방식입니다. 공식 Hugging Face 모델 카드는 Apache-2.0 라이선스와 llama.cpp, Ollama, vLLM, SGLang, Unsloth Studio 실행 경로를 안내합니다.
왜 지금 RTX 5090 32GB를 따져봐야 하나요
Qwen3.6-27B-MTP-GGUF는 가벼운 챗봇용 모델이 아닙니다. Q4 계열로 양자화해도 모델 본체, KV cache, compute buffer, MTP draft context가 같이 올라갑니다. 짧은 질문 몇 개만 던질 때는 24GB 카드도 꽤 괜찮습니다. 하지만 코딩 LLM은 저장소 파일, 에러 로그, 테스트 결과, 요구사항을 길게 넣고 여러 번 왕복합니다. 여기서 VRAM 여유가 없으면 속도보다 먼저 안정성이 흔들립니다.
NVIDIA 공식 RTX 5090 페이지는 이 카드가 32GB GDDR7 메모리를 갖췄다고 설명합니다. 이 32GB는 마케팅 숫자보다 실사용에서 더 중요합니다. 27B 모델을 Q4로 낮추고도 긴 컨텍스트와 MTP를 켜면, 24GB에서는 “들어가긴 하는데 옵션을 줄여야 하는” 장면이 자주 나옵니다. 32GB는 그 줄타기를 줄여줍니다.
용어 먼저 정리
CUDA: NVIDIA GPU로 AI 계산을 돌리는 기본 실행 환경입니다. Qwen3.6을 llama.cpp에서 GPU 가속으로 쓰려면 드라이버와 CUDA 호환성이 중요합니다.
VRAM: 그래픽카드 전용 메모리입니다. 로컬 LLM에서는 GPU 이름보다 모델과 캐시가 이 안에 들어가는지가 먼저입니다.
GGUF: llama.cpp 계열에서 많이 쓰는 모델 파일 형식입니다. Ollama, LM Studio도 이 흐름과 잘 맞습니다.
quantization: 모델 숫자 정밀도를 낮춰 메모리 사용량을 줄이는 작업입니다. Q4, Q5, Q8처럼 표시하고, 숫자가 높을수록 무겁지만 품질 보존에 유리합니다.
MTP: 다음 토큰 후보를 더 넓게 예측해 속도를 올리려는 기능입니다. 빠를 수 있지만 draft context와 버퍼가 붙어 VRAM을 더 먹을 수 있습니다.
실사용 사례에서 나온 기준
첫 번째 사례는 RTX 5090 32GB입니다. 7월 7일 llama.cpp 이슈 #25408 작성자는 RTX 5090에서 Qwen3.6-27B-UD-Q4_K_XL을 --spec-type draft-mtp와 함께 실행했습니다. 이 환경에서 fit-params가 MTP 컨텍스트를 실제보다 크게 잡아, 컨텍스트를 과하게 줄이는 문제가 보고됐습니다. 핵심은 “5090도 무한정 넉넉한 게 아니라, fitting 계산과 컨텍스트 설정을 봐야 한다”는 점입니다.
두 번째 사례는 RTX 5070 12GB입니다. 7월 5일 llama.cpp 이슈 #25318은 RTX 5070, Ubuntu 24.04, NVIDIA Driver 595.71.05, CUDA 13.2 환경에서 MTP GGUF 모델 실행 중 CUDA unspecified launch failure와 GPU lost from bus를 보고했습니다. 모델은 Qwen 자체는 아니지만 qwen alias로 MTP GGUF를 돌린 사례라, “Blackwell이면 12GB도 괜찮다”는 식의 단순 판단을 깨는 근거로 충분합니다.
세 번째 사례는 Intel Arc B70 Pro 듀얼 구성입니다. 7월 3일 llama.cpp 이슈 #25286은 SYCL 백엔드에서 device lost와 out of device memory를 보고했습니다. 요즘 Intel GPU도 로컬 AI에서 관심을 받지만, Qwen3.6-MTP 같은 최신 GGUF 실험은 아직 NVIDIA CUDA 쪽 커뮤니티 신호가 더 빠릅니다. 새 장비를 사는 입장에서는 이 차이를 무시하기 어렵습니다.
네 번째 보조 신호는 Mac입니다. 7월 6일 Ollama 이슈 #17050은 MacBook Air M3 24GB에서 Qwen3.5/Qwen3.6의 MLX 변형이 느리거나 실행이 어렵다는 보고를 담고 있습니다. 맥은 조용하고 전력 효율이 좋지만, MTP·GGUF·CUDA 최적화를 만지는 로컬 코딩 실험실로는 NVIDIA 데스크톱이 더 수월합니다.
최소 사양과 권장 사양을 나눠보면
RTX 4070 Ti Super/5070 Ti급 16GB, RAM 32GB, NVMe 50GB 이상. Q4 이하와 짧은 문맥은 가능성이 있지만, MTP와 긴 코딩 세션은 여유가 적습니다.
RTX 3090/4090 24GB, RAM 64GB, NVMe 1TB. Qwen3.6-27B Q4 계열을 개인 코딩 보조로 굴려볼 수 있지만, MTP와 긴 컨텍스트를 동시에 욕심내면 옵션 조절이 필요합니다.
RTX 5090 32GB, RAM 64~128GB, 빠른 NVMe 1TB 이상. 24GB보다 여유가 있어 MTP, 64K 이상 문맥, 장시간 에이전트 실험에서 덜 피곤합니다.
병목은 VRAM, 그다음은 컨텍스트입니다
첫 병목은 VRAM입니다. 모델 파일만 보고 “Q4면 작다”고 생각하면 곤란합니다. 실제 실행에서는 KV cache와 compute buffer가 붙습니다. MTP를 켜면 draft context까지 고려해야 합니다. 7월 8일 병합된 llama.cpp PR #25465도 speculative context fitting의 over-allocation을 고치는 내용입니다. 최신 빌드를 써야 하는 이유가 여기에 있습니다.
두 번째 병목은 컨텍스트입니다. 코딩 LLM은 짧은 채팅보다 앞부분을 오래 들고 갑니다. 8K 문맥에서는 멀쩡하던 세팅이 64K나 128K로 올라가면 VRAM 계산이 달라집니다. 초보자는 처음부터 128K를 목표로 잡지 말고, 8K에서 정상 동작을 본 뒤 16K, 32K, 64K 순서로 올리는 게 안전합니다.
세 번째 병목은 드라이버입니다. RTX 5070 이슈처럼 GPU lost from bus가 나오면 설정값만 바꿔 해결하기 어렵습니다. NVIDIA 드라이버, CUDA 버전, llama.cpp 빌드가 함께 맞아야 합니다. 그래서 업무용 메인 PC라면 검증된 안정 조합을 쓰고, 실험용 PC라면 업데이트 로그를 남겨두는 편이 좋습니다.

맥 계열과 NVIDIA 계열의 체감 차이
Mac mini나 MacBook Pro의 Apple Silicon은 조용하고 전력 효율이 좋습니다. 통합 메모리라 작은 모델을 로컬로 돌릴 때 경험도 깔끔합니다. 문서 요약, 가벼운 챗, 작은 코딩 보조는 맥에서도 충분히 할 만합니다.
하지만 Qwen3.6-27B-MTP-GGUF처럼 최신 GGUF, MTP, 긴 컨텍스트, llama.cpp 옵션을 계속 만지는 작업은 NVIDIA 쪽이 훨씬 자료가 많습니다. CUDA 로그, VRAM fitting, -ngl, -b, -ub, KV cache 타입 같은 옵션을 커뮤니티가 빠르게 검증합니다. 조용한 개인 비서면 맥, 로컬 코딩 실험실이면 RTX 데스크톱 쪽이 맞습니다.
낮추면 돌아가는 설정
1. Q8부터 시작하지 말고 UD-Q4_K_XL 또는 Q4_K_M 계열로 시작합니다.
2. 컨텍스트는 8K 또는 16K로 시작하고, 안정성을 확인한 뒤 올립니다.
3. MTP는 --spec-type draft-mtp를 바로 크게 주지 말고 draft 수를 낮게 잡습니다.
4. 메모리 자동 fitting을 쓸 때는 최신 llama.cpp 빌드와 관련 이슈 상태를 확인합니다.
5. OOM이나 driver crash가 보이면 문맥 길이, batch, ubatch, MTP 옵션을 한 번에 하나씩만 줄입니다.
설치/세팅 흐름
- 하드웨어를 먼저 확인합니다. 이번 권장선은 RTX 5090 32GB, 시스템 RAM 64GB 이상, NVMe 여유 1TB급입니다.
- NVIDIA 드라이버와 CUDA 환경을 맞춥니다. Linux 또는 WSL2가 로그 확인과 빌드에는 편합니다.
- 가장 쉬운 첫 실행은 공식 모델 카드처럼
llama serve -hf unsloth/Qwen3.6-27B-MTP-GGUF:UD-Q4_K_XL로 시작하는 방식입니다. - 직접 빌드한다면
git clone https://github.com/ggml-org/llama.cpp.git후 CUDA 옵션으로 최신 빌드를 만듭니다. - 처음 실행은 8K~16K 문맥, Q4 계열, 동시 요청 1개로 tokens/s와 첫 토큰 지연을 기록합니다.
- 그다음 MTP, 긴 문맥, 에이전트 연결을 하나씩 추가합니다. 한 번에 다 켜면 병목 원인을 찾기 어렵습니다.
잘 맞는 작업과 아직 부담스러운 작업
잘 맞는 작업
개인 코드 리뷰, 테스트 작성, 함수 단위 리팩터링, 에러 로그 해석, 작은 저장소 구조 파악은 RTX 5090 32GB에서 꽤 편하게 노려볼 수 있습니다. 특히 24GB에서 아슬아슬하던 문맥 길이를 조금 더 여유 있게 잡을 수 있습니다.
아직 부담스러운 작업
여러 명이 동시에 붙는 서버, 128K 이상 문맥을 항상 유지하는 에이전트, 여러 모델을 동시에 올리는 구성은 5090 한 장도 만능이 아닙니다. 여기부터는 RTX PRO 6000, 듀얼 GPU, 원격 서버와 비교해야 합니다.
사도 되는 사람 / 보류할 사람
사도 되는 사람은 로컬 LLM을 취미가 아니라 업무 도구로 계속 만질 사람입니다. 코딩 에이전트, 긴 프롬프트, Ollama·llama.cpp·LM Studio를 자주 바꾸며 실험한다면 32GB VRAM의 여유가 시간을 아껴줍니다. 드라이버와 로그를 직접 볼 수 있는 데스크톱 운용자에게 특히 잘 맞습니다.
보류할 사람은 단순 챗봇이나 가벼운 문서 요약만 원하는 사람입니다. 그런 용도라면 RTX 5090은 과합니다. Mac mini, RTX 4060 Ti 16GB, RTX 4070급 노트북, 클라우드 API가 더 합리적일 수 있습니다. 또 케이스 공간, 12VHPWR 전원, 파워 용량을 확인하지 못한다면 구매를 미루는 편이 낫습니다.
자주 하는 질문
낮은 설정에서 실험은 가능할 수 있지만 권장하지 않습니다. 최근 RTX 5070 12GB MTP 이슈처럼 드라이버 안정성 문제까지 나오면 초보자가 해결하기 어렵습니다.
생성 속도도 차이가 나지만, 이번 주제에서는 8GB VRAM 차이가 더 중요합니다. 긴 문맥과 MTP를 같이 쓰면 32GB가 세팅 여유를 줍니다.
조용함과 휴대성은 맥이 좋습니다. 다만 Qwen3.6-MTP-GGUF의 최신 실험, CUDA 최적화, llama.cpp 이슈 대응은 NVIDIA 데스크톱 자료가 더 풍부합니다.
RTX 5090을 살 정도의 로컬 LLM PC라면 64GB를 최소로 보는 편이 좋습니다. IDE, 브라우저, Docker, 로그, 모델 다운로드를 같이 열면 32GB는 금방 답답합니다.
구매 판단
이번 글의 조건에 맞춰 연결한 제품은 GIGABYTE AORUS GEFORCE RTX 5090 STEALTH ICE D7 32GB 그래픽카드입니다. 핵심은 브랜드가 아니라 RTX 5090과 32GB GDDR7 VRAM입니다. Qwen3.6-27B-MTP-GGUF를 오래 굴릴 장비라면 그래픽카드 길이, 보조전원, 파워서플라이, 케이스 흡배기, 보증 조건을 같이 봐야 합니다.
최종 판단은 이렇게 나누면 됩니다. 이미 RTX 3090/4090 24GB가 있다면 먼저 그 장비에서 Q4와 16K 문맥으로 시작하세요. 새로 고가 GPU를 살 계획이고 로컬 코딩 LLM을 장기간 쓸 생각이라면 RTX 5090 32GB는 납득 가능한 선택입니다. 반대로 “가끔 로컬 챗만 해보고 싶다”면 이 가격대는 확실히 과합니다.
근거 링크
- Hugging Face unsloth/Qwen3.6-27B-MTP-GGUF: Apache-2.0 라이선스, GGUF 형식, llama.cpp/Ollama 실행 경로 확인.
- NVIDIA RTX 5090 공식 페이지: 32GB GDDR7 스펙 확인.
- llama.cpp issue #25408: 2026년 7월 7일 RTX 5090 32GB에서 Qwen3.6-27B MTP fitting 과대 추정 보고.
- llama.cpp PR #25465: 2026년 7월 8일 speculative context fitting 수정 근거.
- llama.cpp issue #25318: 2026년 7월 5일 RTX 5070 12GB MTP CUDA driver crash 보고.
- llama.cpp issue #25286: 2026년 7월 3일 Intel Arc B70 Pro SYCL OOM/device lost 보고.
- Ollama issue #17050: 2026년 7월 6일 MacBook Air M3 24GB에서 Qwen MLX 변형 문제 보고.