오과장입니다. 로컬 LLM을 노트북에서 돌린다고 하면 보통 “몇 B 모델까지 가능하냐”만 묻는데, 이번 Qwen3.6-27B-MTP 쪽은 질문을 조금 바꿔야 합니다. 모델 파일이 올라가느냐보다, 긴 문맥과 MTP를 켠 상태에서 VRAM이 얼마나 남느냐가 훨씬 중요합니다.

- Qwen3.6-27B-MTP-GGUF는 RTX 5090 24GB 노트북에서도 텍스트 전용, Q4 계열, 짧은 문맥 조건이면 시도할 만합니다.
- 다만 최근 llama.cpp 이슈에서 22GB급 GPU는 80k 컨텍스트를 간신히 올린 뒤 생성 중 OOM이 났고, 32GB급 RTX 5090도 긴 문맥+MTP+비전 조합에서는 여유가 크지 않았습니다.
- 노트북 구매 기준으로는 VRAM 24GB, 시스템 RAM 64GB, SSD 2TB를 권장선으로 보고, 80k 이상 장문·이미지 입력·여러 동시 요청은 데스크톱 32GB 이상으로 넘기는 편이 낫습니다.
- Mac 계열은 전력과 조용함은 좋지만, 이 조합에서는 CUDA 생태계와 llama.cpp CUDA 백엔드가 더 빠르게 검증되고 있습니다.
이 도구가 뭔가요?
Qwen3.6-27B는 Qwen 계열의 27B급 오픈 모델이고, GGUF는 llama.cpp 같은 로컬 실행 도구에서 쓰기 쉬운 모델 파일 형식입니다. MTP는 Multi-Token Prediction의 줄임말로, 한 번에 다음 토큰 후보를 더 공격적으로 예측해 속도를 끌어올리는 방식입니다. 쉽게 말하면 코딩 보조용 대형 모델을 내 PC 안에서 돌리되, 속도와 메모리 사이에서 계속 줄타기를 하는 조합입니다.
용어 먼저 정리
- CUDA: NVIDIA 그래픽카드에서 AI 계산을 빠르게 돌리게 해 주는 실행 기반입니다.
- VRAM: 그래픽카드 전용 메모리입니다. 모델 무게, 문맥 길이, 캐시가 여기에 올라갑니다.
- GGUF: llama.cpp가 읽기 좋은 로컬 LLM 파일 형식입니다. 같은 모델도 Q4, Q5처럼 여러 압축 단계로 나옵니다.
- Quantization: 모델을 더 작은 숫자 형식으로 줄이는 작업입니다. Q4는 가볍고, Q5/Q6는 품질이 조금 더 좋지만 메모리를 더 씁니다.
- Context: 모델이 한 번에 기억하고 참고하는 입력 길이입니다. 8k, 32k, 80k처럼 커질수록 VRAM이 빠르게 늘어납니다.
- MTP: 여러 토큰을 미리 예측해 속도를 높이는 기법입니다. 편하지만 최근 이슈 기준으로 VRAM 여유를 더 요구합니다.
실사용 사례에서 나온 기준
이번 판단의 핵심은 공식 모델 카드보다 최근 이슈입니다. Hugging Face에서 Qwen/Qwen3.6-27B는 Apache-2.0 라이선스 모델로 올라와 있고, Unsloth의 GGUF 저장소에는 Q4, Q5, Q6, Q8 등 여러 양자화 파일이 준비되어 있습니다. 여기까지만 보면 “내 GPU에 맞는 파일을 고르면 되겠네”처럼 보입니다.
하지만 2026년 5월 20일에 올라온 llama.cpp 이슈들을 보면 사정이 조금 달라집니다. 한 사용자는 RTX 5090에서 VRAM 32.6GiB가 보이는 환경으로 Qwen3.6-27B-UD-Q5_K_XL, MTP, mmproj 비전 파일을 함께 올렸고, 긴 42k 토큰 요청 뒤 VRAM 잔류량이 올라가며 mmproj 초기화에서 CUDA OOM을 만났다고 적었습니다. 또 다른 사용자는 22GB 2080 Ti에서 Qwen3.6-27B-MTP Q4_K_XL을 80k 컨텍스트로 거의 꽉 채워 올렸지만, 생성이 진행되면서 21.05GB에서 21.75GB까지 늘다가 10k 토큰 부근에서 OOM이 났다고 보고했습니다.
이 말은 간단합니다. 모델 파일이 로딩된다는 사실과 하루 종일 안정적으로 쓴다는 사실은 다릅니다. 특히 코딩용으로 긴 저장소 파일을 붙여 넣고, 서버 모드로 켜 두고, MTP까지 쓰면 여유 VRAM 2~3GB는 금방 사라질 수 있습니다.
- 공식 모델: Qwen/Qwen3.6-27B는 Hugging Face에 Apache-2.0 라이선스로 공개되어 있습니다.
- GGUF 배포: Unsloth 저장소에는 Q4_0, Q4_K_M, Q5_K_M, Q6_K, Q8_0 등 여러 GGUF 파일이 있습니다.
- 32GB급 사례: RTX 5090 32.6GiB 환경에서도 긴 문맥, MTP, 비전 mmproj를 함께 쓰면 VRAM 압박과 OOM이 보고됐습니다.
- 22GB급 사례: 80k 컨텍스트는 올라가도 생성 중 VRAM이 증가해 OOM으로 이어진 사례가 있습니다.
- 다중 GPU 사례: Qwen3.5-122B MTP 쪽에서는 RTX 3060+RTX 4050 조합에서 출력 품질 문제가 보고되어, MTP가 항상 만능 가속 버튼은 아니라는 점도 보입니다.
최소 사양과 권장 사양
최소 사양을 아주 공격적으로 잡으면 16GB VRAM에서도 작은 양자화와 짧은 컨텍스트로 “실행”은 가능할 수 있습니다. 그러나 이 글의 주제는 Qwen3.6-27B-MTP를 코딩 보조로 쓰는 것입니다. 저장소 파일을 읽히고, 긴 프롬프트를 넣고, 여러 번 대화하는 용도라면 최소 사양은 추천 사양이 아닙니다.
- 16GB VRAM: 27B MTP를 메인 작업용으로 권하기 어렵습니다. 더 작은 Qwen3 14B급이나 8B급이 낫습니다.
- 24GB VRAM: Q4 계열, 8k~32k 문맥, 텍스트 전용이면 실사용 후보입니다. RTX 5090 노트북은 여기에 해당합니다.
- 32GB VRAM 이상: Q5, 긴 문맥, 비전 mmproj, 서버 상시 실행까지 생각한다면 이쪽이 더 맞습니다.
- RAM 32GB: 단일 모델 실험은 가능하지만 브라우저, IDE, Docker까지 켜면 빡빡합니다.
- RAM 64GB: 로컬 LLM과 개발 환경을 같이 쓰는 노트북의 현실적 권장선입니다.
- SSD 2TB: GGUF 파일 여러 개, 개발 프로젝트, 캐시, Docker 이미지를 함께 두려면 1TB도 빨리 찹니다.
맥 계열과 NVIDIA 계열 체감 차이
맥북 프로나 맥미니 M 계열은 조용하고 전력 효율이 좋습니다. 통합 메모리도 커서 64GB, 96GB 구성이라면 큰 모델을 올려 보는 재미가 있습니다. 다만 이번 조합처럼 llama.cpp CUDA 이슈가 빠르게 쌓이고, MTP·mmproj·VRAM 동작을 세밀하게 봐야 하는 경우에는 NVIDIA 쪽 자료가 더 직접적입니다.
NVIDIA 노트북의 장점은 CUDA 기준으로 문제를 찾고 해결하기 쉽다는 점입니다. 단점은 명확합니다. 노트북 RTX 5090은 이름은 5090이어도 데스크톱 RTX 5090 32GB와 같은 여유를 기대하면 안 됩니다. 24GB VRAM은 충분히 큰 숫자지만, 27B MTP와 긴 문맥 앞에서는 “넉넉함”이 아니라 “상한선에 가까운 출발점”입니다.
어떤 설정을 낮추면 되나
- 양자화: 처음부터 Q5/Q6를 고집하지 말고 Q4_K_M 또는 Q4 계열로 시작합니다.
- 컨텍스트: 80k 대신 8k, 16k, 32k 순서로 올립니다. 긴 저장소 전체를 한 번에 넣는 습관은 피합니다.
- MTP: 속도보다 안정성이 먼저라면 MTP를 끄고 같은 프롬프트를 비교합니다.
- 비전/mmproj: 이미지 입력까지 붙이면 VRAM 여유가 급격히 줄 수 있으니 텍스트 전용부터 안정화합니다.
- 동시 요청: llama-server에서 parallel 값을 높이면 캐시와 상태가 더 늘어납니다. 처음에는 1로 잡는 편이 안전합니다.
- 캐시 형식: cache-type-k/v를 낮추면 메모리 절약에 도움이 되지만 품질과 안정성을 같이 확인해야 합니다.
설치/세팅 흐름
- 1. NVIDIA 드라이버와 CUDA 런타임이 정상인지 먼저 확인합니다. Windows라면 WSL2 Ubuntu 환경도 같이 검토합니다.
- 2. llama.cpp를 CUDA 옵션으로 빌드합니다. 예시는 cmake -B build -DGGML_CUDA=ON 이후 cmake --build build --config Release 입니다.
- 3. Hugging Face에서 unsloth/Qwen3.6-27B-MTP-GGUF 저장소의 Q4 계열 GGUF를 먼저 내려받습니다.
- 4. 첫 실행은 llama-cli로 짧게 확인합니다. 서버부터 켜기보다 모델 로딩, 속도, VRAM 점유를 먼저 봅니다.
- 5. llama-server로 넘어갈 때는 --ctx-size 8192 또는 16384, --parallel 1, 텍스트 전용으로 시작합니다.
- 6. nvidia-smi로 로딩 직후와 생성 중 VRAM을 따로 기록합니다. 생성 뒤 메모리가 내려오지 않으면 컨텍스트와 MTP를 낮춥니다.
되는 것 / 어려운 것
- Q4 계열 27B 모델 실험
- 짧은 코드 질문과 리팩터링 상담
- 8k~32k 문맥의 단일 사용자 세션
- IDE 옆에서 보조 모델로 쓰는 흐름
- Q5/Q6 + 80k 문맥 상시 사용
- MTP와 비전 mmproj 동시 사용
- 여러 사용자의 병렬 요청
- 모델 여러 개를 동시에 띄우는 작업

사도 되는 사람 / 보류할 사람
- 사도 되는 사람: 로컬 LLM을 취미가 아니라 실제 코딩 보조, 문서 요약, 사내 자료 실험에 꾸준히 쓸 사람입니다.
- 사도 되는 사람: 외부 GPU 박스나 데스크톱을 둘 공간이 없고, 이동 가능한 최고급 NVIDIA 노트북이 필요한 사람입니다.
- 보류할 사람: 80k 이상 장문, 비전 입력, 여러 모델 동시 실행이 목표인 사람입니다. 이 경우 데스크톱 RTX 5090 32GB 이상이 더 정직합니다.
- 보류할 사람: 단순 채팅, 간단한 코드 질문만 할 사람입니다. 14B 이하 모델이나 클라우드 도구가 비용 대비 낫습니다.
자주 하는 질문
Qwen3.6-27B-MTP를 이 글의 기준대로 쓰기에는 어렵습니다. 8GB VRAM은 7B~8B급 모델, 아주 가벼운 양자화, 짧은 문맥 쪽으로 보는 편이 맞습니다.
아닙니다. Q4와 짧은 문맥은 해볼 만하지만, Q5, 80k 컨텍스트, MTP, 비전 입력을 함께 켜면 24GB도 빠듯합니다. 이름보다 VRAM 잔량을 봐야 합니다.
모델만 놓고 보면 가능할 수 있지만 개발 환경까지 같이 쓰면 64GB가 편합니다. 브라우저 탭, IDE, Docker, 문서, 로컬 서버가 동시에 켜지면 시스템 RAM도 금방 줄어듭니다.
맥은 조용하고 전력 효율이 좋지만, 이번처럼 CUDA 기반 이슈와 세팅값이 활발하게 공유되는 모델은 NVIDIA 쪽이 문제 해결 자료를 찾기 쉽습니다. 대신 맥은 큰 통합 메모리 구성을 고르면 다른 종류의 로컬 AI 실험에 장점이 있습니다.
출처와 확인한 근거
- Qwen/Qwen3.6-27B Hugging Face
- Unsloth Qwen3.6-27B-MTP-GGUF
- llama.cpp issue #23371
- llama.cpp issue #23446
- llama.cpp issue #23447
제품 소개: 기가바이트 2025 어로스 마스터 16 RTX 5090
제품 한줄 소개
기가바이트 2025 어로스 마스터 16은 RTX 5090 Laptop GPU급 그래픽 성능을 노트북 안에 넣은 고성능 게이밍·크리에이터 노트북입니다.
추천 대상
Qwen3.6-27B-MTP 같은 20B급 이상 로컬 LLM을 Q4 중심으로 실험하고, 동시에 게임·영상·개발 작업까지 한 대에서 처리하려는 사용자에게 어울립니다. 특히 데스크톱을 둘 수 없지만 CUDA 기반 AI 실험을 계속하고 싶은 사람에게 현실적인 선택지입니다.
비추천 대상
긴 문맥 80k 이상, 비전 모델 동시 사용, 여러 명이 접속하는 서버 용도라면 노트북보다 32GB 이상 VRAM을 가진 데스크톱 워크스테이션이 낫습니다. 단순 로컬 챗봇 용도라면 가격 대비 과합니다.
구매 전 체크 3가지
1. 실제 RTX 5090 Laptop GPU 구성인지 확인합니다.
2. RAM 64GB 이상 구성 또는 업그레이드 가능 여부를 봅니다.
3. SSD 2TB 이상을 권장합니다. GGUF 모델 파일과 개발 환경을 같이 두면 저장공간이 빠르게 줄어듭니다.
마무리하면
Qwen3.6-27B-MTP는 “노트북에서도 대형 코딩 LLM을 돌릴 수 있나?”라는 질문에 흥미로운 답을 줍니다. 가능은 합니다. 하지만 답은 조건부입니다. RTX 5090 24GB 노트북은 시작점으로는 강하지만, 긴 문맥과 MTP와 비전 입력을 한꺼번에 욕심내면 곧바로 한계가 보입니다.
그래서 이 조합을 산다면 기대치를 정확히 잡아야 합니다. Q4, 텍스트 전용, 8k~32k 문맥, 단일 사용자 세션이면 충분히 실험 가치가 있습니다. 반대로 “내 코드베이스 전체를 넣고 하루 종일 서버처럼 돌리겠다”면 노트북보다 32GB 이상 데스크톱 GPU가 더 맞습니다. 로컬 AI 장비는 비싼 이름보다 남는 VRAM이 더 솔직합니다.