매거진

Qwen3.6-27B MTP를 RTX 3090 24GB에서 돌릴 수 있을까

2026. 05. 12.

쿠팡 파트너스 활동의 일환으로 일정액의 수수료를 제공받을 수 있습니다.

오과장입니다. 오늘은 froggeric/Qwen3.6-27B-MTP-GGUFRTX 3090 24GB 한 장에서 llama.cpp로 굴릴 때 어디까지 기대해도 되는지 정리합니다. 직접 테스트 글은 아니고, 2026년 5월 7~10일 사이 공개된 모델 카드·llama.cpp PR·실사용 벤치·오류 리포트를 기준으로 구매 판단에 필요한 선만 추렸습니다.

Qwen 계열 모델 공식 이미지
Qwen 계열 대형 모델은 긴 컨텍스트와 코딩 성능을 앞세우지만, 로컬 구동은 VRAM 계산이 먼저입니다.

짧은 답변

RTX 3090 24GB 한 장으로 Qwen3.6-27B MTP GGUF는 “텍스트 전용 로컬 코딩 서버”까지는 꽤 실전적입니다. 최근 공개 벤치에서 Q4_K_M, 164K 컨텍스트, llama.cpp MTP 빌드 조합이 내러티브 47.49 TPS, 코드 55.09 TPS를 기록했습니다.

다만 여유롭다는 뜻은 아닙니다. 벤치 후 GPU 사용량이 22.7GB 안팎까지 올라갔고, 150K 긴 컨텍스트 테스트 뒤에는 23.7GB까지 찼습니다. 그래서 새 장비 기준은 RTX 3090/4090 24GB가 최소선, 안정 운용은 시스템 RAM 64GB와 NVMe 여유 공간을 같이 봐야 합니다.

이 도구가 뭔가요?

Qwen3.6-27B-MTP-GGUF는 Qwen 계열 27B 모델을 llama.cpp에서 쓰기 쉽게 GGUF로 변환한 모델입니다. 핵심은 MTP, 즉 다음 토큰을 하나씩만 맞히지 않고 여러 후보를 미리 예측해 생성 속도를 끌어올리는 방식입니다. 모델 카드에서는 텍스트 전용 MTP가 약 2.5배 빠른 생성을 노린다고 설명합니다.

용어 먼저 정리

  • GGUF: llama.cpp 계열 앱에서 많이 쓰는 모델 파일 형식입니다. Ollama·LM Studio 쪽과도 연결성이 좋습니다.
  • MTP: Multi-Token Prediction입니다. 초안 토큰을 몇 개 먼저 뽑아보고 맞는 것만 채택해 속도를 올립니다.
  • VRAM: 그래픽카드 전용 메모리입니다. 모델 파일, KV cache, 작업 버퍼가 여기에 올라갑니다.
  • KV cache: 긴 대화와 긴 문서를 처리할 때 쌓이는 중간 기억장입니다. 컨텍스트를 길게 잡을수록 VRAM을 크게 먹습니다.
  • Q4_K_M: 4비트 계열 양자화입니다. 품질을 조금 양보하고 모델 크기를 줄여 24GB GPU에 넣기 위한 선택입니다.

실사용 사례에서 나온 기준

  • 2026년 5월 7일 club-3090 이슈 #94에서는 RTX 3090 24GB 한 장, llama.cpp PR #22673 MTP 빌드, Qwen3.6-27B-Q4_K_M-mtp.gguf 조합으로 코드 55.09 TPS가 보고됐습니다.
  • 같은 리포트의 GPU 상태는 벤치 후 22,718MiB / 24,576MiB였습니다. 24GB 카드도 남는 공간이 2GB 안팎이라는 뜻입니다.
  • 추가 긴 컨텍스트 테스트에서는 약 120K·150K needle recall이 PASS였지만, 150K 뒤 VRAM은 23,777MiB까지 올라갔습니다. 262K를 기본값처럼 쓰면 위험합니다.
  • 2026년 5월 7일 이슈 #97에서는 opencode와 llama.cpp 기본 엔드포인트 조합에서 hang 사례가 공유됐습니다. 속도만 보지 말고 클라이언트 호환성도 확인해야 합니다.

전력과 소음도 따로 봐야 합니다. RTX 3090 벤치에서는 300W를 넘는 소비전력과 70도대 온도가 함께 나타났습니다. 작은 방에서 여름에 돌릴 계획이라면 성능 숫자보다 열 배출과 팬 소리가 더 크게 느껴질 수 있습니다. 로컬 LLM 서버는 벤치마크 한 번보다 장시간 켜 두는 생활감이 중요합니다.

여기서 중요한 결론은 “27B가 24GB에서 된다”가 아니라 “Q4 양자화, 텍스트 전용, 컨텍스트 관리, 최신 MTP 빌드라는 조건을 맞추면 쓸 만하다”입니다. 특히 이미지 입력은 모델 카드에서 MTP와 함께 쓰면 불안정하다고 경고합니다. 영상·이미지까지 한 번에 하려는 장비가 아니라, 코딩 보조와 긴 문서 질의응답용으로 보는 편이 맞습니다.

이 제품 구경하러 가기

최소 사양과 권장 사양

최소선: RTX 3090 24GB, 시스템 RAM 32GB, NVMe 여유 80GB 이상, Ubuntu 또는 WSL2, 직접 빌드 가능한 llama.cpp 환경입니다. 여기서 24GB는 넉넉한 권장이 아니라 진입선입니다. 브라우저와 게임 런처가 GPU 메모리를 조금만 차지해도 서버 시작이 실패할 수 있으니, 전용으로 비워 둘 수 있는 데스크톱이 유리합니다.

권장선: RTX 4090 24GB, 시스템 RAM 64GB, NVMe 1TB 이상, CUDA 빌드와 서버 로그를 읽을 수 있는 사람입니다. 장시간 쓰려면 전원부와 쿨링도 중요합니다. 27B 모델은 짧게 한두 번 답하는 작업보다, 문서 전체를 넣고 계속 질문할 때 발열과 메모리 압박이 드러납니다.

피할 선: RTX 4060 8GB, RTX 4070 8GB 노트북, 시스템 RAM 16GB, 저장공간이 100GB 이하로 남은 PC입니다. 이 모델보다 7B~14B급이 훨씬 편합니다. 특히 노트북 GPU는 같은 RTX 이름이어도 전력 제한과 냉각 여유가 작습니다. 로컬 LLM을 하루 종일 켜둘 계획이라면 얇은 게이밍 노트북보다 두꺼운 데스크톱이 관리하기 쉽습니다.

맥 계열과 NVIDIA 계열 체감 차이

Mac Studio나 Mac mini 고용량 통합 메모리 모델은 GGUF를 조용히 돌리기 좋습니다. 다만 이번 글의 기준은 llama-server, MTP, 긴 컨텍스트, CUDA GPU 한 장입니다. 최근 벤치 숫자와 문제 해결 기록이 대부분 NVIDIA 기준으로 올라와 있어, 같은 모델을 따라 해보려면 RTX 3090/4090 쪽이 시행착오가 적습니다.

맥은 전력과 소음에서 편하고, NVIDIA 데스크톱은 CUDA 생태계와 서버형 운용에서 편합니다. Qwen3.6-27B MTP를 “에디터에 붙여 매일 쓰는 로컬 코딩 도우미”로 만들고 싶다면, 조용함보다 VRAM 24GB와 드라이버 관리가 우선입니다.

어떤 설정을 낮추면 돌아가나요?

  • 컨텍스트를 먼저 낮춥니다. 262K는 가능성의 숫자이고, RTX 3090 한 장에서는 64K~164K부터 보는 편이 안전합니다.
  • KV cache를 q8_0 또는 q4_0로 낮춥니다. 품질보다 긴 문서 처리와 안정성이 중요할 때 효과가 큽니다.
  • MTP draft 개수를 과하게 올리지 않습니다. 속도 욕심을 내다가 클라이언트 hang이나 VRAM 압박을 만날 수 있습니다.
  • 이미지 입력은 MTP를 끈 별도 서버로 분리합니다. 모델 카드와 실사용 리포트 모두 이 조합을 조심스럽게 다룹니다.

설치/세팅 흐름

  1. RTX 3090/4090 드라이버와 CUDA 런타임을 최신으로 맞추고 nvidia-smi에서 24GB VRAM이 정상 표시되는지 확인합니다.
  2. llama.cpp 안정판이 아니라 MTP 지원 PR 또는 그 이후 빌드를 사용합니다. 모델 카드 예시는 PR #22673 기반 빌드를 요구합니다.
  3. cmake -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release로 CUDA 빌드를 준비하고 llama-server 타깃을 빌드합니다.
  4. Hugging Face에서 Qwen3.6-27B-Q4_K_M-mtp.gguf처럼 24GB에 맞는 양자화 파일을 받습니다. Q5 이상은 여유가 급격히 줄 수 있습니다.
  5. 첫 실행은 --spec-type mtp --spec-draft-n-max 3 --cache-type-k q4_0 --cache-type-v q4_0 -c 65536 -ngl 99처럼 보수적으로 시작합니다.
  6. 서버가 뜨면 http://127.0.0.1:8081/v1 형태로 에디터·코딩 도구에 붙이고, 응답 중 VRAM이 23GB를 넘는지 계속 봅니다.

되는 것 / 어려운 것

되는 것: 긴 README 요약, 로컬 코드 리뷰, 개인용 OpenAI 호환 API 서버, 외부 클라우드에 올리기 애매한 문서 질의응답입니다.

어려운 것: 8GB 노트북에서 쾌적하게 쓰기, 262K 컨텍스트 상시 사용, MTP와 비전 입력 동시 사용, 여러 명이 함께 쓰는 안정 서버 운영입니다.

사도 되는 사람 / 보류할 사람

사도 되는 사람은 이미 Ollama나 LM Studio로 7B~14B 모델을 써봤고, 답변 품질과 긴 문서 처리에서 더 큰 모델이 필요하다고 느끼는 사람입니다. 드라이버 업데이트, 빌드 로그, 서버 옵션을 만지는 데 거부감이 없다면 RTX 3090/4090 24GB 데스크톱은 꽤 명확한 선택입니다.

보류할 사람은 “AI PC 하나 사면 다 되겠지”라고 기대하는 입문자입니다. 이 조합은 편한 앱 설치형 모델이 아니라, 최신 PR과 모델 파일, 옵션 튜닝을 따라가야 하는 실험형 로컬 서버에 가깝습니다.

RTX 4090 24GB 데스크톱 예시 이미지
구매 판단용 예시: 24GB VRAM을 갖춘 RTX 4090 데스크톱

자주 하는 질문

Q. RTX 4070 12GB로는 불가능한가요?
작은 양자화와 짧은 컨텍스트로 실험은 가능할 수 있지만, 이 글의 기준인 27B MTP 긴 컨텍스트 운용에는 맞지 않습니다. 12GB라면 Qwen 8B~14B가 낫습니다.

Q. RTX 3090 중고와 RTX 4090 새 제품 중 어느 쪽이 낫나요?
예산만 보면 3090 중고가 매력적입니다. 장시간 운용, 전력 효율, 보증, 발열까지 보면 4090 완제품이 더 마음 편합니다.

Q. MTP를 켜면 무조건 좋은가요?
텍스트 생성 속도에는 도움이 됩니다. 다만 비전 입력이나 특정 클라이언트 조합에서는 문제가 보고됐으니, 업무용이면 MTP 서버와 일반 서버를 따로 두는 편이 안전합니다.

Q. RAM은 32GB면 되나요?
혼자 테스트하는 최소선은 32GB입니다. 브라우저, IDE, Docker, 모델 캐시를 같이 쓰면 64GB가 훨씬 덜 답답합니다.

출처와 확인 링크

구매 판단

결론은 분명합니다. Qwen3.6-27B MTP를 오늘 로컬에서 의미 있게 쓰려면 VRAM 24GB, RAM 64GB 권장, NVMe 넉넉함, 최신 NVIDIA 드라이버, llama.cpp 빌드 가능 여부를 봐야 합니다. 그래서 연결 상품은 RTX 4090 24GB 데스크톱 계열로 잡았습니다. 단순 입문용은 아니고, 로컬 코딩 LLM을 매일 쓰겠다는 사람에게 맞는 선택지입니다. 반대로 가끔 챗봇을 켜는 정도라면 24GB 데스크톱을 바로 사기보다 클라우드 API나 8B급 로컬 모델로 사용량을 먼저 확인하는 편이 낫습니다. 장비값보다 중요한 것은 이 모델이 실제 업무 흐름에 매일 들어오느냐입니다.

이 제품 구경하러 가기

관련 글 추천