오과장입니다. 요즘 로컬 LLM 이야기를 보면 “몇 B 모델이 된다더라”보다 더 중요한 질문이 있습니다. 실제 내 책상 위 장비에서 답변 속도가 참을 만한지, 세팅하다가 VRAM 부족으로 멈추지 않는지, 그리고 돈을 쓰려면 8GB 카드인지 12GB 카드인지 24GB 카드인지 어디서 선을 그어야 하는지입니다.

짧은 답변
Qwen3.6-27B-MTP-GGUF는 듀얼 RTX 3060 12GB 조합에서 “장난감”이 아니라 로컬 코딩 보조용으로 현실성이 있습니다. 최근 Reddit 실사용 벤치에서는 i7-4770K급 오래된 플랫폼에 RTX 3060 12GB 2장을 꽂고 Q4_K_S 양자화, llama.cpp CUDA 빌드, 텐서 병렬 설정으로 대략 30~50 tokens/s 구간을 보고했습니다.
다만 결론은 “RTX 3060 한 장이면 충분”이 아닙니다. 한 장 12GB는 13B급이나 낮은 양자화 실험용, 두 장 24GB는 27B급 실사용 진입점, 24GB 단일 RTX 3090/4090/5090급은 세팅 난이도를 줄이는 권장선으로 보는 게 맞습니다.
이 도구가 뭔가요?
Qwen3.6-27B-MTP-GGUF는 Qwen 계열 27B급 오픈 모델을 로컬 실행용 GGUF 형식으로 배포한 모델입니다. MTP는 한 번에 다음 토큰 후보를 여러 개 예측해 생성 속도를 끌어올리는 방식이고, Unsloth는 최근 문서와 모델 카드에서 Qwen3.6 MTP GGUF를 로컬 실행 대상으로 안내하고 있습니다. 코딩 보조, 긴 문맥 질의, 사내 문서 기반 에이전트처럼 외부 API로 보내기 애매한 작업에 관심을 받습니다.
왜 하필 듀얼 RTX 3060 12GB인가
RTX 3060 12GB는 최신 GPU는 아니지만 로컬 AI에서는 묘한 위치에 있습니다. 게임 성능만 보면 RTX 4060 계열이 더 매력적으로 보일 때가 많지만, LLM 추론에서는 VRAM 용량이 먼저 막습니다. Qwen3.6-27B 같은 27B급 모델은 양자화를 해도 모델 본체와 KV cache가 함께 올라가야 하므로 8GB 단일 GPU로는 품질과 문맥 길이를 크게 양보해야 합니다.
최근 실사용 글의 핵심도 여기에 있습니다. 작성자는 중고 RTX 3060 12GB 두 장을 약 400달러 예산의 실험 조합으로 묶고, 오래된 Z87 플랫폼에서도 PCIe x8+x8 구성이 병목을 어느 정도 피한다고 설명했습니다. 본문 판단은 그 글 하나를 맹신하지 않고, 댓글에서 이어진 vLLM/ik_llama 권장, PCIe 대역폭 지적, CUDA 13.2 주의까지 함께 반영했습니다.
용어 먼저 정리
CUDA: NVIDIA GPU에서 AI 계산을 빠르게 돌리게 해주는 실행 환경입니다. 버전이 맞지 않으면 컴파일은 돼도 특정 양자화 모델 실행에서 문제가 날 수 있습니다.
VRAM: 그래픽카드 전용 메모리입니다. 로컬 LLM에서는 GPU 성능보다 먼저 모델이 VRAM에 들어가는지가 체감 속도를 가릅니다.
GGUF: llama.cpp 계열에서 많이 쓰는 로컬 모델 파일 형식입니다. Ollama, LM Studio, llama.cpp에서 다루기 쉽습니다.
quantization: 모델 숫자 정밀도를 줄여 용량과 메모리 사용량을 낮추는 작업입니다. Q4, Q5, Q8처럼 표기하고, 낮출수록 가볍지만 품질 손실 가능성이 커집니다.
MTP: Multi-Token Prediction입니다. 다음 토큰을 하나씩만 찍는 대신 여러 후보를 예측해 생성 속도를 높이는 방식입니다.
실사용 사례에서 나온 기준
최근 7일 내 판단 근거로 쓸 만한 커뮤니티 포인트는 세 가지입니다. 첫째, Reddit의 듀얼 RTX 3060 12GB 벤치 글은 Qwen3.6-27B-GGUF와 MTP 모델을 함께 놓고, Q4_K_S 양자화, Kubuntu 24.04, CUDA 13.2, llama.cpp CUDA 빌드, -sm tensor -ts 1,1 조합을 공개했습니다. 결과 숫자는 환경 의존성이 있지만, “24GB VRAM급을 두 장으로 만들면 27B급 Qwen이 코딩 보조로 들어온다”는 현실적 기준을 줍니다.
둘째, 같은 글의 댓글 흐름은 더 중요합니다. 댓글에서는 tensor parallel에는 vLLM도 검토하라고 했고, GGUF를 고수한다면 ik_llama 그래프 모드도 언급했습니다. 또 4장 RTX 3060, MI50, 3090 혼합 구성 사례가 붙으면서 병목이 단순 VRAM만이 아니라 PCIe 대역폭, 카드 간 통신, 전력 제한, 드라이버 버전에 있다는 점이 드러납니다.
셋째, CUDA 13.2 관련 llama.cpp 이슈가 최근 댓글에서 다시 호출됐습니다. 댓글 작성자는 CUDA 12.x, 13.1, 13.3 쪽을 제안하며 13.2가 일부 quant 실행에서 문제를 만들 수 있다고 짚었습니다. 초보자는 “최신 CUDA면 무조건 좋다”고 생각하기 쉬운데, 로컬 LLM은 런타임 조합이 더 보수적이어야 합니다.
최소 사양과 권장 사양
RTX 3060 12GB 1장, RAM 32GB 이상. 7B~14B 모델 또는 27B 극저용량 양자화 실험에 가깝습니다.
RTX 3060 12GB 2장, RAM 64GB 이상, NVMe 여유 80GB 이상. Qwen3.6-27B Q4급을 코딩 보조로 써볼 수 있는 진입점입니다.
RTX 3090 24GB 이상 단일 카드 또는 24GB 이상 NVIDIA 카드. 세팅 단순성, 전력, 케이스 공간, 발열 관리까지 보면 이쪽이 편합니다.
병목은 어디서 생기나
첫 번째 병목은 VRAM입니다. 모델 본체만 보고 계산하면 “Q4면 되겠네”라고 생각하기 쉽지만, 실제 대화에서는 KV cache가 커집니다. 문맥 길이를 128K 이상으로 욕심내면 VRAM과 시스템 RAM을 동시에 압박합니다. Reddit 사례에서도 tensor parallel을 쓰면 KV cache quantization 옵션을 같이 쓰기 어렵다는 제한이 언급됐고, 이 때문에 160K 문맥을 원할 때 답답하다는 코멘트가 있었습니다.
두 번째 병목은 카드 간 통신입니다. 듀얼 GPU는 VRAM이 단순 합산되는 느낌을 주지만, 실제론 두 GPU가 데이터를 주고받아야 합니다. PCIe 3.0 x8+x8은 생각보다 버틸 수 있지만, x16+x1 같은 구성이나 칩셋 경유 슬롯은 속도를 크게 깎을 수 있습니다.
세 번째 병목은 소프트웨어입니다. llama.cpp는 설치가 쉽고 GGUF 생태계가 넓습니다. vLLM은 텐서 병렬이나 서버 운용에서 매력적일 수 있지만 세팅 난이도가 올라갑니다. Mac 계열은 MLX와 Metal 덕분에 조용하고 전력 효율이 좋지만, NVIDIA CUDA 생태계처럼 MTP, 텐서 병렬, 최신 GGUF 최적화가 빠르게 반영되는 흐름과는 체감이 다릅니다.

맥 계열과 NVIDIA 계열 체감 차이
Mac mini M4 24GB나 32GB급도 Qwen 계열을 MLX나 Ollama로 돌리는 재미가 있습니다. 장점은 조용하고 전력 부담이 적고, 통합 메모리라 “VRAM 8GB라서 바로 막힘” 같은 느낌이 덜하다는 점입니다. 하지만 27B급을 긴 문맥으로 돌릴 때 속도와 실험 자유도는 NVIDIA 쪽이 유리한 경우가 많습니다.
반대로 NVIDIA 데스크톱은 귀찮습니다. 드라이버, CUDA, llama.cpp 빌드, 전원 케이블, 케이스 슬롯, 발열이 모두 변수입니다. 대신 한 번 맞춰 놓으면 GGUF, vLLM, SGLang, 로컬 에이전트 서버처럼 선택지가 넓습니다. 코딩 LLM을 매일 붙여 쓰려면 이 차이가 큽니다.
낮추면 돌아가는 설정
1. Q8 대신 Q4_K_S 또는 비슷한 4bit 계열 양자화부터 시작합니다.
2. 문맥 길이는 처음부터 128K로 잡지 말고 16K 또는 32K로 확인합니다.
3. MTP draft 개수는 크게 올리지 말고 --spec-draft-n-max 1 같은 보수적 값으로 시작합니다.
4. Windows에서 공유 GPU 메모리에 기대지 말고, 가능하면 Linux에서 VRAM 사용량을 직접 확인합니다.
5. CUDA 13.2에서 이상한 quant 오류가 나면 CUDA 12.x 또는 문제가 적다는 버전으로 내려봅니다.
설치/세팅 흐름
- 운영체제를 정합니다. 처음이면 Windows+LM Studio가 쉽고, 듀얼 GPU/llama.cpp 빌드까지 볼 거면 Ubuntu 또는 Kubuntu 계열이 편합니다.
- NVIDIA 드라이버와 CUDA를 설치합니다. 단, 최신 버전만 고집하지 말고 llama.cpp 이슈에서 문제 버전이 언급되는지 확인합니다.
git clone https://github.com/ggml-org/llama.cpp.git후 CUDA 옵션으로 빌드하거나, Windows라면 최근 릴리스의 CUDA 빌드를 받습니다.- 모델은 Hugging Face에서
unsloth/Qwen3.6-27B-MTP-GGUF또는 일반 GGUF를 고르고, 처음에는 Q4 계열 파일을 받습니다. - 단일 GPU라면 작은 문맥으로 먼저 확인하고, 듀얼 RTX 3060이면
-sm tensor -ts 1,1같은 분할 설정을 테스트합니다. - 속도보다 안정성을 먼저 봅니다. OOM, 첫 토큰 지연, 긴 답변 중 멈춤, 컨텍스트 증가 시 속도 하락을 각각 기록한 뒤 문맥 길이와 draft 설정을 조절합니다.
되는 것 / 어려운 것
되는 것
개인 코드 리뷰, 작은 리팩터링 제안, 로컬 문서 기반 질의, 에이전트 보조 답변은 충분히 노려볼 수 있습니다. 30 tokens/s 안팎이면 대화형 코딩 보조로 답답함이 크게 줄어듭니다.
어려운 것
긴 저장소 전체를 계속 먹이는 128K~262K 문맥, 여러 명 동시 접속 서버, 무손실에 가까운 Q8 장문 운용은 24GB급 단일 카드나 더 큰 구성이 낫습니다.
사도 되는 사람 / 보류할 사람
사도 되는 쪽은 이미 데스크톱을 쓰고 있고, 파워와 케이스 슬롯이 남고, 중고/리퍼 GPU 리스크를 감당할 수 있는 사람입니다. 특히 “RTX 4060 8GB 노트북은 있는데 로컬 LLM이 계속 작다”는 답답함이 있다면, RTX 3060 12GB 2장 구성은 실험값이 분명합니다.
보류할 쪽도 분명합니다. 조용한 책상, 낮은 전기요금, 쉬운 세팅이 중요하면 Mac mini M4 24GB/32GB나 클라우드 GPU가 낫습니다. 그리고 새 그래픽카드 한 장만 살 예정이면 RTX 3060 12GB를 새 가격으로 비싸게 사기보다, 24GB 단일 카드 중고가와 비교해야 합니다.
자주 하는 질문
작은 모델이나 낮은 양자화는 됩니다. 하지만 Qwen3.6-27B급을 긴 문맥으로 편하게 쓰는 기준은 아닙니다. 8GB는 VRAM보다 시스템 RAM 오프로딩에 기대는 순간 체감이 크게 떨어질 수 있습니다.
같지 않습니다. 용량은 비슷하게 활용할 수 있어도 카드 간 통신, PCIe 슬롯, 소프트웨어 분할 방식이 추가 변수입니다. 편한 건 24GB 단일 카드, 가성비 실험은 듀얼 3060 쪽입니다.
Unsloth 모델 안내에는 Ollama 실행 경로도 나옵니다. 다만 이번 커뮤니티 벤치의 핵심 설정은 llama.cpp의 MTP와 텐서 병렬 쪽이라, 같은 속도를 기대하려면 llama.cpp 또는 관련 런타임을 직접 다루는 편이 낫습니다.
최소 32GB로 맛보기는 가능하지만, 듀얼 GPU와 긴 문맥 실험까지 하면 64GB를 권합니다. 96GB 이상은 대형 MoE나 긴 컨텍스트 실험에서 여유가 생깁니다.
구매 판단
이 글의 결론은 “RTX 3060 12GB를 무조건 사라”가 아닙니다. Qwen3.6-27B-MTP-GGUF를 로컬 코딩 LLM로 굴릴 목적이라면 12GB VRAM 한 장보다, 12GB 두 장 또는 24GB 단일 카드가 판단 기준입니다. 쿠팡에서 RTX 3060 12GB를 볼 때도 8GB 모델, RTX 3060 Ti 8GB, 이름만 비슷한 해외 병행/중고 상품을 섞어 보지 말고 반드시 RTX 3060, 12GB GDDR6, 8핀 전원, 케이스 길이, 파워 550W 이상을 확인해야 합니다.
지금 새 제품 가격이 높게 잡혀 있다면 급하게 결제할 이유는 없습니다. 이 조합은 “싸게 12GB VRAM을 모아 로컬 LLM 실험을 하는” 쪽에 가치가 있으니까요. 가격이 24GB 단일 카드 중고와 가까워지는 순간, 설치 난이도까지 포함하면 24GB 단일 카드가 더 깨끗한 선택입니다.
근거 링크
- Unsloth Qwen3.6 문서: 최근 4일 내 업데이트된 Qwen3.6 로컬 실행 안내와 RAM 기준 확인.
- Hugging Face unsloth/Qwen3.6-27B-MTP-GGUF: MTP GGUF 모델 카드와 실행 대상 확인.
- Reddit LocalLLaMA 듀얼 RTX 3060 실사용 벤치: 최근 댓글까지 포함해 30~50 tokens/s, tensor split, PCIe/CUDA 논의 확인.
- llama.cpp CUDA 13.2 quant 이슈: 최근 커뮤니티 댓글에서 다시 지목된 CUDA 버전 리스크 확인.
- MSI RTX 3060 Ventus 2X 12G OC 사양: 12GB GDDR6, 170W, 8핀, 권장 550W 파워 확인.