오과장입니다. 오늘은 Qwen3.6-35B-A3B-MTP를 MacBook Pro M5 Pro 48GB에서 돌릴 때 어디까지 기대해도 되는지 정리합니다. 이 모델은 “로컬 코딩 LLM”으로 관심이 큽니다. 다만 35B라는 숫자만 보고 16GB 맥북이나 12GB 그래픽카드에 억지로 올리면, 실행은커녕 컨텍스트가 잘리고 속도도 무너질 수 있습니다.
Qwen3.6-35B-A3B-MTP를 로컬 코딩용으로 쓰려면 Mac에서는 48GB 통합 메모리를 사실상 출발선으로 보는 편이 안전합니다. 24GB 맥은 작은 Qwen 9B/27B 양자화 모델까지는 가능성이 있지만, 35B에 긴 컨텍스트를 붙이면 여유가 부족합니다. NVIDIA 쪽은 12GB VRAM 단독으로는 어렵고, 24GB 이상 또는 CPU/RAM 오프로딩을 각오해야 합니다.
Qwen3.6-35B-A3B는 Qwen 계열의 오픈웨이트 AI 모델입니다. 전체 파라미터는 35B지만, 한 번에 활성화되는 부분은 약 3B인 MoE 구조라서 “큰 모델의 지식과 작은 모델의 속도”를 노립니다. MTP는 다음 토큰을 여러 단계로 예측해 추론을 빠르게 만들려는 방식입니다. 쉽게 말하면, 개발자가 코드를 물어봤을 때 답변 흐름을 더 빨리 이어가도록 돕는 장치입니다.
용어 먼저 정리
VRAM은 그래픽카드 전용 메모리입니다. NVIDIA 노트북/데스크톱에서는 여기가 부족하면 모델이 GPU에 다 못 올라갑니다.
통합 메모리는 맥에서 CPU와 GPU가 같이 쓰는 메모리입니다. 48GB라고 해도 전부 모델에 쓰는 것은 아니고, macOS와 앱이 먼저 가져갑니다.
GGUF는 llama.cpp, Ollama, LM Studio 같은 로컬 LLM 도구에서 자주 쓰는 모델 파일 형식입니다.
Quantization은 모델을 더 작게 압축하는 과정입니다. Q4, Q5, Q8처럼 숫자가 올라갈수록 보통 품질은 좋아지지만 메모리를 더 씁니다.
실사용 사례에서 나온 기준
최근 7일 자료를 보면 기준이 꽤 선명합니다. Qwen 공식 Hugging Face 모델 카드는 Qwen3.6-35B-A3B가 35B 전체, 3B 활성 MoE 구조이고 기본 컨텍스트가 262K라고 설명합니다. 숫자만 보면 가볍게 느껴질 수 있지만, 긴 컨텍스트와 KV 캐시가 붙는 순간 메모리 압박이 커집니다.
가장 직접적인 근거는 2026년 5월 26일 turboquant-mlx의 M5 Pro 48GB 벤치마크 이슈입니다. 이 사례에서는 MacBook Pro M5 Pro 48GB, Metal working set 약 40.2GB 환경에서 Qwen3.6-35B-A3B-tq3-g32가 약 18GB 피크로 올라가고, KV 캐시와 다른 작업을 위한 여유가 남는다고 보고했습니다. 1024토큰 생성 기준으로 fp16 KV baseline은 생성 약 52 tokens/s, 압축 KV 구성은 프롬프트 처리 속도를 끌어올리는 대신 생성 속도가 약간 내려가는 흐름을 보였습니다.
반대로 12GB 그래픽카드는 빠듯합니다. 2026년 5월 27일 Unsloth Studio 이슈에서는 RTX 4070 SUPER 12GB에서 Qwen3.6 35B 계열을 올릴 때 vision용 mmproj가 자동 로드되며 VRAM overflow, 컨텍스트 128K에서 4096으로 축소, 40 tokens/s 이상에서 약 10 tokens/s로 하락하는 문제가 보고됐습니다. 같은 날 llama.cpp Vulkan 이슈도 Qwen3.6-35B-A3B-MTP에서 빌드 버전에 따라 생성 속도가 크게 떨어지는 사례를 남겼습니다.
MacBook Pro M5 Pro 48GB는 Qwen3.6-35B-A3B-MTP를 로컬 코딩 보조로 다뤄볼 수 있는 현실적인 맥 기준입니다. 16GB는 논외, 24GB는 35B보다 작은 모델로 낮추는 편이 맞고, 48GB부터 “모델 + KV 캐시 + 에디터 + 브라우저” 조합이 그나마 숨을 쉽니다.
커뮤니티 의견도 비슷합니다. 2026년 5월 27일 r/LocalLLM 글에서는 MacBook Pro M5 Pro 48GB 보유자가 macOS가 가져간 뒤 약 35GB 안팎을 로컬 LLM에 쓸 수 있다고 보고, Qwen3.5/3.6 32B·35B A3B와 Q4/Q6 균형을 질문했습니다. 같은 날 Ryzen AI Max+ 395 128GB 워크스테이션 글에서는 Qwen3.6-35B-A3B Q4_K_M, Q8, MTP 버전을 코딩용으로 비교하며 LM Studio, Lemonade, llama.cpp, VS Code 확장 연결을 언급했습니다. 즉 관심은 단순 채팅이 아니라 로컬 코딩 워크플로우입니다.
최소 사양과 권장 사양
Mac 32GB 이상 또는 GPU 16GB 이상에서 Q4 계열, 짧은 컨텍스트, 텍스트 전용으로 시도합니다. 다만 이 구간은 “잘 된다”보다 “설정을 낮추면 뜬다”에 가깝습니다.
MacBook Pro M5 Pro 48GB, Mac Studio/MacBook Pro 64GB 이상, 또는 NVIDIA 24GB VRAM 이상을 봅니다. 로컬 코딩 에이전트까지 붙일 생각이면 RAM/통합 메모리 여유가 속도보다 먼저입니다.
16GB 맥북, 8GB GPU 노트북, 12GB GPU만 보고 35B 장기 컨텍스트를 기대하는 선택은 피하는 편이 낫습니다. 작은 모델은 가능해도 오늘 주제인 Qwen3.6-35B-A3B-MTP와는 급이 다릅니다.
맥 계열과 NVIDIA 계열 체감 차이
맥의 장점은 통합 메모리입니다. 48GB 구성이라면 35B 양자화 모델을 올리고도 에디터, 터미널, 브라우저를 같이 열 여지가 생깁니다. 대신 CUDA 생태계만큼 튜닝 사례가 많지는 않고, MLX·Metal·llama.cpp 빌드별 차이를 감수해야 합니다.
NVIDIA는 CUDA 쪽 문서와 커뮤니티 노하우가 많습니다. 하지만 VRAM이 칼같이 제한입니다. 12GB 카드는 Qwen3.6-35B를 “쾌적하게” 보기 어렵고, 24GB 카드부터 대화가 시작됩니다. 데스크톱 RTX 4090/5090급은 빠르지만, 노트북 독자에게는 가격·소음·전력까지 부담이 큽니다.
설치/세팅 흐름
- 먼저 macOS를 최신 상태로 맞추고, Xcode Command Line Tools를 설치합니다. 터미널에서
xcode-select --install을 실행하면 됩니다. - 초보자는 LM Studio나 Ollama보다 먼저 Unsloth GGUF 문서를 읽고, MTP와 mmproj가 같이 켜지지 않는 구성을 확인합니다.
- 모델은 처음부터 Q8로 욕심내지 말고 Q4 또는 IQ4 계열로 시작합니다. 35B에서는 품질보다 “먼저 안정적으로 뜨는지”가 우선입니다.
- 컨텍스트는 262K로 바로 올리지 말고 8K, 16K, 32K 순서로 늘립니다. 에이전트 코딩은 컨텍스트가 커질수록 KV 캐시가 메모리를 먹습니다.
- VS Code, OpenCode, Cline류 도구와 연결할 때는 한 번에 대형 코드베이스 전체를 물리지 말고 작은 폴더부터 테스트합니다.
- 속도가 갑자기 떨어지면 모델 문제가 아니라 백엔드 버전, MTP 설정, vision mmproj 자동 로드, 컨텍스트 자동 축소를 먼저 봅니다.
되는 것 / 어려운 것
개인 코드 설명, 작은 파일 리팩터링 계획, 테스트 아이디어, 터미널 명령 제안, 로컬 문서 기반 질의응답은 충분히 시도할 만합니다. 48GB 맥에서는 모델이 완전히 불가능한 급은 아닙니다.
대형 저장소 전체를 한 번에 넣고, 긴 체인 작업을 계속 돌리고, 이미지 입력까지 같이 쓰고, 100K 이상 컨텍스트를 항상 유지하는 방식은 어렵습니다. 이건 48GB에서도 설정 관리가 필요합니다.
사도 되는 사람 / 보류할 사람
사도 되는 사람: 맥을 메인 개발 장비로 쓰고, 로컬 LLM 코딩 보조를 진지하게 붙여보고 싶고, 48GB 이상 메모리 옵션을 고를 예산이 있는 사람입니다.
보류할 사람: 웹 개발 공부, 문서 작업, 가벼운 ChatGPT 대체 정도가 목적이라면 35B 모델 때문에 고가 맥을 살 필요가 없습니다. 16GB/24GB 맥에 작은 모델을 쓰거나 클라우드 API를 섞는 편이 낫습니다.
자주 하는 질문
Q. 48GB면 Qwen3.6-35B가 완전히 여유롭나요?
A. 아닙니다. 모델은 올라갈 수 있지만 컨텍스트, 백엔드, 에디터, 브라우저까지 합치면 여유를 관리해야 합니다.
Q. 24GB 맥북 프로로는 안 되나요?
A. 35B는 추천하기 어렵습니다. Qwen 9B나 27B 양자화 모델부터 보는 편이 맞습니다.
Q. RTX 4070 12GB 노트북이면 더 빠르지 않나요?
A. 작은 모델은 빠를 수 있지만, 35B 장기 컨텍스트에서는 VRAM이 먼저 막힙니다. 12GB는 이 글의 목표 모델과 잘 맞지 않습니다.
Q. NPU가 중요하나요?
A. 이 경우 병목은 NPU보다 메모리와 GPU/Metal 백엔드입니다. Copilot+ PC의 TOPS 숫자만 보고 Qwen3.6 35B를 판단하면 안 됩니다.
구매 판단
Qwen3.6-35B-A3B-MTP를 목표로 장비를 산다면 핵심은 “AI 노트북”이라는 광고 문구가 아니라 메모리입니다. MacBook Pro M5 Pro를 본다면 48GB 이상, 저장공간은 모델 파일 여러 개를 생각해 1TB 이상이 편합니다. 이미 24GB 맥을 갖고 있다면 장비를 바꾸기 전에 Qwen 9B/27B 계열로 먼저 워크플로우를 잡는 게 낫습니다.
오늘 기준으로는 MacBook Pro M5 Pro 48GB가 로컬 코딩 LLM 입문과 실사용 사이의 균형점입니다. 더 싼 장비도 가능하지만 설정을 많이 타고, 더 센 장비는 가격이 바로 튑니다. 그래서 구매 버튼을 누르기 전에는 꼭 메모리 옵션을 확인해야 합니다. 16GB 기본형은 이 글의 목적과 맞지 않습니다. 특히 장비를 한 번 사서 몇 년 쓰는 개발자라면, 칩 등급보다 메모리 용량에서 아끼지 않는 편이 체감 손해를 줄입니다.