매거진

Qwen3.6-35B-A3B는 64GB RAM 장비에서 현실적인가

2026. 06. 14.

쿠팡 파트너스 활동의 일환으로 일정액의 수수료를 제공받을 수 있습니다.

오과장입니다. 이번 글은 Qwen3.6-35B-A3B를 “내 컴퓨터에서 코딩 보조로 쓸 수 있나”만 놓고 봅니다. 결론부터 말하면, 이 모델은 이름의 35B만 보고 겁먹을 모델은 아니지만 16GB 메모리 장비에 가볍게 얹는 모델도 아닙니다. 최근 7일 안에 올라온 GitHub 이슈들을 보면 64GB급 Mac, 128GB 통합 메모리 장비, AMD Strix Halo 같은 넉넉한 메모리 장비에서는 실사용 로그가 나오고, 병목은 단순 GPU 성능보다 모델 로딩, 캐시, 긴 컨텍스트, 런타임 버전 쪽으로 이동했습니다.

노트북에서 로컬 AI 개발 환경을 구성하는 장면
Qwen3.6-35B-A3B는 작은 챗봇보다 로컬 코딩 에이전트 쪽에서 관심이 큰 모델입니다.

짧은 답변

Qwen3.6-35B-A3B를 지금 현실적으로 돌릴 기준

  • 최소 체험: 32GB RAM + 24GB 안팎 모델 파일을 받을 SSD. 단, 긴 컨텍스트와 다른 앱 동시 사용은 바로 답답해집니다.
  • 현실 권장: 64GB RAM 또는 64GB 이상 통합 메모리. Mac M4 Max 64GB, RAM 64GB로 올린 NVIDIA 노트북, 128GB급 AI 미니PC가 기준선입니다.
  • 피해야 할 선택: 16GB Mac mini, 16GB RAM 게이밍 노트북, VRAM 8GB만 보고 RAM을 그대로 두는 구성.
  • 구매 판단: 새 장비를 산다면 메모리 64GB 이상을 먼저 보세요. 이미 업그레이드 가능한 노트북이 있다면 64GB RAM 업그레이드가 GPU 교체보다 먼저입니다.

이 도구가 뭔가요?

Qwen3.6-35B-A3B는 Qwen 계열의 오픈 웨이트 MoE 언어 모델입니다. 전체 파라미터는 35B급이지만 한 번에 활성화되는 부분은 약 3B급이라, 코딩 보조와 에이전트 작업에서 “큰 모델 느낌을 더 작은 연산량으로” 노리는 구조입니다. Ollama 라이브러리에는 `ollama run qwen3.6:35b-a3b`로 실행하는 항목이 있고, 모델 설명은 agentic coding과 repository-level reasoning 개선을 강조합니다.

용어 먼저 정리

MoE: 여러 전문가 블록 중 일부만 켜는 방식입니다. 전체 크기는 커도 매 토큰마다 전부 계산하지 않습니다.

VRAM: GPU 전용 메모리입니다. 모델 일부, KV 캐시, 계산 그래프가 여기에 올라가면 속도가 좋아집니다.

GGUF: llama.cpp 계열에서 많이 쓰는 로컬 실행용 모델 파일 형식입니다.

Quantization: 모델을 4비트, 8비트처럼 줄여 메모리 사용량을 낮추는 압축 방식입니다. 품질과 속도는 설정마다 달라집니다.

KV cache: 긴 문맥을 기억하기 위해 쌓이는 캐시입니다. 컨텍스트를 늘릴수록 메모리와 속도에 직접 영향을 줍니다.

실사용 사례에서 나온 기준

최근 7일 안의 판단 근거는 공식 소개보다 실제 이슈 로그가 더 중요했습니다. Ollama의 Qwen3.6 페이지는 1주 전 업데이트로 표시되고, Q4_K_M 항목이 24GB로 표시됩니다. 이 숫자는 “파일이 작다”가 아니라 “24GB급 여유를 잡고 시작해야 한다”에 가깝습니다.

Mac M4 Max 64GB

Ollama 이슈 #16417에는 MacBook Pro M4 Max 64GB에서 일부 GGUF/MLX 모델은 깨졌지만 `qwen3.6:35b-a3b-coding-mxfp8`는 여전히 작동한다고 보고됐습니다. 64GB 통합 메모리급이 현실선이라는 힌트입니다.

NVIDIA GB10 128GB

Ollama 이슈 #16610은 ASUS Ascent GX10, NVIDIA GB10, 128GiB 공유 메모리에서 q8_0 실행 시 총 메모리 약 40.3GiB 로그를 남겼습니다. 병목은 메모리 부족보다 재로딩 회귀였습니다.

AMD Strix Halo

llama.cpp 이슈 #24437은 Strix Halo, 111616MiB VRAM allocation, LPDDR5X-8000에서 Q8_0 벤치를 다룹니다. AMD도 가능하지만 ROCm/rocWMMA 옵션에 따라 긴 컨텍스트 prefill 성능이 흔들립니다.

RX 9070 XT 16GB

llama.cpp 이슈 #24483은 RX 9070 XT 16GB에서 IQ3_XXS와 turbo3 KV 캐시로 262k 컨텍스트 테스트를 했습니다. 짧은 프롬프트 102.9 t/s가 50k 근처에서 66.2 t/s로 낮아졌습니다.

이 사례들을 합치면 답은 꽤 분명합니다. “16GB에서도 억지로 된다”는 이야기를 구매 기준으로 삼으면 안 됩니다. 실제 코딩 에이전트는 브라우저, IDE, 파일 인덱싱, 터미널, 모델 서버가 같이 열립니다. 모델만 올리는 계산보다 전체 작업 메모리가 먼저 막힙니다.

최근 7일 근거를 어떻게 읽어야 하나

2026년 6월 10일의 Strix Halo 이슈, 6월 12일 전후의 RDNA4 긴 컨텍스트 이슈, 최근 1주 안의 Ollama Mac M4 Max 64GB 이슈, 6일 전의 NVIDIA GB10 128GiB 이슈는 모두 “모델 자체가 신기하다”보다 “런타임과 메모리 배치가 체감 성능을 좌우한다”는 쪽을 보여줍니다. 즉 구매자는 벤치 점수보다 내 장비에서 모델이 계속 메모리에 남아 있는지, 긴 프롬프트에서 토큰 생성 속도가 얼마나 내려가는지, 오류가 났을 때 버전을 되돌릴 수 있는지를 먼저 봐야 합니다.

이 제품 구경하러 가기

Mac과 NVIDIA 체감 차이

Mac 계열

통합 메모리라 모델과 앱이 같은 큰 풀을 씁니다. 64GB 이상이면 세팅은 편하지만, 24GB나 32GB 모델은 다른 앱을 닫아야 하고 swap이 걸리면 체감이 갑자기 나빠집니다.

NVIDIA 계열

CUDA 생태계와 llama.cpp/Ollama 지원이 편합니다. 다만 노트북 RTX 4060 8GB 같은 장비는 GPU에 전부 올리는 모델이 아니라 CPU/RAM 오프로딩 모델로 봐야 합니다. RAM 64GB와 빠른 NVMe가 없으면 “실행은 되는데 작업은 답답한” 쪽으로 갑니다.

Mac 노트북과 개발 작업 공간
Mac은 통합 메모리 용량, NVIDIA 노트북은 VRAM과 시스템 RAM의 균형이 핵심입니다.

설치/세팅 흐름

  1. 먼저 RAM을 확인합니다. 32GB 이하는 Qwen3.6-35B-A3B를 메인 작업 모델로 잡지 않는 편이 낫습니다.
  2. Ollama를 설치하고 `ollama run qwen3.6:35b-a3b`로 기본 실행 여부를 봅니다.
  3. 긴 작업을 할 계획이면 `num_ctx`를 처음부터 크게 잡지 말고 16k, 32k, 64k 순서로 올립니다.
  4. NVIDIA 장비는 `nvidia-smi`로 VRAM 사용량을 보며, 부족하면 더 낮은 quant 또는 CPU 오프로딩을 선택합니다.
  5. Mac은 Activity Monitor에서 메모리 압력과 swap 사용량을 봅니다. 노란색/빨간색이면 브라우저와 IDE 탭부터 줄입니다.
  6. Ollama 0.30.x 계열에서 반복 로딩이 보이면 최근 이슈처럼 버전 회귀를 의심하고, 작동하던 버전으로 내려 테스트합니다.

되는 것 / 어려운 것

되는 것

  • 작은 저장소 코드 설명
  • 로컬 API로 IDE 보조 연결
  • 32k 안팎 컨텍스트의 코드 수정
  • 개인 문서/코드의 오프라인 처리

어려운 것

  • 16GB 메모리 장비에서 IDE까지 같이 켜기
  • 항상 100k 이상 컨텍스트로 빠르게 쓰기
  • 8GB VRAM에 모델 전체를 올리기
  • 런타임 버전 문제를 무시하고 안정 서버처럼 쓰기

사도 되는 사람 / 보류할 사람

사도 되는 사람

로컬 코딩 모델을 매일 쓰고, 개인정보나 회사 코드를 외부 API로 보내기 어렵고, 장비 메모리를 64GB 이상으로 맞출 수 있는 사람입니다. 새 노트북보다 업그레이드 가능한 기존 노트북에 64GB RAM과 1TB 이상 NVMe를 붙이는 쪽이 비용 대비 낫습니다.

보류할 사람

가끔 챗봇처럼 질문하는 정도라면 Qwen3.6-35B-A3B 때문에 비싼 장비를 살 필요가 없습니다. 7B~14B급 코딩 모델이나 클라우드 API가 훨씬 편합니다. Mac mini 기본형 16GB, RAM 납땜형 24GB 노트북은 이 목적만으로 사면 아쉽습니다.

자주 하는 질문

Q. 24GB RAM MacBook도 되나요?

짧은 테스트는 가능할 수 있지만, 이 글의 구매 기준으로는 보류입니다. 모델 서버와 개발 도구를 같이 열면 여유가 너무 적습니다.

Q. RTX 4060 8GB 노트북은 완전히 안 되나요?

완전히 안 되는 쪽은 아닙니다. 다만 GPU만 믿으면 안 되고, RAM 64GB와 낮은 quant, 작은 컨텍스트부터 시작해야 합니다.

Q. AMD도 괜찮나요?

가능성은 큽니다. 하지만 최근 llama.cpp 이슈처럼 ROCm, Vulkan, flash attention 옵션에 따른 성능 편차가 있어 초보자에게는 NVIDIA나 Mac보다 손이 더 갑니다.

Q. 가장 먼저 낮출 설정은?

컨텍스트 길이입니다. 64k, 100k 욕심을 내기 전에 16k~32k에서 안정성을 확인하고, 그다음 quant와 KV cache 타입을 조정하세요.

구매 판단

Qwen3.6-35B-A3B를 기준으로 장비를 고르면 “GPU 이름”보다 “메모리 여유”가 먼저입니다. Mac이라면 64GB 이상 통합 메모리, NVIDIA 노트북이라면 8GB VRAM이라도 시스템 RAM 64GB와 NVMe 여유 공간을 갖춘 구성이 현실적입니다. 이미 RTX 노트북이나 미니PC를 갖고 있다면, 새 GPU를 보기 전에 64GB DDR5 RAM 업그레이드 가능 여부부터 확인하는 쪽이 덜 낭비입니다.

특히 노트북 구매 단계라면 RAM 납땜형 16GB/24GB 제품은 가격이 좋아도 이 모델용으로는 피하는 편이 낫습니다. Qwen3.6-35B-A3B를 오래 켜두고 코딩 보조로 붙이면 모델 파일, KV 캐시, 브라우저 탭, IDE 인덱싱이 동시에 메모리를 씁니다. 32GB는 실험실, 64GB는 작업 시작점, 128GB는 긴 컨텍스트와 여러 모델을 함께 다루는 여유라고 보면 됩니다. 저장공간도 512GB보다는 1TB 이상이 좋습니다. 모델 파일 여러 개와 quant 버전을 비교하다 보면 100GB는 금방 사라집니다.

예산이 한정돼 있다면 우선순위는 분명합니다. 첫째, 메모리 64GB 이상. 둘째, 발열을 오래 버티는 섀시. 셋째, 빠른 NVMe 저장공간. 넷째, CUDA가 필요한 워크플로라면 NVIDIA GPU입니다. 반대로 화면 해상도, 얇은 두께, AI PC라는 마케팅 문구는 이 모델의 체감 속도를 직접 보장하지 않습니다. 로컬 AI 장비는 예쁜 사양표보다 오래 켜 놓았을 때 조용히 버티는 구성이 더 중요합니다.

이 제품 구경하러 가기

출처

관련 글 추천