오과장입니다. 오늘 볼 조합은 Qwen3.6 35B-A3B를 Ryzen AI Max+ 395 128GB급 미니PC에서 로컬 코딩 LLM으로 쓰는 것입니다. 결론부터 말하면 “일반 16GB 노트북에서도 되나요?”라는 질문에는 아니라고 답해야 합니다. Ollama의 qwen3.6:35b-a3b 페이지가 Q4_K_M 모델 크기를 24GB로 표시하고, 최근 실사용 이슈들은 긴 컨텍스트와 MTP 가속까지 붙이면 메모리와 백엔드 안정성이 바로 병목이 된다고 보여줍니다.

Qwen3.6 35B-A3B를 로컬 코딩용으로 제대로 쓰려면 최소 48GB급 통합 메모리 또는 24GB VRAM GPU부터 봐야 합니다. 하지만 긴 컨텍스트와 저장소 단위 코딩 보조까지 노리면 Ryzen AI Max+ 395 128GB 같은 통합 메모리 미니PC가 훨씬 편합니다. 16GB RAM 노트북, RTX 4060 8GB 노트북, 보급형 AMD iGPU 미니PC는 35B급보다 7B~14B급 모델이 맞습니다.
이 도구가 뭔가요?
Qwen3.6은 Alibaba Cloud의 Qwen 계열 오픈 웨이트 LLM입니다. Ollama 설명에 따르면 agentic coding, 도구 사용, thinking preservation 쪽을 강화한 모델입니다. 35B-A3B는 전체 파라미터는 35B급이지만 한 번에 활성화되는 전문가 일부만 쓰는 MoE 구조라, 같은 크기의 일반 dense 모델보다 실행 부담을 줄이는 방향입니다.
용어 먼저 정리
GGUF는 llama.cpp 계열에서 많이 쓰는 로컬 모델 파일 형식입니다. Q4_K_M은 모델을 4비트 수준으로 줄인 양자화라 메모리를 아끼지만 품질과 속도는 설정에 따라 달라집니다. KV 캐시는 긴 대화를 기억하기 위해 쌓이는 작업 메모리입니다. 컨텍스트는 모델이 한 번에 읽을 수 있는 글의 길이이고, MTP는 다음 토큰을 더 빨리 예측하려는 speculative decoding 계열 가속 기능으로 보면 됩니다. Vulkan은 AMD·Intel GPU에서도 쓸 수 있는 그래픽/연산 백엔드입니다.
왜 지금 이 조합을 봐야 하나요?
Qwen3.6은 Ollama 라이브러리에서 “agentic coding”과 “thinking preservation”을 전면에 내세웁니다. 개발자가 로컬에서 쓰고 싶은 이유도 분명합니다. 회사 코드나 개인 프로젝트를 외부 API로 보내기 싫을 때, 저장소 구조를 읽고 수정 방향을 제안하는 코딩 보조 모델을 내 장비에서 돌릴 수 있기 때문입니다.
다만 35B급 모델은 이름만 보고 가볍게 접근하면 곧바로 막힙니다. Ollama의 qwen3.6:35b-a3b Q4_K_M 항목만 해도 모델 크기가 24GB입니다. 여기에 긴 컨텍스트의 KV 캐시, 서버 프로세스, 운영체제, IDE, 브라우저까지 더하면 “메모리 32GB면 충분하겠지”라는 계산이 틀어집니다.
실사용 사례에서 나온 기준
최근 7일 안의 커뮤니티 신호가 꽤 구체적입니다. 2026년 5월 17일 생성되고 5월 22일 갱신된 llama.cpp 이슈 #23230은 Framework Desktop Ryzen AI Max 395+ 128GB, Fedora 43, Vulkan-RADV 백엔드에서 Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf를 llama-server로 띄운 사례를 보여줍니다. 명령에는 -c 131072, q8_0 KV 캐시, draft-mtp가 들어갑니다. 즉 35B급 Qwen을 긴 컨텍스트 코딩 서버로 쓰려면 “그냥 실행”이 아니라 메모리 큰 통합 GPU 장비와 세부 옵션이 필요합니다.
반대로 2026년 5월 19일 llama.cpp 이슈 #23321은 GMKtec M5 PLUS의 AMD Radeon Graphics와 Vulkan 환경에서 no-kv-offload를 켰을 때 Qwen3.6-35B-A3B 출력이 깨지는 사례를 담고 있습니다. 이건 AMD iGPU가 전부 나쁘다는 뜻이 아닙니다. 다만 보급형 미니PC 내장그래픽과 35B급 코딩 모델 조합은 백엔드 옵션 하나에도 결과가 흔들릴 수 있다는 경고에 가깝습니다.
또 2026년 5월 21일 Unsloth 이슈 #5676은 Qwen3.6-35B-A3B-UD-Q8_K_XL.gguf를 Unsloth Studio로 실행하며 --ctx-size 128000, q8_0 KV 캐시를 넘겼지만, 로그에서 컨텍스트가 자동으로 4096까지 줄었다고 보고합니다. 본문에는 모델 크기 36.4GB라는 로그도 나옵니다. 초보자 입장에서는 이 대목이 중요합니다. 모델이 로드되는 것과 긴 문맥으로 쓸 수 있는 것은 다른 문제입니다.
16GB RAM 노트북은 Qwen3.6 35B 대상이 아닙니다. 32GB도 짧은 컨텍스트와 더 작은 양자화에 묶입니다. 64GB 통합 메모리부터 실험권이고, Ryzen AI Max+ 395 128GB급은 긴 컨텍스트와 서버 운용까지 노릴 수 있는 현실적인 권장선입니다. NVIDIA로 간다면 최소 24GB VRAM GPU가 기준입니다.
최소 사양과 권장 사양은 다릅니다
최소 사양을 “모델 파일이 디스크에 들어간다”로 잡으면 판단이 망가집니다. Q4_K_M 파일이 24GB라는 건 저장공간과 로딩 부담의 시작일 뿐입니다. 코딩 모델은 저장소 파일을 길게 붙여 넣고, 이전 대화와 도구 호출까지 유지해야 쓸모가 생깁니다. 이때 KV 캐시가 커지고, 메모리가 부족하면 컨텍스트를 줄이거나 일부 계산을 CPU로 밀어내게 됩니다.
16GB RAM, 8GB VRAM 노트북. 35B 대신 7B~14B 코딩 모델을 고르는 편이 낫습니다.
64GB 통합 메모리 또는 24GB VRAM. 짧은 컨텍스트부터 올리며 맞춰야 합니다.
Ryzen AI Max+ 395 128GB, RAM 여유 큰 미니PC, SSD 2TB. 로컬 코딩 서버로 굴리기 좋습니다.
맥 계열과 NVIDIA 계열, AMD 통합 메모리의 차이
맥 계열은 조용하고 통합 메모리 효율이 좋습니다. 하지만 Ollama 이슈 #16264처럼 Apple Silicon M4 Max와 Metal 환경에서도 Qwen3-VL-8B GGUF + mmproj 비전 요청이 첫 이미지에서 크래시나는 사례가 있습니다. 이 글의 주제는 텍스트 코딩 모델이지만, “맥이면 모든 GGUF가 매끄럽다”는 식으로 일반화하면 위험합니다.
NVIDIA는 CUDA 생태계가 강하고 문서와 사례가 많습니다. 대신 35B급을 GPU에 넉넉히 올리려면 24GB VRAM 이상이 필요해 가격이 크게 뜁니다. Ryzen AI Max+ 395 계열은 전용 VRAM 대신 큰 통합 메모리를 활용하는 쪽입니다. 최고 토큰 속도만 보면 하이엔드 NVIDIA가 유리할 수 있지만, 책상 위 미니PC 한 대로 긴 컨텍스트 로컬 코딩 서버를 만들고 싶다면 128GB 통합 메모리의 장점이 큽니다.

어떤 설정을 낮추면 돌아가나요?
첫 번째는 컨텍스트입니다. 처음부터 128K를 욕심내지 말고 8K, 16K, 32K 순서로 올려야 합니다. 두 번째는 양자화입니다. Q8 계열은 품질은 좋지만 메모리 부담이 큽니다. Q4_K_M이나 Q4_K_XL로 시작해 실제 답변 품질을 보고 올리는 편이 낫습니다. 세 번째는 KV 캐시 타입입니다. f16이 부담스럽다면 q8_0 같은 캐시 설정을 검토해야 합니다.
MTP도 무조건 켜면 좋은 옵션으로 보면 안 됩니다. llama.cpp #23230에서는 MTP 정리 이후 draft-mtp --spec-draft-n-max 3가 이전 대비 85~90% 수준으로 느려졌고, n-max 2가 95% 수준이었다는 비교가 나옵니다. 속도 옵션은 버전과 모델에 따라 체감이 바뀌니, 설치 직후에는 기본 실행을 성공시킨 뒤 하나씩 켜는 쪽이 안전합니다.
설치/세팅 흐름
- 가장 쉬운 시작은 Ollama qwen3.6:35b-a3b로
ollama run qwen3.6:35b-a3b를 실행하는 것입니다. - 서버용으로 다룰 사람은 llama.cpp를 빌드하고 Vulkan, CUDA, Metal 중 장비에 맞는 백엔드를 확인합니다.
- 처음 실행은 컨텍스트 8192 또는 16384, batch는 낮게, MTP는 끈 상태에서 성공 여부를 확인합니다.
- 성공하면
-c 32768,-c 65536처럼 컨텍스트를 단계적으로 올리고 메모리 사용량을 봅니다. - 긴 문맥이 필요하면
--cache-type-k q8_0,--cache-type-v q8_0같은 KV 캐시 옵션을 실험합니다. - MTP는 마지막에 켭니다.
draft-mtp와spec-draft-n-max값을 바꿔가며 토큰 속도와 답변 품질을 같이 봅니다.
되는 것 / 어려운 것
128GB 통합 메모리 미니PC에서는 Qwen3.6 35B-A3B Q4 계열을 로컬 코딩 보조 서버로 실험할 여지가 큽니다. 짧은 저장소 설명, 함수 리팩터링, 코드 리뷰 초안에는 충분히 의미가 있습니다.
16GB 일반 노트북, 8GB VRAM 게이밍 노트북, 보급형 AMD iGPU 미니PC에서 35B급 긴 컨텍스트 코딩 서버를 안정적으로 굴리는 건 기대치를 낮춰야 합니다.
사도 되는 사람 / 보류할 사람
사도 되는 사람은 로컬 LLM을 장난감이 아니라 작업 환경으로 쓰려는 개발자입니다. IDE, 브라우저, Docker, 문서, LLM 서버를 동시에 켜고, 긴 코드베이스를 모델에 넘기고 싶은 사람에게 128GB 통합 메모리는 분명한 의미가 있습니다. 특히 책상 위에 큰 데스크톱을 두기 어렵다면 Ryzen AI Max+ 395 미니PC는 꽤 설득력 있는 선택지입니다.
보류할 사람도 있습니다. 코딩 질문 몇 개만 할 거라면 35B급보다 Qwen3 8B, 14B, 30B A3B 같은 가벼운 모델부터 써도 됩니다. 이미 RTX 4060 8GB 노트북을 갖고 있다면 무리해서 35B를 얹기보다 작은 코딩 모델과 클라우드 모델을 섞는 편이 낫습니다. 또 백엔드 옵션을 직접 만질 생각이 없다면 Ollama에서 기본 모델을 돌려보고, 원하는 워크플로우가 맞는지 먼저 확인해야 합니다.

자주 하는 질문
Q. 24GB 모델이면 32GB RAM PC에서 되지 않나요?
짧게 실행될 수는 있지만 권장하지 않습니다. 운영체제와 KV 캐시, 서버 프로세스, 브라우저와 IDE가 같이 메모리를 씁니다. 32GB는 여유가 너무 적습니다.
Q. RTX 4060 8GB 노트북으로는 완전히 불가능합니까?
35B급 Qwen3.6에는 맞지 않습니다. 대신 7B~14B급 코딩 모델이나 더 작은 양자화 모델을 고르는 편이 훨씬 실용적입니다.
Q. Ryzen AI Max+의 NPU가 이 모델을 돌리나요?
이 글의 기준은 NPU가 아니라 통합 메모리와 GPU 백엔드입니다. 현재 로컬 LLM 운용에서는 NPU TOPS보다 llama.cpp, Ollama, Vulkan/CUDA/Metal 지원이 더 중요합니다.
Q. Q4와 Q8 중 무엇을 받으면 되나요?
처음은 Q4 계열이 낫습니다. Q8은 메모리 부담이 커서 64GB 장비에서도 컨텍스트와 캐시 설정을 더 신경 써야 합니다.
Q. Mac mini M4도 괜찮나요?
메모리를 크게 잡은 맥은 좋은 로컬 LLM 장비가 될 수 있습니다. 다만 GGUF, 비전 모델, Metal 백엔드에서 모델별 이슈가 나올 수 있으니 “맥이면 다 된다”보다 “내가 쓸 모델이 잘 돈다”를 확인해야 합니다.
구매 판단
Qwen3.6 35B-A3B를 로컬 코딩 LLM으로 진지하게 쓰려면 메모리 128GB급 미니PC나 24GB VRAM 이상 GPU 장비가 기준입니다. 이번 글에서 연결한 Ryzen AI Max+ 395 계열 미니PC는 그런 면에서 35B급 GGUF 모델을 만져볼 수 있는 하드웨어 후보입니다. 단, 구매 전에는 RAM 용량이 128GB인지, SSD가 최소 1TB 이상인지, OS와 드라이버를 직접 세팅할 수 있는지 확인해야 합니다.
최종 판단은 간단합니다. 로컬 코딩 LLM을 매일 켜둘 사람은 메모리를 아끼면 안 됩니다. 가끔 질문만 할 사람은 작은 모델을 쓰고, 35B급은 나중에 넘어가도 늦지 않습니다.
출처: Ollama qwen3.6:35b-a3b, llama.cpp #23230, llama.cpp #23321, Unsloth #5676, Ollama #16264, llama.cpp