매거진

Qwen3.6 35B를 RTX 4060 8GB 노트북에서? 코딩은 가능하지만 RAM 32GB가 하한선입니다

2026. 07. 06.

쿠팡 파트너스 활동의 일환으로 일정액의 수수료를 제공받을 수 있습니다.

오과장입니다. 오늘은 로컬 LLM 글에서 흔한 “요즘 모델 몇 개 모음”이 아니라, 하나만 보겠습니다. Qwen3.6-35B-A3B GGUFRTX 4060 Laptop GPU 8GB + RAM 32GB급 노트북에서 코딩 보조로 돌릴 수 있느냐입니다. 최근 7일 안쪽 Reddit LocalLLaMA 실사용 댓글과 llama.cpp 이슈를 같이 보면 결론은 단순합니다. 돌아갑니다. 그런데 “GPU만 좋으면 끝”이 아니라, RAM과 오프로딩 세팅을 이해해야 쓸 만합니다.

MSI 소드 GF76 B13VFK  i7-13620H/ 32GB(16GB+16GB 추가)/ 512GB/ RTX4060 8G/ FreeDOS 제품 사진
Qwen3.6 35B-A3B를 노트북에서 보려면 RTX 4060/5060 같은 8GB VRAM보다 RAM 32GB 이상 여부가 먼저 보입니다.
짧은 답변

RTX 4060 8GB 노트북에서도 Qwen3.6-35B-A3B는 Q4 양자화, llama.cpp, CPU/RAM 오프로딩 조합으로 현실적인 속도 사례가 있습니다. 다만 8GB VRAM에 모델을 전부 올리는 방식이 아닙니다. 새로 장비를 산다면 RAM 32GB는 하한선, 64GB는 권장선, SSD 1TB와 좋은 냉각은 사실상 필수 옵션으로 보는 편이 맞습니다.

이 도구가 뭔가요?

Qwen3.6-35B-A3B 설명 박스

Qwen3.6-35B-A3B는 Qwen 계열의 오픈 웨이트 언어 모델입니다. 이름의 35B는 전체 파라미터 규모, A3B는 한 번에 활성화되는 파라미터가 약 3B급이라는 뜻에 가깝습니다. Hugging Face의 Unsloth GGUF 배포판은 llama.cpp, LM Studio, Ollama식 실행 흐름에서 쓰기 쉬운 파일을 제공합니다.

용어 먼저 정리

이 글에서 필요한 단어
  • CUDA: NVIDIA GPU로 AI 계산을 돌리게 해주는 기반입니다. RTX 노트북에서 가장 자료가 많은 경로입니다.
  • VRAM: GPU 전용 메모리입니다. RTX 4060 Laptop은 보통 8GB라 35B 모델 전체를 담기엔 부족합니다.
  • RAM: 노트북 메인 메모리입니다. 이 조합에서는 일부 전문가 텐서와 캐시가 RAM 쪽으로 밀리므로 32GB 미만은 빡빡합니다.
  • GGUF: llama.cpp에서 쓰는 모델 파일 형식입니다. 로컬 LLM 초보자는 우선 GGUF Q4 파일부터 시작하는 편이 낫습니다.
  • Quantization: 모델을 Q4, Q5처럼 압축해 메모리를 줄이는 방식입니다. 숫자가 낮을수록 가벼워지지만 품질 손실 가능성이 커집니다.
  • KV cache: 긴 대화를 이어갈 때 필요한 작업 메모리입니다. 컨텍스트를 크게 잡으면 모델 파일보다 이 캐시가 병목이 됩니다.
  • MoE offload: MoE 모델의 일부 전문가 텐서를 GPU가 아니라 CPU/RAM 쪽에 두는 방식입니다. 8GB VRAM 조합의 핵심 꼼수입니다.

공식 문서에서 확인할 것

설치 출발점은 Unsloth의 Qwen3.6-35B-A3B-GGUF 모델 페이지입니다. 여기에는 llama serve -hf unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_M처럼 바로 서버를 띄우는 흐름, OpenClaw 같은 로컬 에이전트 연결 예시, Docker Model Runner 예시가 들어 있습니다. Unsloth 문서는 Qwen3.6 35B-A3B를 22GB RAM급에서도 돌릴 수 있다고 소개하지만, 이 문장은 “노트북에서 편하다”는 뜻이 아닙니다. OS, IDE, 브라우저, 모델 캐시까지 같이 켜는 실제 작업 기준으로는 32GB부터 봐야 합니다.

실사용 사례에서 나온 기준

최근 4일 전 LocalLLaMA의 “32GB RAM + 8GB VRAM에서 Qwen3.6 35A3B가 되느냐” 논의에서는 같은 4060 조합으로 64K Q4 컨텍스트에서 25 t/s를 봤다는 댓글, 6GB VRAM RTX 2060에서도 Q4_K_S를 밀어 넣었다는 댓글, 5060 8GB + 32GB DDR4에서 31 t/s 추론을 말하는 댓글이 같이 나왔습니다. 또 6일 전 실제 코딩 작업에서 로컬 모델을 쓰는 글에서는 8GB VRAM 장비에서 Qwen3.6-35B-A3B가 40 t/s 근처까지 나온다는 비교와, 노트북 GPU는 같은 숫자의 데스크톱 GPU보다 메모리 대역폭이 낮다는 지적이 붙었습니다.

최근 커뮤니티 기준
  • RTX 4060 8GB + RAM 32GB: Q4 기준으로 가능 사례가 있습니다.
  • 6GB VRAM: 돌아간다는 사례는 있지만 초보자 구매 기준으로 권하지 않습니다.
  • 16GB RAM: 모델보다 개발 환경이 먼저 숨이 찰 가능성이 큽니다.
  • 64K 이상 컨텍스트: 가능 사례는 있지만, 처음 세팅은 32K부터 올리는 편이 안전합니다.
  • 노트북 GPU: 데스크톱 RTX 4060/4070 숫자를 그대로 기대하면 안 됩니다.

최근 이슈가 말하는 병목

하드웨어 판단에서 중요한 건 “된다”보다 “어디서 느려지느냐”입니다. 2026년 7월 2일 올라온 llama.cpp 이슈 #25224는 8GB VRAM 단일 GPU에서 MoE 모델 자동 맞춤 배치가 바뀌며 생성 속도가 26.1 t/s에서 15.0 t/s로 떨어지는 사례를 설명합니다. 핵심은 MoE 전문가 텐서가 더 많이 시스템 메모리로 밀리고, 토큰마다 host-to-device 전송이 늘어난다는 점입니다. 즉 RTX 4060 8GB 노트북은 “모델이 뜬다”와 “코딩 보조로 견딜 만하다” 사이에 세팅 차이가 큽니다.

최소 사양과 현실 권장 사양

최소로 실험

RTX 4060 Laptop 8GB, RAM 32GB, SSD 여유 80GB 이상, Windows 11 또는 Linux, CUDA 지원 llama.cpp. 모델은 Q4 계열, 컨텍스트는 32K부터 시작합니다.

현실적 권장

RTX 4060/5060 8GB급이라도 RAM 64GB 업그레이드 가능 모델, SSD 1TB 이상, 전원 연결 시 성능 유지가 좋은 15~16형 게이밍 섀시가 좋습니다.

편한 구성

VRAM 16GB 이상 GPU나 24GB 데스크톱 GPU는 CPU 오프로딩 의존이 줄어듭니다. 장시간 에이전트 코딩은 이쪽이 훨씬 덜 예민합니다.

맥 계열과 NVIDIA 계열 체감 차이

맥은 통합 메모리라 “VRAM 8GB 한계”가 덜 보입니다. 하지만 24GB 통합 메모리 맥에서 35B Q4와 IDE, 브라우저, 터미널, 로컬 서버를 동시에 오래 돌리는 건 여전히 빠듯합니다. NVIDIA 노트북은 VRAM 벽이 선명한 대신 CUDA, llama.cpp, Flash Attention, KV 캐시 양자화, MoE CPU 오프로딩 관련 사례가 훨씬 많습니다. 초보자가 최근 커뮤니티 레시피를 따라 하며 시행착오를 줄이려면 RTX 4060/5060급 NVIDIA 노트북이 더 자료 친화적입니다. 반대로 조용한 작업, 배터리, 휴대성이 우선이면 맥에서 더 작은 Qwen3.6 4B/8B급 모델을 안정적으로 쓰는 편이 낫습니다.

어떤 설정을 낮추면 돌아가나

처음 낮출 값은 모델 욕심이 아니라 컨텍스트입니다. Qwen3.6이 긴 컨텍스트를 지원한다고 해도, RTX 4060 8GB 노트북에서 처음부터 100K, 190K를 잡는 건 고생문입니다. --ctx-size 32768로 시작해서 48K, 64K로 올리세요. 다음은 KV 캐시 타입입니다. -ctk q8_0 -ctv q8_0는 비교적 보수적이지만 메모리를 씁니다. 메모리가 부족하면 q4 계열 캐시를 검토할 수 있으나 출력 안정성도 같이 봐야 합니다. 마지막은 --n-cpu-moe나 자동 fit입니다. GPU에 억지로 올리려다 공유 메모리로 밀리면 오히려 느려질 수 있습니다.

설치/세팅 흐름

처음 쓰는 사람이 밟을 순서
  1. NVIDIA 드라이버를 최신 안정 버전으로 올리고 CUDA가 잡히는지 nvidia-smi로 확인합니다.
  2. llama.cpp CUDA 빌드 또는 최신 릴리스의 llama-server를 준비합니다. Windows라면 미리 빌드된 바이너리로 시작해도 됩니다.
  3. Hugging Face에서 unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_M 같은 Q4 GGUF를 받습니다.
  4. 첫 실행은 llama-server -hf unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_M -c 32768 -fa on -ctk q8_0 -ctv q8_0처럼 보수적으로 시작합니다.
  5. 작업 관리자나 nvidia-smi로 VRAM 8GB가 꽉 차는지, RAM이 28GB 이상 치솟는지 확인합니다.
  6. 속도가 10 t/s 아래로 떨어지면 컨텍스트, 배치, MoE 오프로딩 값을 하나씩 줄여 비교합니다.
  7. 그 뒤 Continue, OpenCode, OpenClaw 같은 도구에 http://127.0.0.1:8080/v1 OpenAI 호환 엔드포인트로 연결합니다.
에이수스 2026 TUF 게이밍 A16 라이젠7 라이젠 200 시리즈 지포스 RTX 5060, FA608UMI-TU196, WIN11 Home, 32GB, 1TB, 예거 그레이 제품 사진
로컬 LLM용 노트북은 GPU명보다 RAM 구성, SSD 여유 공간, 냉각 성능을 같이 봐야 합니다.

되는 것 / 어려운 것

되는 것

함수 단위 코드 작성, 오류 로그 해석, 파일 몇 개 수준 리팩터링, 오프라인 코딩 보조, 작은 에이전트 루프는 시도할 만합니다.

어려운 것

대형 레포 전체를 100K 이상 컨텍스트로 계속 물고 가는 작업, 브라우저와 IDE와 모델 서버를 동시에 오래 켜는 작업, 여러 요청 병렬 처리는 32GB RAM에서 빠르게 답답해집니다.

포기할 것

RTX 4060 8GB 노트북으로 35B Q5/Q6, 초장문 컨텍스트, 멀티 에이전트 동시 실행을 모두 잡겠다는 계획은 현실적이지 않습니다.

사도 되는 사람 / 보류할 사람

구매 판단
  • 사도 되는 사람: 이미 로컬 LLM을 실험해 봤고, CUDA/드라이버/명령어 세팅을 만지는 데 거부감이 없으며, RAM 32GB 이상 노트북을 고를 사람입니다.
  • 보류할 사람: 클릭 한 번으로 ChatGPT급 코딩 에이전트를 기대하는 사람, 16GB RAM 노트북을 오래 쓸 사람, 배터리 상태에서 조용히 돌릴 모델을 원하는 사람입니다.
  • 중고/특가 체크: RTX 4060 8GB라도 RAM 업그레이드가 막힌 얇은 노트북은 피하세요. 로컬 LLM은 얇고 뜨거운 섀시와 궁합이 좋지 않습니다.

자주 하는 질문

FAQ

Q. RTX 4050 6GB도 되나요?
사례는 있지만 구매 기준으로는 비추천입니다. Qwen3.6 35B는 “띄우기”보다 “작업 중 버티기”가 문제라 8GB VRAM과 32GB RAM을 하한선으로 잡는 편이 낫습니다.

Q. RAM 16GB 노트북이면 Q4로 가능하지 않나요?
짧은 테스트는 가능할 수 있지만 개발 도구와 브라우저까지 켜면 여유가 거의 없습니다. 이 글의 구매 판단에서는 제외합니다.

Q. Ollama가 더 쉽지 않나요?
쉽지만 세밀한 VRAM/RAM 오프로딩과 최신 llama.cpp 옵션을 만지려면 llama-server 쪽이 판단하기 좋습니다.

Q. Qwen3.6 27B와 35B-A3B 중 뭐가 낫나요?
최근 장문 벤치 논의에서는 27B dense가 더 똑똑하다는 의견과 35B-A3B가 더 빠르게 반복할 수 있다는 의견이 같이 나옵니다. 8GB VRAM 노트북에서는 속도와 세팅 가능성 때문에 35B-A3B Q4부터 보는 편이 현실적입니다.

제품 소개

이 글에서 연결할 제품은 “Qwen3.6 35B를 완벽하게 돌리는 장비”가 아니라, 최근 실사용 사례와 같은 방향의 NVIDIA 8GB VRAM급 게이밍 노트북 + RAM 32GB 전후 조건에 맞춘 후보입니다. 제품명에 RTX 4060 또는 RTX 5060, 32GB RAM 구성이 보이면 우선 검토 대상입니다. 반대로 16GB RAM 고정형, 얇은 저전력 섀시, SSD 512GB 단일 구성은 로컬 LLM용으로는 아쉽습니다.

출처와 날짜 확인

본문 판단 근거는 2026년 6월 29일부터 7월 6일 사이에 확인 가능한 커뮤니티/이슈 위주로 잡았습니다. 공식 모델 페이지와 문서는 설치 주소와 기본 실행법 확인용으로만 사용했습니다. 참고 링크: 32GB RAM + 8GB VRAM 논의, 실제 코딩 작업 글, 65K~128K 컨텍스트 벤치 논의, llama.cpp 8GB VRAM MoE 이슈, Unsloth Qwen3.6 GGUF 모델 페이지.

관련 글 추천