오과장입니다. 이번 글은 Qwen3.6-35B-A3B를 RTX 4060 Laptop 8GB 노트북에서 로컬 코딩 AI로 굴릴 수 있는지, 최근 7일 안쪽 실사용 의견을 기준으로 정리한 구매 판단 글입니다.
결론부터 살짝 얄밉게 말하면, "된다"와 "편하다"는 다릅니다. 8GB VRAM 노트북에서도 돌아간 사례는 나왔지만, 핵심은 GPU 성능보다 VRAM 여유, 시스템 RAM 32GB 이상, CPU 오프로딩, 그리고 백그라운드 앱 정리입니다.
짧은 답변
Qwen3.6-35B-A3B + RTX 4060 Laptop 8GB 조합은 실험용이 아니라 실제 코딩 보조까지 노릴 수 있습니다. 다만 풀 GPU 로딩이 아니라 전문가 레이어 일부를 CPU/RAM으로 넘기는 방식이라, 16GB RAM 노트북은 권하지 않습니다.
- 최소: RTX 4060 Laptop 8GB, 시스템 RAM 32GB, SSD 여유 80GB 이상
- 현실 권장: RTX 4060/4070 Laptop 8GB 이상, RAM 32GB 이상, 가능하면 Linux 또는 WSL 세팅
- 구매 판단: 새로 산다면 8GB GPU보다 16GB VRAM 그래픽카드/노트북이 낫지만, 이미 RTX 4060 노트북이 있다면 충분히 시도할 만합니다.
이 도구가 뭔가요?
Qwen3.6-35B-A3B는 알리바바 Qwen 계열의 오픈 웨이트 코딩/에이전트용 언어 모델입니다. 이름의 35B는 전체 파라미터 규모, A3B는 한 번에 활성화되는 파라미터가 약 3B라는 뜻에 가깝습니다. 그래서 파일은 크지만 매 토큰 계산량은 상대적으로 작아, 작은 GPU에서도 CPU/RAM 오프로딩을 섞어 돌려보는 사례가 많습니다.
용어 먼저 정리
그래픽카드 전용 메모리입니다. LLM에서는 모델 일부, KV 캐시, 실행 중 버퍼가 들어가므로 8GB와 12GB 차이가 체감에 크게 납니다.
llama.cpp 계열에서 많이 쓰는 로컬 모델 파일 형식입니다. Unsloth나 LM Studio 커뮤니티 모델을 내려받아 바로 실행할 때 자주 보입니다.
모델 무게를 16비트 그대로 쓰지 않고 4비트, 5비트처럼 줄이는 압축 방식입니다. VRAM/RAM은 아끼지만 품질과 속도는 quant 종류마다 달라집니다.
Mixture of Experts 구조입니다. 전체 모델은 35B지만 토큰마다 일부 전문가만 움직여서, CPU 오프로딩을 섞으면 의외로 작은 GPU에서도 버틸 수 있습니다.
NVIDIA 쪽 가속은 CUDA, Apple Silicon 쪽 가속은 Metal/MLX를 주로 씁니다. 같은 메모리 용량이라도 NVIDIA VRAM과 맥 통합 메모리는 속도 감각이 다릅니다.
실사용 사례에서 나온 기준
이번 판단의 중심 근거는 2026년 7월 4일 무렵 올라온 LocalLLaMA 실사용 글입니다. 작성자는 RTX 4060 Laptop 8GB, i7-13620H, RAM 32GB, Windows 11, llama.cpp CUDA 빌드에서 Qwen3.6-35B-A3B Q4_K_M 약 20GB GGUF를 다뤘고, 전문가 레이어를 CPU로 넘긴 뒤 약 5.4GB VRAM 사용과 여유 2.5GB 수준에서 좋은 날 약 39 tok/s 생성을 보고했습니다.
흥미로운 부분은 "GPU가 약해서 느리다"가 아니라는 점입니다. 해당 사례에서는 VRAM이 너무 꽉 차면 NVIDIA 드라이버의 시스템 메모리 폴백 때문에 속도가 7 tok/s대로 무너졌고, Discord나 무거운 브라우저 탭을 닫자 6 tok/s대에서 18 tok/s대로 회복됐다고 설명합니다. 즉 병목은 GPU 코어보다 CPU, RAM, VRAM 헤드룸, 백그라운드 앱입니다.
최근 2일 안쪽 Apple Silicon 관련 LocalLLM 토론도 방향을 보태 줍니다. M1 Ultra/M4 Max 128GB에서 Qwen3.6-27B가 15 tok/s 정도라는 질문에, 여러 이용자가 맥 통합 메모리는 용량은 넉넉하지만 메모리 대역폭과 엔진 선택 때문에 NVIDIA 전용 VRAM과 체감이 다르다고 답했습니다. 한 댓글은 M1 Ultra에서 35B-A3B 계열을 주 드라이버로 쓰며 50~60 tok/s를 언급했지만, 이 역시 oMLX, hotswap, SSD 사용 같은 튜닝이 붙은 이야기입니다.
핵심 판단: RTX 4060 Laptop 8GB는 "Qwen3.6-35B-A3B를 켜 볼 수 있는 최저선에 가까운 장비"입니다. 편한 장비라기보다, RAM 32GB와 세팅 의지가 있을 때 로컬 코딩 AI를 체험할 수 있는 실전 하한선으로 보는 게 맞습니다.
최소 사양과 현실 권장 사양
RTX 4060 Laptop 8GB, RAM 32GB, SSD 80GB 이상, llama.cpp CUDA 빌드. 브라우저 탭과 메신저를 줄이는 습관이 필요합니다.
RTX 4070 Laptop 8GB 이상 또는 RTX 4060 Ti/5060 Ti 16GB 데스크톱 GPU, RAM 32~64GB. VRAM 여유가 생길수록 세팅 스트레스가 줄어듭니다.
32GB 맥은 보류, 64GB 이상부터 시도권입니다. 다만 NVIDIA 전용 VRAM보다 토큰 생성 속도는 엔진과 메모리 대역폭 영향을 많이 받습니다.
무엇이 병목인가
Qwen3.6-35B-A3B는 일반적인 7B 모델처럼 "VRAM에 다 넣고 끝"이 아닙니다. 8GB VRAM에서는 파일 전체를 GPU에 올릴 수 없으니 CPU/RAM 오프로딩이 들어갑니다. 그래서 CPU가 약하거나 RAM이 16GB뿐이면 모델이 켜져도 작업 중에 답답해집니다.
저장공간도 가볍게 보면 안 됩니다. GGUF 파일 하나가 quant에 따라 17~22GB대가 될 수 있고, 여러 quant를 시험하면 금방 60GB 이상을 씁니다. Windows에서 WSL과 Open WebUI까지 곁들이면 SSD 여유는 더 필요합니다.
드라이버도 은근히 중요합니다. 커뮤니티 글에서는 같은 모델이라도 llama.cpp 빌드, CUDA 옵션, Windows/WSL 네트워킹, Smart App Control 같은 주변 조건 때문에 성능과 안정성이 갈렸습니다. 그러니 "RTX 4060이면 몇 tok/s"처럼 숫자 하나로 외우기보다, VRAM 여유를 남긴 상태에서 본인 워크플로를 짧게 반복 측정하는 편이 더 정확합니다.
설치/세팅 흐름
- 드라이버 확인: NVIDIA 드라이버와 CUDA 런타임을 최신 안정 버전으로 맞춥니다. Windows라면 WSL2 또는 네이티브 llama.cpp CUDA 빌드 중 하나를 정합니다.
- llama.cpp 준비: 최신 빌드를 사용합니다. Homebrew 환경은
brew install llama.cpp, 직접 빌드는 CUDA 옵션을 켭니다. - 모델 선택: 처음부터 큰 quant를 욕심내지 말고 Unsloth GGUF의 Q4 계열 또는 CPU 오프로딩 친화 quant부터 내려받습니다.
- 서버 실행: 예시는
llama-server -m Qwen3.6-35B-A3B-Q4.gguf -c 65536 --parallel 1 --no-mmap처럼 시작하되, RAM 압박이 있으면 mmap을 다시 켭니다. - VRAM 여유 확인: 작업 관리자나
nvidia-smi로 1.5GB 안팎 여유를 남기는지 봅니다. 여유가 없으면 GPU에 올리는 레이어를 줄입니다. - 코딩 도구 연결: Open WebUI, OpenCode, Continue, Pi, OpenClaw 같은 클라이언트에서 로컬 OpenAI 호환 endpoint를 연결합니다.
낮추면 되는 설정, 포기할 설정
먼저 낮출 것: context 길이, GPU에 올리는 expert 수, draft/MTP 사용, 백그라운드 앱, 브라우저 탭 수입니다. 특히 8GB VRAM에서는 토큰 생성 속도보다 VRAM 폴백을 피하는 쪽이 더 중요합니다.
포기할 것: 200K 이상 긴 컨텍스트, 여러 동시 요청, 브라우저와 IDE를 잔뜩 띄운 상태의 에이전트 루프, 16GB RAM 노트북에서의 안정적 사용입니다. "한 번 답변 생성"은 가능해도 실작업은 다릅니다.
되는 것 / 어려운 것
- 중간 크기 코드베이스 설명
- 짧은 수정안 생성
- 로컬 에이전트 테스트
- 긴 문서 요약 실험
- 대형 저장소 자동 수정 루프
- 여러 동시 요청
- VRAM을 꽉 채우는 MTP/초장문 세팅
- 배터리 모드 사용
사도 되는 사람 / 보류할 사람
사도 되는 사람: 이미 RTX 4060 노트북을 업무용/학습용으로 고려하고 있고, 게임보다 코딩·LLM 실험 비중이 높으며, RAM 32GB 구성을 고를 수 있는 사람입니다. 외장 모니터와 전원 연결 상태에서 로컬 AI를 쓰는 방식이면 꽤 재밌습니다.
보류할 사람: "그냥 설치하면 빠르게 돌아가야 한다"는 기대가 있거나, 16GB RAM 모델만 보고 있거나, 조용하고 얇은 노트북만 원하는 사람입니다. 새 장비를 AI 목적으로만 산다면 16GB VRAM GPU 쪽을 먼저 보세요.
자주 하는 질문
Q. RTX 4060 Laptop 8GB면 충분한가요?
충분하다기보다 "최저선으로 가능"에 가깝습니다. RAM 32GB와 튜닝이 붙어야 합니다.
Q. 16GB RAM 노트북도 되나요?
추천하지 않습니다. 전문가 레이어가 CPU/RAM으로 내려오는 순간 시스템 RAM이 작업 품질을 좌우합니다.
Q. MacBook 32GB와 RTX 4060 8GB 중 뭐가 낫나요?
Qwen3.6-35B-A3B만 보면 32GB 맥은 여유가 애매합니다. 맥은 64GB 이상부터 비교권이고, NVIDIA는 CUDA 생태계와 전용 VRAM 덕분에 세팅 자료가 많습니다.
Q. Ollama로 바로 돌리면 되나요?
초보자는 Ollama/LM Studio가 편하지만, 이번 같은 빡빡한 VRAM 세팅은 llama.cpp 옵션을 직접 만질 때 해결되는 경우가 많습니다.
Q. 새로 산다면 RTX 4060 노트북을 고를까요?
휴대성과 가격이 중요하면 32GB RAM RTX 4060 노트북도 괜찮습니다. 로컬 LLM이 핵심 목적이면 16GB VRAM GPU가 들어간 데스크톱이나 더 큰 GPU 노트북이 낫습니다.
제품 소개와 구매 판단
이번 글에서 연결할 제품 조건은 단순합니다. RTX 4060 Laptop 8GB급 GPU, 시스템 RAM 32GB 우선, SSD 1TB면 더 좋고, 장시간 전원 연결 사용을 견딜 쿨링 설계가 필요합니다. Qwen3.6-35B-A3B를 정말로 자주 돌릴 생각이면 "RTX 4060이라는 이름"보다 "RAM을 32GB로 살 수 있는지"를 먼저 보세요.
또 하나, 노트북 GPU는 같은 RTX 4060이라도 전력 제한과 쿨링에 따라 다릅니다. 긴 에이전트 작업은 짧은 벤치마크보다 열과 전원 설정 영향을 더 크게 받습니다. 그래서 얇은 휴대용 모델보다는 팬 소음이 조금 있어도 전원 연결 상태에서 성능 유지가 되는 구성이 낫습니다.
쿠팡에서는 RTX 4060 노트북 32GB 구성을 우선 확인했습니다. 가격은 자주 바뀌므로, 아래 버튼은 이 글의 하드웨어 판단과 직접 연결되는 RTX 4060급 노트북 후보를 확인하는 용도입니다.