오과장입니다. 로컬 코딩 에이전트를 장비 관점에서 보면 “큰 모델이 열린다”보다 “내 GPU에서 긴 프롬프트를 먹고도 작업을 이어가느냐”가 더 중요합니다. 이번 글은 Qwen3.6-35B-A3B 하나만 잡고, RTX 5070 Ti 16GB급 그래픽카드에서 현실적으로 어디까지 기대해도 되는지 따져봅니다.
짧은 답변
Qwen3.6-35B-A3B는 RTX 5070 Ti 16GB에서 로컬 코딩 에이전트용으로 시도할 만합니다. 최근 LocalLLM 댓글에서는 5070 Ti 16GB에서 Qwen 3.6 35B A3B Q5_K_M을 100K 문맥, 50 tokens/s 이상으로 쓴다는 경험이 나왔고, 다른 16GB VRAM 글에서도 35B A3B Q8과 128K 문맥을 약 20 tokens/s로 쓰는 사례가 붙었습니다.
다만 16GB는 “넉넉함”이 아니라 “잘 맞추면 된다”에 가깝습니다. Q3 이하 양자화, Ollama 기본 컨텍스트, 무리한 256K 문맥, VRAM을 꽉 채우는 설정은 피하고, Q4 또는 Q5, llama.cpp, Flash Attention, CPU expert offload 쪽으로 접근하는 편이 현실적입니다.
이 도구가 뭔가요?
Qwen3.6-35B-A3B는 Qwen 계열의 35B급 오픈 가중치 모델입니다. 이름의 A3B는 전체 파라미터는 크지만 한 번 생성할 때 활성화되는 부분이 약 3B급이라는 뜻으로 이해하면 됩니다. 그래서 같은 27B dense 모델보다 전체 크기는 커도, MoE 구조와 오프로딩을 잘 쓰면 16GB VRAM에서도 코딩 보조용으로 들어올 여지가 있습니다.
왜 35B인데 16GB 이야기가 나오나
일반적인 감각으로는 35B 모델을 16GB GPU에서 돌린다는 말이 이상하게 들립니다. 모델 파일과 대화 중 생기는 KV cache가 모두 GPU 메모리에 들어가야 한다고 생각하면 당연합니다. 그런데 Qwen3.6-35B-A3B는 MoE, 즉 Mixture of Experts 구조라 매번 전체 35B가 같은 방식으로 활성화되지 않습니다. 최근 커뮤니티에서 16GB 카드 이야기가 계속 나오는 이유가 여기에 있습니다.
중요한 건 “모델이 로드된다”와 “코딩 에이전트로 쓸 만하다”는 다른 말이라는 점입니다. 8GB GPU에서도 CPU/RAM 오프로딩과 낮은 양자화로 화면에 글자는 나오게 만들 수 있습니다. 하지만 코드베이스를 읽고, 도구를 호출하고, 실패 후 다시 고치는 에이전트 작업은 긴 문맥과 빠른 prompt ingestion이 필요합니다. 그래서 이번 글은 8GB가 아니라 RTX 5070 Ti 16GB를 현실 기준으로 잡았습니다.
용어 먼저 정리
CUDA: NVIDIA GPU에서 AI 계산을 빠르게 돌리기 위한 실행 환경입니다. llama.cpp를 GPU로 빌드하거나 최신 GGUF를 돌릴 때 버전 궁합이 중요합니다.
VRAM: 그래픽카드 전용 메모리입니다. 로컬 LLM에서는 GPU 성능보다 먼저 모델과 KV cache가 VRAM에 들어가는지가 막힙니다.
GGUF: llama.cpp, LM Studio, Ollama에서 많이 쓰는 로컬 모델 파일 형식입니다.
quantization: 모델 숫자 정밀도를 낮춰 파일 크기와 메모리 사용량을 줄이는 작업입니다. Q4, Q5, Q8처럼 표시하고, 낮출수록 가볍지만 품질 손실 가능성이 커집니다.
MoE: 여러 전문가 묶음 중 일부만 골라 계산하는 구조입니다. Qwen3.6-35B-A3B가 16GB 카드에서 거론되는 핵심 이유입니다.
실사용 사례에서 나온 기준
최근 7일 안의 커뮤니티 근거는 꽤 선명합니다. LocalLLM의 “16GB VRAM에서 agentic coding이 되느냐”는 질문에 한 댓글 작성자는 5070 Ti에서 Qwen 3.6 35B A3B를 쓴다고 답했습니다. Q3 이하 양자화는 에이전트 작업에 별로라며 Q4 또는 Q5를 권했고, Ollama보다 llama.cpp가 낮은 VRAM 상황에서 낫다고 했습니다. 같은 흐름에서 Q5_K_M, 100K 문맥, 50 tokens/s 이상이라는 수치도 공유됐습니다.
다른 16GB VRAM 질문에서는 27B dense보다 35B A3B가 나을 수 있다는 의견이 붙었습니다. 35B A3B Q8, 128K 문맥, expert layer CPU offload, 약 20 tokens/s라는 사례가 나왔고, RTX 5070 Ti 16GB에서는 35B Q8과 256K 문맥에서 30~40 tokens/s를 봤다는 댓글도 있었습니다. 수치 자체는 각자의 설정과 CPU/RAM에 강하게 묶이지만, 16GB 단일 카드가 35B A3B의 실사용 경계선이라는 판단에는 도움이 됩니다.
반대로 경고 신호도 있습니다. 6일 전 llama.cpp 이슈 #25304는 RTX 4060 Laptop 8GB에서 Qwen3 기반 MoE 35B A3B 계열 19GB GGUF를 CPU expert offload로 밀어 넣다가, 첫 추론 시 cuBLAS가 추가 워크스페이스를 잡지 못해 실패한 사례입니다. 이 사례는 5070 Ti 16GB와 같지 않지만, “VRAM을 끝까지 채우면 실행 직전에 터질 수 있다”는 현실적인 경고입니다.
최소 사양과 현실 권장 사양
RTX 4060 8GB, RAM 32GB, 짧은 문맥, Q4 이하. 돌아갈 수는 있어도 에이전트 코딩 메인 장비로 권하기 어렵습니다.
RTX 5070 Ti 16GB, RAM 64GB, NVMe 여유 80GB 이상. Qwen3.6-35B-A3B Q4/Q5, 32K~100K 문맥을 현실적으로 시도할 수 있습니다.
RTX 3090/4090/5090처럼 24GB 이상 NVIDIA GPU. 긴 문맥, Q5 이상, 여러 세션, 낮은 실패율을 원하면 이쪽이 편합니다.
병목은 어디서 오나
첫 병목은 VRAM입니다. Qwen3.6-35B-A3B Q4/Q5 파일만 보고 “16GB에 들어가겠네”라고 계산하면 빠집니다. 실제 대화에서는 KV cache가 붙고, 문맥 길이를 32K에서 100K 이상으로 올릴수록 캐시가 커집니다. 그래서 커뮤니티 사례들이 양자화, expert offload, Flash Attention, context size를 같이 말하는 겁니다.
두 번째 병목은 prompt ingestion입니다. 코딩 에이전트는 한두 문장 채팅보다 입력이 큽니다. 저장소 구조, 파일 내용, 테스트 로그, 에러 메시지를 한꺼번에 읽습니다. 생성 속도만 50 tokens/s라고 해서 모든 체감이 빠른 게 아닙니다. 큰 프롬프트를 처음 먹이는 시간이 길면 에이전트가 도구를 여러 번 돌리는 과정에서 답답해집니다.
세 번째 병목은 런타임입니다. Unsloth의 GGUF 모델 카드는 llama.cpp, Ollama, LM Studio, vLLM 같은 실행 경로를 안내합니다. 초보자는 LM Studio가 쉽고, 터미널이 괜찮으면 Ollama가 단순합니다. 하지만 16GB VRAM에서 35B A3B를 코딩 에이전트로 쓰려면 llama.cpp가 설정을 더 투명하게 보여줍니다. 특히 --ctx-size, --flash-attn, GPU layer, expert offload, batch/ubatch 같은 값을 직접 만질 수 있는지가 큽니다.

맥 계열과 NVIDIA 계열 체감 차이
Mac mini M4 24GB나 32GB는 조용하고 전력 효율이 좋습니다. Ollama나 MLX 계열로 작은 Qwen 모델을 돌리고, 개인 문서 질의나 짧은 코드 보조를 쓰기에는 만족도가 높습니다. 통합 메모리라 8GB VRAM 벽처럼 딱 끊기는 느낌도 덜합니다.
하지만 Qwen3.6-35B-A3B GGUF, Q4/Q5 선택, llama.cpp 최신 옵션, CUDA 최적화, 로컬 코딩 에이전트 연결은 NVIDIA 쪽 커뮤니티 속도가 더 빠릅니다. 반대로 NVIDIA 데스크톱은 귀찮습니다. 드라이버, CUDA, 파워, 발열, 케이스 길이, 보조전원까지 봐야 합니다. 조용한 개인 AI 메모장이 목적이면 맥, 로컬 에이전트 실험실이 목적이면 RTX 5070 Ti 같은 NVIDIA 카드가 더 맞습니다.
낮추면 돌아가는 설정
1. Q3 이하는 피하고, 처음은 Q4_K_M 또는 Q5_K_M에서 품질과 속도를 비교합니다.
2. 문맥은 256K부터 욕심내지 말고 32K, 64K, 100K 순서로 올립니다.
3. --flash-attn을 켜고, VRAM 사용량을 nvidia-smi로 보면서 여유를 남깁니다.
4. expert layer를 CPU/RAM으로 일부 빼는 설정은 속도와 안정성을 같이 보며 조절합니다.
5. Claude Code 호환 API에 억지로 붙이기보다 OpenCode, Pi, oh-my-pi처럼 로컬 OpenAI 호환 서버를 잘 받는 도구를 먼저 씁니다.
설치/세팅 흐름
- GPU와 시스템을 먼저 확인합니다. RTX 5070 Ti 16GB, RAM 64GB 이상, NVMe 여유 80GB 이상, 300W급 GPU를 감당할 파워와 케이스 길이를 봅니다.
- NVIDIA 드라이버와 CUDA를 설치합니다. 최신 버전을 무조건 고집하지 말고 llama.cpp 이슈에서 CUDA 관련 문제가 반복되는지 확인합니다.
git clone https://github.com/ggml-org/llama.cpp.git후 CUDA 옵션으로 빌드하거나, 운영체제에 맞는 최신 CUDA 빌드를 받습니다.- 모델은
unsloth/Qwen3.6-35B-A3B-GGUF에서 Q4 또는 Q5 계열부터 시작합니다. 처음부터 Q8과 256K 문맥을 함께 잡지 않습니다. - llama.cpp 서버를 OpenAI 호환 API로 띄우고, OpenCode나 Pi 같은 코딩 에이전트에
http://127.0.0.1:8080/v1형태로 연결합니다. - 첫 테스트는 작은 저장소, 32K 문맥, 짧은 작업으로 합니다. 이후 tokens/s, 첫 토큰 지연, prompt ingestion 시간, VRAM 피크, 도구 호출 성공률을 보고 문맥과 양자화를 올립니다.
되는 것 / 어려운 것
되는 것
개인 코드 리뷰, 작은 기능 구현, 테스트 실패 원인 분석, 문서 기반 질의, 에이전트 반복 수정은 충분히 노려볼 수 있습니다. 특히 Q4/Q5와 32K~100K 문맥을 잘 맞추면 “로컬이라 답답하다”는 느낌이 크게 줄어듭니다.
어려운 것
대형 상용 모델 수준의 추론 품질, 여러 명 동시 서버, 저장소 전체를 256K 문맥에 계속 넣는 운용, Q8 고집은 어렵습니다. 이 영역은 24GB 이상 GPU나 클라우드 API가 더 낫습니다.
사도 되는 사람 / 보류할 사람
사도 되는 사람은 로컬 코딩 에이전트를 매일 붙여 쓰고 싶고, 데스크톱 전력과 발열을 감당할 수 있으며, llama.cpp 설정을 만지는 데 거부감이 없는 쪽입니다. RTX 5070 Ti 16GB는 Qwen3.6-35B-A3B를 “실험용으로만 겨우”가 아니라, 개인 작업 보조로 굴려볼 수 있는 현실선입니다.
보류할 사람은 조용한 노트북 환경, 쉬운 앱 설치, 낮은 전기요금을 우선하는 쪽입니다. 또 이미 RTX 4060 8GB 노트북을 갖고 있다면 35B A3B에 맞춰 억지로 늘리기보다, 7B~14B급 코딩 모델이나 클라우드 보조를 섞는 편이 돈을 덜 씁니다. 5070 Ti 가격이 24GB 중고 카드와 가까워진다면 24GB 쪽도 같이 비교해야 합니다.
자주 하는 질문
낮은 양자화와 CPU 오프로딩으로 실행은 시도할 수 있습니다. 하지만 최근 llama.cpp 이슈처럼 VRAM을 꽉 채우면 첫 추론에서 실패할 수 있고, 코딩 에이전트 체감은 16GB 카드보다 훨씬 불안합니다.
16GB VRAM에서는 27B dense가 오히려 더 답답하다는 의견이 있습니다. 35B-A3B는 MoE라 expert offload와 양자화를 잘 쓰면 16GB에서 더 현실적인 경우가 있습니다.
시작은 쉽습니다. 다만 컨텍스트 기본값, GPU 오프로딩, 세부 캐시 설정을 직접 조절해야 하는 순간 llama.cpp가 낫습니다. 에이전트 작업이 목적이면 처음부터 llama.cpp 서버를 익히는 편이 좋습니다.
짧은 테스트는 가능하지만 권장은 64GB입니다. CPU expert offload, 브라우저, IDE, 에이전트 로그, 긴 문맥을 같이 쓰면 32GB는 금방 좁습니다.
구매 판단
이번 글에서 연결한 상품은 MSI 지포스 RTX 5070 TI 게이밍 트리오 OC 16GB입니다. 글에서 도출한 조건과 맞는 핵심은 RTX 5070 Ti, 16GB VRAM, NVIDIA CUDA, 300W급 전력, 3팬 쿨링입니다. 결제 전에는 제품명에 RTX 5070 Ti와 16GB가 정확히 있는지, 케이스 길이와 두께가 맞는지, 파워서플라이에 12V-2x6 또는 필요한 보조전원 케이블이 있는지 확인해야 합니다.
정리하면, Qwen3.6-35B-A3B를 로컬 코딩 에이전트로 쓰려는 사람에게 RTX 5070 Ti 16GB는 꽤 설득력 있는 현실선입니다. 단순 채팅이면 과하고, 대형 상용 모델 대체를 기대하면 실망합니다. 하지만 코드가 외부로 나가는 게 싫고, 한 대의 데스크톱에서 로컬 에이전트를 계속 실험하고 싶다면 16GB NVIDIA 카드 중에서는 충분히 볼 만합니다.
근거 링크
- Qwen/Qwen3.6-35B-A3B Hugging Face: 모델 위치와 기본 사용 경로 확인.
- unsloth/Qwen3.6-35B-A3B-GGUF: llama.cpp, Ollama, vLLM, OpenAI 호환 서버 실행 경로 확인.
- Unsloth Qwen3.6 문서: 최근 Qwen3.6 로컬 실행과 CUDA 주의 흐름 확인.
- Reddit LocalLLM 16GB VRAM agentic coding 토론: 1일 전 5070 Ti 16GB, Qwen3.6 35B A3B, Q4/Q5, llama.cpp 권장 의견 확인.
- Reddit LocalLLM Qwen3.6-27B on 16GB VRAM: 2일 전 35B A3B Q8, 128K/256K 문맥, 16GB VRAM 사례 확인.
- Reddit LocalLLM RTX 3080 10GB Qwen3.6 35B: 4일 전 10GB VRAM에서도 MoE 모델이 코딩 에이전트에 연결됐다는 반례 확인.
- llama.cpp issue #25304: 6일 전 RTX 4060 Laptop 8GB, Qwen3 기반 MoE, cuBLAS VRAM 실패 사례 확인.
- MSI RTX 5070 Ti 16G Gaming Trio OC: 16GB GDDR7, 300W급 소비전력, 쿨링 구조 확인.