매거진

Qwen3.6-27B NVFP4와 RTX 5090 32GB | 로컬 코딩 AI는 된다, 설정이 관건

2026. 07. 04.

쿠팡 파트너스 활동의 일환으로 일정액의 수수료를 제공받을 수 있습니다.

오과장입니다. 이번 글은 nvidia/Qwen3.6-27B-NVFP4를 RTX 5090 32GB에서 로컬 코딩/에이전트용으로 돌릴 수 있느냐를 따집니다. 결론부터 말하면, "된다"가 맞지만 "아무 vLLM 명령어로 바로 된다"는 쪽은 아닙니다. 최근 Hugging Face 커뮤니티에는 RTX 5090에서 OOM을 본 사람, vLLM 0.24.0과 fp8 KV cache 설정으로 20만 토큰 안팎까지 밀어 넣은 사람, Docker 환경변수까지 조정해 성공한 사람이 같이 나옵니다. 그래서 이 글의 판단 기준은 단순 파라미터 수가 아니라 32GB VRAM에서 NVFP4 가중치, KV 캐시, CUDA/FlashInfer/vLLM 설정이 동시에 맞아야 한다는 쪽입니다.

GIGABYTE 지포스 RTX 5090 WINDFORCE OC D7 32GB 제품 이미지
RTX 5090 32GB는 Qwen3.6-27B NVFP4를 노려볼 수 있는 소비자용 단일 GPU 기준선입니다. 이미지: Coupang Partners.

짧은 답변

RTX 5090 32GB는 살 수 있는 후보입니다. 다만 목표가 "Qwen3.6-27B NVFP4를 262K 문맥까지 안정 운용"이라면 여전히 실험 영역입니다.

  • 로컬 코딩 에이전트, RAG, 긴 PRD 검토에는 RTX 5090 32GB가 현실적인 단일 GPU 출발점입니다.
  • 최소로는 24GB급 INT4/GGUF도 가능하지만, 긴 컨텍스트와 도구 호출까지 붙이면 금방 좁아집니다.
  • 맥 계열은 통합 메모리 용량이 넉넉하면 모델은 얹기 쉽지만, NVFP4/vLLM/Blackwell 경로의 속도 이점은 NVIDIA 쪽이 가져갑니다.

이 도구가 뭔가요?

Qwen3.6-27B는 Qwen 계열의 27B급 dense 모델이고, NVIDIA의 NVFP4 버전은 그 모델을 FP4 계열 형식으로 줄인 체크포인트입니다. Hugging Face 모델 카드 기준으로 텍스트, 이미지, 비디오 입력을 다루는 오토리그레시브 모델이며, 개발자는 에이전트, 챗봇, RAG 같은 배포용으로 바로 가져다 쓸 수 있습니다. 여기서 관심사는 모델 자체보다 32GB VRAM 한 장에서 장문 코딩 작업을 얼마나 현실적으로 버틸 수 있느냐입니다.

용어 먼저 정리

CUDA: NVIDIA GPU에서 AI 계산을 돌리는 기본 런타임입니다. RTX 5090은 Blackwell 세대라 FP4 관련 경로가 중요합니다.

VRAM: 그래픽카드 메모리입니다. 모델 가중치뿐 아니라 긴 대화 기록을 담는 KV 캐시도 여기를 씁니다.

NVFP4: NVIDIA가 Blackwell GPU에서 빠르게 처리하도록 미는 4비트 계열 양자화 형식입니다. 작고 빠르지만 소프트웨어 경로가 맞아야 합니다.

vLLM / KV cache: vLLM은 모델을 서버처럼 띄우는 추론 엔진이고, KV cache는 긴 컨텍스트를 빠르게 이어 읽기 위해 쌓는 메모리입니다.

실사용 사례에서 나온 기준

최근 7일 안쪽 근거만 놓고 보면 분위기는 꽤 또렷합니다. NVIDIA가 올린 Qwen3.6-27B-NVFP4 모델 카드는 2026년 6월 26일 공개로 표시되고, Apache 2.0 조건과 Model Optimizer 기반 양자화, 27B 파라미터, 최대 262K 컨텍스트를 밝힙니다. vLLM 레시피는 Qwen3.6-27B를 dense 27B, 262,144 컨텍스트 모델로 설명하면서 BF16은 H200/H100급, FP8은 40GB GPU, INT4는 24GB GPU, NVFP4는 NVIDIA Blackwell GPU를 전제로 둡니다.

하지만 커뮤니티 반응은 더 조심스럽습니다. Hugging Face 토론 "RTX 5090 32GB에서 되느냐"에는 3일 전 질문 아래로 "된다"는 답과 "vLLM nightly에서 OOM이 난다"는 보고가 같이 붙었습니다. 같은 스레드에서 한 참여자는 vLLM 0.24.0, VLLM_NVFP4_GEMM_BACKEND=flashinfer-cutlass, --kv-cache-dtype fp8_e4m3, --max-model-len 204800, --gpu-memory-utilization 0.92 조합을 제시했습니다. 또 다른 참여자는 Unsloth Q6_K GGUF로 RTX 5090 32GB에서 128K 컨텍스트를 VRAM 안에 넣고 있으며, NVIDIA 공식 NVFP4로 갈아탈 예정이라고 적었습니다.

품질 쪽도 아직 "속도만 보고 끝"은 아닙니다. 4일 전 Reddit LocalLLaMA 토론에서는 NVFP4가 GGUF와 무엇이 다른지 묻는 초보 질문, 27B dense 모델의 코딩 지속력과 디버깅 능력을 높게 보는 의견, 4비트 양자화는 distillation/보정 방식에 따라 품질 차이가 크다는 경계가 같이 나왔습니다. NVIDIA Developer Forum의 7월 1일 벤치마크 글은 vLLM 0.24.0과 MMLU 평가 설정을 공개해, 최소한 "공식 NVFP4 체크포인트를 vLLM으로 평가하려는 움직임"이 실제로 진행 중임을 보여줍니다.

하드웨어 판단

최소로 맛보기

RTX 4090/3090 24GB, RTX 5080 16GB 일부 환경, Mac 48~64GB 통합 메모리에서도 작은 양자화와 짧은 문맥은 시도할 수 있습니다. 대신 vLLM NVFP4의 장점은 제한됩니다.

현실적 권장

RTX 5090 32GB, 시스템 RAM 64GB 이상, NVMe 2TB 이상, Linux 또는 WSL2, 최신 NVIDIA 드라이버와 CUDA 13 계열 준비가 좋습니다.

장문 안정 운용

262K 전체 문맥을 늘 열어두고 여러 세션을 돌릴 생각이면 RTX PRO 6000 Blackwell 96GB, H100/H200, B200/GB10 같은 상위 장비가 맞습니다.

병목은 VRAM보다 설정 조합입니다

27B 모델을 FP16으로 보면 32GB 카드 한 장으로는 안 맞습니다. NVFP4나 INT4가 필요한 이유가 여기입니다. 하지만 줄인 가중치가 VRAM에 들어간다고 끝이 아닙니다. 긴 컨텍스트를 잡으면 KV 캐시가 커지고, vLLM은 CUDA 그래프와 JIT 컴파일러, 배치 토큰 공간도 먹습니다. 그래서 RTX 5090 32GB에서는 --max-model-len, --max-num-seqs, --gpu-memory-utilization, --kv-cache-dtype를 같이 낮춰야 합니다.

맥 계열은 관점이 다릅니다. Mac Studio나 MacBook Pro 64GB/96GB는 통합 메모리 덕분에 모델 파일을 올리는 부담은 덜하지만, NVFP4 텐서 코어와 vLLM의 Blackwell 최적화 경로를 그대로 쓰는 장비가 아닙니다. MLX/GGUF로 조용히 굴리는 용도라면 좋지만, 이번 글의 목표인 "Qwen3.6-27B NVFP4를 빠르게 코딩 에이전트 서버로"라면 NVIDIA 32GB VRAM 카드가 더 직접적인 선택입니다.

초기 세팅에서 가장 많이 헷갈리는 지점은 "32GB면 32GB 전부를 모델에 쓸 수 있다"는 착각입니다. 실제로는 운영체제, 드라이버, vLLM 런타임, CUDA 그래프, KV 캐시, 입력 배치가 모두 같은 VRAM 안에서 자리를 나눕니다. 그래서 5090을 샀는데도 OOM이 날 수 있고, 반대로 문맥 길이와 동시 요청 수를 낮추면 같은 카드에서 꽤 긴 작업도 버팁니다. 구매 판단은 GPU 이름보다 원하는 문맥 길이, 하루 작업 시간, 직접 튜닝할 의지를 먼저 기준으로 잡는 편이 정확합니다.

되는 것 / 어려운 것

되는 것: 8K~128K 안쪽 코딩 질의, PRD 요약, 테스트 실패 로그 분석, RAG 챗봇, 개인용 로컬 에이전트 서버.

어려운 것: 262K 문맥 고정, 다중 접속, nightly 빌드 추격, 모델별 tool-call parser까지 한 번에 완성하는 세팅.

ASUS ROG Astral 지포스 RTX 5090 32GB 제품 이미지
같은 RTX 5090 32GB라도 길이, 전원, 케이스 호환성, 파워 용량이 다릅니다. AI용은 VRAM만큼 발열과 전력 여유도 봐야 합니다. 이미지: Coupang Partners.
이 제품 구경하러 가기

설치/세팅 흐름

1. 운영체제와 드라이버 정리

Linux 또는 WSL2에서 최신 NVIDIA 드라이버를 먼저 맞춥니다. RTX 5090은 Blackwell이라 FP4 지원을 잘못 감지하는 빌드가 있으면 OOM이나 성능 저하가 납니다.

2. vLLM 0.24.0부터 시작

최근 토론에서는 nightly보다 안정 릴리스에서 문제가 줄었다는 보고가 있습니다. uv pip install -U vllm --torch-backend=auto처럼 격리 환경을 만들고 버전을 기록해 둡니다.

3. 모델을 로컬 경로에 받기

huggingface-cli download nvidia/Qwen3.6-27B-NVFP4 --local-dir ./models/qwen36-nvfp4처럼 경로를 고정합니다. 디스크는 모델, 캐시, 로그까지 합쳐 2TB NVMe가 편합니다.

4. 짧은 문맥으로 부팅 테스트

처음부터 262K로 가지 말고 --max-model-len 16384, --max-num-seqs 1, --gpu-memory-utilization 0.85, --kv-cache-dtype fp8부터 확인합니다.

5. FlashInfer와 NVFP4 백엔드 조정

문제가 없으면 VLLM_NVFP4_GEMM_BACKEND=flashinfer-cutlass, --attention-backend flashinfer, --enable-prefix-caching을 추가합니다.

6. 코딩 에이전트에 붙이기

/v1/chat/completions 또는 OpenAI 호환 API로 Cursor, OpenCode, aider, 자체 RAG 앱에 붙입니다. 이때 tool-call parser는 qwen3_coder 계열 지원 여부를 확인합니다.

사도 되는 사람 / 보류할 사람

사도 되는 사람: 매일 로컬 코딩 에이전트를 쓰고, Linux/WSL2 문제 해결에 익숙하고, 500W 이상 GPU 전력과 케이스 공간을 감당할 수 있는 사람입니다.

보류할 사람: Ollama에서 모델 이름만 치고 바로 쓰고 싶은 사람, 노트북 저소음이 우선인 사람, 262K 문맥을 늘 켜둘 사람입니다. 이 경우 클라우드 GPU로 먼저 하루 빌려보는 쪽이 낫습니다.

자주 하는 질문

RTX 5080 16GB로는 안 되나요?

작은 GGUF, 짧은 문맥, CPU/RAM 오프로딩을 섞으면 시도는 됩니다. 하지만 NVFP4 27B를 로컬 코딩 서버처럼 쓰려는 목표라면 16GB는 병목이 너무 빨리 옵니다.

RTX 4090 24GB와 RTX 5090 32GB 차이가 큰가요?

이 모델에서는 큽니다. 24GB는 모델을 얹은 뒤 KV 캐시 여유가 빠듯하고, 5090은 Blackwell FP4 경로와 32GB VRAM 덕분에 긴 문맥을 더 현실적으로 다룹니다.

Mac Studio 64GB와 비교하면요?

메모리 총량은 Mac이 편할 수 있습니다. 다만 이번 NVFP4/vLLM/Blackwell 조합의 핵심은 NVIDIA GPU의 추론 경로라서, 속도와 서버화는 RTX 5090 쪽이 유리합니다.

초보자는 무엇부터 낮춰야 하나요?

가장 먼저 --max-model-len을 16K나 32K로 낮추고, --max-num-seqs를 1로 둡니다. 그 다음 KV cache를 fp8로 두고, 안정화 뒤에 문맥을 올리는 순서가 덜 고생합니다.

제품 소개와 구매 판단

이번 글의 CTA는 GIGABYTE 지포스 RTX 5090 WINDFORCE OC D7 32GB 계열 상품으로 연결했습니다. 글에서 도출한 조건과 맞는 이유는 단순합니다. Qwen3.6-27B NVFP4는 RTX 5090 32GB가 단일 소비자 GPU 중 가장 직접적인 타깃이고, 32GB VRAM은 24GB 카드보다 KV 캐시와 vLLM 부가 메모리에서 훨씬 숨통이 트입니다. 다만 구매 전에는 그래픽카드 길이, 파워 1000W급 여유, 12V-2x6 케이블, 케이스 흡배기, 메인보드 슬롯 간섭을 꼭 확인해야 합니다.

정리하면, RTX 5090 32GB는 "로컬 AI 장난감"이 아니라 작은 개발 서버에 가깝습니다. Qwen3.6-27B NVFP4를 매일 코딩 보조로 쓰려면 충분히 매력적인 카드지만, 설치와 설정을 직접 만질 각오가 있어야 합니다. 처음부터 안정형을 원하면 96GB급 워크스테이션 GPU나 클라우드 GPU가 편하고, 비용을 줄이고 싶으면 24GB 카드에서 Q4/GGUF와 짧은 문맥으로 먼저 감을 잡는 편이 낫습니다.

이 제품 구경하러 가기

관련 글 추천