오과장입니다. 오늘은 Qwen3 30B/35B급 MoE 모델을 Ryzen AI Max+ 395, 그러니까 Strix Halo 128GB급 미니PC에서 Ollama로 굴릴 때 어디까지 현실적인지 보겠습니다.
결론부터 살짝 말하면, 이 조합은 “작은 책상 위 로컬 AI 서버”로는 꽤 매력적입니다. 다만 CUDA 달린 RTX 데스크톱처럼 생각하면 실망합니다. 최근 7일 안에 올라온 Ollama 이슈와 PR들을 보면, Strix Halo의 핵심은 단순 속도가 아니라 큰 통합 메모리를 Ollama와 llama.cpp가 얼마나 똑똑하게 인식하느냐입니다. 모델은 좋아졌는데, 스케줄러·ROCm·Vulkan·MoE 오프로딩 설정이 아직 같이 움직이는 단계라서 장비 판단을 조금 까칠하게 해야 합니다.

짧은 답변
- 살 수 있는 사람: Qwen3 30B/35B급 로컬 LLM, 코딩 보조, 문서 요약, 개인 서버를 한 미니PC에 묶고 싶은 사람입니다.
- 최소 현실선: 64GB 통합 메모리도 가능권이지만, 긴 컨텍스트와 여러 모델 상주까지 보려면 128GB급이 훨씬 편합니다.
- 주의점: Ollama 0.30.x 계열에서는 Strix Halo의 VRAM carveout을 host RAM처럼 잘못 제한하는 사례가 최근 보고됐습니다.
- 사지 말아야 할 사람: CUDA 최적화, Stable Diffusion·영상 생성 최고 속도, vLLM 대량 처리량이 목적이면 RTX 4090/5090 데스크톱이 더 단순합니다.
이 도구가 뭔가요?
Qwen3는 Alibaba Qwen 계열의 오픈소스 대형 언어 모델군입니다. Ollama에서는 ollama run qwen3:30b처럼 비교적 간단히 내려받아 실행할 수 있고, Qwen3 30B는 MoE 구조라 전체 파라미터는 크지만 한 번에 활성화되는 부분은 더 작습니다. 그래서 로컬 코딩 보조, 긴 문서 요약, 개인 지식 검색용으로 관심을 받습니다.
왜 지금 Strix Halo 이야기가 다시 나왔나
공식 Ollama 모델 페이지는 Qwen3를 dense와 MoE 모델을 포함한 모델군으로 설명하고, 30B 모델은 19GB 크기와 256K 컨텍스트로 표시합니다. 여기서 초보자가 바로 헷갈립니다. “19GB면 32GB RAM 미니PC도 되나?”라고 보이지만, 실제 실행에서는 모델 파일만 보지 않습니다. KV cache, 컨텍스트 길이, 병렬 요청 수, GPU 오프로딩, 운영체제 여유 메모리까지 같이 먹습니다.
2026년 6월 14일 올라온 Ollama #16719가 바로 그 지점을 보여줍니다. 작성자는 Ryzen AI Max+ 395 Strix Halo APU, Radeon 8060S, Ubuntu 24.04, Ollama 0.30.8, BIOS VRAM carveout 96GiB, 시스템 RAM 32GiB 환경에서 qwen3.5:35b와 qwen3.6:latest를 각각 약 24GiB 모델로 다뤘습니다. 한 모델은 잘 올라가지만 두 번째 모델을 띄우면 첫 모델이 내려가는 현상이 보고됐습니다. 로그상 GPU carveout에는 여유가 있는데 Ollama 스케줄러가 host RAM free를 기준으로 예산을 낮게 잡은 것이 핵심입니다.
용어 먼저 정리
VRAM carveout
통합 GPU가 메모리 일부를 그래픽용처럼 잡아 쓰는 영역입니다. Strix Halo는 BIOS 설정에 따라 크게 잡을 수 있습니다.
MoE
모델 안에 여러 전문가 블록이 있고, 요청마다 일부만 활성화하는 구조입니다. 파일은 커도 계산은 일부만 합니다.
GGUF
llama.cpp 계열에서 많이 쓰는 로컬 LLM 파일 형식입니다. 양자화 모델 배포에 자주 보입니다.
quantization
모델 숫자 정밀도를 낮춰 용량과 메모리를 줄이는 방식입니다. Q4, Q5 같은 표기가 여기에 가깝습니다.
CUDA / ROCm / Vulkan / Metal
NVIDIA는 CUDA, AMD는 ROCm·Vulkan, Mac은 Metal 경로가 중요합니다. 같은 모델도 백엔드에 따라 체감이 달라집니다.
KV cache
대화 기록과 긴 문맥을 처리하기 위해 쌓이는 메모리입니다. 컨텍스트를 키우면 모델 파일보다 이쪽이 병목이 됩니다.
실사용 사례에서 나온 기준
최근 근거는 단순 홍보가 아니라 실제 오류 보고와 수정 PR입니다. Ollama #16720은 Strix Halo 같은 unified-memory APU에서 GPU free memory를 더 신뢰하도록 바꾸자는 PR입니다. 작성자는 수정 후 Vulkan 쪽에서 첫 모델 이후에도 88.5GiB available로 보고되고, ROCm 쪽도 4.2GiB가 아니라 73.4GiB로 보이는 식의 개선을 설명했습니다. 즉 128GB급 통합 메모리 장비를 사도 소프트웨어가 그 여유를 제대로 읽지 못하면 체감은 갑자기 32GB 장비처럼 줄어듭니다.
또 하나는 2026년 6월 12일의 Ollama #16688입니다. 이 PR은 MoE 모델에서 expert tensor 일부를 CPU에 남기는 num_cpu_moe 옵션을 Ollama에 노출하자는 내용입니다. 테스트 장비는 RTX 2070 7.78GB VRAM이지만 메시지는 Strix Halo에도 중요합니다. 큰 MoE 모델은 모든 것을 GPU에 억지로 넣는 것보다, 큰 expert는 CPU/RAM 쪽에 두고 GPU 친화적인 부분을 GPU에 남기는 배치가 더 낫기 때문입니다.
llama.cpp 쪽에서도 같은 흐름이 보입니다. llama.cpp #24524는 CUDA 환경에서 CPU-resident MoE expert 중 자주 쓰이는 expert를 남는 VRAM에 캐시하는 아이디어를 다룹니다. 병합된 안정 기능이라기보다 실험적 PR이지만, 방향은 분명합니다. 2026년 로컬 LLM 병목은 “모델이 올라가냐”에서 끝나지 않고, MoE expert와 KV cache를 어느 메모리 계층에 둘지로 이동하고 있습니다.
하드웨어 판단 카드
Qwen3 8B/14B는 16~32GB RAM 장비에서도 접근 가능합니다. 30B/35B급은 양자화와 짧은 컨텍스트가 필요합니다.
Qwen3 30B/35B, 긴 문맥, 서버 상시 실행은 Ryzen AI Max+ 395 128GB급처럼 통합 메모리 여유가 큰 장비가 편합니다.
NPU TOPS만 보고 LLM이 빨라질 거라 기대하면 안 됩니다. Qwen3 로컬 실행은 주로 GPU/메모리/백엔드 싸움입니다.

맥 계열과 NVIDIA 계열과는 무엇이 다른가
Mac mini M4나 Mac Studio 계열은 Metal 백엔드와 통합 메모리의 조합이 강점입니다. 설정이 단순하고 조용하며, llama.cpp·Ollama 이용 사례도 많습니다. 다만 Windows/Linux 기반 서버, Docker, x86 개발 환경, AMD ROCm/Vulkan 실험을 묶고 싶다면 Strix Halo 미니PC가 더 재미있는 선택지가 됩니다. 문제는 재미있는 만큼 설정도 까다롭다는 겁니다.
NVIDIA RTX 계열은 CUDA 생태계가 압도적으로 쉽습니다. 같은 예산에서 16GB, 24GB, 32GB VRAM 카드를 넣은 데스크톱은 이미지 생성, vLLM, PyTorch 실험에서 덜 헤맵니다. 대신 본체가 커지고 전력과 소음이 올라갑니다. Ryzen AI Max+ 395 미니PC는 “최고속 LLM 머신”이 아니라 “작고 조용한 고메모리 로컬 AI 박스”에 가깝습니다.
설치/세팅 흐름
직접 테스트한 것은 아니므로 아래는 최근 이슈와 공식 사용 흐름을 바탕으로 한 안전한 세팅 순서입니다. 처음부터 긴 컨텍스트와 다중 모델 상주를 켜지 말고, 작은 확인부터 가야 합니다.
처음 세팅 6단계
- BIOS에서 통합 GPU 메모리 carveout을 확인합니다. 64GB 또는 96GB처럼 크게 잡는 옵션이 있으면 로컬 LLM에 유리합니다.
- OS는 Windows보다 Ubuntu 24.04 계열부터 검토합니다. 최근 Strix Halo 보고는 Ubuntu, ROCm, Vulkan 로그가 많아 진단이 쉽습니다.
- Ollama를 설치하고 작은 모델부터 실행합니다.
ollama run qwen3:8b로 백엔드와 메모리 보고를 먼저 확인합니다. - 30B 모델은 단일 모델부터 올립니다.
ollama run qwen3:30b후ollama ps,rocm-smi --showmeminfo vram로 실제 사용량을 봅니다. - 컨텍스트는 32K부터 올립니다. 처음부터 128K~256K로 가면 KV cache 때문에 메모리 판단이 흐려집니다.
- 다중 모델 상주는 Ollama 최신 빌드와 이슈 상태를 확인한 뒤 시도합니다. 0.30.x의 Strix Halo 메모리 인식 이슈가 얽혀 있으니, Vulkan/ROCm 로그를 남겨야 합니다.
어떤 설정을 낮추면 돌아가나
가장 먼저 낮출 것은 모델 크기가 아니라 컨텍스트입니다. Qwen3 30B/35B급을 쓰고 싶다면 256K 욕심부터 내려놓고 16K 또는 32K에서 시작하는 편이 낫습니다. 다음은 양자화입니다. Q4 계열은 메모리를 크게 줄이지만 품질과 안정성에서 Q5 이상과 차이가 날 수 있습니다. 마지막은 병렬 수입니다. OLLAMA_NUM_PARALLEL=2 같은 설정은 편하지만 KV cache와 메모리 예측을 같이 키웁니다.
MoE 모델에서는 --n-cpu-moe나 num_cpu_moe 류의 옵션도 주목해야 합니다. 아직 Ollama 본류에 어떻게 들어갈지는 논의 중이지만, 핵심 생각은 쉽습니다. 큰 expert 블록 일부를 CPU/RAM 쪽에 두고, GPU에는 attention·router·자주 쓰는 부분을 남겨 병목을 줄이는 방식입니다. Strix Halo는 CPU와 GPU가 같은 메모리 풀을 공유하므로 이런 설정이 특히 중요해질 가능성이 큽니다.

되는 것 / 어려운 것
Qwen3 8B~30B 단일 실행, 개인 코딩 보조, 긴 문서 요약, Open WebUI와 조합한 개인 서버, 128GB 메모리를 활용한 다중 작업은 현실적입니다.
RTX CUDA 생태계만큼 쉬운 고속 추론, 여러 24GB급 모델 안정 상주, 최신 ROCm 이슈를 신경 쓰지 않는 초간단 운영은 아직 어렵습니다.
사도 되는 사람 / 보류할 사람
사도 되는 사람은 로컬 AI를 취미가 아니라 작업실 인프라처럼 쓰려는 사람입니다. VS Code, 로컬 LLM, 문서 검색, 개인 위키, 브라우저, NAS 연동, 간단한 이미지 작업을 하나의 조용한 미니PC에 묶고 싶다면 Ryzen AI Max+ 395 128GB급은 설득력이 있습니다. 특히 “외장 GPU 데스크톱은 싫지만 16GB RAM 미니PC는 답답하다”는 층에 잘 맞습니다.
보류할 사람도 분명합니다. 설치 후 바로 빠른 속도를 기대하는 초보자, 게임과 이미지 생성이 주목적인 사람, CUDA 튜토리얼 그대로 따라갈 사람이면 NVIDIA 외장 GPU 장비가 더 낫습니다. Strix Halo는 하드웨어가 나쁘다기보다, 2026년 6월 현재 소프트웨어가 빠르게 맞춰지는 중인 플랫폼입니다.
자주 하는 질문
FAQ
Q. Ryzen AI Max+ 395 128GB면 Qwen3 235B도 편하게 되나요?A. 아닙니다. 235B는 Ollama 페이지 기준 142GB급으로 표시되는 거대 모델이라 128GB 장비의 여유 작업까지 생각하면 무리입니다. 이 글의 현실권은 30B/35B급입니다.
Q. NPU가 있으면 LLM이 빨라지나요?A. 보통은 아닙니다. 현재 Qwen3 같은 로컬 LLM은 NPU보다 GPU/메모리/백엔드 최적화 영향이 큽니다. NPU는 회의 효과, 작은 온디바이스 기능, 일부 전용 런타임에서 봐야 합니다.
Q. 64GB 모델을 사도 괜찮나요?A. Qwen3 8B, 14B, 30B 단일 실행 위주라면 가능성이 있습니다. 다만 35B, 긴 컨텍스트, 다중 모델 상주까지 노리면 128GB가 훨씬 안전합니다.
Q. Windows와 Linux 중 무엇이 낫나요?A. 일반 사용은 Windows가 편하지만, Strix Halo 로컬 LLM 이슈를 추적하고 ROCm/Vulkan 로그를 보려면 Linux가 더 유리합니다. 처음 세팅은 Ubuntu 24.04 계열 자료를 같이 보는 편이 좋습니다.
Q. 맥 미니 M4와 비교하면요?A. 맥 미니는 조용하고 Metal 경로가 단순합니다. Ryzen AI Max+ 395는 더 큰 통합 메모리 구성과 Windows/Linux 서버 활용이 장점입니다. 단순함은 Mac, 실험 폭은 Strix Halo 쪽입니다.
구매 판단
이번 글의 기준은 분명합니다. Qwen3 30B/35B급 로컬 LLM을 돌릴 장비를 고를 때는 “NPU 탑재 AI PC”라는 문구보다 통합 메모리 용량, GPU 백엔드, Ollama/llama.cpp 업데이트 속도, 저장공간을 먼저 봐야 합니다. Ryzen AI Max+ 395 128GB급 Strix Halo 미니PC는 이 조건을 꽤 잘 만족합니다. 하지만 아직은 최신 이슈를 따라갈 의지가 있는 사람에게 더 어울립니다.
아래 제품은 글에서 본 조건과 직접 연결되는 Ryzen AI Max+ 395 128GB급 미니PC 후보입니다. Qwen3 30B/35B급 로컬 LLM을 작업실 장비로 굴리고 싶다면, 가격보다 먼저 RAM 128GB 구성, SSD 2TB급, OS, 실제 APU 모델명, 냉각 설계를 확인하세요.
출처: Ollama Qwen3 모델 페이지, Ollama #16719, Ollama #16720, Ollama #16688, llama.cpp #24524.