2026 로컬 AI 랩 구성: 16GB CUDA vs 64/96GB Mac vs 예정 128GB 박스
AI Tech Engine 랩의 실제 장비 구성. RTX 4080 16GB, M1 Max 64GB, M2 Max 96GB가 지금 무엇을 담당하고, 예정된 Strix Halo·DGX Spark 128GB가 왜 70B급·로컬 에이전트용인지 정리한다. 미실측 TPS는 넣지 않는다.
2026 로컬 AI 랩 구성: 16GB CUDA vs 64/96GB Mac vs 예정 128GB 박스
핵심 결론 (Bottom Line) 지금 이 랩의 실측 가능한 장비는 세 대다. RTX 4080 16GB는 CUDA 경로의 빠른 소형·중형 모델용이고, 27B Q4는 빠듯하다. M1 Max 64GB·M2 Max 96GB 통합 메모리가 현재 장문맥·대형 가중치의 주력이다. AMD Ryzen AI Max+ 395 128GB(Strix Halo)와 Gigabyte DGX Spark 128GB는 아직 입고 전(예정) 이며, 도착 후 70B급과 로컬 에이전트 작업을 맡길 예정이다. 이 글에는 우리가 측정하지 않은 tok/s를 넣지 않는다.
로컬 LLM 글을 읽다 보면 카드 한 장의 VRAM과 통합 메모리 박스의 용량이 같은 숫자처럼 적혀 있는 경우가 많다. 실제 랩에서는 그 둘이 다른 병목을 만든다. 16GB CUDA는 연산은 빠르지만 가중치+KV 캐시가 카드 안에 갇힌다. 64/96GB Apple UMA는 용량은 넉넉하지만 대역폭과 런타임 경로가 CUDA와 다르다. 128GB 박스는 그 간극을 메우려고 들이는 장비이지, 이미 벤치가 끝난 장비가 아니다.
이 글은 2026년 8월 30일 기준, AI Tech Engine 랩이 지금 갖고 있는 것과 예정인 것을 구분해서 적는다.
현재 플릿 (보유)
| 장비 | 메모리 | 메모리 구조 | 역할 | 상태 |
|---|---|---|---|---|
| MacBook (M1 Max) | 64GB | Apple 통합 메모리, 공식 최대 64GB·대역폭 최대 400GB/s | 이동·장문맥·MLX/llama.cpp | 보유 |
| Mac Studio (M2 Max) | 96GB | Apple 통합 메모리, 공식 최대 96GB·대역폭 최대 400GB/s | 상시 로컬 서버, 14–32B·(조건부) 70B Q4 | 보유 |
| CUDA 워크스테이션 (RTX 4080) | 16GB GDDR6X | 분리 VRAM. NVIDIA 공식 스펙 16GB | 7–8B·14B 쾌적, 27B Q4는 타이트 | 보유 |
스펙 출처는 제조사 페이지다. M1 Max 통합 메모리 최대 64GB·400GB/s는 Apple 뉴스룸(2021-10), M2 Max 최대 96GB·400GB/s는 Apple 뉴스룸(2023-01), RTX 4080 16GB GDDR6X는 NVIDIA GeForce RTX 4080 Family.
예정 플릿 (미입고)
아래 두 대는 아직 이 랩에 없다. 후속 측정 대상이다.
| 장비 | 메모리 | 제조사 공칭 | 예정 역할 | 상태 |
|---|---|---|---|---|
| AMD Ryzen AI Max+ 395 (Strix Halo) | 128GB LPDDR5x | 공식 최대 메모리 128GB. Halo Developer Platform 구성은 128GB·대역폭 256GB/s·Radeon 8060S 40CU | 70B급 Q4, 로컬 에이전트, ROCm/llama.cpp | 예정 |
| Gigabyte DGX Spark (GIGABYTE AI TOP ATOM / NVIDIA GB10) | 128GB 통합 LPDDR5x | NVIDIA DGX Spark: 128GB coherent unified, 대역폭 273GB/s. Gigabyte AI TOP ATOM도 동일 128GB 통합 메모리 | 70B급, CUDA 에이전트 스택, (해당 시) Portable Computer | 예정 |
출처: AMD Ryzen AI Max+ 395, AMD Ryzen AI Halo Developer Platform, NVIDIA DGX Spark, GIGABYTE AI TOP ATOM.
NVIDIA는 DGX Spark에서 추론 최대 200B 파라미터, 파인튜닝 최대 70B를 공칭한다. 그 숫자는 NVIDIA 제품 페이지의 주장이며, 이 랩의 실측이 아니다. Gigabyte 쪽도 단일 장비 200B·ConnectX-7로 두 대 연결 시 405B를 적는다. 도착 전에 그 공칭을 우리 벤치처럼 쓰지 않는다.
런타임: 실제로 쓰는 경로
이 랩에서 모델 호스트에 쓰는 기본 경로는 세 가지다.
- Ollama — Mac·CUDA 모두에서 빠르게 올려 보는 기본 서버. GGUF 계열을 감싼 인터페이스.
- llama.cpp — 양자화·컨텍스트·레이어 오프로드를 직접 만질 때. CUDA / Metal / (예정) Vulkan·ROCm.
- MLX — Apple Silicon 전용. M1 Max·M2 Max에서 가중치를 통합 메모리에 올려 둘 때의 주력 중 하나.
CUDA 박스에는 나중에 vLLM·SGLang도 붙일 수 있다. Qwen 공식 카드가 프로덕션 서빙 엔진으로 그 둘을 권한다. 다만 지금 랩의 일상 루프는 Ollama / llama.cpp / MLX다. 4080 16GB에서 vLLM으로 27B를 “여유 있게” 돌린다는 말은 하지 않는다.
티어별로 무엇이 현실적인가
숫자는 “가중치가 메모리에 들어가는가”이지, 체감 속도가 아니다. KV 캐시·비전 프로젝터·에이전트 툴 루프는 가중치 외에 메모리를 더 먹는다. 그래서 같은 27B Q4라도 16GB VRAM과 96GB UMA의 체감이 갈린다.
7–8B 클래스
세 대 모두 수월하다. 4080 16GB의 본업이다. Q4 가중치는 수 GB 수준이라 컨텍스트를 꽤 열어 둬도 VRAM 안에 남는다. Mac은 전력·소음·이동이 필요할 때 같은 크기를 MLX/llama.cpp로 돌린다. 이 티어에서 장비를 고르는 기준은 용량이 아니라 어떤 런타임을 쓰느냐다.
14–32B 클래스 (27B 포함)
여기부터 장비가 갈린다.
- RTX 4080 16GB: 14B Q4는 현실적인 일상 워크로드다. 27B Q4는 타이트하다. Unsloth가 공개한 Qwen3.8-27B GGUF 파일 크기만 봐도 4-bit가 대략 14.3–17.6GB다 (
UD-IQ4_XS14.3GB,UD-Q4_K_S15.4GB,Q4_016.1GB,UD-Q4_K_M16.5GB,UD-Q4_K_XL17.6GB, unsloth/Qwen3.8-27B-GGUF). Unsloth 문서의 4-bit 요구량도 총 메모리 16–19GB다. 16GB 카드에 Q4를 올리면 KV 캐시·멀티모달 프로젝터 자리가 거의 없다. 짧은 컨텍스트, 더 낮은 양자화(Q3), 또는 “로드는 되지만 에이전트 루프는 포기”가 정직한 기대치다. - M1 Max 64GB / M2 Max 96GB: 27–32B Q4의 현재 주력이다. 가중치가 VRAM 16GB에 잘리지 않고, 통합 메모리에서 컨텍스트를 더 열 수 있다. 대역폭은 4080 GDDR6X보다 낮을 수 있어도, 올라가는가의 문제는 여기서 풀린다. 96GB Studio가 64GB MacBook보다 여유 있다. 장문맥·비전 입력·툴 루프를 동시에 열수록 64GB도 금방 빠듯해진다.
- 예정 128GB: 27B를 “겨우 올린다”가 아니라 컨텍스트와 에이전트 상태를 같이 들고 가려는 자리다. 지금은 계획이다.
70B 클래스
16GB CUDA로는 성립하지 않는다. Q4 70B 가중치만 해도 대략 30GB대 후반이고, KV 캐시가 더해진다.
- M1 Max 64GB: Q4 70B를 시도할 수 있는 하한에 가깝다. 올라가도 컨텍스트·배치·비전을 같이 열기는 어렵다.
- M2 Max 96GB: 현재 플릿에서 70B Q4를 로컬에 올려 두는 가장 현실적인 박스다. 그래도 “여유 있는 에이전트 런타임”과는 거리가 있다.
- 예정 128GB (Strix Halo / DGX Spark): 70B급과 로컬 에이전트를 위해 들이는 장비다. 도착 전 공칭 200B 추론을 우리 결과처럼 인용하지 않는다.
박스를 어떻게 나눠 쓰는가
실무 배분은 대략 이렇게 고정돼 있다.
- 4080 16GB — 반복 많은 짧은 작업. 7–8B·14B, CUDA 커널 확인, llama.cpp CUDA 빌드, 양자화 파일의 “로드 여부” 스크리닝. 27B는 스모크 테스트 한도.
- M1 Max 64GB MacBook — 이동, 초안, MLX 경로, 장문맥 초벌. 전원이 없는 환경에서 14–32B.
- M2 Max 96GB Mac Studio — 상시 켜 두는 로컬 엔드포인트. 32B 전후와, 필요할 때만 70B Q4. Apple 경로의 기준 머신.
- 예정 Strix Halo 128GB — x86 통합 메모리 대조군. 같은 70B GGUF를 Mac UMA와 대역폭·ROCm 경로에서 비교할 자리.
- 예정 Gigabyte DGX Spark 128GB — NVIDIA 통합 메모리 + CUDA 소프트웨어 스택. 에이전트 하네스, Spark를 전제로 한 로컬 패키지(예: Portable Computer) 실험 자리. 그 제품의 스펙 매핑은 오픈웨이트 글에서 다룬다.
세 대(지금)와 다섯 대(예정 포함)를 한 점수로 줄여 “이 랩의 TPS”를 만드는 일은 하지 않는다. 메모리 구조가 다르면 병목이 다르다.
정직한 한계
- 미실측 속도. Meta는 Muse Glimmer Q4를 RTX 5090·M4 Max·M5 Max에서 tok/s로 공개했다. Unsloth는 B200에서 NVFP4 처리량을 공개했다. 우리 플릿이 아니다. 따라 적지 않는다.
- 16GB의 의미. 2026년 8월 오픈웨이트 27B/30B Q4 파일은 종종 16GB를 넘거나, 넘지 않아도 KV를 남기지 않는다. 4080은 이 랩에서 “27B를 돌리는 카드”가 아니라 “27B Q4가 얼마나 빠듯한지 보여주는 카드”다.
- 통합 메모리의 의미. 64/96GB Mac이 현재 장문맥·대형 가중치 경로인 이유는 속도 자랑이 아니라 용량이다.
- 128GB는 아직 데이터 포인트가 아니다. 입고 후 같은 프롬프트·같은 양자화·같은 컨텍스트로 세 구조(16GB CUDA / Apple UMA / 128GB UMA)를 나란히 잰다.
128GB 두 대가 오면 다음에 잴 것
예정 장비가 책상 위에 놓이면, 아래만 측정한다. 그 전에는 빈칸으로 둔다.
- 동일 가중치 로드 여부 — Qwen3.8-27B Q4, Muse Glimmer 30B Q4, 그리고 70B급 Q4 한 개. 로드 성공/실패, 사용 메모리, 컨텍스트를 어디까지 열 수 있는지.
- 런타임 매트릭스 — 같은 모델을 Ollama / llama.cpp / (Mac) MLX / (Spark) CUDA 서빙. 가능하면 동일 프롬프트 세트.
- 에이전트 루프 — 단일 완결 채팅이 아니라 툴 호출이 여러 턴인 작업. 실패 시 재시도까지 포함해 벽시계 시간. tok/s만 보고하지 않는다.
- Strix Halo vs DGX Spark — 둘 다 128GB여도 대역폭(AMD 공칭 256GB/s vs NVIDIA 공칭 273GB/s)과 소프트웨어 스택이 다르다. 같은 70B Q4에서 메모리 헤드룸과 안정성을 비교.
- 16GB 대조군 — 4080에서 실패한 설정(긴 컨텍스트, 비전+텍스트, 드래프터 포함)이 128GB에서 열리는지. 열리면 그게 128GB를 들인 이유다.
속도 표가 나오기 전에 쓸 수 있는 문장은 하나다. 지금은 16GB CUDA가 27B Q4의 하한이고, 64/96GB Mac이 장문맥 경로이며, 128GB는 70B·에이전트를 위한 예정 확장이다.
추천 클라우드 GPU & 엔지니어링 툴
공식 사이트 (제휴 ID 대기)제휴(Affiliate) 추적 ID는 아직 발급되지 않았습니다. 아래는 각 제품의 공식 사이트이며, 가짜 ref/click ID는 넣지 않습니다.