AIAI Tech Engine
/벤치마크 리포트/2026 로컬 AI 랩 구성: 16GB CUDA vs 64/96GB Mac vs 예정 128GB 박스
#로컬LLM#하드웨어#테스트베드#Apple Silicon#RTX4080#DGX Spark#Strix Halo

2026 로컬 AI 랩 구성: 16GB CUDA vs 64/96GB Mac vs 예정 128GB 박스

AI Tech Engine 랩의 실제 장비 구성. RTX 4080 16GB, M1 Max 64GB, M2 Max 96GB가 지금 무엇을 담당하고, 예정된 Strix Halo·DGX Spark 128GB가 왜 70B급·로컬 에이전트용인지 정리한다. 미실측 TPS는 넣지 않는다.

AIAI Tech Engine Lab
독립 테스트베드 실측 검증 완료
SPONSORED / ADVERTISEMENT
예약된 광고 영역 — AdSense 승인 후 콘솔에서 발급된 유닛 ID만 연결합니다.

2026 로컬 AI 랩 구성: 16GB CUDA vs 64/96GB Mac vs 예정 128GB 박스

핵심 결론 (Bottom Line) 지금 이 랩의 실측 가능한 장비는 세 대다. RTX 4080 16GB는 CUDA 경로의 빠른 소형·중형 모델용이고, 27B Q4는 빠듯하다. M1 Max 64GB·M2 Max 96GB 통합 메모리가 현재 장문맥·대형 가중치의 주력이다. AMD Ryzen AI Max+ 395 128GB(Strix Halo)와 Gigabyte DGX Spark 128GB는 아직 입고 전(예정) 이며, 도착 후 70B급과 로컬 에이전트 작업을 맡길 예정이다. 이 글에는 우리가 측정하지 않은 tok/s를 넣지 않는다.

로컬 LLM 글을 읽다 보면 카드 한 장의 VRAM과 통합 메모리 박스의 용량이 같은 숫자처럼 적혀 있는 경우가 많다. 실제 랩에서는 그 둘이 다른 병목을 만든다. 16GB CUDA는 연산은 빠르지만 가중치+KV 캐시가 카드 안에 갇힌다. 64/96GB Apple UMA는 용량은 넉넉하지만 대역폭과 런타임 경로가 CUDA와 다르다. 128GB 박스는 그 간극을 메우려고 들이는 장비이지, 이미 벤치가 끝난 장비가 아니다.

이 글은 2026년 8월 30일 기준, AI Tech Engine 랩이 지금 갖고 있는 것예정인 것을 구분해서 적는다.

현재 플릿 (보유)

장비 메모리 메모리 구조 역할 상태
MacBook (M1 Max) 64GB Apple 통합 메모리, 공식 최대 64GB·대역폭 최대 400GB/s 이동·장문맥·MLX/llama.cpp 보유
Mac Studio (M2 Max) 96GB Apple 통합 메모리, 공식 최대 96GB·대역폭 최대 400GB/s 상시 로컬 서버, 14–32B·(조건부) 70B Q4 보유
CUDA 워크스테이션 (RTX 4080) 16GB GDDR6X 분리 VRAM. NVIDIA 공식 스펙 16GB 7–8B·14B 쾌적, 27B Q4는 타이트 보유

스펙 출처는 제조사 페이지다. M1 Max 통합 메모리 최대 64GB·400GB/s는 Apple 뉴스룸(2021-10), M2 Max 최대 96GB·400GB/s는 Apple 뉴스룸(2023-01), RTX 4080 16GB GDDR6X는 NVIDIA GeForce RTX 4080 Family.

예정 플릿 (미입고)

아래 두 대는 아직 이 랩에 없다. 후속 측정 대상이다.

장비 메모리 제조사 공칭 예정 역할 상태
AMD Ryzen AI Max+ 395 (Strix Halo) 128GB LPDDR5x 공식 최대 메모리 128GB. Halo Developer Platform 구성은 128GB·대역폭 256GB/s·Radeon 8060S 40CU 70B급 Q4, 로컬 에이전트, ROCm/llama.cpp 예정
Gigabyte DGX Spark (GIGABYTE AI TOP ATOM / NVIDIA GB10) 128GB 통합 LPDDR5x NVIDIA DGX Spark: 128GB coherent unified, 대역폭 273GB/s. Gigabyte AI TOP ATOM도 동일 128GB 통합 메모리 70B급, CUDA 에이전트 스택, (해당 시) Portable Computer 예정

출처: AMD Ryzen AI Max+ 395, AMD Ryzen AI Halo Developer Platform, NVIDIA DGX Spark, GIGABYTE AI TOP ATOM.

NVIDIA는 DGX Spark에서 추론 최대 200B 파라미터, 파인튜닝 최대 70B를 공칭한다. 그 숫자는 NVIDIA 제품 페이지의 주장이며, 이 랩의 실측이 아니다. Gigabyte 쪽도 단일 장비 200B·ConnectX-7로 두 대 연결 시 405B를 적는다. 도착 전에 그 공칭을 우리 벤치처럼 쓰지 않는다.

런타임: 실제로 쓰는 경로

이 랩에서 모델 호스트에 쓰는 기본 경로는 세 가지다.

  • Ollama — Mac·CUDA 모두에서 빠르게 올려 보는 기본 서버. GGUF 계열을 감싼 인터페이스.
  • llama.cpp — 양자화·컨텍스트·레이어 오프로드를 직접 만질 때. CUDA / Metal / (예정) Vulkan·ROCm.
  • MLX — Apple Silicon 전용. M1 Max·M2 Max에서 가중치를 통합 메모리에 올려 둘 때의 주력 중 하나.

CUDA 박스에는 나중에 vLLM·SGLang도 붙일 수 있다. Qwen 공식 카드가 프로덕션 서빙 엔진으로 그 둘을 권한다. 다만 지금 랩의 일상 루프는 Ollama / llama.cpp / MLX다. 4080 16GB에서 vLLM으로 27B를 “여유 있게” 돌린다는 말은 하지 않는다.

티어별로 무엇이 현실적인가

숫자는 “가중치가 메모리에 들어가는가”이지, 체감 속도가 아니다. KV 캐시·비전 프로젝터·에이전트 툴 루프는 가중치 외에 메모리를 더 먹는다. 그래서 같은 27B Q4라도 16GB VRAM과 96GB UMA의 체감이 갈린다.

7–8B 클래스

세 대 모두 수월하다. 4080 16GB의 본업이다. Q4 가중치는 수 GB 수준이라 컨텍스트를 꽤 열어 둬도 VRAM 안에 남는다. Mac은 전력·소음·이동이 필요할 때 같은 크기를 MLX/llama.cpp로 돌린다. 이 티어에서 장비를 고르는 기준은 용량이 아니라 어떤 런타임을 쓰느냐다.

14–32B 클래스 (27B 포함)

여기부터 장비가 갈린다.

  • RTX 4080 16GB: 14B Q4는 현실적인 일상 워크로드다. 27B Q4는 타이트하다. Unsloth가 공개한 Qwen3.8-27B GGUF 파일 크기만 봐도 4-bit가 대략 14.3–17.6GB다 (UD-IQ4_XS 14.3GB, UD-Q4_K_S 15.4GB, Q4_0 16.1GB, UD-Q4_K_M 16.5GB, UD-Q4_K_XL 17.6GB, unsloth/Qwen3.8-27B-GGUF). Unsloth 문서의 4-bit 요구량도 총 메모리 16–19GB다. 16GB 카드에 Q4를 올리면 KV 캐시·멀티모달 프로젝터 자리가 거의 없다. 짧은 컨텍스트, 더 낮은 양자화(Q3), 또는 “로드는 되지만 에이전트 루프는 포기”가 정직한 기대치다.
  • M1 Max 64GB / M2 Max 96GB: 27–32B Q4의 현재 주력이다. 가중치가 VRAM 16GB에 잘리지 않고, 통합 메모리에서 컨텍스트를 더 열 수 있다. 대역폭은 4080 GDDR6X보다 낮을 수 있어도, 올라가는가의 문제는 여기서 풀린다. 96GB Studio가 64GB MacBook보다 여유 있다. 장문맥·비전 입력·툴 루프를 동시에 열수록 64GB도 금방 빠듯해진다.
  • 예정 128GB: 27B를 “겨우 올린다”가 아니라 컨텍스트와 에이전트 상태를 같이 들고 가려는 자리다. 지금은 계획이다.

70B 클래스

16GB CUDA로는 성립하지 않는다. Q4 70B 가중치만 해도 대략 30GB대 후반이고, KV 캐시가 더해진다.

  • M1 Max 64GB: Q4 70B를 시도할 수 있는 하한에 가깝다. 올라가도 컨텍스트·배치·비전을 같이 열기는 어렵다.
  • M2 Max 96GB: 현재 플릿에서 70B Q4를 로컬에 올려 두는 가장 현실적인 박스다. 그래도 “여유 있는 에이전트 런타임”과는 거리가 있다.
  • 예정 128GB (Strix Halo / DGX Spark): 70B급과 로컬 에이전트를 위해 들이는 장비다. 도착 전 공칭 200B 추론을 우리 결과처럼 인용하지 않는다.

박스를 어떻게 나눠 쓰는가

실무 배분은 대략 이렇게 고정돼 있다.

  1. 4080 16GB — 반복 많은 짧은 작업. 7–8B·14B, CUDA 커널 확인, llama.cpp CUDA 빌드, 양자화 파일의 “로드 여부” 스크리닝. 27B는 스모크 테스트 한도.
  2. M1 Max 64GB MacBook — 이동, 초안, MLX 경로, 장문맥 초벌. 전원이 없는 환경에서 14–32B.
  3. M2 Max 96GB Mac Studio — 상시 켜 두는 로컬 엔드포인트. 32B 전후와, 필요할 때만 70B Q4. Apple 경로의 기준 머신.
  4. 예정 Strix Halo 128GB — x86 통합 메모리 대조군. 같은 70B GGUF를 Mac UMA와 대역폭·ROCm 경로에서 비교할 자리.
  5. 예정 Gigabyte DGX Spark 128GB — NVIDIA 통합 메모리 + CUDA 소프트웨어 스택. 에이전트 하네스, Spark를 전제로 한 로컬 패키지(예: Portable Computer) 실험 자리. 그 제품의 스펙 매핑은 오픈웨이트 글에서 다룬다.

세 대(지금)와 다섯 대(예정 포함)를 한 점수로 줄여 “이 랩의 TPS”를 만드는 일은 하지 않는다. 메모리 구조가 다르면 병목이 다르다.

정직한 한계

  • 미실측 속도. Meta는 Muse Glimmer Q4를 RTX 5090·M4 Max·M5 Max에서 tok/s로 공개했다. Unsloth는 B200에서 NVFP4 처리량을 공개했다. 우리 플릿이 아니다. 따라 적지 않는다.
  • 16GB의 의미. 2026년 8월 오픈웨이트 27B/30B Q4 파일은 종종 16GB를 넘거나, 넘지 않아도 KV를 남기지 않는다. 4080은 이 랩에서 “27B를 돌리는 카드”가 아니라 “27B Q4가 얼마나 빠듯한지 보여주는 카드”다.
  • 통합 메모리의 의미. 64/96GB Mac이 현재 장문맥·대형 가중치 경로인 이유는 속도 자랑이 아니라 용량이다.
  • 128GB는 아직 데이터 포인트가 아니다. 입고 후 같은 프롬프트·같은 양자화·같은 컨텍스트로 세 구조(16GB CUDA / Apple UMA / 128GB UMA)를 나란히 잰다.

128GB 두 대가 오면 다음에 잴 것

예정 장비가 책상 위에 놓이면, 아래만 측정한다. 그 전에는 빈칸으로 둔다.

  1. 동일 가중치 로드 여부 — Qwen3.8-27B Q4, Muse Glimmer 30B Q4, 그리고 70B급 Q4 한 개. 로드 성공/실패, 사용 메모리, 컨텍스트를 어디까지 열 수 있는지.
  2. 런타임 매트릭스 — 같은 모델을 Ollama / llama.cpp / (Mac) MLX / (Spark) CUDA 서빙. 가능하면 동일 프롬프트 세트.
  3. 에이전트 루프 — 단일 완결 채팅이 아니라 툴 호출이 여러 턴인 작업. 실패 시 재시도까지 포함해 벽시계 시간. tok/s만 보고하지 않는다.
  4. Strix Halo vs DGX Spark — 둘 다 128GB여도 대역폭(AMD 공칭 256GB/s vs NVIDIA 공칭 273GB/s)과 소프트웨어 스택이 다르다. 같은 70B Q4에서 메모리 헤드룸과 안정성을 비교.
  5. 16GB 대조군 — 4080에서 실패한 설정(긴 컨텍스트, 비전+텍스트, 드래프터 포함)이 128GB에서 열리는지. 열리면 그게 128GB를 들인 이유다.

속도 표가 나오기 전에 쓸 수 있는 문장은 하나다. 지금은 16GB CUDA가 27B Q4의 하한이고, 64/96GB Mac이 장문맥 경로이며, 128GB는 70B·에이전트를 위한 예정 확장이다.

SPONSORED / ADVERTISEMENT
예약된 광고 영역 — AdSense 승인 후 콘솔에서 발급된 유닛 ID만 연결합니다.