AIAI Tech Engine
/벤치마크 리포트/Qwen3.8-27B와 2026년 8월 오픈웨이트: 우리 랩에서 오늘 올릴 수 있는 것
#Qwen3.8#Muse Glimmer#오픈웨이트#로컬LLM#Apache-2.0#테스트베드

Qwen3.8-27B와 2026년 8월 오픈웨이트: 우리 랩에서 오늘 올릴 수 있는 것

Qwen3.8-27B와 Meta Muse Glimmer 30B를 Hugging Face·공식 문서로 확인하고, AI Tech Engine 랩의 M1 Max 64GB / M2 Max 96GB / RTX 4080 16GB와 예정 128GB 박스에 각각 무엇을 올릴 수 있는지 매핑한다. 미실측 tok/s 없음.

AIAI Tech Engine Lab
독립 테스트베드 실측 검증 완료
SPONSORED / ADVERTISEMENT
예약된 광고 영역 — AdSense 승인 후 콘솔에서 발급된 유닛 ID만 연결합니다.

Qwen3.8-27B와 2026년 8월 오픈웨이트: 우리 랩에서 오늘 올릴 수 있는 것

핵심 결론 (Bottom Line) 2026년 8월, 이 랩이 로컬에서 손으로 만질 수 있는 오픈웨이트는 Qwen3.8-27B와 Meta Muse Glimmer 30B다. 둘 다 Apache 2.0이다. Qwen3.8-Max급 체크포인트(2.4T/활성 95B)는 커스텀 라이선스에 용량도 우리 플릿 밖이다. 오늘 27B/30B를 여유 있게 호스트하는 쪽은 M1 Max 64GB·M2 Max 96GB다. RTX 4080 16GB는 27B Q4가 빠듯하고, Glimmer Q4는 Meta가 적는 24GB 봉투에 못 미친다. AMD AI Max+ 395 128GB와 Gigabyte DGX Spark 128GB는 예정이다.

이 글은 견적 가이드가 아니다. AI Tech Engine 랩이 지금 책상 위에 있는 세 대에서 무엇을 로드할 수 있는지, 그리고 아직 안 온 128GB 두 대가 열리면 무엇을 잴지다. 우리가 재지 않은 tok/s는 적지 않는다.

Qwen3.8-27B — 공식 카드

저장소: Hugging Face Qwen/Qwen3.8-27B. README 라이선스 필드 apache-2.0.

항목 공식 표기 이 랩에서 쓰는 방식
파라미터 카드 27B. HF 파일 메타는 28B params로도 보임 카드의 27B를 쓴다
유형 Causal Language Model with Vision Encoder 텍스트만 올릴 때와 비전을 켤 때를 나눠 잰다
컨텍스트 네이티브 262,144, 확장 최대 1,000,000 풀 262K는 가정치가 아님. 우리 박스에서 몇 토큰까지 열리는지만 기록
모달리티 네이티브 이미지·비디오 mmproj/비전 경로 on/off가 메모리에 미치는 차이를 볼 항목
라이선스 Apache 2.0 로컬 재배포·내부 실험에 막힘이 적다
공식 서빙 권장 SGLang, vLLM, TokenSpeed 일상 루프는 Ollama / llama.cpp / (Mac) MLX. 4080 16GB에서 vLLM 여유 서빙은 주장하지 않음

Alibaba Cloud Community 2026-08-17 소개: 네이티브 멀티모달 덴스, Apache 2.0, 262K 네이티브·1M 확장 (원문). 카드에 붙은 벤치 점수표는 Qwen 자사 수치라 우리 결과로 옮기지 않는다.

아키텍처 한 줄만 실무에 남긴다. 히든 레이아웃 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)). 64층이 전부 풀 어텐션은 아니다. KV 부담이 구형 덴스 27B와 다를 수 있어도, 파일 크기는 양자화가 결정한다.

공식 레포는 BF16 safetensors다. 이 랩이 실제로 올리는 쪽은 GGUF/MLX 양자화다. Unsloth GGUF 4-bit 파일 크기(커뮤니티 양자화, 공식 가중치 아님): UD-IQ4_XS 14.3GB, UD-Q4_K_S 15.4GB, Q4_0 16.1GB, UD-Q4_K_M 16.5GB, UD-Q4_K_XL 17.6GB (unsloth/Qwen3.8-27B-GGUF). Unsloth 문서의 4-bit 요구량은 총 메모리 16–19GB (docs). 16GB VRAM에 Q4를 넣는다는 말은 이 숫자와 같이 읽어야 한다.

Qwen3.8-Max / 2.4T — 이 랩의 대상이 아님

플래그십 오픈 체크포인트: Qwen/Qwen3.8-2.4T-A95B.

항목 공식 표기
파라미터 총 2.4T, 활성 95B
유형 텍스트 전용. 오픈 체크포인트는 비전 없음, thinking 끄기 불가
컨텍스트 네이티브 262,144, 확장 최대 1,010,000
라이선스 qwen3.8-max / Qwen3.8-Max License (Apache 2.0 아님)

라이선스 원문(LICENSE): 사용·수정·배포·호스팅·파인튜닝은 허용. 월간 활성 1억 또는 월 매출 2,000만 달러 초과 시 모델명 표기. MaaS/AI Work Assistant 사업으로 12개월 합산 매출 5,000만 달러를 넘으면 Qwen과 별도 라이선스. 내부 사용은 제3자에게 모델·출력을 안 주면 후자 조항의 예외.

Qwen Cloud의 Qwen3.8-Max API는 이 체크포인트보다 기능이 많다(비전, non-thinking, 기본 1M, 빌트인 툴). 이름만 같고 로컬 가중치와 API는 다른 물건이다.

용량: HF 표기 2.4T BF16. Unsloth가 공개한 1-bit GGUF도 397GB. 예정 128GB 두 대를 합쳐도 이 랩에서 호스트하지 않는다. Max는 대조군으로만 이름 붙인다.

Meta Muse Glimmer 30B — 공식 페이지 확인

1차 출처: Meta AI Research 블로그, 개발자 문서, HF meta-models/Muse-Glimmer-30B.

항목 공식 표기
파라미터 30B. 카드는 비전 인코더 포함 약 29.6B
라이선스 Apache 2.0 (가중치·양자화·드래프터·퍼셉션 인코더)
컨텍스트 문서 기본 128K, 더 긴 컨텍스트 지원. 카드 131,072+
모달리티 입력 텍스트+이미지, 출력 텍스트. 오디오 없음. 비디오는 프레임 처리
로컬 설계 양자화로 언어 모델을 20GB 미만으로 줄여 24GB 또는 32GB 봉투에 KV·비전·드래프터를 같이 넣는 목표

GGUF (get-the-model): 텍스트 Q4 KQuant-17GB 약 17GB (24GB VRAM 미만 목표), 동적 Q4 약 20GB (32GB 목표), mmproj 약 1.4GB, DFlash 약 1.6GB.

Meta는 llama.cpp, MLX, Ollama, ExecuTorch, vLLM, SGLang을 경로로 적는다. 이 랩의 당장 루프는 Ollama / llama.cpp / (Mac) MLX다. Meta tok/s 표는 RTX 5090·M4 Max·M5 Max 측정이라 우리 4080·M1 Max·M2 Max 숫자가 아니다. 옮기지 않는다.

Perplexity Portable Computer

VentureBeat 2026-08-25공식 제품 페이지가 맞다.

  • DGX Spark와 Linux + NVIDIA RTX에서 하네스·오케스트레이터·로컬 모델을 한 패키지로 돌린다.
  • 로컬 모델: Qwen 3.8 27B 또는 PPLX 27B. Nemotron은 예고.
  • VentureBeat 인용: RTX 최소 24GB VRAM이 경험의 바닥. Linux 우선, Windows는 9월, macOS는 로드맵에 없음.

우리 함의: 보유 4080 16GB는 24GB 바닥 미달. M1/M2 Mac은 대상이 아니다. 예정 Gigabyte DGX Spark 128GB가 이 제품을 시험할 자리다. 입고 전 설치 후기는 쓰지 않는다.

우리 플릿 매핑 — 오늘 vs 예정

숫자는 “가중치가 메모리에 들어가는가”다. 속도가 아니다.

오늘 (보유)

워크로드 RTX 4080 16GB (보유) M1 Max 64GB MacBook (보유) M2 Max 96GB Mac Studio (보유)
7–8B Q4 일상 CUDA 루프 이동·MLX 상시 가능
14B Q4 현실적 여유 여유
Qwen3.8-27B Q4 타이트. 4-bit 파일이 14–18GB대. KV·비전을 열면 16GB를 넘기기 쉽다. Q3 또는 초단 컨텍스트 스모크 테스트 가능. 현재 주력. 262K 풀은 가정하지 않음 가능, 더 여유. 27B+툴 루프의 상시 박스
Muse Glimmer 30B Q4 비권장. Meta 타깃 24/32GB. 17GB+mmproj만으로 16GB를 넘거나 캐시가 없다 가능. Meta가 Mac 로컬을 명시. 우리 tok/s 없음 가능. 이미지 입력·에이전트 헤드룸은 64GB보다 낫다
70B Q4 불가 하한 시도. 컨텍스트 희생 현재 플릿의 현실적 상한
Qwen3.8-2.4T-A95B 불가 불가 불가
Portable Computer 24GB 바닥 미달 맥 로드맵 없음 맥 로드맵 없음

4080에서 27B를 “돌렸다”고 쓰려면 양자화·컨텍스트·비전 on/off를 같이 적는다. 조건 없는 성공 보고는 하지 않는다.

예정 (미입고) — 도착 후 측정 대상

워크로드 AMD AI Max+ 395 128GB Strix Halo (예정) Gigabyte DGX Spark 128GB (예정)
Qwen3.8-27B Q4 가중치+장문맥+에이전트 상태를 같이 들 자리 동일. CUDA 스택, vLLM 후보
Muse Glimmer 30B Q4 24/32GB 타깃을 넘는 헤드룸. 상시 로컬 에이전트 실험 동일. CUDA 서빙·하네스
70B Q4 이 박스를 들이는 이유 NVIDIA 공칭 파인튜닝 최대 70B. 추론 공칭 200B는 미실측
Qwen 2.4T 불가 불가
Portable Computer NVIDIA 전제 제품. 1차 타깃 아님 공식/VentureBeat가 Spark를 1차 타깃으로 적음. 입고 후 설치 여부만 확인

이 랩이 다음에 잴 것 (27B/30B)

128GB가 오기 전에도 보유 세 대에서 아래만 남긴다. 속도 표보다 먼저.

  1. 로드 프로파일 — 같은 Qwen3.8-27B GGUF/MLX, 같은 Glimmer Q4를 4080 / M1 Max / M2 Max에 올린다. 성공·OOM·사용 메모리.
  2. 컨텍스트 한도 — 비전 off 상태에서 컨텍스트를 늘려 가며 어디서 끊기는지. 262K/128K 공칭을 우리 한도로 쓰지 않는다.
  3. 비전 on — 27B mmproj, Glimmer 1.4GB 프로젝터를 켰을 때 16GB vs 64GB vs 96GB의 차이.
  4. 런타임 — Ollama / llama.cpp / MLX. 가능한 조합만. 없는 경로는 빈칸.
  5. 128GB 입고 후 — 같은 파일을 Strix Halo·Spark에 다시 올리고, 70B Q4와 툴 루프 벽시계를 추가. Portable Computer는 Spark에서만 시도.

하지 않는 일: Qwen 자사 벤치 점수를 우리 결과로 옮기기, Meta 5090/M4 Max tok/s를 우리 숫자처럼 쓰기, 2.4T를 128GB에 올릴 수 있다고 쓰기, 예정 장비의 공칭 200B를 2026년 8월 랩 능력으로 쓰기.

파일 크기와 라이선스는 오늘 확인됐다. 속도는 이 세 대(그리고 예정 두 대)에서 직접 재기 전에는 빈칸이다.

SPONSORED / ADVERTISEMENT
예약된 광고 영역 — AdSense 승인 후 콘솔에서 발급된 유닛 ID만 연결합니다.