Qwen3.8-27B와 2026년 8월 오픈웨이트: 우리 랩에서 오늘 올릴 수 있는 것
Qwen3.8-27B와 Meta Muse Glimmer 30B를 Hugging Face·공식 문서로 확인하고, AI Tech Engine 랩의 M1 Max 64GB / M2 Max 96GB / RTX 4080 16GB와 예정 128GB 박스에 각각 무엇을 올릴 수 있는지 매핑한다. 미실측 tok/s 없음.
Qwen3.8-27B와 2026년 8월 오픈웨이트: 우리 랩에서 오늘 올릴 수 있는 것
핵심 결론 (Bottom Line) 2026년 8월, 이 랩이 로컬에서 손으로 만질 수 있는 오픈웨이트는 Qwen3.8-27B와 Meta Muse Glimmer 30B다. 둘 다 Apache 2.0이다. Qwen3.8-Max급 체크포인트(2.4T/활성 95B)는 커스텀 라이선스에 용량도 우리 플릿 밖이다. 오늘 27B/30B를 여유 있게 호스트하는 쪽은 M1 Max 64GB·M2 Max 96GB다. RTX 4080 16GB는 27B Q4가 빠듯하고, Glimmer Q4는 Meta가 적는 24GB 봉투에 못 미친다. AMD AI Max+ 395 128GB와 Gigabyte DGX Spark 128GB는 예정이다.
이 글은 견적 가이드가 아니다. AI Tech Engine 랩이 지금 책상 위에 있는 세 대에서 무엇을 로드할 수 있는지, 그리고 아직 안 온 128GB 두 대가 열리면 무엇을 잴지다. 우리가 재지 않은 tok/s는 적지 않는다.
Qwen3.8-27B — 공식 카드
저장소: Hugging Face Qwen/Qwen3.8-27B. README 라이선스 필드 apache-2.0.
| 항목 | 공식 표기 | 이 랩에서 쓰는 방식 |
|---|---|---|
| 파라미터 | 카드 27B. HF 파일 메타는 28B params로도 보임 | 카드의 27B를 쓴다 |
| 유형 | Causal Language Model with Vision Encoder | 텍스트만 올릴 때와 비전을 켤 때를 나눠 잰다 |
| 컨텍스트 | 네이티브 262,144, 확장 최대 1,000,000 | 풀 262K는 가정치가 아님. 우리 박스에서 몇 토큰까지 열리는지만 기록 |
| 모달리티 | 네이티브 이미지·비디오 | mmproj/비전 경로 on/off가 메모리에 미치는 차이를 볼 항목 |
| 라이선스 | Apache 2.0 | 로컬 재배포·내부 실험에 막힘이 적다 |
| 공식 서빙 권장 | SGLang, vLLM, TokenSpeed | 일상 루프는 Ollama / llama.cpp / (Mac) MLX. 4080 16GB에서 vLLM 여유 서빙은 주장하지 않음 |
Alibaba Cloud Community 2026-08-17 소개: 네이티브 멀티모달 덴스, Apache 2.0, 262K 네이티브·1M 확장 (원문). 카드에 붙은 벤치 점수표는 Qwen 자사 수치라 우리 결과로 옮기지 않는다.
아키텍처 한 줄만 실무에 남긴다. 히든 레이아웃 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)). 64층이 전부 풀 어텐션은 아니다. KV 부담이 구형 덴스 27B와 다를 수 있어도, 파일 크기는 양자화가 결정한다.
공식 레포는 BF16 safetensors다. 이 랩이 실제로 올리는 쪽은 GGUF/MLX 양자화다. Unsloth GGUF 4-bit 파일 크기(커뮤니티 양자화, 공식 가중치 아님): UD-IQ4_XS 14.3GB, UD-Q4_K_S 15.4GB, Q4_0 16.1GB, UD-Q4_K_M 16.5GB, UD-Q4_K_XL 17.6GB (unsloth/Qwen3.8-27B-GGUF). Unsloth 문서의 4-bit 요구량은 총 메모리 16–19GB (docs). 16GB VRAM에 Q4를 넣는다는 말은 이 숫자와 같이 읽어야 한다.
Qwen3.8-Max / 2.4T — 이 랩의 대상이 아님
플래그십 오픈 체크포인트: Qwen/Qwen3.8-2.4T-A95B.
| 항목 | 공식 표기 |
|---|---|
| 파라미터 | 총 2.4T, 활성 95B |
| 유형 | 텍스트 전용. 오픈 체크포인트는 비전 없음, thinking 끄기 불가 |
| 컨텍스트 | 네이티브 262,144, 확장 최대 1,010,000 |
| 라이선스 | qwen3.8-max / Qwen3.8-Max License (Apache 2.0 아님) |
라이선스 원문(LICENSE): 사용·수정·배포·호스팅·파인튜닝은 허용. 월간 활성 1억 또는 월 매출 2,000만 달러 초과 시 모델명 표기. MaaS/AI Work Assistant 사업으로 12개월 합산 매출 5,000만 달러를 넘으면 Qwen과 별도 라이선스. 내부 사용은 제3자에게 모델·출력을 안 주면 후자 조항의 예외.
Qwen Cloud의 Qwen3.8-Max API는 이 체크포인트보다 기능이 많다(비전, non-thinking, 기본 1M, 빌트인 툴). 이름만 같고 로컬 가중치와 API는 다른 물건이다.
용량: HF 표기 2.4T BF16. Unsloth가 공개한 1-bit GGUF도 397GB. 예정 128GB 두 대를 합쳐도 이 랩에서 호스트하지 않는다. Max는 대조군으로만 이름 붙인다.
Meta Muse Glimmer 30B — 공식 페이지 확인
1차 출처: Meta AI Research 블로그, 개발자 문서, HF meta-models/Muse-Glimmer-30B.
| 항목 | 공식 표기 |
|---|---|
| 파라미터 | 30B. 카드는 비전 인코더 포함 약 29.6B |
| 라이선스 | Apache 2.0 (가중치·양자화·드래프터·퍼셉션 인코더) |
| 컨텍스트 | 문서 기본 128K, 더 긴 컨텍스트 지원. 카드 131,072+ |
| 모달리티 | 입력 텍스트+이미지, 출력 텍스트. 오디오 없음. 비디오는 프레임 처리 |
| 로컬 설계 | 양자화로 언어 모델을 20GB 미만으로 줄여 24GB 또는 32GB 봉투에 KV·비전·드래프터를 같이 넣는 목표 |
GGUF (get-the-model): 텍스트 Q4 KQuant-17GB 약 17GB (24GB VRAM 미만 목표), 동적 Q4 약 20GB (32GB 목표), mmproj 약 1.4GB, DFlash 약 1.6GB.
Meta는 llama.cpp, MLX, Ollama, ExecuTorch, vLLM, SGLang을 경로로 적는다. 이 랩의 당장 루프는 Ollama / llama.cpp / (Mac) MLX다. Meta tok/s 표는 RTX 5090·M4 Max·M5 Max 측정이라 우리 4080·M1 Max·M2 Max 숫자가 아니다. 옮기지 않는다.
Perplexity Portable Computer
VentureBeat 2026-08-25와 공식 제품 페이지가 맞다.
- DGX Spark와 Linux + NVIDIA RTX에서 하네스·오케스트레이터·로컬 모델을 한 패키지로 돌린다.
- 로컬 모델: Qwen 3.8 27B 또는 PPLX 27B. Nemotron은 예고.
- VentureBeat 인용: RTX 최소 24GB VRAM이 경험의 바닥. Linux 우선, Windows는 9월, macOS는 로드맵에 없음.
우리 함의: 보유 4080 16GB는 24GB 바닥 미달. M1/M2 Mac은 대상이 아니다. 예정 Gigabyte DGX Spark 128GB가 이 제품을 시험할 자리다. 입고 전 설치 후기는 쓰지 않는다.
우리 플릿 매핑 — 오늘 vs 예정
숫자는 “가중치가 메모리에 들어가는가”다. 속도가 아니다.
오늘 (보유)
| 워크로드 | RTX 4080 16GB (보유) | M1 Max 64GB MacBook (보유) | M2 Max 96GB Mac Studio (보유) |
|---|---|---|---|
| 7–8B Q4 | 일상 CUDA 루프 | 이동·MLX | 상시 가능 |
| 14B Q4 | 현실적 | 여유 | 여유 |
| Qwen3.8-27B Q4 | 타이트. 4-bit 파일이 14–18GB대. KV·비전을 열면 16GB를 넘기기 쉽다. Q3 또는 초단 컨텍스트 스모크 테스트 | 가능. 현재 주력. 262K 풀은 가정하지 않음 | 가능, 더 여유. 27B+툴 루프의 상시 박스 |
| Muse Glimmer 30B Q4 | 비권장. Meta 타깃 24/32GB. 17GB+mmproj만으로 16GB를 넘거나 캐시가 없다 | 가능. Meta가 Mac 로컬을 명시. 우리 tok/s 없음 | 가능. 이미지 입력·에이전트 헤드룸은 64GB보다 낫다 |
| 70B Q4 | 불가 | 하한 시도. 컨텍스트 희생 | 현재 플릿의 현실적 상한 |
| Qwen3.8-2.4T-A95B | 불가 | 불가 | 불가 |
| Portable Computer | 24GB 바닥 미달 | 맥 로드맵 없음 | 맥 로드맵 없음 |
4080에서 27B를 “돌렸다”고 쓰려면 양자화·컨텍스트·비전 on/off를 같이 적는다. 조건 없는 성공 보고는 하지 않는다.
예정 (미입고) — 도착 후 측정 대상
| 워크로드 | AMD AI Max+ 395 128GB Strix Halo (예정) | Gigabyte DGX Spark 128GB (예정) |
|---|---|---|
| Qwen3.8-27B Q4 | 가중치+장문맥+에이전트 상태를 같이 들 자리 | 동일. CUDA 스택, vLLM 후보 |
| Muse Glimmer 30B Q4 | 24/32GB 타깃을 넘는 헤드룸. 상시 로컬 에이전트 실험 | 동일. CUDA 서빙·하네스 |
| 70B Q4 | 이 박스를 들이는 이유 | NVIDIA 공칭 파인튜닝 최대 70B. 추론 공칭 200B는 미실측 |
| Qwen 2.4T | 불가 | 불가 |
| Portable Computer | NVIDIA 전제 제품. 1차 타깃 아님 | 공식/VentureBeat가 Spark를 1차 타깃으로 적음. 입고 후 설치 여부만 확인 |
이 랩이 다음에 잴 것 (27B/30B)
128GB가 오기 전에도 보유 세 대에서 아래만 남긴다. 속도 표보다 먼저.
- 로드 프로파일 — 같은 Qwen3.8-27B GGUF/MLX, 같은 Glimmer Q4를 4080 / M1 Max / M2 Max에 올린다. 성공·OOM·사용 메모리.
- 컨텍스트 한도 — 비전 off 상태에서 컨텍스트를 늘려 가며 어디서 끊기는지. 262K/128K 공칭을 우리 한도로 쓰지 않는다.
- 비전 on — 27B mmproj, Glimmer 1.4GB 프로젝터를 켰을 때 16GB vs 64GB vs 96GB의 차이.
- 런타임 — Ollama / llama.cpp / MLX. 가능한 조합만. 없는 경로는 빈칸.
- 128GB 입고 후 — 같은 파일을 Strix Halo·Spark에 다시 올리고, 70B Q4와 툴 루프 벽시계를 추가. Portable Computer는 Spark에서만 시도.
하지 않는 일: Qwen 자사 벤치 점수를 우리 결과로 옮기기, Meta 5090/M4 Max tok/s를 우리 숫자처럼 쓰기, 2.4T를 128GB에 올릴 수 있다고 쓰기, 예정 장비의 공칭 200B를 2026년 8월 랩 능력으로 쓰기.
파일 크기와 라이선스는 오늘 확인됐다. 속도는 이 세 대(그리고 예정 두 대)에서 직접 재기 전에는 빈칸이다.
추천 클라우드 GPU & 엔지니어링 툴
공식 사이트 (제휴 ID 대기)제휴(Affiliate) 추적 ID는 아직 발급되지 않았습니다. 아래는 각 제품의 공식 사이트이며, 가짜 ref/click ID는 넣지 않습니다.