Qwen3.8-Flash-Next 메모리 티어: 16GB / 64·96GB / 예정 128GB에서 무엇이 올라가나
2026-08-26 공개 Qwen3.8-Flash-Next(125B-A6B + 51B n-gram)를 Unsloth GGUF·커뮤니티 MLX 파일 크기와 공식 카드로만 읽고, AI Tech Engine 랩의 RTX 4080 16GB / M1 Max 64GB / M2 Max 96GB / 예정 128GB에 매핑한다. 미실측 tok/s 없음.
Qwen3.8-Flash-Next 메모리 티어: 16GB / 64·96GB / 예정 128GB에서 무엇이 올라가나
핵심 결론 (Bottom Line) 2026년 8월 26일 공개된 Qwen3.8-Flash-Next는 직전 글의 Qwen3.8-27B와 다른 물건이다. 공식 카드 기준 백본 125B(활성 6B) + n-gram 임베딩 51B + MTP 4B다. 연산은 희소하지만 디스크·상주 용량은 워크스테이션급이다. Unsloth GGUF는 약 72.5–111GB, 커뮤니티 MLX 4-bit는 103.8GB다. 오늘 보유 플릿(4080 16GB / M1 Max 64GB / M2 Max 96GB)에서는 “VRAM에 다 넣는다”가 아니라 n-gram·전문가 가중치를 어디에 둘지가 핵심이다. AMD AI Max+ 395 128GB·Gigabyte DGX Spark 128GB는 아직 미입고. 이 글에 우리 tok/s는 없다.
이 글은 벤치 표 복사가 아니다. AI Tech Engine 랩이 같은 주에 나온 Flash-Next를 플릿 구성에 올려 볼 때, 파일이 어디에 들어가고 어디서 끊기는지만 적는다.
공식 카드 — 27B와 무엇이 다른가
저장소: Hugging Face Qwen/Qwen3.8-Flash-Next. MarkTechPost·커뮤니티 요약은 라이선스를 qwen-community-1.0(Apache 2.0 아님)으로 적는다. 상용·재배포 전에 HF LICENSE를 직접 확인한다.
| 항목 | 공식 표기 | 이 랩에서 읽는 방식 |
|---|---|---|
| 파라미터 | 125B(활성 6B) + n-gram 51B + MTP 4B | “6B 활성”은 FLOPs 이야기. 디스크/상주는 180B급 패키지 |
| 유형 | Causal LM + Vision Encoder | 텍스트 경로와 비전 on을 나눠 잰다 |
| 컨텍스트 | 네이티브 262,144, YaRN으로 최대 1,000,000 | 풀 262K는 가정치가 아님 |
| 레이아웃 | 48층, 12 × (3 × (GDN→MoE) → 1 × (QSA→MoE)) |
희소 어텐션·MoE·n-gram이 같이 있음 |
| N-gram | 20,000,000 엔트리 bigram/trigram (layer 2) | 호스트 RAM/SSD 오프로드 전제. 계산 가속기만의 문제가 아님 |
| 서빙 | vLLM, SGLang, TokenSpeed, transformers, llama.cpp(GGUF) | 일상 루프는 llama.cpp / (Mac) MLX. 멀티 GPU FP8 레시피를 우리 결과로 옮기지 않음 |
MarkTechPost가 인용한 체크포인트 크기: FP8 172.78 GiB, BF16 335.28 GiB. 희소 활성은 연산만 줄이고 저장 용량은 줄이지 않는다.
Qwen 자사 벤치 점수표와 “1/9 학습 비용” 주장은 옮기지 않는다. 비교군은 Qwen3.8-27B 매핑과 M1 Max 실측(27B)이다. Flash-Next 속도 표는 아직 빈칸이다.
커뮤니티 양자화 파일 크기 (우리 실측 아님)
우리가 재측정한 값이 아니다. 로드 계획을 짤 때 쓰는 문서·카드 표기다.
Unsloth GGUF (unsloth/Qwen3.8-Flash-Next-GGUF, 실행 가이드)
| quant | 표기 크기 |
|---|---|
| UD-IQ1_S | 72.5 GB |
| UD-IQ1_M | 74.5 GB |
| UD-Q2_K_XL | 78.9 GB |
| UD-IQ3_XXS | 82.0 GB |
| UD-Q3_K_XL | 90.0 GB |
| UD-IQ4_XS | 93.7 GB |
| UD-Q4_K_XL | 111.3 GB |
Unsloth 문서는 “75GB RAM/통합 메모리, GPU VRAM 필수 아님”과 n-gram(PLE) SSD/호스트 오프로드를 같이 적는다. 그건 그들의 가이드다. 우리 박스에서 같은 숫자가 나온다는 뜻이 아니다.
llama.cpp 쪽은 2026-08-27 전후로 qwen4exp / Flash-Next 경로가 병합됐다는 커뮤니티 보고가 있다. 이 랩의 빌드 커밋·플래그는 아직 기록하지 않았다.
커뮤니티 MLX (PipeNetwork 측정표)
| build | 표기 size |
|---|---|
| bfloat16 (upstream) | 360.0 GB |
| 8-bit | 192.2 GB |
| 6-bit | 148.0 GB |
| mixed-4/8-bit | 106.2 GB |
| 4-bit | 103.8 GB |
레포는 mixed-4/8-bit를 150GB 미만 권장 빌드로 적고, uniform 4-bit는 PPL 손해(+20.6% vs bf16)가 크다고 한다. M1 Max 64GB / M2 Max 96GB에는 권장 MLX 빌드가 통째로 들어가지 않는다. bf16 상주 ~354GB·~24 tok/s 같은 레포 문구는 우리 장비가 아니다. 옮기지 않는다.
SSD에 n-gram을 둔 분할 GGUF (참고)
AtomicChat 등은 n-gram 샤드를 SSD에 두고 빠른 메모리 요구를 낮춘 빌드를 공개했다(예: 총 ~84.9–110.5GB, 인메모리 표기 ~45.8–56.1GB). 64GB/96GB Mac 가이드로 적혀 있어도, 이 랩의 로드·품질·속도 검증은 없다. “가능하다는 주장”과 “우리 바늘”을 섞지 않는다.
우리 플릿 매핑 — 오늘 vs 예정
숫자는 “파일이 어디에 들어갈 여지가 있는가”다. 속도가 아니다.
오늘 (보유)
| 경로 | RTX 4080 16GB | M1 Max 64GB MacBook | M2 Max 96GB Mac Studio |
|---|---|---|---|
| FP8/BF16 공식 가중치 | 불가 (172–335 GiB급) | 불가 | 불가 |
| Unsloth GGUF 전체 RAM 상주 | 불가. VRAM 16GB ≪ 72–111GB | 1-bit |
경계. 저비트 GGUF + 짧은 컨텍스트는 시도 후보. Q4급 111GB는 초과 |
| GGUF + n-gram/전문가 오프로드 (llama.cpp CUDA/Metal) | 실험 후보. 카드는 활성 전문가·KV만, 나머지·n-gram은 시스템 RAM/SSD. “돌렸다”고 쓰려면 양자화·오프로드 플래그·성공/실패를 같이 적는다 | 실험 후보. Metal + mmap/SSD 경로가 커뮤니티에 있으나 미실측 | 실험 후보. 64GB보다 헤드룸. 역시 미실측 |
| MLX 4-bit / mixed (~104–106GB) | 대상 아님 | 비권장. 파일이 64GB를 넘김 | 비권장. 96GB에도 파일이 넘거나 KV·비전 자리 없음 |
| 비전 on | 더 빠듯. 1차로 텍스트만 | 동일 | 동일 |
4080 16GB의 포인트는 “Flash-Next를 VRAM에 넣는다”가 아니라, 16GB 컴퓨트 + 큰 시스템 RAM으로 n-gram 오프로드 스모크가 성립하는지다. 성립 여부는 아직 빈칸이다.
예정 (미입고)
| 경로 | AMD AI Max+ 395 128GB Strix Halo (예정) | Gigabyte DGX Spark 128GB (예정) |
|---|---|---|
| Unsloth Q4급 GGUF (~93–111GB) | 가중치+여유 KV를 같이 들 목표 티어 | 동일. CUDA/llama.cpp·(해당 시) vLLM 후보 |
| n-gram을 NVMe에 둔 런북 | ROCm/Vulkan 경로를 입고 후 확인 | 커뮤니티 Spark 전용 런북이 이미 나옴. 입고 전 설치 후기 없음 |
| MLX | Apple 아님 | Apple 아님 |
| 구매·가용성 (2026-08 말 스냅샷) | Strix Halo 128GB 미니PC는 DRAM 수급으로 품절·고가 보고가 섞임. 입고 전 가격표를 벤치처럼 쓰지 않음 | Founders/리셀 MSRP 대역은 공개되어 있으나, 이 랩 발주·도착 확인 전 |
예정 장비 공칭(200B 추론 등)을 Flash-Next 결과처럼 인용하지 않는다.
27B 글과의 관계
| Qwen3.8-27B 매핑 | 이 글 (Flash-Next) | |
|---|---|---|
| 아키텍처 | 덴스 27B (+비전) | MoE 125B-A6B + 51B n-gram |
| 4-bit 파일 규모 | Unsloth ~14–18GB | Unsloth ~94–111GB (Q4 근처) |
| 오늘 주력 박스 | M1/M2 Max에 올라가는 쪽 | 보유 박스에서는 오프로드·분할이 기본 가정 |
| 우리 tok/s | M1 Max 실측 있음 | 없음 |
Flash-Next는 “27B를 다시 매핑한 글”이 아니다. 같은 주 릴리스가 플릿의 빈칸(128GB)·오프로드 실험을 새로 연다.
이 랩이 다음에 잴 것 (Flash-Next)
128GB 입고 전, 보유 장비에서만.
- 로드 프로파일 — 같은 Unsloth GGUF를 4080(CUDA 오프로드) / M1 Max / M2 Max에 올린다. 성공·OOM·상주 메모리·사용한 플래그.
- n-gram 위치 — RAM vs SSD(mmap). 표기된 인메모리 절감이 우리 박스에서 재현되는지.
- 품질 스모크 — 로드만 되지 않고, 짧은 코딩·지시 따르기에서 붕괴/반복이 없는지. (벤치 점수 복붙 금지)
- 비전 off 고정 — 1차는 텍스트. mmproj·비디오는 그다음.
- 128GB 입고 후 — 같은 파일을 Strix Halo·Spark에 다시 올리고, Q4급 상주 + 장문맥을 같은 바늘로 잰다.
하지 않는 일: Qwen/Unsloth/MLX 레포 tok/s를 우리 숫자로 쓰기, M5 Max·5090 커뮤니티 속도를 4080·M1/M2에 외삽하기, 예정 128GB를 이미 측정한 것처럼 쓰기, 27B 실측 표를 Flash-Next 결과처럼 재사용하기.
파일 크기와 티어 매핑만 오늘 확인됐다. 속도 칸은 비운다.
추천 클라우드 GPU & 엔지니어링 툴
공식 사이트 (제휴 ID 대기)제휴(Affiliate) 추적 ID는 아직 발급되지 않았습니다. 아래는 각 제품의 공식 사이트이며, 가짜 ref/click ID는 넣지 않습니다.