AIAI Tech Engine
/벤치마크 리포트/Qwen3.8-Flash-Next 메모리 티어: 16GB / 64·96GB / 예정 128GB에서 무엇이 올라가나
#Qwen3.8-Flash-Next#로컬LLM#메모리티어#llama.cpp#MLX#테스트베드

Qwen3.8-Flash-Next 메모리 티어: 16GB / 64·96GB / 예정 128GB에서 무엇이 올라가나

2026-08-26 공개 Qwen3.8-Flash-Next(125B-A6B + 51B n-gram)를 Unsloth GGUF·커뮤니티 MLX 파일 크기와 공식 카드로만 읽고, AI Tech Engine 랩의 RTX 4080 16GB / M1 Max 64GB / M2 Max 96GB / 예정 128GB에 매핑한다. 미실측 tok/s 없음.

AIAI Tech Engine Lab
독립 테스트베드 실측 검증 완료
SPONSORED / ADVERTISEMENT
예약된 광고 영역 — AdSense 승인 후 콘솔에서 발급된 유닛 ID만 연결합니다.

Qwen3.8-Flash-Next 메모리 티어: 16GB / 64·96GB / 예정 128GB에서 무엇이 올라가나

핵심 결론 (Bottom Line) 2026년 8월 26일 공개된 Qwen3.8-Flash-Next는 직전 글의 Qwen3.8-27B와 다른 물건이다. 공식 카드 기준 백본 125B(활성 6B) + n-gram 임베딩 51B + MTP 4B다. 연산은 희소하지만 디스크·상주 용량은 워크스테이션급이다. Unsloth GGUF는 약 72.5–111GB, 커뮤니티 MLX 4-bit는 103.8GB다. 오늘 보유 플릿(4080 16GB / M1 Max 64GB / M2 Max 96GB)에서는 “VRAM에 다 넣는다”가 아니라 n-gram·전문가 가중치를 어디에 둘지가 핵심이다. AMD AI Max+ 395 128GB·Gigabyte DGX Spark 128GB는 아직 미입고. 이 글에 우리 tok/s는 없다.

이 글은 벤치 표 복사가 아니다. AI Tech Engine 랩이 같은 주에 나온 Flash-Next를 플릿 구성에 올려 볼 때, 파일이 어디에 들어가고 어디서 끊기는지만 적는다.

공식 카드 — 27B와 무엇이 다른가

저장소: Hugging Face Qwen/Qwen3.8-Flash-Next. MarkTechPost·커뮤니티 요약은 라이선스를 qwen-community-1.0(Apache 2.0 아님)으로 적는다. 상용·재배포 전에 HF LICENSE를 직접 확인한다.

항목 공식 표기 이 랩에서 읽는 방식
파라미터 125B(활성 6B) + n-gram 51B + MTP 4B “6B 활성”은 FLOPs 이야기. 디스크/상주는 180B급 패키지
유형 Causal LM + Vision Encoder 텍스트 경로와 비전 on을 나눠 잰다
컨텍스트 네이티브 262,144, YaRN으로 최대 1,000,000 풀 262K는 가정치가 아님
레이아웃 48층, 12 × (3 × (GDN→MoE) → 1 × (QSA→MoE)) 희소 어텐션·MoE·n-gram이 같이 있음
N-gram 20,000,000 엔트리 bigram/trigram (layer 2) 호스트 RAM/SSD 오프로드 전제. 계산 가속기만의 문제가 아님
서빙 vLLM, SGLang, TokenSpeed, transformers, llama.cpp(GGUF) 일상 루프는 llama.cpp / (Mac) MLX. 멀티 GPU FP8 레시피를 우리 결과로 옮기지 않음

MarkTechPost가 인용한 체크포인트 크기: FP8 172.78 GiB, BF16 335.28 GiB. 희소 활성은 연산만 줄이고 저장 용량은 줄이지 않는다.

Qwen 자사 벤치 점수표와 “1/9 학습 비용” 주장은 옮기지 않는다. 비교군은 Qwen3.8-27B 매핑M1 Max 실측(27B)이다. Flash-Next 속도 표는 아직 빈칸이다.

커뮤니티 양자화 파일 크기 (우리 실측 아님)

우리가 재측정한 값이 아니다. 로드 계획을 짤 때 쓰는 문서·카드 표기다.

Unsloth GGUF (unsloth/Qwen3.8-Flash-Next-GGUF, 실행 가이드)

quant 표기 크기
UD-IQ1_S 72.5 GB
UD-IQ1_M 74.5 GB
UD-Q2_K_XL 78.9 GB
UD-IQ3_XXS 82.0 GB
UD-Q3_K_XL 90.0 GB
UD-IQ4_XS 93.7 GB
UD-Q4_K_XL 111.3 GB

Unsloth 문서는 “75GB RAM/통합 메모리, GPU VRAM 필수 아님”과 n-gram(PLE) SSD/호스트 오프로드를 같이 적는다. 그건 그들의 가이드다. 우리 박스에서 같은 숫자가 나온다는 뜻이 아니다.

llama.cpp 쪽은 2026-08-27 전후로 qwen4exp / Flash-Next 경로가 병합됐다는 커뮤니티 보고가 있다. 이 랩의 빌드 커밋·플래그는 아직 기록하지 않았다.

커뮤니티 MLX (PipeNetwork 측정표)

build 표기 size
bfloat16 (upstream) 360.0 GB
8-bit 192.2 GB
6-bit 148.0 GB
mixed-4/8-bit 106.2 GB
4-bit 103.8 GB

레포는 mixed-4/8-bit를 150GB 미만 권장 빌드로 적고, uniform 4-bit는 PPL 손해(+20.6% vs bf16)가 크다고 한다. M1 Max 64GB / M2 Max 96GB에는 권장 MLX 빌드가 통째로 들어가지 않는다. bf16 상주 ~354GB·~24 tok/s 같은 레포 문구는 우리 장비가 아니다. 옮기지 않는다.

SSD에 n-gram을 둔 분할 GGUF (참고)

AtomicChat 등은 n-gram 샤드를 SSD에 두고 빠른 메모리 요구를 낮춘 빌드를 공개했다(예: 총 ~84.9–110.5GB, 인메모리 표기 ~45.8–56.1GB). 64GB/96GB Mac 가이드로 적혀 있어도, 이 랩의 로드·품질·속도 검증은 없다. “가능하다는 주장”과 “우리 바늘”을 섞지 않는다.

우리 플릿 매핑 — 오늘 vs 예정

숫자는 “파일이 어디에 들어갈 여지가 있는가”다. 속도가 아니다.

오늘 (보유)

경로 RTX 4080 16GB M1 Max 64GB MacBook M2 Max 96GB Mac Studio
FP8/BF16 공식 가중치 불가 (172–335 GiB급) 불가 불가
Unsloth GGUF 전체 RAM 상주 불가. VRAM 16GB ≪ 72–111GB 1-bit저비트도 빠듯불가 (72GB+). 가이드의 75GB 바닥을 64GB가 밑돈다 경계. 저비트 GGUF + 짧은 컨텍스트는 시도 후보. Q4급 111GB는 초과
GGUF + n-gram/전문가 오프로드 (llama.cpp CUDA/Metal) 실험 후보. 카드는 활성 전문가·KV만, 나머지·n-gram은 시스템 RAM/SSD. “돌렸다”고 쓰려면 양자화·오프로드 플래그·성공/실패를 같이 적는다 실험 후보. Metal + mmap/SSD 경로가 커뮤니티에 있으나 미실측 실험 후보. 64GB보다 헤드룸. 역시 미실측
MLX 4-bit / mixed (~104–106GB) 대상 아님 비권장. 파일이 64GB를 넘김 비권장. 96GB에도 파일이 넘거나 KV·비전 자리 없음
비전 on 더 빠듯. 1차로 텍스트만 동일 동일

4080 16GB의 포인트는 “Flash-Next를 VRAM에 넣는다”가 아니라, 16GB 컴퓨트 + 큰 시스템 RAM으로 n-gram 오프로드 스모크가 성립하는지다. 성립 여부는 아직 빈칸이다.

예정 (미입고)

경로 AMD AI Max+ 395 128GB Strix Halo (예정) Gigabyte DGX Spark 128GB (예정)
Unsloth Q4급 GGUF (~93–111GB) 가중치+여유 KV를 같이 들 목표 티어 동일. CUDA/llama.cpp·(해당 시) vLLM 후보
n-gram을 NVMe에 둔 런북 ROCm/Vulkan 경로를 입고 후 확인 커뮤니티 Spark 전용 런북이 이미 나옴. 입고 전 설치 후기 없음
MLX Apple 아님 Apple 아님
구매·가용성 (2026-08 말 스냅샷) Strix Halo 128GB 미니PC는 DRAM 수급으로 품절·고가 보고가 섞임. 입고 전 가격표를 벤치처럼 쓰지 않음 Founders/리셀 MSRP 대역은 공개되어 있으나, 이 랩 발주·도착 확인 전

예정 장비 공칭(200B 추론 등)을 Flash-Next 결과처럼 인용하지 않는다.

27B 글과의 관계

Qwen3.8-27B 매핑 이 글 (Flash-Next)
아키텍처 덴스 27B (+비전) MoE 125B-A6B + 51B n-gram
4-bit 파일 규모 Unsloth ~14–18GB Unsloth ~94–111GB (Q4 근처)
오늘 주력 박스 M1/M2 Max에 올라가는 보유 박스에서는 오프로드·분할이 기본 가정
우리 tok/s M1 Max 실측 있음 없음

Flash-Next는 “27B를 다시 매핑한 글”이 아니다. 같은 주 릴리스가 플릿의 빈칸(128GB)·오프로드 실험을 새로 연다.

이 랩이 다음에 잴 것 (Flash-Next)

128GB 입고 전, 보유 장비에서만.

  1. 로드 프로파일 — 같은 Unsloth GGUF를 4080(CUDA 오프로드) / M1 Max / M2 Max에 올린다. 성공·OOM·상주 메모리·사용한 플래그.
  2. n-gram 위치 — RAM vs SSD(mmap). 표기된 인메모리 절감이 우리 박스에서 재현되는지.
  3. 품질 스모크 — 로드만 되지 않고, 짧은 코딩·지시 따르기에서 붕괴/반복이 없는지. (벤치 점수 복붙 금지)
  4. 비전 off 고정 — 1차는 텍스트. mmproj·비디오는 그다음.
  5. 128GB 입고 후 — 같은 파일을 Strix Halo·Spark에 다시 올리고, Q4급 상주 + 장문맥을 같은 바늘로 잰다.

하지 않는 일: Qwen/Unsloth/MLX 레포 tok/s를 우리 숫자로 쓰기, M5 Max·5090 커뮤니티 속도를 4080·M1/M2에 외삽하기, 예정 128GB를 이미 측정한 것처럼 쓰기, 27B 실측 표를 Flash-Next 결과처럼 재사용하기.

파일 크기와 티어 매핑만 오늘 확인됐다. 속도 칸은 비운다.

SPONSORED / ADVERTISEMENT
예약된 광고 영역 — AdSense 승인 후 콘솔에서 발급된 유닛 ID만 연결합니다.