AIAI Tech Engine
/벤치마크/Flash-Next 시각 비교 16k: Spark vs AMD vs AMD+4080
#visual compare#Flash-Next#RTX4080#DGX Spark#EVO-X3#16k

Flash-Next 시각 비교 16k: Spark vs AMD vs AMD+4080

Flash-Next 16k 3박스 속도 비교 + 사람 눈 품질 한계. 자동 hit는 과대평가; 게임은 시네마틱 정지장면, space-02는 로켓/전투기 드리프트.

AIAI Tech Engine Lab
독립 테스트베드 실측
SPONSORED / ADVERTISEMENT
예약된 광고 영역

한 줄. Flash-Next를 같은 3프롬프트 · seed=441 · max_tokens=16000으로 Spark / EVO AMD-only / EVO AMD+4080에서 돌렸다. 속도는 Spark ≫ AMD ≈ AMD+4080. 다만 사람 눈으로 보면 결과물 품질은 대체로 실패에 가깝다 — 자동 hit_ratio·closed_html은 “키워드/태그 있음”일 뿐, 장면이 맞거나 게임이 동작한다는 뜻이 아니다.

팩 정의: 시각 비교 팩 v1. 스모크 프롬프트: game-01 · arch-01 · space-02. HTML은 Three.js CDN. Playwright render_ok는 세 박스 모두 0/3(닫힌 HTML이어도 게이트 미통과).

Totals

SparkEVO AMDEVO AMD+4080
mean wall247s410s442s
decode~37 tok/s~26.5~25.3
mean hit_ratio0.890.940.89
closed_html3/33/33/3
render_ok0/30/30/3

사람 눈 · 품질 한계 (중요)

배포 HTML을 직접 열어보면:

  • 안 나오거나 거의 빈 화면인 케이스가 있다. Playwright render_ok가 전 박스 0/3인 이유와 같다.
  • game-*: 프롬프트 자체가 “플레이 가능 게임”이 아니라 시네마틱 스크린샷이었다. 실제 산출물에도 keydown/WASD가 없고, 카메라 루프만 있는 정지 장면이다. “게임이 안 돈다”는 기대와 프롬프트가 어긋났다.
  • space-02: 요구는 행어 안 은색 기체 + 주황 엔지니어 3 + 상자 + 파란 로봇 + 문 너머 행성. 코드 주석/타이틀은 Hangar라고 써도, 메시 조합이 로켓/전투기 실루엣으로 보이는 드리프트가 난다. 문자열 체크는 spacecraft/hangar 단어만 세서 통과시킨다.
  • arch-01이 상대적으로 덜 깨지지만, 그래도 “포토리얼 건축 비주얼” 수준은 아니다.

즉 이번 런의 유효한 결론은 박스 간 속도·용량이지, “Flash-Next가 멋진 3D를 잘 만든다”가 아니다. 다음 팩(v2)에서는 (1) 플레이 가능 게임 vs 정지 장면 분리, (2) NOT rocket launch / NOT open space dogfight 같은 네거티브 고정, (3) 문자열 대신 비전/사람 채점을 기본으로 바꿔야 한다.

AMD+4080은 VRAM 말고 이득이 있나?

이 워크로드에서는 거의 없다. Flash-Next ROCmFP4가 AMD 단독(-dev Vulkan0 -c 32768)으로 이미 들어가면, 4080을 layer spill(-sm layer -ts 56,8)로 붙이는 비용(PCIe·레이어 분할)이 그대로 wall에 붙는다. 측정값도 AMD 410s vs AMD+4080 442s — spill이 ~8% 더 느리다.

  • 이득이 되는 경우: 가중치·KV가 AMD VRAM에 안 들어갈 때, 또는 -c를 크게 올려야 긴 HTML이 잘리지 않을 때(이전 quality×cost에서 -c 4096 절단 → 32k 필요).
  • 이득이 없는 경우: 이번처럼 모델+컨텍스트가 AMD에 이미 들어갈 때. 속도·체크리스트 모두 AMD 단독이 같거나 나음.
  • 품질: hit_ratio는 AMD 단독이 미세 우위(특히 arch-01 0.83 vs 0.67). 4080이 “더 예쁘게” 만들지는 않음.

Setup

SparkEVO AMDEVO AMD+4080
serveSGLang NVFP4 :30000llama.cpp Vulkan0 :8080llama.cpp Vulkan1,0 -ts 56,8
weightsFlash-Next NVFP4ROCmFP4-FAST ple16동일 GGUF
paramstemp 0.4 · thinking off · seed 441 · max_tokens 16000

프롬프트별 wall

promptSparkAMDAMD+4080
game-01284s · 36.5 t/s · 10.4k tok426s · 26.5 · 11.3k522s · 25.2 · 13.1k
arch-01162s · 38.1 · 6.2k314s · 26.6 · 8.4k356s · 25.4 · 9.0k
space-02294s · 38.0 · 11.2k490s · 26.4 · 12.9k448s · 25.3 · 11.3k

결과 HTML

SparkAMDAMD+4080
game-01HTMLHTMLHTML
arch-01HTMLHTMLHTML
space-02HTMLHTMLHTML

읽는 법

  • Spark가 wall·tok/s 모두 1등. 같은 Flash-Next라도 NVFP4+SGLang이 Vulkan GGUF보다 ~1.6–1.8× 빠름.
  • 4080 spill = capacity. 이미 fit이면 AMD-only로 두고, 큰 모델·긴 컨텍스트에만 spill을 켠다.
  • render_ok=0은 “장면이 없다”가 아니라 Playwright 게이트(RAF/루프 등) 미충족. 체크리스트·닫힌 HTML은 통과.
  • 12프롬프트 × 4모델 풀 매트릭스는 아직 스모크 3개·Flash-Next만.

원본: results/visual-compare/t16k-{spark,evo-amd,evo4080}-flash/ · 2026-09-04.