알리바바 Qwen팀, 멀티모달 MoE 모델 ‘Qwen3.8-Flash-Next’ 공개

알리바바의 인공지능 연구팀 Qwen이 멀티모달 Mixture-of-Experts(MoE) 모델 ‘Qwen3.8-Flash-Next’를 공개했다. 이 모델은 1250억 개 규모의 백본에 510억 개 N-gram 임베딩 테이블, 40억 개 멀티 토큰 예측 모듈을 결합한 구조로, 토큰당 실제로 활성화되는 파라미터는 60억 개 수준이다. Qwen팀은 이번 모델을 차기 세대인 Qwen4 아키텍처의 사전 공개판으로 소개했다.
Qwen팀은 이번 모델이 토큰당 비용을 낮추는 데 초점을 맞췄다고 설명했다. 공개 자료에 따르면 Qwen3.8-Flash-Next는 기존 Qwen3.7-Plus 대비 학습 비용이 약 9분의 1 수준이다. 또 추론 효율을 높이기 위해 Gated DeltaNet과 Qwen Sparse Attention을 결합한 하이브리드 구조, Gated Residual, N-gram Embedding, Muon 옵티마이저 등 네 가지 변화를 적용했다.
모델 규모는 크지만 실제 구동 방식은 희소 활성화에 가깝다. 공개된 설명에 따르면 이 모델은 총 512개 전문가를 두고, 토큰마다 10개 라우팅 전문가와 1개 공유 전문가를 활성화한다. 저장 용량은 FP8 체크포인트 기준 172.78GiB, BF16 기준 335.28GiB로 제시됐다. Qwen 측은 FP8 환경에서 GB300 기준 TP2가 최소 검증 구성이고, 8×H200 노드에서는 TEP8 사용을 권장한다고 밝혔다. 일반적인 TP8 구성은 체크포인트의 128단위 양자화 블록과 맞지 않는다고 설명했다.
성능도 함께 공개됐다. Qwen팀은 DeepSWE 1.1에서 58.7점, SWE-bench Pro에서 62.5점, SWE-bench Multilingual에서 81.0점, LiveCodeBench v6에서 91.9점을 기록했다고 밝혔다. 멀티모달 항목에서는 AndroidWorld 84.5점, LVBench 76.6점, RealWorldQA 88.5점, MathVision 95.7점을 제시했다. 다만 일부 고난도 추론 과제에서는 경쟁 모델이 앞섰다. 예를 들어 HLE에서는 Claude Opus 4.6이 40.0점으로 Qwen의 35.9점을 웃돌았고, NL2Repo-Bench에서는 DeepSeek-V4-Flash-0731이 54.2점으로 Qwen의 48.1점보다 높았다.
이번 공개는 알리바바가 차세대 Qwen 계열의 방향성을 미리 보여주려는 성격도 있다. Qwen3.8-Flash-Next는 최대 26만2144토큰의 문맥을 기본 지원하고, YaRN을 통해 100만 토큰까지 확장할 수 있다. 또한 vLLM, SGLang, TokenSpeed, transformers serve, llama.cpp 등 여러 서빙 환경을 지원하며, Unsloth, Swift, LLaMA-Factory를 통한 미세조정도 가능하다. Qwen은 이 모델이 QwenWork의 ‘Standard’ 모드와 Qwen Code에도 이미 적용됐다고 밝혔다.
다만 속도 향상 수치는 아직 Qwen 측이 제시한 값이다. 공개 자료에는 QSA 커널 기준 최대 7.6배의 prefill, 4.9배의 decode 속도 향상이 적혀 있고, SGLang cookbook과 vLLM 레시피에는 각각 10.2배, 6.6배 수치가 제시돼 있다. 실제 성능은 독립적인 검증이 더 필요하다.
김성진 메타브리프 기자 sieghaft@gmail.com