Qwen3.8-Flash-Next: 알리바바, Qwen4 아키텍처 미리보기 공개
알리바바 Qwen팀이 1250억 파라미터 중 토큰당 60억 개만 활성화되는 MoE 모델 Qwen3.8-Flash-Next를 공개했다. 훈련 비용은 전작의 9분의 1 수준이다.

알리바바 Qwen팀은 2026년 8월 26일, 개방형 가중치 멀티모달 MoE(전문가 혼합) 모델인 Qwen3.8-Flash-Next를 공개했다. MarkTechPost에 따르면 이 모델은 “토큰당 비용”을 최적화하기 위해 설계됐다. 이 체크포인트는 1250억 파라미터 규모의 백본을 갖췄지만 토큰마다 실제로 활성화되는 파라미터는 60억 개에 불과하다. Qwen팀은 이 비율을 Qwen4를 뒷받침할 아키텍처의 초기 미리보기로 자리매김했는데, MarkTechPost에 따르면 이는 Qwen3.5 이전에 Qwen3-Next가 했던 역할과 같다.
MarkTechPost 보도에 따르면 메인 백본에 510억 파라미터 규모의 N-gram 임베딩 테이블과 40억 파라미터 규모의 멀티토큰 예측 모듈을 더하면 디스크 상의 총 파라미터 수는 1800억 개에 이른다. The Decoder는 이 N-gram 레이어를 흔히 쓰이는 단어 묶음을 독립된 항목으로 저장하는 일종의 “구문 사전”이라고 설명하며, GPU 메모리 대신 일반 시스템 램에 둘 수 있고 그에 따른 추가 비용은 Qwen 표현으로 “비교적 낮다”고 전했다.
이번 출시를 지탱하는 네 가지 변화
MarkTechPost는 Qwen3.8-Flash-Next 뒤에 있는 네 가지 아키텍처 변화를 짚었다. 첫째는 하이브리드 어텐션 방식이다. 네 개 레이어 중 세 개는 이력을 고정 크기의 순환 상태로 압축하는 선형 어텐션 메커니즘인 Gated DeltaNet을 실행하고, 나머지 한 개 레이어는 경량 인덱서를 통해 마이크로블록 단위로 맥락을 선택하는 Qwen Sparse Attention(QSA)을 실행한다. 모델 전체 48개 레이어에서 이 패턴은 “Gated DeltaNet 3개 층 + QSA 1개 층”을 한 블록으로 삼아 12번 반복되며, QSA 예산은 512개 블록 또는 2048개 토큰으로 제한된다.
두 번째 변화인 Gated Residual은 잔차 흐름을 네 개의 병렬 가지로 넓히고, 요소 단위 읽기 게이트와 가지별 쓰기 게이트로 제어하며 병목 랭크는 320이다. 세 번째는 앞서 설명한 N-gram 임베딩이다. 네 번째는 훈련 방식으로, MarkTechPost에 따르면 특정 가중치 범주에 Muon 옵티마이저를 AdamW와 함께 적용하고 배치 크기 워밍업을 없앴으며 모델의 스케일링 법칙을 다시 맞췄다. MoE 레이어 자체는 512개 전문가 중에서 라우팅하며, 토큰마다 라우팅된 전문가 10개와 공유 전문가 1개를 활성화하고, 전문가 중간 차원은 640이다.
- 메인 백본 총 1250억 파라미터 중 토큰당 60억 개만 활성화
- 510억 파라미터 N-gram 임베딩 테이블과 40억 파라미터 멀티토큰 예측 모듈—디스크 상 총 파라미터 1800억 개
- MoE 레이어 전문가 512개, 토큰당 라우팅 전문가 10개+공유 전문가 1개 활성화
- 네이티브 컨텍스트 윈도우 26만 2144토큰, YaRN을 통해 100만 토큰까지 확장 가능
- FP8 체크포인트: 172.78 GiB, BF16 체크포인트: 335.28 GiB
벤치마크는 더 큰 경쟁 모델들을 앞섰지만—전 영역은 아니다
The Decoder에 따르면 에이전트형 코딩에서 Qwen은 Flash-Next가 DeepSWE 1.1에서 58.7점, SWE-bench Pro에서 62.5점을 기록해 DeepSeek-V4-Flash와 Claude Opus 4.6(Max)을 모두 앞섰다고 밝혔다. 오피스 및 업무 워크플로 과제에서는 격차가 더 벌어진다. The Decoder 보도에 따르면 Flash-Next는 CoWorkBench에서 73.9점을 기록해 DeepSeek-V4-Flash의 45.1점을 크게 웃돌았고, JobBench에서는 55.7점으로 Qwen3.7-Plus의 27.6점의 거의 두 배에 달했다. The Decoder가 전한 알리바바 자체 벤치마크 비교에 따르면 Qwen3.7-Plus 자체는 총 3970억 파라미터에 토큰당 170억 개가 활성화되는데, 이는 Flash-Next 활성 파라미터 수의 거의 세 배에 해당하며, DeepSeek-V4-Flash는 총 2840억 파라미터에 130억 개가 활성화된다.
이 모델이 모든 영역에서 앞서는 것은 아니다. MarkTechPost에 따르면 Humanity's Last Exam에서는 Claude Opus 4.6(Max)이 40.0점으로 Qwen의 35.9점을 앞섰고, NL2Repo-Bench에서는 DeepSeek-V4-Flash-0731이 54.2점으로 48.1점을 앞섰다. The Decoder는 비교 대상인 Claude Opus 4.6이 2026년 2월에 나온 상대적으로 “오래된” Anthropic 모델이라는 점을 덧붙이며, 벤치마크 점수와 실제 성능은 다를 수 있다고 경고했다.
훈련 비용은 9분의 1, 가격은 수분의 1
MarkTechPost에 따르면 Qwen은 Flash-Next의 훈련 비용이 Qwen3.7-Plus의 약 9분의 1이었다고 밝혔다. 서빙 속도에 대해서는 두 매체가 전한 구체적인 수치가 서로 다르다. MarkTechPost 보도에 따르면 Qwen 자체 발표는 QSA 커널이 100만 토큰 기준으로 프리필에서 최대 7.6배, 디코드에서 최대 4.9배 속도 향상을 가져왔다고 주장하는 반면, 같은 MarkTechPost 기사에서 인용된 SGLang과 vLLM의 별도 배포 가이드는 각각 10.2배, 6.6배의 개선폭을 제시한다. MarkTechPost는 이 차이 자체를 지적하며 “독립적으로 측정되기 전까지는 이 범위를 벤더 자체 발표 수치로 취급하라”고 당부했다. MarkTechPost에 따르면 Qwen은 또한 프리픽스 캐시 적중률 90% 조건에서 Qwen3.7-Plus 대비 8.6배의 프리필 처리량을 주장한다.
가격 면에서 The Decoder 보도에 따르면 정식 서비스 버전인 Qwen3.8-Flash는 QwenCloud를 통해 입력 토큰 100만 개당 0.16달러, 출력 토큰 100만 개당 0.47달러에 제공되며, 관련 API는 조만간 공개될 예정이다. The Decoder는 이는 알리바바의 현 플래그십 모델인 Qwen3.8-Max—8월 초 출시돼 Claude Opus 4.8, Gemini 3.1 Pro, GPT-5.6 Sol을 겨냥한 모델—가격의 약 12분의 1 수준이라고 전했다. 이는 알리바바 자체 벤치마크에서 Flash-Next의 성능이 이 플래그십 모델보다 다소 낮게 나타남에도 불구하고 그렇다.
배포는 가능하지만 워크스테이션에서는 무리
활성 파라미터 수가 효율적이라 해도 Flash-Next는 개인 개발자가 손쉽게 돌릴 수 있는 모델은 아니다. MarkTechPost에 따르면 FP8 체크포인트 용량은 172.78 GiB, BF16 버전은 335.28 GiB에 달한다. vLLM 자체 배포 가이드에 따르면 엔비디아 GB300에서 검증된 최소 FP8 구성은 텐서 병렬 방식으로 GPU 2개가 필요하며 4개가 권장되고, 8×H200 노드에서는 표준 8-way 텐서 병렬 방식이 이 체크포인트의 128폭 양자화 블록과 호환되지 않기 때문에 텐서-전문가 혼합 병렬 구성이 필요하다. MarkTechPost는 희소 활성화가 연산량은 줄이지만 저장 용량은 줄이지 않는다고 지적한다. 이 모델은 Apache 2.0이 아니라 알리바바 자체의 qwen-community-1.0 라이선스로 배포되며, 이는 상업적 이용 전에 약관을 꼼꼼히 확인해야 한다는 뜻이라고 MarkTechPost는 덧붙였다.
알리바바가 Flash-Next로 거는 승부수는 숫자만이 아니라 구조 그 자체에 있다. 전문가 혼합 라우팅과 보조 조회 테이블을 통해 전체 용량을 키우면서도 활성 파라미터 수를 낮게 유지하면, 훨씬 크고 비싼 시스템의 추론 품질에 근접하면서도 쿼리당 연산 비용은 극히 일부로 줄일 수 있다. Qwen이 이번 출시를 완성품이 아니라 “아키텍처 미리보기”로 규정하는 이유도 여기에 있다. 알리바바가 전체 Qwen4 라인업으로 확장하려는 아이디어를, 더 작은 모델을 통해 공개적으로 예행연습하고 있는 셈이다.
Claude나 GPT 같은 서구권 독점 API를 쓸지, 중국산 개방형 가중치 모델로 갈아탈지 저울질하는 기업들에게 Qwen3.8-Flash-Next는 그 선택지를 한층 더 뚜렷하게 만든다. 최상위 독점 모델 가격의 극히 일부에 불과하면서도 코딩과 사무 자동화 벤치마크에서 훨씬 큰 시스템과 맞먹거나 앞서는 개방형 가중치 모델을, 이제 직접 구축해 운영하거나 QwenCloud를 통해 대여해 쓸 수 있게 됐다. 다만 여전히 노트북이 아니라 다중 GPU 서버가 필요하고, 라이선스도 Apache가 아니어서 상업적 도입 전에는 약관을 꼼꼼히 살펴볼 필요가 있다.
출처
- Alibaba's Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 ArchitectureMarkTechPost · 2026년 8월 26일
- Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"The Decoder · 2026년 8월 26일



