2026년 8월 26일 저녁, 알리바바의 퉁이첸원(Tongyi Qianwen) 팀은 효율성에 초점을 맞춘 멀티모달 MoE 모델 'Qwen3.8-Flash'를 공개하고, 동시에 차세대 Qwen4 제품군의 기반이 될 'Qwen3.8-Flash-Next'의 가중치를 오픈소스로 공개했다. 핵심 수치는 공격적이다. 훈련 비용은 Qwen3.7-Plus의 약 9분의 1, API 가격은 입력 100만 토큰당 1위안, 그리고 베이스 모델은 자신의 약 3배 파라미터를 가진 모델의 베이스 버전을 14개 벤치마크 중 8개에서 앞질렀다. 중국 AI 위에 구축하는 개발자, 특히 에이전트 개발자와 AI 네이티브 캠페인을 준비하는 마케터에게 이는 DeepSeek V4 물결 이후 가장 중요한 중국 모델 릴리스다.
1. 무슨 일이 있었나: 릴리스 + 아키텍처 프리뷰
2026년 8월 26일 23시(베이징 시간)경, 알리바바는 'Qwen3.8-Flash'와 'Qwen3.8-Flash-Next'의 가중치를 Hugging Face와 ModelScope에 공개했다. FP8 양자화 버전도 함께 제공된다.
하나의 발표에 두 가지 의미가 있다:
- Qwen3.8-Flash — 프로덕션 모델. 125B 총 파라미터에 51B N-gram 임베딩 테이블을 겸비한 멀티모달 MoE로, 토큰당 약 6B만 활성화한다. 네이티브 컨텍스트 262,144토큰, YaRN으로 100만 토큰까지 확장 가능.
- Qwen3.8-Flash-Next — 아키텍처 프리뷰. 파라미터는 동일하지만, 첸원은 이를 Qwen4 제품군의 '원형(prototype)'이라고 명시했다. Qwen4 정식 출시에 앞서 커뮤니티가 추론 프레임워크를 적응시키고 실제 워크로드로 검증할 수 있도록 조기 공개된 것.
API(첸원 AI 플랫폼 경유)는 입력 100만 토큰 1위안·출력 3위안이며, 첸원 오피스의 '표준 모드'에 이미 내장됐다.
2. 중요한 숫자: 비용·가격·벤치마크
| 지표 | 값 | 맥락 |
|---|---|---|
| 훈련 비용 | Qwen3.7-Plus의 약 1/9 | 알리바바 발표, 동일 제품군 비교 |
| API 가격(입력) | 100만 토큰 1위안 | Claude Opus 4.6 API 가격의 약 3% |
| API 가격(출력) | 100만 토큰 3위안 | Qwen3.8-Max(12위안/36위안)의 약 1/12. DeepSeek V4 Flash 피크 시 약 1/3·오프피크 시 약 2/3 |
| 활성 파라미터 | 토큰당 약 6B | 125B 본체 + 51B N-gram 테이블 |
| 컨텍스트 | 262K 네이티브 → 1M(YaRN) | 장기 에이전트 태스크용 |
| 베이스 모델 성적 | 14개 벤치마크 중 8개 최고 | MMLU-Pro, SuperGPQA, BBH, SWEBench-Pretrain, MGSM, MMMU |
| SWE-bench Pro(공식) | 62.5 vs 53.4(Opus 4.6 Max) | 6B 활성으로 +9.1점 |
알리바바의 후속 훈련 평가에서는 CoWorkBench 장기 전문 태스크 73.9(DeepSeek V4 Flash 초과), AndroidWorld +22.5, MathVision +25.1, 임베디드 지능 ERQA +31.5, 비교 가능한 9개 벤치마크 중 8승으로 알려졌다. 이는 벤더 공표치로 제3자 검증이 필요하지만, 부풀리기 어려운 베이스 모델 성적(Flash-Base가 약 3배 활성 파라미터의 Qwen3.7-Plus 베이스 버전을 능가)이 더 신뢰할 만한 신호다.
3. 본론: Qwen4를 미리 보는 4가지 아키텍처 혁신
첸원은 Flash-Next를 '스파스화(sparsification)'의 단계적 진화로 규정한다. 스파스성을 FFN 레이어(기존 MoE)에서 어텐션·지식 저장·잔차 연결로 확장한다. 연동된 4가지 변경:
| 혁신 | 기능 | 의미 |
|---|---|---|
| GDN + QSA 어텐션 | Gated DeltaNet이 히스토리를 압축. Qwen Sparse Attention은 경량 Indexer로 micro-block 단위에 중요한 컨텍스트를 선택 | 선택된 블록에서만 전체 어텐션 실행. 1M 컨텍스트에서 Prefill 최대 7.6배·Decode 최대 4.9배 가속. 캐시 히트 90% 시 Prefill 처리량 약 8.6배 |
| 4레인 Gated Residual | 잔차 스트림을 4개 병렬 브랜치로 분할, 동적 게이트로 제어. FP8 상태 저장 | 학습을 안정적으로 유지하며 층간 용량 확대. 메모리 트래픽 절감 |
| N-gram Embedding | 최근 토큰 n-gram을 키로 하는 51B 파라미터 룩업 테이블(2번째 레이어에서 주입) | 계산 없이 용량 추가. 테이블은 호스트 메모리로 오프로드하고 비동기 프리페치 가능 — '계산 대신 메모리' |
| Muon 옵티마이저 | 직교화 정밀도·Muon/AdamW 역할 분담·융합 파라미터 분할, Scaling Law 재피팅 | 3가지 아키텍처 변경을 대규모에서 안정적으로 학습시키는 전제. 배치 크기 warmup 폐지 |
구성은 48개 레이어, GDN 36 : QSA 12의 3:1 비율. 설계 철학은 DeepSeek의 Engram, Google의 SCONE과 같은 방향 — 지식 저장을 '계산 파라미터'에서 '룩업 메모리'로 옮긴다. 이 경로가 통하면 파라미터를 늘려도 대부분 CPU 메모리에 대기하다 쿼리 시에만 움직이므로, 모델 규모 확대와 추론 비용 증가를 분리할 수 있다.
4. Qwen3.8 라인업에서 Flash의 위치
| 모델 | 공개일 | 프로필 | 활성 파라미터 | 전장 |
|---|---|---|---|---|
| Qwen3.8-Max | 8월 3일 | 플래그십 품질 | 2.4T 총 / 95B 활성 | Arena 세계 2위. 클라우드 품질 대결(Claude/GPT 대항) |
| Qwen3.8-27B | 8월 14일 | 덴스·로컬 | 27B | 컨슈머 GPU, 로컬 에이전트 |
| Qwen3.8-Flash | 8월 26일 | 효율 + 아키텍처 프리뷰 | 125B + 51B 테이블 / 6B 활성 | API 가격 전쟁, 고처리량 멀티모달 에이전트 |
3개 크기, 3개 전장. Max는 브랜드와 품질, 27B는 로컬 커뮤니티, Flash는 API 경제성과 차세대 아키텍처 검증. Qwen 오픈소스 생태계는 Hugging Face 다운로드 30억 회, 파생 모델 30만 개 이상으로 보고되며, 전 계층을 오픈으로 내놓는 방식으로 쌓아온 해자다.
5. 개발자와 에이전트에게 의미하는 것
가장 실행 가능한 신호는 가격이다. 에이전트 워크로드는 단발 채팅보다 몇 자릿수 더 많은 토큰을 소비한다 — 계획 단계, 도구 호출, 재시도 모두가 컨텍스트를 소모한다. 1위안/3위안(100만 토큰)이면 다음 선택지가 현실이 된다:
- 청구서를 걱정하지 않고 에이전트가 더 길게 추론하고 재시도하게 한다.
- 컨텍스트를 억지로 잘라내거나 모델 라우팅에서 타협하는 것을 멈춘다.
- 기존에 비용상 불가능했던 고처리량 멀티모달·장기 태스크를 실행한다.
주의점도 하나. '6B 활성' 마케팅과 달리 풀 체크포인트는 양자화 전 약 335GiB(131개 샤드)다. Flash는 클라우드 추론, 멀티 GPU 워크스테이션, 128GB 이상 유니파이드 메모리 머신을 겨냥하며 컨슈머 GPU 단일 카드로는 실행 불가다. 단일 카드 로컬 사용은 27B 모델이 보완 역할이다.
6. '아키텍처 카나리아' 전략
Qwen4의 아키텍처 프리뷰를 'Qwen3.8-Flash-Next' 이름으로 내놓는 것은 의도적인 리스크 관리다. 바로 'Qwen4'로 내놓으면 브랜드 기대가 전부 걸리고 문제 발생 시 큰 비판을 받는다. '기술 프리뷰'로 규정하면 여유가 생긴다. 그동안 커뮤니티는 vLLM·SGLang·llama.cpp 지원과 실사용 검증을 Qwen4 정식 출시 몇 달 전부터 진행해준다. 첸원은 Qwen3-Next(Gated DeltaNet, 초희소 MoE, MTP)에서 같은 방식을 썼고 이후 정식 제품군이 이를 채택했다. Flash-Next도 같은 플레이북을 4개 아키텍처 차원에 한 번에 적용한 형태다.
7. 마케터와 브랜드에게 의미하는 것
중국 시장에서 마케팅하는 브랜드와 AI 전략을 총괄하는 에이전시에 주는 시사점은 3가지다:
- AI 에이전트 비용이 다시 붕괴한다. 중국 주요 연구소는 모두 100만 토큰 한 자릿수 위안의 가격 경쟁으로 들어섰다. 추론이 싸지면 AI 네이티브 소비자 접점(쇼핑 어시스턴트, 고객 서비스, 콘텐츠 생성)은 더 빨리 확장된다. 캠페인 계획의 전제였던 'AI 기능은 비싸다'는 더 이상 성립하지 않는다.
- 효율 아키텍처가 AI가 실행되는 곳을 바꾼다. 첸원의 방향(전 계층 스파스화, CPU 메모리로의 지식 오프로드)은 알리바바 생태계 내부(첸원 오피스, Alibaba Cloud, 타오바오 어시스턴트)에서 더 싸고 빠른 에이전트 경험을 예고한다. 생태계 통합형 에이전트(알리바바 vs 텐센트 vs 바이트댄스)는 더우바오 워크와 WorkBuddy에서 다룬 기업 진입점 경쟁을 계속할 것이다.
- 벤치마크도 예산도 움직이는 표적이다. 벤더 공표치(SWE-bench Pro에서 Opus 4.6에 +9.1 등)는 독립 검증이 필요하다. 클라이언트 프로젝트의 모델 선정은 리더보드가 아니라 클라이언트 자체 태스크(코딩, 오피스 업무, 고객 대응)로 테스트해야 한다.
요약: Qwen3.8-Flash는 DeepSeek 이후 중국 주요 연구소가 낸 가장 강력한 '저렴함 + 오픈' 선언이다. 가격 붕괴는 브랜드가 중국에서 자동화할 수 있는 범위를 넓히고, 아키텍처 프리뷰는 차세대 중국 AI의 방향을 보여준다. 둘 다 에이전트 중개형 마케팅의 채널로서 알리바바 생태계를 계속 주시해야 할 이유다.
출처: 지에몐신원(界面新聞, 2026-08-26) https://view.inews.qq.com/a/20260826A0CSTE00 ;지치즈신(機器之心, 2026-08-26) https://view.inews.qq.com/a/20260826A0E0HU00 ;IT시대망(2026-08-26);AI중문커뮤니티/후커지(2026-08-26);Tenten developer analysis (2026-08-27).