DeepSeek-R1 vs Qwen3.8-Flash-Next

Try Try

DeepSeek-R1 has 684B parameters (36.6B active per token) and takes 689 GB on disk; Qwen3.8-Flash-Next has 180B and takes 360 GB. Compare them layer by layer.

At a glance

deepseek-ai/DeepSeek-R1Qwen/Qwen3.8-Flash-Next
Repo createdJan 20, 2025updated Mar 27, 2025Aug 24, 2026updated Aug 27, 2026
Model typeMixture of expertsFull attention (MLA)Not shown: breakdown incomplete
InputsTextText + images449M vision encoder
Total parameters684B3.8× more180B3.8× less
Active per token36.6B5.4% of the modelNot shown: breakdown incomplete
Experts8 of 256 activeplus 1 shared, always onNot shown: breakdown incomplete
Max context (from config)160K tokens1.6× less256K tokens1.6× more
Layers611.3× moreplus 1 extra prediction layer481.3× less36 linear + 12 full attention
On disk689 GB1.9× more163 files360 GB1.9× less131 files
PrecisionFP8 E4M3 (99%), BF16 (1.1%)BF16 (100%)
QuantizationFP8 E4M3blocks of 128×128 · 99% of parametersNoneoriginal precision (BF16)
Fewest GPUs6× NVIDIA H200fits in one 8-GPU server · weights only5× NVIDIA H100fits in one 8-GPU server · weights only
Licensemitqwen-community-1.0 (custom)
GitHubdeepseek-ai/DeepSeek-R1QwenLM/Qwen3.8-Flash-Next