sparse-MoE

taxonomy axis: compute_structure

Decision rule: MoE layers dominate (≥80% of transformer layers are routed FFNs).

Anchor: Mixtral 8x7B

Models in this category (27)

ModelOrgDateBlockAttentionContextTotalActive
Lagunapoolsidenot disclosedsparse-MoEhybrid131,07233.4B3B
INTELLECT-3Prime Intellect (Prime Intellect, Inc.)not disclosedsparse-MoEnot disclosed65,536106B12B
MixtralMistral AI2024-01-08sparse-MoEGQA32,76847B13B
DeepSeek-V3DeepSeek-AI2024-12-27sparse-MoEMLA4,096671B37B
DeepSeek-R1DeepSeek-AI2025-01-22sparse-MoE671B37B
Qwen3Qwen Team2025-05-15sparse-MoEGQA32,768235B22B
Kimi K2Kimi Team (Moonshot AI)2025-07-28sparse-MoEMLA4,0961.043T32.6B
gpt-ossOpenAI2025-08-05sparse-MoEhybridnot disclosed116.83B5.13B
GLM-4.5 (ARC series)Zhipu AI & Tsinghua University (GLM-4.5 Team)2025-08-08sparse-MoEGQA131,072106B12B
GLM-4.5 (ARC series)Zhipu AI & Tsinghua University (GLM-4.5 Team)2025-08-08sparse-MoEGQA131,072355B32B
Kimi LinearKimi Team (Moonshot AI)2025-11-01sparse-MoEhybrid4,09648B3B
DeepSeek-V3.2DeepSeek-AI2025-12-02sparse-MoEMLA131,072not disclosednot disclosed
Nemotron 3 NanoNVIDIA2025-12-23sparse-MoEGQA524,28831.6B3.2B
MiMo-V2Xiaomi (LLM-Core)2026-01-06sparse-MoEhybrid262,144309B15B
LongCat-FlashMeituan LongCat Team2026-01-29sparse-MoEnot disclosed131,07268.5B2.9B
GLM-5Zhipu AI & Tsinghua University (GLM-5 Team)2026-02-17sparse-MoEMLA200K744B40B
TrinityArcee AI2026-02-19sparse-MoEhybrid262,144400B13B
Nemotron 3 SuperNVIDIA2026-04-03sparse-MoEGQA1,048,576120.6B12.7B
DeepSeek-V4DeepSeek-AI2026-04-26sparse-MoEhybrid1M1.6T49B
ZAYA1Zyphra2026-05-06sparse-MoEGQA131,0728.4B760M
MiniMax-M2 seriesMiniMax2026-05-26sparse-MoEGQA192K229.9B9.8B
Mellum 2JetBrains (with Constructor University, Bremen)2026-05-29sparse-MoEhybrid131,07212B2.5B
Nemotron 3 Ultra (Nemotron 3 family)NVIDIA2026-06-09sparse-MoEhybrid1,048,576550B55B
MiniMax M3MiniMax (with authors from Peking University, NVIDIA, Zhejiang University, HUST, Nanjing University, Hangzhou Dianzi University)2026-06-11sparse-MoEGQAnot disclosed109B6B
Ling 2.6Ling Team, Inclusion AI2026-06-13sparse-MoEhybrid262,1441Tnot disclosed
Solar Open 2Upstage (Upstage Solar Team)2026-07-22sparse-MoEhybrid1,048,576250B15B
Kimi K3Kimi Team (Moonshot AI)2026-07-27sparse-MoEhybrid1M2.78T104.2B

What varies within this category

attention variant varies — GQA, MLA, hybrid, not disclosed. trained context varies — 1000000, 1048576, 131072, 192000, 200000, 262144, 32768, 4096, 524288, 65536, not disclosed. openness varies — open-weights, open-weights-open-data, undisclosed. scale class varies — frontier, large, medium, not disclosed.