efficient-attention

taxonomy axis: sequence_mixing

Decision rule: Attention with restricted/computed patterns (sliding window, linear attention, sparse patterns) — but still attention.

Anchor: Mistral (sliding window layers)

Models in this category (9)

ModelOrgDateBlockAttentionContextTotalActive
Gemma 3Google DeepMind (Gemma Team)2025-03-25densesliding-window131,07227B27B
DeepSeek-V3.2DeepSeek-AI2025-12-02sparse-MoEMLA131,072not disclosednot disclosed
MiMo-V2Xiaomi (LLM-Core)2026-01-06sparse-MoEhybrid262,144309B15B
GLM-5Zhipu AI & Tsinghua University (GLM-5 Team)2026-02-17sparse-MoEMLA200K744B40B
DeepSeek-V4DeepSeek-AI2026-04-26sparse-MoEhybrid1M1.6T49B
ZAYA1Zyphra2026-05-06sparse-MoEGQA131,0728.4B760M
MiniMax M3MiniMax (with authors from Peking University, NVIDIA, Zhejiang University, HUST, Nanjing University, Hangzhou Dianzi University)2026-06-11sparse-MoEGQAnot disclosed109B6B
Ling 2.6Ling Team, Inclusion AI2026-06-13sparse-MoEhybrid262,1441Tnot disclosed
Gemma 4Google DeepMind (Gemma Team)2026-07-24densehybridnot disclosed31.25B31.25B

What varies within this category

attention variant varies — GQA, MLA, hybrid, sliding-window. block type varies — dense, sparse-MoE. trained context varies — 1000000, 131072, 200000, 262144, not disclosed. openness varies — open-weights, undisclosed. scale class varies — frontier, large, medium, not disclosed.