dense

taxonomy axis: compute_structure

Decision rule: Every transformer layer's FFN is fully active per token; no routing anywhere.

Anchor: Llama 3 (report describes no MoE; absence rule → inferred)

Models in this category (16)

ModelOrgDateBlockAttentionContextTotalActive
AntaresCisco Foundation AInot discloseddenseGQA131,0721B1B
Nanbeige4.2Nanbeige LLM Lab, Boss Zhipinnot discloseddensenot disclosed262,1443B3B
GPT-2OpenAInot discloseddense1,0241.542B1.542B
Phi-3Microsoft2024-04-22denseMHA4,0963.8B3.8B
Llama 3Llama Team, AI @ Meta2024-07-23denseGQA131,072405B405B
Llama 3.1Meta (Llama Team, AI @ Meta)2024-07-31denseGQA131,072405B405B
Phi-4Microsoft Research2024-12-12denseMHA4,09614B14B
OLMo 2OLMo Team, Allen Institute for AI (Ai2)2024-12-31denseMHA4,0967B7B
xLSTM-7BNXAI (NX-AI)2025-03-17denselinear/state-space8,1926.87B6.87B
Gemma 3Google DeepMind (Gemma Team)2025-03-25densesliding-window131,07227B27B
Qwen3Qwen Team2025-05-15denseGQA32,76832B32B
OLMo 3Allen Institute for AI (Olmo Team)2025-12-15densehybrid8,19232B32B
Nanbeige4.1Nanbeige LLM Lab, Boss Zhipin2026-02-13densenot disclosed262,1443B3B
Tiny AyaCohere Labs / Cohere2026-03-12densehybrid8,1923.35B3.35B
VibeThinkerWeibo2026-06-15densenot disclosed65,5363B3B
Gemma 4Google DeepMind (Gemma Team)2026-07-24densehybridnot disclosed31.25B31.25B

What varies within this category

attention variant varies — GQA, MHA, hybrid, linear/state-space, not disclosed, sliding-window. trained context varies — 1024, 131072, 262144, 32768, 4096, 65536, 8192, not disclosed. openness varies — open-weights, open-weights-open-data, undisclosed. scale class varies — frontier, large, medium.