medium

taxonomy axis: scale_class

Decision rule: 1B ≤ p < 10B

Anchor: Llama 3.1 8B

Models in this category (12)

ModelOrgDateBlockAttentionContextTotalActive
AntaresCisco Foundation AInot discloseddenseGQA131,0721B1B
Nanbeige4.2Nanbeige LLM Lab, Boss Zhipinnot discloseddensenot disclosed262,1443B3B
GPT-2OpenAInot discloseddense1,0241.542B1.542B
Lagunapoolsidenot disclosedsparse-MoEhybrid131,07233.4B3B
Phi-3Microsoft2024-04-22denseMHA4,0963.8B3.8B
Phi-4Microsoft Research2024-12-12denseMHA4,09614B14B
OLMo 2OLMo Team, Allen Institute for AI (Ai2)2024-12-31denseMHA4,0967B7B
xLSTM-7BNXAI (NX-AI)2025-03-17denselinear/state-space8,1926.87B6.87B
Nanbeige4.1Nanbeige LLM Lab, Boss Zhipin2026-02-13densenot disclosed262,1443B3B
Tiny AyaCohere Labs / Cohere2026-03-12densehybrid8,1923.35B3.35B
ZAYA1Zyphra2026-05-06sparse-MoEGQA131,0728.4B760M
VibeThinkerWeibo2026-06-15densenot disclosed65,5363B3B

What varies within this category

attention variant varies — GQA, MHA, hybrid, linear/state-space, not disclosed. block type varies — dense, sparse-MoE. trained context varies — 1024, 131072, 262144, 4096, 65536, 8192. openness varies — open-weights, open-weights-open-data, undisclosed.