text-only

taxonomy axis: modality

Decision rule: Report describes no non-text input or output.

Anchor: Llama 3.1

Models in this category (41)

ModelOrgDateBlockAttentionContextTotalActive
AntaresCisco Foundation AInot discloseddenseGQA131,0721B1B
Nanbeige4.2Nanbeige LLM Lab, Boss Zhipinnot discloseddensenot disclosed262,1443B3B
GPT-2OpenAInot discloseddense1,0241.542B1.542B
Lagunapoolsidenot disclosedsparse-MoEhybrid131,07233.4B3B
INTELLECT-3Prime Intellect (Prime Intellect, Inc.)not disclosedsparse-MoEnot disclosed65,536106B12B
MixtralMistral AI2024-01-08sparse-MoEGQA32,76847B13B
JambaAI21 Labs2024-03-28hybridGQA1M52B12B
Phi-3Microsoft2024-04-22denseMHA4,0963.8B3.8B
Llama 3Llama Team, AI @ Meta2024-07-23denseGQA131,072405B405B
Llama 3.1Meta (Llama Team, AI @ Meta)2024-07-31denseGQA131,072405B405B
Phi-4Microsoft Research2024-12-12denseMHA4,09614B14B
DeepSeek-V3DeepSeek-AI2024-12-27sparse-MoEMLA4,096671B37B
OLMo 2OLMo Team, Allen Institute for AI (Ai2)2024-12-31denseMHA4,0967B7B
DeepSeek-R1DeepSeek-AI2025-01-22sparse-MoE671B37B
xLSTM-7BNXAI (NX-AI)2025-03-17denselinear/state-space8,1926.87B6.87B
Qwen3Qwen Team2025-05-15denseGQA32,76832B32B
Qwen3Qwen Team2025-05-15sparse-MoEGQA32,768235B22B
Kimi K2Kimi Team (Moonshot AI)2025-07-28sparse-MoEMLA4,0961.043T32.6B
gpt-ossOpenAI2025-08-05sparse-MoEhybridnot disclosed116.83B5.13B
GLM-4.5 (ARC series)Zhipu AI & Tsinghua University (GLM-4.5 Team)2025-08-08sparse-MoEGQA131,072106B12B
GLM-4.5 (ARC series)Zhipu AI & Tsinghua University (GLM-4.5 Team)2025-08-08sparse-MoEGQA131,072355B32B
Kimi LinearKimi Team (Moonshot AI)2025-11-01sparse-MoEhybrid4,09648B3B
DeepSeek-V3.2DeepSeek-AI2025-12-02sparse-MoEMLA131,072not disclosednot disclosed
OLMo 3Allen Institute for AI (Olmo Team)2025-12-15densehybrid8,19232B32B
Nemotron 3 NanoNVIDIA2025-12-23sparse-MoEGQA524,28831.6B3.2B
MiMo-V2Xiaomi (LLM-Core)2026-01-06sparse-MoEhybrid262,144309B15B
LongCat-FlashMeituan LongCat Team2026-01-29sparse-MoEnot disclosed131,07268.5B2.9B
Nanbeige4.1Nanbeige LLM Lab, Boss Zhipin2026-02-13densenot disclosed262,1443B3B
GLM-5Zhipu AI & Tsinghua University (GLM-5 Team)2026-02-17sparse-MoEMLA200K744B40B
TrinityArcee AI2026-02-19sparse-MoEhybrid262,144400B13B
Qwen3-Coder-NextQwen Team2026-02-28hybridhybrid262,14480B3B
Tiny AyaCohere Labs / Cohere2026-03-12densehybrid8,1923.35B3.35B
Nemotron 3 SuperNVIDIA2026-04-03sparse-MoEGQA1,048,576120.6B12.7B
Qwen3.5Qwen Team2026-04-21hybridhybrid262,144not disclosednot disclosed
DeepSeek-V4DeepSeek-AI2026-04-26sparse-MoEhybrid1M1.6T49B
ZAYA1Zyphra2026-05-06sparse-MoEGQA131,0728.4B760M
Mellum 2JetBrains (with Constructor University, Bremen)2026-05-29sparse-MoEhybrid131,07212B2.5B
Nemotron 3 Ultra (Nemotron 3 family)NVIDIA2026-06-09sparse-MoEhybrid1,048,576550B55B
Ling 2.6Ling Team, Inclusion AI2026-06-13sparse-MoEhybrid262,1441Tnot disclosed
VibeThinkerWeibo2026-06-15densenot disclosed65,5363B3B
Solar Open 2Upstage (Upstage Solar Team)2026-07-22sparse-MoEhybrid1,048,576250B15B

What varies within this category

attention variant varies — GQA, MHA, MLA, hybrid, linear/state-space, not disclosed. block type varies — dense, hybrid, sparse-MoE. trained context varies — 1000000, 1024, 1048576, 131072, 200000, 262144, 32768, 4096, 524288, 65536, 8192, not disclosed. openness varies — open-weights, open-weights-open-data, undisclosed. scale class varies — frontier, large, medium, not disclosed.