frontier-generalist

taxonomy axis: design_intent

Decision rule: Framed as a general-purpose foundation model; broad benchmark coverage.

Anchor: Llama 3.1

Models in this category (25)

ModelOrgDateBlockAttentionContextTotalActive
Nanbeige4.2Nanbeige LLM Lab, Boss Zhipinnot discloseddensenot disclosed262,1443B3B
GPT-2OpenAInot discloseddense1,0241.542B1.542B
MixtralMistral AI2024-01-08sparse-MoEGQA32,76847B13B
JambaAI21 Labs2024-03-28hybridGQA1M52B12B
Llama 3Llama Team, AI @ Meta2024-07-23denseGQA131,072405B405B
Llama 3.1Meta (Llama Team, AI @ Meta)2024-07-31denseGQA131,072405B405B
DeepSeek-V3DeepSeek-AI2024-12-27sparse-MoEMLA4,096671B37B
OLMo 2OLMo Team, Allen Institute for AI (Ai2)2024-12-31denseMHA4,0967B7B
xLSTM-7BNXAI (NX-AI)2025-03-17denselinear/state-space8,1926.87B6.87B
Qwen3Qwen Team2025-05-15denseGQA32,76832B32B
Qwen3Qwen Team2025-05-15sparse-MoEGQA32,768235B22B
Kimi K2Kimi Team (Moonshot AI)2025-07-28sparse-MoEMLA4,0961.043T32.6B
GLM-4.5 (ARC series)Zhipu AI & Tsinghua University (GLM-4.5 Team)2025-08-08sparse-MoEGQA131,072106B12B
GLM-4.5 (ARC series)Zhipu AI & Tsinghua University (GLM-4.5 Team)2025-08-08sparse-MoEGQA131,072355B32B
Kimi LinearKimi Team (Moonshot AI)2025-11-01sparse-MoEhybrid4,09648B3B
OLMo 3Allen Institute for AI (Olmo Team)2025-12-15densehybrid8,19232B32B
Nanbeige4.1Nanbeige LLM Lab, Boss Zhipin2026-02-13densenot disclosed262,1443B3B
GLM-5Zhipu AI & Tsinghua University (GLM-5 Team)2026-02-17sparse-MoEMLA200K744B40B
TrinityArcee AI2026-02-19sparse-MoEhybrid262,144400B13B
Qwen3.5Qwen Team2026-04-21hybridhybrid262,144not disclosednot disclosed
MiniMax-M2 seriesMiniMax2026-05-26sparse-MoEGQA192K229.9B9.8B
Nemotron 3 Ultra (Nemotron 3 family)NVIDIA2026-06-09sparse-MoEhybrid1,048,576550B55B
Ling 2.6Ling Team, Inclusion AI2026-06-13sparse-MoEhybrid262,1441Tnot disclosed
Solar Open 2Upstage (Upstage Solar Team)2026-07-22sparse-MoEhybrid1,048,576250B15B
Kimi K3Kimi Team (Moonshot AI)2026-07-27sparse-MoEhybrid1M2.78T104.2B

What varies within this category

attention variant varies — GQA, MHA, MLA, hybrid, linear/state-space, not disclosed. block type varies — dense, hybrid, sparse-MoE. trained context varies — 1000000, 1024, 1048576, 131072, 192000, 200000, 262144, 32768, 4096, 8192. openness varies — open-weights, open-weights-open-data, undisclosed. scale class varies — frontier, large, medium.