open-weights

taxonomy axis: openness

Decision rule: Weights released; data not released.

Anchor: Llama 3 (report states weights release; data composition disclosed but not released)

Models in this category (34)

ModelOrgDateBlockAttentionContextTotalActive
AntaresCisco Foundation AInot discloseddenseGQA131,0721B1B
Nanbeige4.2Nanbeige LLM Lab, Boss Zhipinnot discloseddensenot disclosed262,1443B3B
Lagunapoolsidenot disclosedsparse-MoEhybrid131,07233.4B3B
MixtralMistral AI2024-01-08sparse-MoEGQA32,76847B13B
JambaAI21 Labs2024-03-28hybridGQA1M52B12B
Llama 3Llama Team, AI @ Meta2024-07-23denseGQA131,072405B405B
Llama 3.1Meta (Llama Team, AI @ Meta)2024-07-31denseGQA131,072405B405B
DeepSeek-V3DeepSeek-AI2024-12-27sparse-MoEMLA4,096671B37B
DeepSeek-R1DeepSeek-AI2025-01-22sparse-MoE671B37B
xLSTM-7BNXAI (NX-AI)2025-03-17denselinear/state-space8,1926.87B6.87B
Gemma 3Google DeepMind (Gemma Team)2025-03-25densesliding-window131,07227B27B
Qwen3Qwen Team2025-05-15denseGQA32,76832B32B
Qwen3Qwen Team2025-05-15sparse-MoEGQA32,768235B22B
Kimi K2Kimi Team (Moonshot AI)2025-07-28sparse-MoEMLA4,0961.043T32.6B
gpt-ossOpenAI2025-08-05sparse-MoEhybridnot disclosed116.83B5.13B
GLM-4.5 (ARC series)Zhipu AI & Tsinghua University (GLM-4.5 Team)2025-08-08sparse-MoEGQA131,072106B12B
GLM-4.5 (ARC series)Zhipu AI & Tsinghua University (GLM-4.5 Team)2025-08-08sparse-MoEGQA131,072355B32B
Kimi LinearKimi Team (Moonshot AI)2025-11-01sparse-MoEhybrid4,09648B3B
DeepSeek-V3.2DeepSeek-AI2025-12-02sparse-MoEMLA131,072not disclosednot disclosed
MiMo-V2Xiaomi (LLM-Core)2026-01-06sparse-MoEhybrid262,144309B15B
LongCat-FlashMeituan LongCat Team2026-01-29sparse-MoEnot disclosed131,07268.5B2.9B
Nanbeige4.1Nanbeige LLM Lab, Boss Zhipin2026-02-13densenot disclosed262,1443B3B
GLM-5Zhipu AI & Tsinghua University (GLM-5 Team)2026-02-17sparse-MoEMLA200K744B40B
TrinityArcee AI2026-02-19sparse-MoEhybrid262,144400B13B
Qwen3-Coder-NextQwen Team2026-02-28hybridhybrid262,14480B3B
Tiny AyaCohere Labs / Cohere2026-03-12densehybrid8,1923.35B3.35B
DeepSeek-V4DeepSeek-AI2026-04-26sparse-MoEhybrid1M1.6T49B
MiniMax-M2 seriesMiniMax2026-05-26sparse-MoEGQA192K229.9B9.8B
Mellum 2JetBrains (with Constructor University, Bremen)2026-05-29sparse-MoEhybrid131,07212B2.5B
MiniMax M3MiniMax (with authors from Peking University, NVIDIA, Zhejiang University, HUST, Nanjing University, Hangzhou Dianzi University)2026-06-11sparse-MoEGQAnot disclosed109B6B
Ling 2.6Ling Team, Inclusion AI2026-06-13sparse-MoEhybrid262,1441Tnot disclosed
Solar Open 2Upstage (Upstage Solar Team)2026-07-22sparse-MoEhybrid1,048,576250B15B
Gemma 4Google DeepMind (Gemma Team)2026-07-24densehybridnot disclosed31.25B31.25B
Kimi K3Kimi Team (Moonshot AI)2026-07-27sparse-MoEhybrid1M2.78T104.2B

What varies within this category

attention variant varies — GQA, MLA, hybrid, linear/state-space, not disclosed, sliding-window. block type varies — dense, hybrid, sparse-MoE. trained context varies — 1000000, 1048576, 131072, 192000, 200000, 262144, 32768, 4096, 8192, not disclosed. scale class varies — frontier, large, medium, not disclosed.