hybrid

taxonomy axis: sequence_mixing

Decision rule: Mixed attention + SSM/linear layers (or attention variants in a deliberate per-layer pattern).

Anchor: Jamba (1 attention : 7 Mamba layers)

Models in this category (14)

ModelOrgDateBlockAttentionContextTotalActive
Lagunapoolsidenot disclosedsparse-MoEhybrid131,07233.4B3B
JambaAI21 Labs2024-03-28hybridGQA1M52B12B
gpt-ossOpenAI2025-08-05sparse-MoEhybridnot disclosed116.83B5.13B
Kimi LinearKimi Team (Moonshot AI)2025-11-01sparse-MoEhybrid4,09648B3B
OLMo 3Allen Institute for AI (Olmo Team)2025-12-15densehybrid8,19232B32B
TrinityArcee AI2026-02-19sparse-MoEhybrid262,144400B13B
Qwen3-Coder-NextQwen Team2026-02-28hybridhybrid262,14480B3B
Tiny AyaCohere Labs / Cohere2026-03-12densehybrid8,1923.35B3.35B
Nemotron 3 SuperNVIDIA2026-04-03sparse-MoEGQA1,048,576120.6B12.7B
Qwen3.5Qwen Team2026-04-21hybridhybrid262,144not disclosednot disclosed
Mellum 2JetBrains (with Constructor University, Bremen)2026-05-29sparse-MoEhybrid131,07212B2.5B
Nemotron 3 Ultra (Nemotron 3 family)NVIDIA2026-06-09sparse-MoEhybrid1,048,576550B55B
Solar Open 2Upstage (Upstage Solar Team)2026-07-22sparse-MoEhybrid1,048,576250B15B
Kimi K3Kimi Team (Moonshot AI)2026-07-27sparse-MoEhybrid1M2.78T104.2B

What varies within this category

attention variant varies — GQA, hybrid. block type varies — dense, hybrid, sparse-MoE. trained context varies — 1000000, 1048576, 131072, 262144, 4096, 8192, not disclosed. openness varies — open-weights, open-weights-open-data, undisclosed. scale class varies — frontier, large, medium.