SSM
taxonomy axis: sequence_mixing
Decision rule: State-space layers (Mamba-style) do the mixing; no attention in the block.
Anchor: Mamba
Models in this category (2)
| Model | Org | Date | Block | Attention | Context | Total | Active |
|---|---|---|---|---|---|---|---|
| xLSTM-7B | NXAI (NX-AI) | 2025-03-17 | dense | linear/state-space | 8,192 | 6.87B | 6.87B |
| Nemotron 3 Nano | NVIDIA | 2025-12-23 | sparse-MoE | GQA | 524,288 | 31.6B | 3.2B |
What varies within this category
attention variant varies — GQA, linear/state-space. block type varies — dense, sparse-MoE. trained context varies — 524288, 8192. openness varies — open-weights, open-weights-open-data. scale class varies — large, medium.