multimodal

taxonomy axis: modality

Decision rule: Report describes vision/audio/other modalities in or out.

Anchor: GPT-4V (if its report is ever in the atlas — else first multimodal report ingested)

Models in this category (5)

ModelOrgDateBlockAttentionContextTotalActive
Gemma 3Google DeepMind (Gemma Team)2025-03-25densesliding-window131,07227B27B
MiniMax-M2 seriesMiniMax2026-05-26sparse-MoEGQA192K229.9B9.8B
MiniMax M3MiniMax (with authors from Peking University, NVIDIA, Zhejiang University, HUST, Nanjing University, Hangzhou Dianzi University)2026-06-11sparse-MoEGQAnot disclosed109B6B
Gemma 4Google DeepMind (Gemma Team)2026-07-24densehybridnot disclosed31.25B31.25B
Kimi K3Kimi Team (Moonshot AI)2026-07-27sparse-MoEhybrid1M2.78T104.2B

What varies within this category

attention variant varies — GQA, hybrid, sliding-window. block type varies — dense, sparse-MoE. trained context varies — 1000000, 131072, 192000, not disclosed. scale class varies — frontier, large.