Index / Open-weight models on Apple Silicon
The local LLM leaderboard
According to the LLMCheck index, 91 open-weight models are scored 0–100 on capability, speed on Apple Silicon, RAM accessibility, and license openness. Every speed figure below carries a provenance mark — sourced, estimated, or community — so you can trace any number back to where it came from. Nothing here is unattributed.
Provenance key
sourced
Published figure — vendor or press review
estimated
Derived from published bandwidth model
community
Linked individual run — blog, forum or submission
Fits in
License
91 of 91 shown
| # | Model | Score↓0–100 composite | Speedtok/s decode | TTFTseconds | RAMunified min | License |
|---|---|---|---|---|---|---|
| 1 | KAT-Coder-V2.5 35B MoE · Q4_K_M · Kwaipilot |
82 |
estimated117 | — | 24 GB | Apache 2.0 |
| 2 | Qwen 3.6-35B-A3B 35B MoE · Q4_K_M · Alibaba |
81 |
community126 | — | 24 GB | Apache 2.0 |
| 3 | Nemotron 3.5 Lightning 30B MoE · Q4_K_M · NVIDIA |
79 |
estimated103 | — | 18 GB | OpenMDW |
| 4 | Gemma 4 26B-A4B 26B MoE · Q4_K_M · Google |
78 |
estimated106 | — | 18 GB | Apache 2.0 |
| 5 | Laguna XS 2.1 33B MoE · Q4_K_M · Poolside |
76 |
estimated117 | — | 24 GB | OpenMDW |
| 6 | MiMo-V2.6-Flash 309B MoE · Q4_K_M · Xiaomi |
72 |
estimated42 M5 Ultra | — | 170 GB | MIT |
| 7 | Nemotron-Cascade 2 30B MoE · Q4_K_M · NVIDIA |
71 |
estimated117 | — | 18 GB | NVIDIA Open |
| 8 | Qwen3.8-27B 27.8B · Q4_K_M · Alibaba |
71 |
estimated29 | — | 19 GB | Apache 2.0 |
| 9 | DeepSeek V4 Flash 284B MoE · Q4_K_M · DeepSeek |
70 |
community39 | community0.4 | 120 GB | MIT |
| 10 | DeepSeek V4 Flash Vision-Exp 305B MoE · Q4_K_M · DeepSeek |
70 |
estimated39 | — | 120 GB | MIT |
| 11 | Maple Preview 20B-A1B 20B MoE · Q4_K_M · DeepGrove |
70 |
sourced281 M5 Pro | — | 6 GB | MIT |
| 12 | Qwen 3.5 35B-A3B 35B MoE · Q4_K_M · Alibaba |
70 |
estimated117 | — | 24 GB | Apache 2.0 |
| 13 | Qwen 3.6-27B 27B · Q4_K_M · Alibaba |
70 |
estimated30 | — | 18 GB | Apache 2.0 |
| 14 | Qwen3-Coder-Next 80B MoE · Q4_K_M · Alibaba |
70 |
estimated84 | — | 48 GB | Apache 2.0 |
| 15 | GLM 5.2 753B MoE · Q4_K_M · Zhipu AI |
69 |
estimated22 M5 Ultra | — | 256 GB | MIT |
| 16 | GLM-5.3-Flash 320B MoE · Q4_K_M · Zhipu AI |
68 |
estimated27 | — | 128 GB | MIT |
| 17 | Nanbeige4.2-3B 3B · Q4_K_M · Nanbeige |
68 |
estimated199 | — | 2 GB | Apache 2.0 |
| 18 | GPT-oss 20B 21B MoE · Q4_K_M · OpenAI |
67 |
estimated103 | — | 13 GB | Apache 2.0 |
| 19 | Inkling-Small 276B MoE · Q4_K_M · Thinking Machines |
67 |
estimated42 | — | 96 GB | Apache 2.0 |
| 20 | Muse Glimmer 30B 30B · Q4_K_M · Meta |
67 |
sourced27 | sourced0.4 | 18 GB | Apache 2.0 |
| 21 | Qwen3.8-Flash-Next 125B MoE · Q4_K_M · Alibaba |
67 |
estimated49 | — | 120 GB | Qwen Custom |
| 22 | GLM-5.3 753B MoE · Q4_K_M · Zhipu AI |
66 |
estimated17 M5 Ultra | — | 256 GB | GLM-5.3 |
| 23 | Gemma 4 12B 12B · Q4_K_M · Google |
66 |
estimated64 | — | 9 GB | Apache 2.0 |
| 24 | Qwen 3 30B-A3B 30B MoE · Q4_K_M · Alibaba |
65 |
estimated116 | — | 18 GB | Apache 2.0 |
| 25 | Bonsai 27B 27B · Q4_K_M · Prism ML |
64 |
estimated30 | — | 6 GB | Apache 2.0 |
| 26 | DeepSeek R1 8B 8B · Q4_K_M · DeepSeek |
64 |
estimated91 | — | 6 GB | MIT |
| 27 | Gemma 4 31B 31B · Q4_K_M · Google |
64 |
estimated26 | — | 24 GB | Apache 2.0 |
| 28 | Gemma 4 E4B 4B · Q4_K_M · Google |
64 |
estimated161 | — | 3 GB | Apache 2.0 |
| 29 | Laguna S 2.1 118B MoE · Q4_K_M · Poolside |
64 |
estimated38 | — | 96 GB | OpenMDW |
| 30 | Phi-4 Mini 3.8B · Q4_K_M · Microsoft |
64 |
estimated168 | — | 3 GB | MIT |
| 31 | DeepSeek V4 Pro 1.6T MoE · Q4_K_M · DeepSeek |
63 |
— | — | 850 GB | MIT |
| 32 | DeepSeek V4.1 Flash 552B MoE · Q4_K_M · DeepSeek |
63 |
— | — | 315 GB | MIT |
| 33 | MiMo-V2.6-Pro 1.02T MoE · Q4_K_M · Xiaomi |
63 |
— | — | 581 GB | MIT |
| 34 | Apertus 1.5 8B 8B · Q4_K_M · Swiss AI |
62 |
estimated91 | — | 5 GB | Apache 2.0 |
| 35 | GLM-4.7-Flash 31B · Q4_K_M · Zhipu AI |
61 |
estimated26 | — | 18 GB | MIT |
| 36 | GLM-5.1 754B MoE · Q4_K_M · Zhipu AI |
61 |
— | — | 390 GB | MIT |
| 37 | Gemma 4 E2B 2B · Q4_K_M · Google |
61 |
estimated261 | — | 2 GB | Apache 2.0 |
| 38 | Mistral 7B 7B · Q4_K_M · Mistral |
61 |
estimated102 | — | 5 GB | Apache 2.0 |
| 39 | Qwen 3 8B 8B · Q4_K_M · Alibaba |
61 |
estimated91 | — | 6 GB | Apache 2.0 |
| 40 | Qwen 3.5 122B-A10B 122B MoE · Q4_K_M · Alibaba |
61 |
estimated47 | — | 65 GB | Apache 2.0 |
| 41 | Qwen 3.5 9B 9B · Q4_K_M · Alibaba |
61 |
estimated82 | — | 7 GB | Apache 2.0 |
| 42 | Qwen3-235B-A22B 235B MoE · Q4_K_M · Alibaba |
61 |
estimated15 | — | 128 GB | Apache 2.0 |
| 43 | Kimi K2.6 1T MoE · Q4_K_M · Moonshot AI |
60 |
— | — | 600 GB | Modified MIT |
| 44 | LFM2.5-2.6B 2.6B · Q4_K_M · Liquid AI |
60 |
sourced220 | sourced0.1 | 2 GB | LFM Open |
| 45 | Ministral 8B 8B · Q4_K_M · Mistral |
60 |
estimated91 | — | 6 GB | Apache 2.0 |
| 46 | Qwen 3.5 4B 4B · Q4_K_M · Alibaba |
60 |
estimated161 | — | 3 GB | Apache 2.0 |
| 47 | GPT-oss 120B 117B MoE · Q4_K_M · OpenAI |
59 |
estimated58 | — | 62 GB | Apache 2.0 |
| 48 | Kimi K2.5 1T MoE · Q4_K_M · Moonshot AI |
59 |
— | — | 600 GB | Modified MIT |
| 49 | Mistral Small 4 119B MoE · Q4_K_M · Mistral |
59 |
estimated46 | — | 64 GB | Apache 2.0 |
| 50 | Qwen 3 4B 4B · Q4_K_M · Alibaba |
59 |
estimated161 | — | 3 GB | Apache 2.0 |
| 51 | DeepSeek V3.2-Speciale 685B MoE · Q4_K_M · DeepSeek |
58 |
— | — | 360 GB | MIT |
| 52 | Inkling 975B MoE · Q4_K_M · Thinking Machines |
58 |
— | — | 550 GB | Apache 2.0 |
| 53 | Kimi K3 2.8T MoE · Q4_K_M · Moonshot AI |
58 |
— | — | 1560 GB | Moonshot Custom |
| 54 | Qwen3.8-2.4T-A95B 2.4T MoE · Q4_K_M · Alibaba |
58 |
— | — | 1310 GB | Qwen Custom |
| 55 | SmolLM3 3B 3B · Q4_K_M · HuggingFace |
58 |
estimated199 | — | 2 GB | Apache 2.0 |
| 56 | Gemma 3 4B 4B · Q4_K_M · Google |
56 |
estimated161 | — | 3 GB | Gemma |
| 57 | DeepSeek V3.2 685B MoE · Q4_K_M · DeepSeek |
55 |
— | — | 360 GB | MIT |
| 58 | GLM-4.5-Air 106B MoE · Q4_K_M · Zhipu AI |
55 |
estimated27 | — | 56 GB | MIT |
| 59 | Llama 3.1 8B 8B · Q4_K_M · Meta |
55 |
estimated91 | — | 5 GB | Meta Custom |
| 60 | Phi-4 14B 14B · Q4_K_M · Microsoft |
55 |
estimated55 | — | 10 GB | MIT |
| 61 | Qwen 3 14B 14B · Q4_K_M · Alibaba |
54 |
estimated55 | — | 10 GB | Apache 2.0 |
| 62 | Mistral Small 3.2 24B 24B · Q4_K_M · Mistral |
53 |
estimated33 | — | 14 GB | Apache 2.0 |
| 63 | Devstral Small 24B 24B · Q4_K_M · Mistral |
52 |
estimated33 | — | 14 GB | Apache 2.0 |
| 64 | Hunyuan Hy3 295B MoE · Q4_K_M · Tencent |
52 |
— | — | 160 GB | Apache 2.0 |
| 65 | MiniMax M2.5 230B MoE · Q4_K_M · MiniMax |
52 |
estimated57 M5 Ultra | — | 130 GB | Modified MIT |
| 66 | Ministral 3 14B 14B · Q4_K_M · Mistral |
52 |
estimated55 | — | 10 GB | Apache 2.0 |
| 67 | Qwen 2.5 14B 14B · Q4_K_M · Alibaba |
52 |
estimated55 | — | 10 GB | Apache 2.0 |
| 68 | Gemma 3 12B 12B · Q4_K_M · Google |
51 |
estimated64 | — | 9 GB | Gemma |
| 69 | Ling-3.0 Flash 124B MoE · Q4_K_M · Ant Group |
51 |
— | — | 96 GB | MIT |
| 70 | Solar Open 2 250B 250B MoE · Q4_K_M · Upstage |
51 |
— | — | 160 GB | Solar License |
| 71 | Step-3.5-Flash 196B MoE · Q4_K_M · StepFun |
51 |
estimated29 | — | 120 GB | Apache 2.0 |
| 72 | DeepSeek R1 671B MoE · Q4_K_M · DeepSeek |
50 |
— | — | 350 GB | MIT |
| 73 | DeepSeek R1 32B 32B · Q4_K_M · DeepSeek |
50 |
estimated25 | — | 22 GB | MIT |
| 74 | DeepSeek V3 685B MoE · Q4_K_M · DeepSeek |
50 |
— | — | 360 GB | MIT |
| 75 | QwQ 32B 32B · Q4_K_M · Alibaba |
50 |
estimated25 | — | 22 GB | Apache 2.0 |
| 76 | DeepSeek R1 70B 70B · Q4_K_M · DeepSeek |
49 |
estimated12 | — | 44 GB | MIT |
| 77 | Qwen 3 32B 32B · Q4_K_M · Alibaba |
49 |
estimated25 | — | 22 GB | Apache 2.0 |
| 78 | Qwen 3.5 397B-A17B 397B MoE · Q4_K_M · Alibaba |
49 |
— | — | 210 GB | Apache 2.0 |
| 79 | GLM-4.7 355B · Q4_K_M · Zhipu AI |
47 |
— | — | 180 GB | MIT |
| 80 | Mistral Large 3 675B MoE · Q4_K_M · Mistral |
47 |
— | — | 355 GB | Apache 2.0 |
| 81 | Qwen 3.5 27B 27B · Q4_K_M · Alibaba |
47 |
estimated30 | — | 18 GB | Apache 2.0 |
| 82 | Apertus 1.5 70B 70B · Q4_K_M · Swiss AI |
46 |
estimated12 | — | 44 GB | Apache 2.0 |
| 83 | Gemma 3 27B 27B · Q4_K_M · Google |
46 |
estimated30 | — | 18 GB | Gemma |
| 84 | Llama 4 Scout 109B MoE · Q4_K_M · Meta |
45 |
estimated19 | — | 58 GB | Meta Custom |
| 85 | MiMo-V2-Flash 309B MoE · Q4_K_M · Xiaomi |
45 |
— | — | 165 GB | MIT |
| 86 | Qwen 2.5 72B 72B · Q4_K_M · Alibaba |
45 |
estimated12 | — | 46 GB | Apache 2.0 |
| 87 | Llama 4 Maverick 400B MoE · Q4_K_M · Meta |
44 |
— | — | 210 GB | Meta Custom |
| 88 | Llama 3.1 405B 405B · Q4_K_M · Meta |
43 |
estimated4 M5 Ultra | — | 240 GB | Meta Custom |
| 89 | Mixtral 8x22B 141B MoE · Q4_K_M · Mistral |
43 |
estimated15 | — | 88 GB | Apache 2.0 |
| 90 | Hermes 4 70B 70B · Q4_K_M · Nous Research |
42 |
estimated12 | — | 38 GB | Meta Custom |
| 91 | Llama 3.3 70B 70B · Q4_K_M · Meta |
41 |
estimated12 | — | 44 GB | Meta Custom |
82
#1
81
#2
79
#3
Nemotron 3.5 Lightning
30B MoE · NVIDIA · OpenMDW
tok/s
estimated103
TTFT
—
Min RAM
18 GB
78
#4
76
#5
Laguna XS 2.1
33B MoE · Poolside · OpenMDW
tok/s
estimated117
TTFT
—
Min RAM
24 GB
72
#6
MiMo-V2.6-Flash
309B MoE · Xiaomi · MIT
tok/s
estimated42 M5 Ultra
TTFT
—
Min RAM
170 GB
71
#7
Nemotron-Cascade 2
30B MoE · NVIDIA · NVIDIA Open
tok/s
estimated117
TTFT
—
Min RAM
18 GB
71
#8
70
#9
70
#10
70
#11
Maple Preview 20B-A1B
20B MoE · DeepGrove · MIT
tok/s
sourced281 M5 Pro
TTFT
—
Min RAM
6 GB
70
#12
Qwen 3.5 35B-A3B
35B MoE · Alibaba · Apache 2.0
tok/s
estimated117
TTFT
—
Min RAM
24 GB
70
#13
70
#14
69
#15
GLM 5.2
753B MoE · Zhipu AI · MIT
tok/s
estimated22 M5 Ultra
TTFT
—
Min RAM
256 GB
68
#16
68
#17
Nanbeige4.2-3B
3B · Nanbeige · Apache 2.0
tok/s
estimated199
TTFT
—
Min RAM
2 GB
67
#18
67
#19
Inkling-Small
276B MoE · Thinking Machines · Apache 2.0
tok/s
estimated42
TTFT
—
Min RAM
96 GB
67
#20
67
#21
66
#22
GLM-5.3
753B MoE · Zhipu AI · GLM-5.3
tok/s
estimated17 M5 Ultra
TTFT
—
Min RAM
256 GB
66
#23
65
#24
Qwen 3 30B-A3B
30B MoE · Alibaba · Apache 2.0
tok/s
estimated116
TTFT
—
Min RAM
18 GB
64
#25
Bonsai 27B
27B · Prism ML · Apache 2.0
tok/s
estimated30
TTFT
—
Min RAM
6 GB
64
#26
DeepSeek R1 8B
8B · DeepSeek · MIT
tok/s
estimated91
TTFT
—
Min RAM
6 GB
64
#27
64
#28
64
#29
Laguna S 2.1
118B MoE · Poolside · OpenMDW
tok/s
estimated38
TTFT
—
Min RAM
96 GB
64
#30
Phi-4 Mini
3.8B · Microsoft · MIT
tok/s
estimated168
TTFT
—
Min RAM
3 GB
63
#31
DeepSeek V4 Pro
1.6T MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
850 GB
63
#32
DeepSeek V4.1 Flash
552B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
315 GB
63
#33
MiMo-V2.6-Pro
1.02T MoE · Xiaomi · MIT
tok/s
—
TTFT
—
Min RAM
581 GB
62
#34
Apertus 1.5 8B
8B · Swiss AI · Apache 2.0
tok/s
estimated91
TTFT
—
Min RAM
5 GB
61
#35
61
#36
GLM-5.1
754B MoE · Zhipu AI · MIT
tok/s
—
TTFT
—
Min RAM
390 GB
61
#37
61
#38
Mistral 7B
7B · Mistral · Apache 2.0
tok/s
estimated102
TTFT
—
Min RAM
5 GB
61
#39
61
#40
61
#41
61
#42
Qwen3-235B-A22B
235B MoE · Alibaba · Apache 2.0
tok/s
estimated15
TTFT
—
Min RAM
128 GB
60
#43
Kimi K2.6
1T MoE · Moonshot AI · Modified MIT
tok/s
—
TTFT
—
Min RAM
600 GB
60
#44
LFM2.5-2.6B
2.6B · Liquid AI · LFM Open
tok/s
sourced220
TTFT
sourced0.1
Min RAM
2 GB
60
#45
Ministral 8B
8B · Mistral · Apache 2.0
tok/s
estimated91
TTFT
—
Min RAM
6 GB
60
#46
59
#47
59
#48
Kimi K2.5
1T MoE · Moonshot AI · Modified MIT
tok/s
—
TTFT
—
Min RAM
600 GB
59
#49
Mistral Small 4
119B MoE · Mistral · Apache 2.0
tok/s
estimated46
TTFT
—
Min RAM
64 GB
59
#50
Qwen 3 4B
4B · Alibaba · Apache 2.0
tok/s
estimated161
TTFT
—
Min RAM
3 GB
58
#51
DeepSeek V3.2-Speciale
685B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
360 GB
58
#52
Inkling
975B MoE · Thinking Machines · Apache 2.0
tok/s
—
TTFT
—
Min RAM
550 GB
58
#53
Kimi K3
2.8T MoE · Moonshot AI · Moonshot Custom
tok/s
—
TTFT
—
Min RAM
1560 GB
58
#54
Qwen3.8-2.4T-A95B
2.4T MoE · Alibaba · Qwen Custom
tok/s
—
TTFT
—
Min RAM
1310 GB
58
#55
SmolLM3 3B
3B · HuggingFace · Apache 2.0
tok/s
estimated199
TTFT
—
Min RAM
2 GB
56
#56
Gemma 3 4B
4B · Google · Gemma
tok/s
estimated161
TTFT
—
Min RAM
3 GB
55
#57
DeepSeek V3.2
685B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
360 GB
55
#58
GLM-4.5-Air
106B MoE · Zhipu AI · MIT
tok/s
estimated27
TTFT
—
Min RAM
56 GB
55
#59
55
#60
54
#61
53
#62
Mistral Small 3.2 24B
24B · Mistral · Apache 2.0
tok/s
estimated33
TTFT
—
Min RAM
14 GB
52
#63
Devstral Small 24B
24B · Mistral · Apache 2.0
tok/s
estimated33
TTFT
—
Min RAM
14 GB
52
#64
Hunyuan Hy3
295B MoE · Tencent · Apache 2.0
tok/s
—
TTFT
—
Min RAM
160 GB
52
#65
MiniMax M2.5
230B MoE · MiniMax · Modified MIT
tok/s
estimated57 M5 Ultra
TTFT
—
Min RAM
130 GB
52
#66
Ministral 3 14B
14B · Mistral · Apache 2.0
tok/s
estimated55
TTFT
—
Min RAM
10 GB
52
#67
Qwen 2.5 14B
14B · Alibaba · Apache 2.0
tok/s
estimated55
TTFT
—
Min RAM
10 GB
51
#68
51
#69
Ling-3.0 Flash
124B MoE · Ant Group · MIT
tok/s
—
TTFT
—
Min RAM
96 GB
51
#70
Solar Open 2 250B
250B MoE · Upstage · Solar License
tok/s
—
TTFT
—
Min RAM
160 GB
51
#71
Step-3.5-Flash
196B MoE · StepFun · Apache 2.0
tok/s
estimated29
TTFT
—
Min RAM
120 GB
50
#72
DeepSeek R1
671B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
350 GB
50
#73
DeepSeek R1 32B
32B · DeepSeek · MIT
tok/s
estimated25
TTFT
—
Min RAM
22 GB
50
#74
DeepSeek V3
685B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
360 GB
50
#75
QwQ 32B
32B · Alibaba · Apache 2.0
tok/s
estimated25
TTFT
—
Min RAM
22 GB
49
#76
49
#77
49
#78
Qwen 3.5 397B-A17B
397B MoE · Alibaba · Apache 2.0
tok/s
—
TTFT
—
Min RAM
210 GB
47
#79
GLM-4.7
355B · Zhipu AI · MIT
tok/s
—
TTFT
—
Min RAM
180 GB
47
#80
Mistral Large 3
675B MoE · Mistral · Apache 2.0
tok/s
—
TTFT
—
Min RAM
355 GB
47
#81
Qwen 3.5 27B
27B · Alibaba · Apache 2.0
tok/s
estimated30
TTFT
—
Min RAM
18 GB
46
#82
Apertus 1.5 70B
70B · Swiss AI · Apache 2.0
tok/s
estimated12
TTFT
—
Min RAM
44 GB
46
#83
45
#84
Llama 4 Scout
109B MoE · Meta · Meta Custom
tok/s
estimated19
TTFT
—
Min RAM
58 GB
45
#85
MiMo-V2-Flash
309B MoE · Xiaomi · MIT
tok/s
—
TTFT
—
Min RAM
165 GB
45
#86
Qwen 2.5 72B
72B · Alibaba · Apache 2.0
tok/s
estimated12
TTFT
—
Min RAM
46 GB
44
#87
Llama 4 Maverick
400B MoE · Meta · Meta Custom
tok/s
—
TTFT
—
Min RAM
210 GB
43
#88
Llama 3.1 405B
405B · Meta · Meta Custom
tok/s
estimated4 M5 Ultra
TTFT
—
Min RAM
240 GB
43
#89
Mixtral 8x22B
141B MoE · Mistral · Apache 2.0
tok/s
estimated15
TTFT
—
Min RAM
88 GB
42
#90
Hermes 4 70B
70B · Nous Research · Meta Custom
tok/s
estimated12
TTFT
—
Min RAM
38 GB
41
#91
Llama 3.3 70B
70B · Meta · Meta Custom
tok/s
estimated12
TTFT
—
Min RAM
44 GB
Speed figures are single-stream decode at 4-bit quantization on an M5 Max — or on the Mac Studio M5 Ultra, tagged, for models that need more than 128 GB. The mark says whether a figure is estimated or measured. Method & math →
1–91 of 91
Own the Mac already? See which of these 91 models fit your exact chip and unified memory →
Still choosing hardware? Three questions and the Mac Advisor names the config → · Every Mac compared for local AI →