Index/Leaderboard
Index / Open-weight models on Apple Silicon

The local LLM leaderboard

According to the LLMCheck index, 91 open-weight models are scored 0–100 on capability, speed on Apple Silicon, RAM accessibility, and license openness. Every speed figure below carries a provenance mark — sourced, estimated, or community — so you can trace any number back to where it came from. Nothing here is unattributed.

Provenance key
sourced
Published figure — vendor or press review
estimated
community
Linked individual run — blog, forum or submission
Fits in License 91 of 91 shown
# Model Score↓0–100 composite Speedtok/s decode TTFTseconds RAMunified min License
1 KAT-Coder-V2.5
35B MoE · Q4_K_M · Kwaipilot
82
estimated117 — 24 GB Apache 2.0
2 Qwen 3.6-35B-A3B
35B MoE · Q4_K_M · Alibaba
81
community126 — 24 GB Apache 2.0
3 Nemotron 3.5 Lightning
30B MoE · Q4_K_M · NVIDIA
79
estimated103 — 18 GB OpenMDW
4 Gemma 4 26B-A4B
26B MoE · Q4_K_M · Google
78
estimated106 — 18 GB Apache 2.0
5 Laguna XS 2.1
33B MoE · Q4_K_M · Poolside
76
estimated117 — 24 GB OpenMDW
6 MiMo-V2.6-Flash
309B MoE · Q4_K_M · Xiaomi
72
estimated42 M5 Ultra — 170 GB MIT
7 Nemotron-Cascade 2
30B MoE · Q4_K_M · NVIDIA
71
estimated117 — 18 GB NVIDIA Open
8 Qwen3.8-27B
27.8B · Q4_K_M · Alibaba
71
estimated29 — 19 GB Apache 2.0
9 DeepSeek V4 Flash
284B MoE · Q4_K_M · DeepSeek
70
community39 community0.4 120 GB MIT
10 DeepSeek V4 Flash Vision-Exp
305B MoE · Q4_K_M · DeepSeek
70
estimated39 — 120 GB MIT
11 Maple Preview 20B-A1B
20B MoE · Q4_K_M · DeepGrove
70
sourced281 M5 Pro — 6 GB MIT
12 Qwen 3.5 35B-A3B
35B MoE · Q4_K_M · Alibaba
70
estimated117 — 24 GB Apache 2.0
13 Qwen 3.6-27B
27B · Q4_K_M · Alibaba
70
estimated30 — 18 GB Apache 2.0
14 Qwen3-Coder-Next
80B MoE · Q4_K_M · Alibaba
70
estimated84 — 48 GB Apache 2.0
15 GLM 5.2
753B MoE · Q4_K_M · Zhipu AI
69
estimated22 M5 Ultra — 256 GB MIT
16 GLM-5.3-Flash
320B MoE · Q4_K_M · Zhipu AI
68
estimated27 — 128 GB MIT
17 Nanbeige4.2-3B
3B · Q4_K_M · Nanbeige
68
estimated199 — 2 GB Apache 2.0
18 GPT-oss 20B
21B MoE · Q4_K_M · OpenAI
67
estimated103 — 13 GB Apache 2.0
19 Inkling-Small
276B MoE · Q4_K_M · Thinking Machines
67
estimated42 — 96 GB Apache 2.0
20 Muse Glimmer 30B
30B · Q4_K_M · Meta
67
sourced27 sourced0.4 18 GB Apache 2.0
21 Qwen3.8-Flash-Next
125B MoE · Q4_K_M · Alibaba
67
estimated49 — 120 GB Qwen Custom
22 GLM-5.3
753B MoE · Q4_K_M · Zhipu AI
66
estimated17 M5 Ultra — 256 GB GLM-5.3
23 Gemma 4 12B
12B · Q4_K_M · Google
66
estimated64 — 9 GB Apache 2.0
24 Qwen 3 30B-A3B
30B MoE · Q4_K_M · Alibaba
65
estimated116 — 18 GB Apache 2.0
25 Bonsai 27B
27B · Q4_K_M · Prism ML
64
estimated30 — 6 GB Apache 2.0
26 DeepSeek R1 8B
8B · Q4_K_M · DeepSeek
64
estimated91 — 6 GB MIT
27 Gemma 4 31B
31B · Q4_K_M · Google
64
estimated26 — 24 GB Apache 2.0
28 Gemma 4 E4B
4B · Q4_K_M · Google
64
estimated161 — 3 GB Apache 2.0
29 Laguna S 2.1
118B MoE · Q4_K_M · Poolside
64
estimated38 — 96 GB OpenMDW
30 Phi-4 Mini
3.8B · Q4_K_M · Microsoft
64
estimated168 — 3 GB MIT
31 DeepSeek V4 Pro
1.6T MoE · Q4_K_M · DeepSeek
63
— — 850 GB MIT
32 DeepSeek V4.1 Flash
552B MoE · Q4_K_M · DeepSeek
63
— — 315 GB MIT
33 MiMo-V2.6-Pro
1.02T MoE · Q4_K_M · Xiaomi
63
— — 581 GB MIT
34 Apertus 1.5 8B
8B · Q4_K_M · Swiss AI
62
estimated91 — 5 GB Apache 2.0
35 GLM-4.7-Flash
31B · Q4_K_M · Zhipu AI
61
estimated26 — 18 GB MIT
36 GLM-5.1
754B MoE · Q4_K_M · Zhipu AI
61
— — 390 GB MIT
37 Gemma 4 E2B
2B · Q4_K_M · Google
61
estimated261 — 2 GB Apache 2.0
38 Mistral 7B
7B · Q4_K_M · Mistral
61
estimated102 — 5 GB Apache 2.0
39 Qwen 3 8B
8B · Q4_K_M · Alibaba
61
estimated91 — 6 GB Apache 2.0
40 Qwen 3.5 122B-A10B
122B MoE · Q4_K_M · Alibaba
61
estimated47 — 65 GB Apache 2.0
41 Qwen 3.5 9B
9B · Q4_K_M · Alibaba
61
estimated82 — 7 GB Apache 2.0
42 Qwen3-235B-A22B
235B MoE · Q4_K_M · Alibaba
61
estimated15 — 128 GB Apache 2.0
43 Kimi K2.6
1T MoE · Q4_K_M · Moonshot AI
60
— — 600 GB Modified MIT
44 LFM2.5-2.6B
2.6B · Q4_K_M · Liquid AI
60
sourced220 sourced0.1 2 GB LFM Open
45 Ministral 8B
8B · Q4_K_M · Mistral
60
estimated91 — 6 GB Apache 2.0
46 Qwen 3.5 4B
4B · Q4_K_M · Alibaba
60
estimated161 — 3 GB Apache 2.0
47 GPT-oss 120B
117B MoE · Q4_K_M · OpenAI
59
estimated58 — 62 GB Apache 2.0
48 Kimi K2.5
1T MoE · Q4_K_M · Moonshot AI
59
— — 600 GB Modified MIT
49 Mistral Small 4
119B MoE · Q4_K_M · Mistral
59
estimated46 — 64 GB Apache 2.0
50 Qwen 3 4B
4B · Q4_K_M · Alibaba
59
estimated161 — 3 GB Apache 2.0
51 DeepSeek V3.2-Speciale
685B MoE · Q4_K_M · DeepSeek
58
— — 360 GB MIT
52 Inkling
975B MoE · Q4_K_M · Thinking Machines
58
— — 550 GB Apache 2.0
53 Kimi K3
2.8T MoE · Q4_K_M · Moonshot AI
58
— — 1560 GB Moonshot Custom
54 Qwen3.8-2.4T-A95B
2.4T MoE · Q4_K_M · Alibaba
58
— — 1310 GB Qwen Custom
55 SmolLM3 3B
3B · Q4_K_M · HuggingFace
58
estimated199 — 2 GB Apache 2.0
56 Gemma 3 4B
4B · Q4_K_M · Google
56
estimated161 — 3 GB Gemma
57 DeepSeek V3.2
685B MoE · Q4_K_M · DeepSeek
55
— — 360 GB MIT
58 GLM-4.5-Air
106B MoE · Q4_K_M · Zhipu AI
55
estimated27 — 56 GB MIT
59 Llama 3.1 8B
8B · Q4_K_M · Meta
55
estimated91 — 5 GB Meta Custom
60 Phi-4 14B
14B · Q4_K_M · Microsoft
55
estimated55 — 10 GB MIT
61 Qwen 3 14B
14B · Q4_K_M · Alibaba
54
estimated55 — 10 GB Apache 2.0
62 Mistral Small 3.2 24B
24B · Q4_K_M · Mistral
53
estimated33 — 14 GB Apache 2.0
63 Devstral Small 24B
24B · Q4_K_M · Mistral
52
estimated33 — 14 GB Apache 2.0
64 Hunyuan Hy3
295B MoE · Q4_K_M · Tencent
52
— — 160 GB Apache 2.0
65 MiniMax M2.5
230B MoE · Q4_K_M · MiniMax
52
estimated57 M5 Ultra — 130 GB Modified MIT
66 Ministral 3 14B
14B · Q4_K_M · Mistral
52
estimated55 — 10 GB Apache 2.0
67 Qwen 2.5 14B
14B · Q4_K_M · Alibaba
52
estimated55 — 10 GB Apache 2.0
68 Gemma 3 12B
12B · Q4_K_M · Google
51
estimated64 — 9 GB Gemma
69 Ling-3.0 Flash
124B MoE · Q4_K_M · Ant Group
51
— — 96 GB MIT
70 Solar Open 2 250B
250B MoE · Q4_K_M · Upstage
51
— — 160 GB Solar License
71 Step-3.5-Flash
196B MoE · Q4_K_M · StepFun
51
estimated29 — 120 GB Apache 2.0
72 DeepSeek R1
671B MoE · Q4_K_M · DeepSeek
50
— — 350 GB MIT
73 DeepSeek R1 32B
32B · Q4_K_M · DeepSeek
50
estimated25 — 22 GB MIT
74 DeepSeek V3
685B MoE · Q4_K_M · DeepSeek
50
— — 360 GB MIT
75 QwQ 32B
32B · Q4_K_M · Alibaba
50
estimated25 — 22 GB Apache 2.0
76 DeepSeek R1 70B
70B · Q4_K_M · DeepSeek
49
estimated12 — 44 GB MIT
77 Qwen 3 32B
32B · Q4_K_M · Alibaba
49
estimated25 — 22 GB Apache 2.0
78 Qwen 3.5 397B-A17B
397B MoE · Q4_K_M · Alibaba
49
— — 210 GB Apache 2.0
79 GLM-4.7
355B · Q4_K_M · Zhipu AI
47
— — 180 GB MIT
80 Mistral Large 3
675B MoE · Q4_K_M · Mistral
47
— — 355 GB Apache 2.0
81 Qwen 3.5 27B
27B · Q4_K_M · Alibaba
47
estimated30 — 18 GB Apache 2.0
82 Apertus 1.5 70B
70B · Q4_K_M · Swiss AI
46
estimated12 — 44 GB Apache 2.0
83 Gemma 3 27B
27B · Q4_K_M · Google
46
estimated30 — 18 GB Gemma
84 Llama 4 Scout
109B MoE · Q4_K_M · Meta
45
estimated19 — 58 GB Meta Custom
85 MiMo-V2-Flash
309B MoE · Q4_K_M · Xiaomi
45
— — 165 GB MIT
86 Qwen 2.5 72B
72B · Q4_K_M · Alibaba
45
estimated12 — 46 GB Apache 2.0
87 Llama 4 Maverick
400B MoE · Q4_K_M · Meta
44
— — 210 GB Meta Custom
88 Llama 3.1 405B
405B · Q4_K_M · Meta
43
estimated4 M5 Ultra — 240 GB Meta Custom
89 Mixtral 8x22B
141B MoE · Q4_K_M · Mistral
43
estimated15 — 88 GB Apache 2.0
90 Hermes 4 70B
70B · Q4_K_M · Nous Research
42
estimated12 — 38 GB Meta Custom
91 Llama 3.3 70B
70B · Q4_K_M · Meta
41
estimated12 — 44 GB Meta Custom
82
#1
KAT-Coder-V2.5
35B MoE · Kwaipilot · Apache 2.0
tok/s
estimated117
TTFT
—
Min RAM
24 GB
81
#2
Qwen 3.6-35B-A3B
35B MoE · Alibaba · Apache 2.0
tok/s
community126
TTFT
—
Min RAM
24 GB
79
#3
Nemotron 3.5 Lightning
30B MoE · NVIDIA · OpenMDW
tok/s
estimated103
TTFT
—
Min RAM
18 GB
78
#4
Gemma 4 26B-A4B
26B MoE · Google · Apache 2.0
tok/s
estimated106
TTFT
—
Min RAM
18 GB
76
#5
Laguna XS 2.1
33B MoE · Poolside · OpenMDW
tok/s
estimated117
TTFT
—
Min RAM
24 GB
72
#6
MiMo-V2.6-Flash
309B MoE · Xiaomi · MIT
tok/s
estimated42 M5 Ultra
TTFT
—
Min RAM
170 GB
71
#7
Nemotron-Cascade 2
30B MoE · NVIDIA · NVIDIA Open
tok/s
estimated117
TTFT
—
Min RAM
18 GB
71
#8
Qwen3.8-27B
27.8B · Alibaba · Apache 2.0
tok/s
estimated29
TTFT
—
Min RAM
19 GB
70
#9
DeepSeek V4 Flash
284B MoE · DeepSeek · MIT
tok/s
community39
TTFT
community0.4
Min RAM
120 GB
70
#10
DeepSeek V4 Flash Vision-Exp
305B MoE · DeepSeek · MIT
tok/s
estimated39
TTFT
—
Min RAM
120 GB
70
#11
Maple Preview 20B-A1B
20B MoE · DeepGrove · MIT
tok/s
sourced281 M5 Pro
TTFT
—
Min RAM
6 GB
70
#12
Qwen 3.5 35B-A3B
35B MoE · Alibaba · Apache 2.0
tok/s
estimated117
TTFT
—
Min RAM
24 GB
70
#13
Qwen 3.6-27B
27B · Alibaba · Apache 2.0
tok/s
estimated30
TTFT
—
Min RAM
18 GB
70
#14
Qwen3-Coder-Next
80B MoE · Alibaba · Apache 2.0
tok/s
estimated84
TTFT
—
Min RAM
48 GB
69
#15
GLM 5.2
753B MoE · Zhipu AI · MIT
tok/s
estimated22 M5 Ultra
TTFT
—
Min RAM
256 GB
68
#16
GLM-5.3-Flash
320B MoE · Zhipu AI · MIT
tok/s
estimated27
TTFT
—
Min RAM
128 GB
68
#17
Nanbeige4.2-3B
3B · Nanbeige · Apache 2.0
tok/s
estimated199
TTFT
—
Min RAM
2 GB
67
#18
GPT-oss 20B
21B MoE · OpenAI · Apache 2.0
tok/s
estimated103
TTFT
—
Min RAM
13 GB
67
#19
Inkling-Small
276B MoE · Thinking Machines · Apache 2.0
tok/s
estimated42
TTFT
—
Min RAM
96 GB
67
#20
Muse Glimmer 30B
30B · Meta · Apache 2.0
tok/s
sourced27
TTFT
sourced0.4
Min RAM
18 GB
67
#21
Qwen3.8-Flash-Next
125B MoE · Alibaba · Qwen Custom
tok/s
estimated49
TTFT
—
Min RAM
120 GB
66
#22
GLM-5.3
753B MoE · Zhipu AI · GLM-5.3
tok/s
estimated17 M5 Ultra
TTFT
—
Min RAM
256 GB
66
#23
Gemma 4 12B
12B · Google · Apache 2.0
tok/s
estimated64
TTFT
—
Min RAM
9 GB
65
#24
Qwen 3 30B-A3B
30B MoE · Alibaba · Apache 2.0
tok/s
estimated116
TTFT
—
Min RAM
18 GB
64
#25
Bonsai 27B
27B · Prism ML · Apache 2.0
tok/s
estimated30
TTFT
—
Min RAM
6 GB
64
#26
DeepSeek R1 8B
8B · DeepSeek · MIT
tok/s
estimated91
TTFT
—
Min RAM
6 GB
64
#27
Gemma 4 31B
31B · Google · Apache 2.0
tok/s
estimated26
TTFT
—
Min RAM
24 GB
64
#28
Gemma 4 E4B
4B · Google · Apache 2.0
tok/s
estimated161
TTFT
—
Min RAM
3 GB
64
#29
Laguna S 2.1
118B MoE · Poolside · OpenMDW
tok/s
estimated38
TTFT
—
Min RAM
96 GB
64
#30
Phi-4 Mini
3.8B · Microsoft · MIT
tok/s
estimated168
TTFT
—
Min RAM
3 GB
63
#31
DeepSeek V4 Pro
1.6T MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
850 GB
63
#32
DeepSeek V4.1 Flash
552B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
315 GB
63
#33
MiMo-V2.6-Pro
1.02T MoE · Xiaomi · MIT
tok/s
—
TTFT
—
Min RAM
581 GB
62
#34
Apertus 1.5 8B
8B · Swiss AI · Apache 2.0
tok/s
estimated91
TTFT
—
Min RAM
5 GB
61
#35
GLM-4.7-Flash
31B · Zhipu AI · MIT
tok/s
estimated26
TTFT
—
Min RAM
18 GB
61
#36
GLM-5.1
754B MoE · Zhipu AI · MIT
tok/s
—
TTFT
—
Min RAM
390 GB
61
#37
Gemma 4 E2B
2B · Google · Apache 2.0
tok/s
estimated261
TTFT
—
Min RAM
2 GB
61
#38
Mistral 7B
7B · Mistral · Apache 2.0
tok/s
estimated102
TTFT
—
Min RAM
5 GB
61
#39
Qwen 3 8B
8B · Alibaba · Apache 2.0
tok/s
estimated91
TTFT
—
Min RAM
6 GB
61
#40
Qwen 3.5 122B-A10B
122B MoE · Alibaba · Apache 2.0
tok/s
estimated47
TTFT
—
Min RAM
65 GB
61
#41
Qwen 3.5 9B
9B · Alibaba · Apache 2.0
tok/s
estimated82
TTFT
—
Min RAM
7 GB
61
#42
Qwen3-235B-A22B
235B MoE · Alibaba · Apache 2.0
tok/s
estimated15
TTFT
—
Min RAM
128 GB
60
#43
Kimi K2.6
1T MoE · Moonshot AI · Modified MIT
tok/s
—
TTFT
—
Min RAM
600 GB
60
#44
LFM2.5-2.6B
2.6B · Liquid AI · LFM Open
tok/s
sourced220
TTFT
sourced0.1
Min RAM
2 GB
60
#45
Ministral 8B
8B · Mistral · Apache 2.0
tok/s
estimated91
TTFT
—
Min RAM
6 GB
60
#46
Qwen 3.5 4B
4B · Alibaba · Apache 2.0
tok/s
estimated161
TTFT
—
Min RAM
3 GB
59
#47
GPT-oss 120B
117B MoE · OpenAI · Apache 2.0
tok/s
estimated58
TTFT
—
Min RAM
62 GB
59
#48
Kimi K2.5
1T MoE · Moonshot AI · Modified MIT
tok/s
—
TTFT
—
Min RAM
600 GB
59
#49
Mistral Small 4
119B MoE · Mistral · Apache 2.0
tok/s
estimated46
TTFT
—
Min RAM
64 GB
59
#50
Qwen 3 4B
4B · Alibaba · Apache 2.0
tok/s
estimated161
TTFT
—
Min RAM
3 GB
58
#51
DeepSeek V3.2-Speciale
685B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
360 GB
58
#52
Inkling
975B MoE · Thinking Machines · Apache 2.0
tok/s
—
TTFT
—
Min RAM
550 GB
58
#53
Kimi K3
2.8T MoE · Moonshot AI · Moonshot Custom
tok/s
—
TTFT
—
Min RAM
1560 GB
58
#54
Qwen3.8-2.4T-A95B
2.4T MoE · Alibaba · Qwen Custom
tok/s
—
TTFT
—
Min RAM
1310 GB
58
#55
SmolLM3 3B
3B · HuggingFace · Apache 2.0
tok/s
estimated199
TTFT
—
Min RAM
2 GB
56
#56
Gemma 3 4B
4B · Google · Gemma
tok/s
estimated161
TTFT
—
Min RAM
3 GB
55
#57
DeepSeek V3.2
685B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
360 GB
55
#58
GLM-4.5-Air
106B MoE · Zhipu AI · MIT
tok/s
estimated27
TTFT
—
Min RAM
56 GB
55
#59
Llama 3.1 8B
8B · Meta · Meta Custom
tok/s
estimated91
TTFT
—
Min RAM
5 GB
55
#60
Phi-4 14B
14B · Microsoft · MIT
tok/s
estimated55
TTFT
—
Min RAM
10 GB
54
#61
Qwen 3 14B
14B · Alibaba · Apache 2.0
tok/s
estimated55
TTFT
—
Min RAM
10 GB
53
#62
Mistral Small 3.2 24B
24B · Mistral · Apache 2.0
tok/s
estimated33
TTFT
—
Min RAM
14 GB
52
#63
Devstral Small 24B
24B · Mistral · Apache 2.0
tok/s
estimated33
TTFT
—
Min RAM
14 GB
52
#64
Hunyuan Hy3
295B MoE · Tencent · Apache 2.0
tok/s
—
TTFT
—
Min RAM
160 GB
52
#65
MiniMax M2.5
230B MoE · MiniMax · Modified MIT
tok/s
estimated57 M5 Ultra
TTFT
—
Min RAM
130 GB
52
#66
Ministral 3 14B
14B · Mistral · Apache 2.0
tok/s
estimated55
TTFT
—
Min RAM
10 GB
52
#67
Qwen 2.5 14B
14B · Alibaba · Apache 2.0
tok/s
estimated55
TTFT
—
Min RAM
10 GB
51
#68
Gemma 3 12B
12B · Google · Gemma
tok/s
estimated64
TTFT
—
Min RAM
9 GB
51
#69
Ling-3.0 Flash
124B MoE · Ant Group · MIT
tok/s
—
TTFT
—
Min RAM
96 GB
51
#70
Solar Open 2 250B
250B MoE · Upstage · Solar License
tok/s
—
TTFT
—
Min RAM
160 GB
51
#71
Step-3.5-Flash
196B MoE · StepFun · Apache 2.0
tok/s
estimated29
TTFT
—
Min RAM
120 GB
50
#72
DeepSeek R1
671B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
350 GB
50
#73
DeepSeek R1 32B
32B · DeepSeek · MIT
tok/s
estimated25
TTFT
—
Min RAM
22 GB
50
#74
DeepSeek V3
685B MoE · DeepSeek · MIT
tok/s
—
TTFT
—
Min RAM
360 GB
50
#75
QwQ 32B
32B · Alibaba · Apache 2.0
tok/s
estimated25
TTFT
—
Min RAM
22 GB
49
#76
DeepSeek R1 70B
70B · DeepSeek · MIT
tok/s
estimated12
TTFT
—
Min RAM
44 GB
49
#77
Qwen 3 32B
32B · Alibaba · Apache 2.0
tok/s
estimated25
TTFT
—
Min RAM
22 GB
49
#78
Qwen 3.5 397B-A17B
397B MoE · Alibaba · Apache 2.0
tok/s
—
TTFT
—
Min RAM
210 GB
47
#79
GLM-4.7
355B · Zhipu AI · MIT
tok/s
—
TTFT
—
Min RAM
180 GB
47
#80
Mistral Large 3
675B MoE · Mistral · Apache 2.0
tok/s
—
TTFT
—
Min RAM
355 GB
47
#81
Qwen 3.5 27B
27B · Alibaba · Apache 2.0
tok/s
estimated30
TTFT
—
Min RAM
18 GB
46
#82
Apertus 1.5 70B
70B · Swiss AI · Apache 2.0
tok/s
estimated12
TTFT
—
Min RAM
44 GB
46
#83
Gemma 3 27B
27B · Google · Gemma
tok/s
estimated30
TTFT
—
Min RAM
18 GB
45
#84
Llama 4 Scout
109B MoE · Meta · Meta Custom
tok/s
estimated19
TTFT
—
Min RAM
58 GB
45
#85
MiMo-V2-Flash
309B MoE · Xiaomi · MIT
tok/s
—
TTFT
—
Min RAM
165 GB
45
#86
Qwen 2.5 72B
72B · Alibaba · Apache 2.0
tok/s
estimated12
TTFT
—
Min RAM
46 GB
44
#87
Llama 4 Maverick
400B MoE · Meta · Meta Custom
tok/s
—
TTFT
—
Min RAM
210 GB
43
#88
Llama 3.1 405B
405B · Meta · Meta Custom
tok/s
estimated4 M5 Ultra
TTFT
—
Min RAM
240 GB
43
#89
Mixtral 8x22B
141B MoE · Mistral · Apache 2.0
tok/s
estimated15
TTFT
—
Min RAM
88 GB
42
#90
Hermes 4 70B
70B · Nous Research · Meta Custom
tok/s
estimated12
TTFT
—
Min RAM
38 GB
41
#91
Llama 3.3 70B
70B · Meta · Meta Custom
tok/s
estimated12
TTFT
—
Min RAM
44 GB
Speed figures are single-stream decode at 4-bit quantization on an M5 Max — or on the Mac Studio M5 Ultra, tagged, for models that need more than 128 GB. The mark says whether a figure is estimated or measured. Method & math → 1–91 of 91

Own the Mac already? See which of these 91 models fit your exact chip and unified memory →
Still choosing hardware? Three questions and the Mac Advisor names the config → · Every Mac compared for local AI →