Local LLM Performance on Apple Silicon

Detailed per-chip benchmark pages for 73 model+chip combinations. Find out exactly how fast any model runs on your Mac — from M1 with 8 GB RAM to M5 Max with 128 GB.

These pages answer how fast is this model on that chip. For the inverse — what should I run on the Mac I already own — go to Best local LLM for every Mac →
Shopping for the machine instead? The Mac Advisor turns a budget and a use case into one config → · Every Mac compared →

Gemma 4 E2B
2.3B • up to 261 tok/s
1 chips
Qwen 3.5 4B
4B • up to 161 tok/s
1 chips
Llama 3.1 8B
8B • up to 91 tok/s
3 chips
Mistral Small 4
119B • up to 86 tok/s
1 chips
LFM2.5-2.6B
2.6B • up to 81 tok/s
1 chips
Qwen3-Coder-Next
80B • up to 72 tok/s
2 chips
Gemma 3 12B
12B • up to 64 tok/s
3 chips
GLM-4.5-Air
106B • up to 61 tok/s
1 chips
Qwen3.8-27B
27.8B • up to 57 tok/s
2 chips
Laguna S 2.1
118B • up to 53 tok/s
1 chips
KAT-Coder-V2.5
35B-A3B • up to 52 tok/s
2 chips
Gemma 4 26B-A4B
26B • up to 50 tok/s
3 chips
Gemma 3 4B
4B • up to 49 tok/s
1 chips
Inkling-Small
276B • up to 45 tok/s
1 chips
Qwen 3.6-35B-A3B
35B • up to 42 tok/s
2 chips
Qwen3-235B-A22B
235B • up to 37 tok/s
1 chips
DeepSeek R1 8B
8B • up to 29 tok/s
1 chips
Gemma 3 27B
27B • up to 27 tok/s
2 chips
Muse Glimmer 30B
30B • up to 27 tok/s
2 chips
Gemma 4 31B
31B • up to 26 tok/s
2 chips
Qwen 3 14B
14B • up to 26 tok/s
2 chips
DeepSeek R1 70B
70B • up to 24 tok/s
2 chips
GLM-4.7-Flash
31B • up to 24 tok/s
1 chips
Llama 3.3 70B
70B • up to 24 tok/s
1 chips
Qwen 3 32B
32B • up to 23 tok/s
1 chips
Qwen 2.5 72B
72B • up to 23 tok/s
1 chips
Phi-4 14B
14B • up to 17 tok/s
2 chips
Nemotron 3.5 Lightning
30B • up to 17 tok/s
1 chips
GLM 5.2
753B-A40B • up to 15 tok/s
1 chips
Llama 3.1 405B
405B • up to 4 tok/s
1 chips