According to LLMCheck, this open dataset covers 227 benchmark data points across 79 local LLMs and 10 Apple Silicon chips — real tokens-per-second and time-to-first-token for each. Standard method: Q4_K_M quantization, 256-token input, 512-token output, averaged over 3 runs on a freshly booted Mac. Free to download as CSV or JSON.
🔍 Not sure what your Mac can run? Check your Mac in 10 seconds →
ⓘ Figures are transparent estimates unless marked sourced/community. Own a Mac? Submit a real benchmark →
Real tokens-per-second measurements across 79 models, 12 Apple Silicon chips, and 3 inference engines. Find exactly how fast your model runs on your Mac.
| Model↕ | Params↕ | Quant↕ | Chip↕ | RAM↕ | Engine↕ | tok/s (est.)↓ | TTFT↕ | Date↕ |
|---|---|---|---|---|---|---|---|---|
| SmolLM3 3B | 3B | Q4_K_M | M5 Max | 64 GB | MLX | 168 | 0.1s | 2026-05 |
| Gemma 4 E2B | 2.3B | Q4_K_M | M5 Max | 128 GB | MLX | 158 | 0.1s | 2026-04 |
| Qwen 3.5 4B | 4B | Q4_K_M | M5 Max | 64 GB | MLX | 148 | 0.2s | 2026-03 |
| Phi-5 Mini | 4B | Q4_K_M | M5 Max | 128 GB | MLX | 145 | 0.2s | 2026-05 |
| Phi-4 Mini | 3.8B | Q4_K_M | M5 Max | 64 GB | Ollama | 142 | 0.3s | 2026-03 |
| Llama 3.1 8B | 8B | Q4_K_M | M5 Max | 128 GB | MLX | 138 | 0.3s | 2026-03 |
| Qwen 3 4B | 4B | Q4_K_M | M5 Max | 64 GB | Ollama | 135 | 0.2s | 2026-03 |
| Qwen 4 4B | 4B | Q4_K_M | M5 Max | 128 GB | MLX | 135 | 0.2s | 2026-06 |
| Gemma 3 4B | 4B | Q4_K_M | M5 Max | 64 GB | Ollama | 132 | 0.3s | 2026-03 |
| Gemma 4 E4B | 4B | Q4_K_M | M5 Max | 128 GB | MLX | 128 | 0.2s | 2026-04 |
| Phi-4 Mini | 3.8B | Q4_K_M | M4 Max | 48 GB | MLX | 125 | 0.3s | 2026-02 |
| Mistral 7B | 7B | Q4_K_M | M5 Max | 64 GB | Ollama | 122 | 0.3s | 2026-03 |
| Qwen 3 4B | 4B | Q4_K_M | M4 Pro | 24 GB | MLX | 118 | 0.3s | 2026-02 |
| SmolLM3 3B | 3B | Q4_K_M | M4 Pro | 24 GB | Ollama | 115 | 0.2s | 2026-05 |
| Phi-4 Mini | 3.8B | Q8_0 | M5 Max | 64 GB | MLX | 112 | 0.3s | 2026-03 |
| Llama 5 8B | 8B | Q4_K_M | M5 Max | 128 GB | MLX | 112 | 0.3s | 2026-05 |
| Phi-5 Mini | 4B | Q4_K_M | M4 Pro | 24 GB | Ollama | 110 | 0.3s | 2026-05 |
| Phi-4 Mini | 3.8B | Q4_K_M | M4 Pro | 24 GB | Ollama | 108 | 0.4s | 2026-03 |
| Qwen 4 4B | 4B | Q4_K_M | M4 Pro | 24 GB | Ollama | 108 | 0.3s | 2026-06 |
| Qwen 3.5 9B | 9B | Q4_K_M | M5 Max | 64 GB | Ollama | 105 | 0.5s | 2026-03 |
| Qwen 3 8B | 8B | Q4_K_M | M5 Max | 128 GB | Ollama | 98 | 0.4s | 2026-03 |
| Mistral 7B | 7B | Q4_K_M | M4 Pro | 24 GB | MLX | 98 | 0.4s | 2026-02 |
| Ministral 8B | 8B | Q4_K_M | M5 Max | 64 GB | Ollama | 98 | 0.4s | 2026-03 |
| DeepSeek R1 8B | 8B | Q4_K_M | M5 Max | 64 GB | Ollama | 97 | 0.5s | 2026-03 |
| Phi-4 Mini | 3.8B | Q4_K_M | M3 | 16 GB | MLX | 95 | 0.3s | 2026-02 |
| Gemma 4 E2B | 2.3B | Q4_K_M | M4 Pro | 24 GB | Ollama | 95 | 0.2s | 2026-04 |
| Gemma 3 4B | 4B | Q8_0 | M4 Pro | 24 GB | MLX | 95 | 0.3s | 2026-02 |
| Phi-5 Mini | 4B | Q4_K_M | M5 Pro | 24 GB | MLX | 95 | 0.3s | 2026-05 |
| Qwen 3.5 4B | 4B | Q4_K_M | M4 | 16 GB | Ollama | 92 | 0.4s | 2026-02 |
| Gemma 4 E4B | 4B | Q4_K_M | M5 Pro | 24 GB | Ollama | 92 | 0.3s | 2026-04 |
| Qwen 3.5 9B | 9B | Q4_K_M | M4 Pro | 24 GB | MLX | 92 | 0.4s | 2026-03 |
| SmolLM3 3B | 3B | Q4_K_M | M3 | 16 GB | Ollama | 92 | 0.3s | 2026-05 |
| Gemma 3 4B | 4B | Q4_K_M | M3 Pro | 18 GB | MLX | 88 | 0.4s | 2026-01 |
| Mistral 7B | 7B | Q8_0 | M5 Max | 64 GB | MLX | 88 | 0.4s | 2026-03 |
| Phi-5 Mini | 4B | Q4_K_M | M3 | 16 GB | MLX | 88 | 0.3s | 2026-05 |
| Qwen 4 4B | 4B | Q4_K_M | M3 | 16 GB | MLX | 85 | 0.3s | 2026-06 |
| Gemma 4 E2B | 2.3B | Q4_K_M | M3 | 16 GB | Ollama | 82 | 0.3s | 2026-04 |
| Llama 3.1 8B | 8B | Q8_0 | M5 Max | 64 GB | Ollama | 82 | 0.4s | 2026-03 |
| Qwen 3 8B | 8B | Q4_K_M | M4 Pro | 24 GB | Ollama | 82 | 0.5s | 2026-02 |
| Qwen 4.1 32B-A3B | 32B | Q4_K_M | M5 Max | 128 GB | MLX | 82 | 0.4s | 2026-07 |
| Qwen 4 | 32B | Q4_K_M | M5 Max | 128 GB | MLX | 80 | 0.4s | 2026-06 |
| Gemma 4 E4B | 4B | Q4_K_M | M4 Pro | 24 GB | MLX | 78 | 0.3s | 2026-04 |
| DeepSeek R1 8B | 8B | Q4_K_M | M4 | 16 GB | MLX | 78 | 0.5s | 2026-02 |
| Qwen 3.5 9B | 9B | Q8_0 | M5 Max | 128 GB | MLX | 78 | 0.5s | 2026-03 |
| Qwen 4 Preview 32B-A3B | 32B | Q4_K_M | M5 Max | 128 GB | MLX | 78 | 0.5s | 2026-05 |
| Llama 5 8B | 8B | Q4_K_M | M4 Pro | 24 GB | MLX | 78 | 0.4s | 2026-05 |
| SmolLM3 3B | 3B | Q4_K_M | M2 | 8 GB | Ollama | 78 | 0.4s | 2026-05 |
| Qwen 4 Coder | 32B | Q4_K_M | M5 Max | 128 GB | MLX | 78 | 0.4s | 2026-06 |
| Llama 3.1 8B | 8B | Q4_K_M | M4 | 16 GB | Ollama | 75 | 0.6s | 2026-02 |
| DeepSeek R1 8B | 8B | Q8_0 | M5 Max | 64 GB | MLX | 75 | 0.5s | 2026-03 |
| Gemma 4.5 12B | 12B | Q4_K_M | M5 Max | 128 GB | MLX | 75 | 0.4s | 2026-06 |
| Phi-4 Mini | 3.8B | Q4_K_M | M2 | 8 GB | Ollama | 72 | 0.5s | 2026-01 |
| Qwen 3.5 9B | 9B | Q4_K_M | M4 | 16 GB | LM Studio | 72 | 0.6s | 2026-02 |
| Ministral 8B | 8B | Q4_K_M | M4 | 16 GB | MLX | 72 | 0.5s | 2026-02 |
| Llama 5 8B | 8B | Q4_K_M | M5 Pro | 24 GB | Ollama | 72 | 0.4s | 2026-05 |
| Qwen 4.1 32B-A3B | 32B | Q4_K_M | M5 Max | 64 GB | Ollama | 70 | 0.5s | 2026-07 |
| Qwen 3 8B | 8B | Q8_0 | M4 Pro | 24 GB | MLX | 68 | 0.5s | 2026-02 |
| Gemma 3 12B | 12B | Q4_K_M | M5 Max | 64 GB | Ollama | 68 | 0.6s | 2026-03 |
| Phi-5 Mini | 4B | Q4_K_M | M2 | 8 GB | Ollama | 68 | 0.4s | 2026-05 |
| Qwen 4 | 32B | Q4_K_M | M5 Max | 64 GB | Ollama | 68 | 0.5s | 2026-06 |
| Mistral 7B | 7B | Q8_0 | M4 Pro | 24 GB | Ollama | 65 | 0.5s | 2026-02 |
| Qwen 4 Preview 32B-A3B | 32B | Q4_K_M | M5 Max | 64 GB | Ollama | 65 | 0.6s | 2026-05 |
| SmolLM3 3B | 3B | Q4_K_M | M1 | 8 GB | Ollama | 65 | 0.5s | 2026-05 |
| Qwen 4 Coder | 32B | Q4_K_M | M5 Max | 64 GB | Ollama | 65 | 0.5s | 2026-06 |
| Phi-5 Medium 14B | 14B | Q4_K_M | M5 Max | 128 GB | MLX | 65 | 0.5s | 2026-06 |
| Qwen 4.1 32B-A3B | 32B | Q4_K_M | M4 Max | 128 GB | Ollama | 64 | 0.6s | 2026-07 |
| Gemma 4 E4B | 4B | Q4_K_M | M3 | 16 GB | Ollama | 62 | 0.4s | 2026-04 |
| Mistral 7B | 7B | Q4_K_M | M3 | 16 GB | Ollama | 62 | 0.6s | 2026-01 |
| Llama 3.1 8B | 8B | Q4_K_M | M3 Pro | 18 GB | Ollama | 62 | 0.7s | 2026-01 |
| Phi-4 14B | 14B | Q4_K_M | M5 Max | 64 GB | MLX | 62 | 0.6s | 2026-03 |
| Qwen 3 30B-A3B | 30B | Q4_K_M | M5 Max | 64 GB | Ollama | 62 | 0.7s | 2026-03 |
| Qwen 4 | 32B | Q4_K_M | M4 Max | 128 GB | Ollama | 62 | 0.6s | 2026-06 |
| Qwen 4 Coder | 32B | Q4_K_M | M4 Max | 48 GB | MLX | 62 | 0.6s | 2026-06 |
| Qwen 4 4B | 4B | Q4_K_M | M2 | 8 GB | Ollama | 62 | 0.4s | 2026-06 |
| Qwen 4.1 32B-A3B | 32B | Q4_K_M | M4 Pro | 24 GB | Ollama | 62 | 0.7s | 2026-07 |
| Qwen 4 Preview 32B-A3B | 32B | Q4_K_M | M4 Max | 128 GB | Ollama | 60 | 0.7s | 2026-05 |
| Qwen 4 | 32B | Q4_K_M | M4 Pro | 24 GB | Ollama | 60 | 0.7s | 2026-06 |
| Phi-4 Mini | 3.8B | Q4_K_M | M1 | 16 GB | Ollama | 58 | 0.6s | 2025-12 |
| Gemma 4 E2B | 2.3B | Q4_K_M | M1 | 8 GB | Ollama | 58 | 0.5s | 2026-04 |
| Qwen 3.5 9B | 9B | Q4_K_M | M3 | 16 GB | Ollama | 58 | 0.7s | 2026-01 |
| DeepSeek R1 8B | 8B | Q4_K_M | M2 | 16 GB | Ollama | 58 | 0.8s | 2026-01 |
| Qwen 3 14B | 14B | Q4_K_M | M5 Max | 64 GB | Ollama | 58 | 0.8s | 2026-03 |
| Ministral 14B | 14B | Q4_K_M | M5 Max | 64 GB | Ollama | 58 | 0.7s | 2026-03 |
| Qwen 4 Preview 32B-A3B | 32B | Q4_K_M | M4 Pro | 24 GB | Ollama | 58 | 0.8s | 2026-05 |
| Llama 5 8B | 8B | Q4_K_M | M3 | 16 GB | Ollama | 58 | 0.5s | 2026-05 |
| Qwen 4 Coder | 32B | Q4_K_M | M4 Pro | 24 GB | Ollama | 58 | 0.7s | 2026-06 |
| Gemma 4.5 12B | 12B | Q4_K_M | M4 Pro | 24 GB | MLX | 58 | 0.5s | 2026-06 |
| Phi-5 Medium 14B | 14B | Q4_K_M | M5 Max | 64 GB | Ollama | 58 | 0.6s | 2026-06 |
| Qwen 4.1 32B-A3B | 32B | Q4_K_M | M5 Pro | 64 GB | MLX | 56 | 0.6s | 2026-07 |
| Qwen 3 8B | 8B | Q4_K_M | M2 | 16 GB | Ollama | 55 | 0.7s | 2026-01 |
| Ministral 8B | 8B | Q4_K_M | M3 | 16 GB | LM Studio | 55 | 0.7s | 2026-01 |
| Qwen 3.6-35B-A3B | 35B | Q4_K_M | M5 Max | 128 GB | MLX | 55 | 0.6s | 2026-04 |
| Qwen 4 | 32B | Q4_K_M | M5 Pro | 64 GB | MLX | 55 | 0.6s | 2026-06 |
| Qwen 3 4B | 4B | Q4_K_M | M2 | 8 GB | Ollama | 52 | 0.7s | 2026-01 |
| Gemma 3 12B | 12B | Q4_K_M | M4 Pro | 24 GB | MLX | 52 | 0.7s | 2026-02 |
| Qwen 3.5 35B | 35B | Q4_K_M | M5 Max | 64 GB | MLX | 52 | 0.9s | 2026-03 |
| Qwen 4 Preview 32B-A3B | 32B | Q4_K_M | M5 Pro | 64 GB | MLX | 52 | 0.7s | 2026-05 |
| Gemma 4.5 12B | 12B | Q4_K_M | M5 Pro | 24 GB | Ollama | 52 | 0.6s | 2026-06 |
| Gemma 4 26B-A4B | 26B | Q4_K_M | M5 Max | 128 GB | MLX | 50 | 0.5s | 2026-04 |
| Phi-5 Mini | 4B | Q4_K_M | M1 | 8 GB | Ollama | 50 | 0.5s | 2026-05 |
| Llama 5 Scout | 109B | Q4_K_M | M4 Ultra | 192 GB | MLX | 50 | 0.6s | 2026-05 |
| Gemma 3 4B | 4B | Q4_K_M | M1 | 8 GB | Ollama | 48 | 0.8s | 2025-12 |
| Qwen 3.5 35B | 35B | Q4_K_M | M5 Max | 128 GB | Ollama | 48 | 0.9s | 2026-03 |
| Llama 3.1 8B | 8B | Q4_K_M | M2 | 8 GB | Ollama | 48 | 0.8s | 2025-12 |
| Qwen 3.6-35B-A3B | 35B | Q4_K_M | M5 Max | 64 GB | Ollama | 48 | 0.8s | 2026-04 |
| Phi-5 Medium 14B | 14B | Q4_K_M | M4 Pro | 24 GB | MLX | 48 | 0.7s | 2026-06 |
| Qwen 4.1 32B-A3B | 32B | Q4_K_M | M3 Max | 64 GB | Ollama | 48 | 0.8s | 2026-07 |
| Mistral Medium 4 | 41B | Q4_K_M | M5 Max | 128 GB | MLX | 48 | 0.6s | 2026-07 |
| Qwen 4 | 32B | Q4_K_M | M3 Max | 64 GB | Ollama | 47 | 0.8s | 2026-06 |
| Mistral Small 4 | 119B | Q4_K_M | M4 Ultra | 192 GB | MLX | 45 | 0.7s | 2026-04 |
| Qwen 4 Preview 32B-A3B | 32B | Q4_K_M | M3 Max | 64 GB | Ollama | 45 | 0.9s | 2026-05 |
| Mistral Voyage 24B | 24B | Q4_K_M | M5 Max | 128 GB | MLX | 45 | 0.6s | 2026-05 |
| Devstral Small 24B | 24B | Q4_K_M | M5 Max | 128 GB | MLX | 45 | 0.6s | 2026-05 |
| Qwen 4 Coder | 32B | Q4_K_M | M3 Max | 64 GB | Ollama | 45 | 0.8s | 2026-06 |
| Qwen 4 4B | 4B | Q4_K_M | M1 | 8 GB | Ollama | 45 | 0.6s | 2026-06 |
| Gemma 4 E4B | 4B | Q4_K_M | M1 | 8 GB | Ollama | 42 | 0.6s | 2026-04 |
| Mistral 7B | 7B | Q4_K_M | M1 | 16 GB | Ollama | 42 | 1.2s | 2025-12 |
| Gemma 3 27B | 27B | Q4_K_M | M5 Max | 64 GB | Ollama | 42 | 0.9s | 2026-03 |
| Qwen 3 30B-A3B | 30B | Q4_K_M | M4 Max | 48 GB | Ollama | 42 | 0.9s | 2026-02 |
| Qwen 3 14B | 14B | Q8_0 | M5 Max | 128 GB | MLX | 42 | 0.9s | 2026-03 |
| Qwen 3.6-35B-A3B | 35B | Q4_K_M | M4 Max | 48 GB | MLX | 42 | 0.9s | 2026-04 |
| Mistral Small 4 | 119B | Q4_K_M | M5 Max | 128 GB | MLX | 42 | 0.8s | 2026-04 |
| Llama 5 8B | 8B | Q4_K_M | M2 | 16 GB | Ollama | 42 | 0.7s | 2026-05 |
| Llama 5 Scout | 109B | Q4_K_M | M5 Max | 128 GB | MLX | 42 | 0.8s | 2026-05 |
| Mistral Voyage 24B | 24B | Q4_K_M | M5 Max | 64 GB | Ollama | 42 | 0.7s | 2026-05 |
| Gemma 4.5 12B | 12B | Q4_K_M | M3 | 16 GB | Ollama | 42 | 0.8s | 2026-06 |
| Gemma 4.5 27B | 27B | Q4_K_M | M5 Max | 128 GB | MLX | 42 | 0.6s | 2026-07 |
| Mistral Medium 4 | 41B | Q4_K_M | M5 Max | 64 GB | Ollama | 42 | 0.7s | 2026-07 |
| Gemma 4 26B-A4B | 26B | Q4_K_M | M4 Max | 48 GB | MLX | 40 | 0.7s | 2026-04 |
| Llama 3.1 8B | 8B | Q4_K_M | M1 | 16 GB | Ollama | 40 | 1.1s | 2025-12 |
| Ministral 14B | 14B | Q4_K_M | M4 Pro | 24 GB | Ollama | 40 | 0.9s | 2026-02 |
| Grok 4 Open | 100B | Q4_K_M | M4 Ultra | 192 GB | MLX | 40 | 0.8s | 2026-06 |
| DeepSeek R1 8B | 8B | Q4_K_M | M1 | 16 GB | Ollama | 38 | 1.2s | 2025-11 |
| Gemma 3 12B | 12B | Q4_K_M | M3 | 16 GB | Ollama | 38 | 1.1s | 2026-01 |
| Qwen 3 14B | 14B | Q4_K_M | M4 Pro | 24 GB | LM Studio | 38 | 1.0s | 2026-02 |
| Phi-4 14B | 14B | Q4_K_M | M4 | 16 GB | Ollama | 38 | 1.0s | 2026-02 |
| Qwen 3 8B | 8B | Q4_K_M | M1 | 16 GB | Ollama | 38 | 1.0s | 2025-12 |
| Mistral Small 4 | 119B | Q4_K_M | M5 Max | 128 GB | Ollama | 38 | 0.9s | 2026-04 |
| Llama 5 Scout | 109B | Q4_K_M | M5 Max | 64 GB | Ollama | 38 | 1.0s | 2026-05 |
| Mistral Voyage 24B | 24B | Q4_K_M | M4 Max | 48 GB | MLX | 38 | 0.8s | 2026-05 |
| Devstral Small 24B | 24B | Q4_K_M | M5 Max | 64 GB | Ollama | 38 | 0.7s | 2026-05 |
| GLM 5.2 Air | 106B | Q4_K_M | M4 Ultra | 192 GB | MLX | 38 | 0.8s | 2026-07 |
| Mistral Medium 4 | 41B | Q4_K_M | M4 Max | 48 GB | MLX | 38 | 0.8s | 2026-07 |
| Phi-5 Large 28B | 28B | Q4_K_M | M5 Max | 128 GB | MLX | 38 | 0.6s | 2026-07 |
| Gemma 4.5 27B | 27B | Q4_K_M | M4 Max | 48 GB | MLX | 36 | 0.7s | 2026-07 |
| Gemma 4 26B-A4B | 26B | Q4_K_M | M5 Pro | 24 GB | Ollama | 35 | 0.8s | 2026-04 |
| Qwen 3.5 9B | 9B | Q4_K_M | M1 | 16 GB | Ollama | 35 | 1.1s | 2025-12 |
| Gemma 3 27B | 27B | Q4_K_M | M4 Max | 48 GB | MLX | 35 | 1.1s | 2026-02 |
| Qwen 3 30B-A3B | 30B | Q4_K_M | M4 Pro | 24 GB | MLX | 35 | 1.0s | 2026-02 |
| Nemotron Cascade 2 | 30B | Q4_K_M | M5 Max | 64 GB | Ollama | 35 | 0.9s | 2026-04 |
| Llama 5 Scout | 109B | Q4_K_M | M4 Max | 128 GB | MLX | 35 | 0.9s | 2026-05 |
| Devstral Small 24B | 24B | Q4_K_M | M4 Max | 48 GB | MLX | 35 | 0.8s | 2026-05 |
| Gemma 4.5 12B | 12B | Q4_K_M | M2 | 16 GB | Ollama | 35 | 1.0s | 2026-06 |
| Qwen 3.5 35B | 35B | Q4_K_M | M4 Max | 48 GB | Ollama | 34 | 1.2s | 2026-02 |
| Qwen 4.1 32B-A3B | 32B | Q4_K_M | M3 Pro | 18 GB | Ollama | 34 | 1.1s | 2026-07 |
| GLM 5.2 Air | 106B | Q4_K_M | M5 Max | 128 GB | MLX | 34 | 0.9s | 2026-07 |
| Phi-5 Large 28B | 28B | Q4_K_M | M5 Max | 64 GB | Ollama | 34 | 0.7s | 2026-07 |
| Qwen 4 | 32B | Q4_K_M | M3 Pro | 18 GB | Ollama | 33 | 1.1s | 2026-06 |
| Gemma 3 12B | 12B | Q4_K_M | M2 | 16 GB | Ollama | 32 | 1.3s | 2025-12 |
| Qwen 3 32B | 32B | Q4_K_M | M4 Ultra | 192 GB | Ollama | 32 | 1.0s | 2026-02 |
| Qwen 3.6-35B-A3B | 35B | Q4_K_M | M4 Pro | 24 GB | Ollama | 32 | 1.2s | 2026-04 |
| Qwen 4 Preview 32B-A3B | 32B | Q4_K_M | M3 Pro | 18 GB | Ollama | 32 | 1.2s | 2026-05 |
| Phi-5 Medium 14B | 14B | Q4_K_M | M3 | 16 GB | Ollama | 32 | 1.1s | 2026-06 |
| Grok 4 Open | 100B | Q4_K_M | M5 Max | 128 GB | MLX | 32 | 1.0s | 2026-06 |
| Gemma 4.5 27B | 27B | Q4_K_M | M3 Max | 64 GB | Ollama | 32 | 0.9s | 2026-07 |
| Qwen 3 14B | 14B | Q4_K_M | M3 | 16 GB | Ollama | 30 | 1.2s | 2026-01 |
| Llama 4 Scout | 109B | Q4_K_M | M4 Ultra | 192 GB | MLX | 30 | 1.3s | 2026-02 |
| Ministral 14B | 14B | Q4_K_M | M3 | 16 GB | LM Studio | 30 | 1.2s | 2026-01 |
| GLM 5.2 Air | 106B | Q4_K_M | M5 Max | 64 GB | Ollama | 30 | 1.1s | 2026-07 |
| Gemma 4.5 27B | 27B | Q4_K_M | M5 Pro | 32 GB | Ollama | 30 | 0.9s | 2026-07 |
| Mistral Medium 4 | 41B | Q4_K_M | M3 Max | 64 GB | Ollama | 30 | 1.0s | 2026-07 |
| Command R+ 2 | 104B | Q4_K_M | M5 Max | 128 GB | MLX | 30 | 1.0s | 2026-07 |
| Gemma 4 26B-A4B | 26B | Q4_K_M | M4 Pro | 24 GB | Ollama | 28 | 1.0s | 2026-04 |
| Phi-4 14B | 14B | Q4_K_M | M2 | 16 GB | MLX | 28 | 1.3s | 2026-01 |
| Qwen 3 30B-A3B | 30B | Q4_K_M | M3 Max | 36 GB | Ollama | 28 | 1.3s | 2026-01 |
| Qwen 3 32B | 32B | Q4_K_M | M5 Max | 128 GB | Ollama | 28 | 1.1s | 2026-03 |
| Gemma 3 27B | 27B | Q4_K_M | M3 Max | 96 GB | MLX | 28 | 1.3s | 2026-01 |
| Nemotron Cascade 2 | 30B | Q4_K_M | M4 Max | 48 GB | MLX | 28 | 1.2s | 2026-04 |
| Mistral Voyage 24B | 24B | Q4_K_M | M4 Pro | 32 GB | Ollama | 28 | 1.0s | 2026-05 |
| Grok 4 Open | 100B | Q4_K_M | M5 Max | 64 GB | Ollama | 28 | 1.2s | 2026-06 |
| Phi-5 Large 28B | 28B | Q4_K_M | M4 Pro | 32 GB | MLX | 28 | 0.9s | 2026-07 |
| Command R+ 2 | 104B | Q4_K_M | M5 Max | 64 GB | Ollama | 28 | 1.2s | 2026-07 |
| DeepSeek R1 32B | 32B | Q4_K_M | M5 Max | 64 GB | Ollama | 27 | 1.2s | 2026-03 |
| Gemma 4 31B | 31B | Q4_K_M | M5 Max | 128 GB | MLX | 26 | 0.7s | 2026-04 |
| Llama 4 Scout | 109B | Q4_K_M | M5 Max | 128 GB | MLX | 26 | 1.5s | 2026-03 |
| Devstral Small 24B | 24B | Q4_K_M | M4 Pro | 32 GB | Ollama | 26 | 1.0s | 2026-05 |
| GLM 5.2 Air | 106B | Q4_K_M | M4 Max | 128 GB | MLX | 26 | 1.3s | 2026-07 |
| Gemma 4.5 27B | 27B | Q4_K_M | M4 Pro | 32 GB | Ollama | 26 | 1.0s | 2026-07 |
| Phi-5 Large 28B | 28B | Q4_K_M | M3 Max | 64 GB | Ollama | 26 | 1.1s | 2026-07 |
| Gemma 3 27B | 27B | Q4_K_M | M4 Pro | 24 GB | LM Studio | 25 | 1.5s | 2026-02 |
| Phi-5 Medium 14B | 14B | Q4_K_M | M2 | 16 GB | Ollama | 24 | 1.4s | 2026-06 |
| Command R+ 2 | 104B | Q4_K_M | M4 Max | 128 GB | MLX | 24 | 1.4s | 2026-07 |
| Gemma 4 31B | 31B | Q4_K_M | M5 Max | 64 GB | Ollama | 22 | 0.9s | 2026-04 |
| Qwen 3 32B | 32B | Q4_K_M | M4 Max | 64 GB | MLX | 22 | 1.4s | 2026-02 |
| Llama 4 Scout | 109B | Q4_K_M | M5 Max | 128 GB | Ollama | 22 | 1.8s | 2026-03 |
| Qwen 3.5 35B | 35B | Q4_K_M | M3 Max | 96 GB | Ollama | 22 | 1.5s | 2026-01 |
| Qwen3-235B-A22B | 235B | Q4_K_M | M4 Ultra | 192 GB | MLX | 22 | 1.5s | 2026-04 |
| Nemotron Cascade 2 | 30B | Q4_K_M | M4 Pro | 24 GB | Ollama | 22 | 1.5s | 2026-04 |
| Llama 5 70B | 70B | Q4_K_M | M4 Ultra | 192 GB | Ollama | 22 | 1.3s | 2026-06 |
| Mistral Voyage Pro 70B | 70B | Q4_K_M | M4 Ultra | 192 GB | Ollama | 20 | 1.5s | 2026-06 |
| Gemma 4 31B | 31B | Q4_K_M | M4 Max | 48 GB | MLX | 18 | 1.1s | 2026-04 |
| DeepSeek R1 32B | 32B | Q4_K_M | M4 Max | 48 GB | LM Studio | 18 | 1.8s | 2026-01 |
| Llama 3.3 70B | 70B | Q4_K_M | M4 Ultra | 192 GB | MLX | 18 | 2.0s | 2026-02 |
| Qwen3-235B-A22B | 235B | Q4_K_M | M5 Max | 128 GB | MLX | 18 | 1.8s | 2026-04 |
| Hermes 4 70B | 70B | Q4_K_M | M4 Ultra | 192 GB | Ollama | 18 | 1.5s | 2026-05 |
| Llama 5 70B | 70B | Q4_K_M | M5 Max | 128 GB | MLX | 18 | 1.6s | 2026-06 |
| DeepSeek R1 70B | 70B | Q4_K_M | M4 Ultra | 192 GB | MLX | 16 | 2.2s | 2026-02 |
| Hermes 4 70B | 70B | Q4_K_M | M5 Max | 128 GB | MLX | 16 | 1.8s | 2026-05 |
| Mistral Voyage Pro 70B | 70B | Q4_K_M | M5 Max | 128 GB | MLX | 16 | 1.8s | 2026-06 |
| Qwen 3 32B | 32B | Q4_K_M | M4 Pro | 32 GB | Ollama | 15 | 1.8s | 2026-01 |
| Llama 3.3 70B | 70B | Q4_K_M | M5 Max | 128 GB | MLX | 15 | 2.4s | 2026-03 |
| Qwen 2.5 72B | 72B | Q4_K_M | M4 Ultra | 192 GB | Ollama | 15 | 2.5s | 2026-02 |
| Qwen3-235B-A22B | 235B | Q4_K_M | M5 Max | 128 GB | Ollama | 15 | 2.2s | 2026-04 |
| Llama 5 70B | 70B | Q4_K_M | M4 Max | 128 GB | MLX | 15 | 1.9s | 2026-06 |
| Gemma 4 31B | 31B | Q4_K_M | M4 Pro | 24 GB | Ollama | 14 | 1.4s | 2026-04 |
| DeepSeek R1 32B | 32B | Q4_K_M | M3 Max | 36 GB | Ollama | 14 | 2.0s | 2025-12 |
| Hermes 4 70B | 70B | Q4_K_M | M4 Max | 128 GB | MLX | 13 | 2.1s | 2026-05 |
| Mistral Voyage Pro 70B | 70B | Q4_K_M | M4 Max | 128 GB | MLX | 13 | 2.1s | 2026-06 |
| Llama 3.3 70B | 70B | Q4_K_M | M5 Max | 128 GB | Ollama | 12 | 2.8s | 2026-03 |
| DeepSeek R2 | 671B | Q3_K_M | M4 Ultra | 192 GB | MLX | 12 | 2.0s | 2026-05 |
| DeepSeek R1 70B | 70B | Q4_K_M | M5 Max | 128 GB | Ollama | 11 | 3.0s | 2026-03 |
| Qwen 2.5 72B | 72B | Q4_K_M | M5 Max | 128 GB | Ollama | 10 | 3.2s | 2026-03 |
| GPT-oss 120B | 120B | Q4_K_M | M4 Ultra | 192 GB | MLX | 10 | 4.2s | 2026-02 |
| DeepSeek R2 | 671B | Q2_K | M5 Max | 128 GB | MLX | 8 | 2.5s | 2026-05 |
| GPT-oss 120B | 120B | Q4_K_M | M5 Max | 128 GB | Ollama | 7 | 5.5s | 2026-03 |
| Llama 5 405B | 405B | Q2_K | M4 Ultra | 192 GB | MLX | 5 | 3.0s | 2026-07 |
| Llama 5 405B | 405B | Q2_K | M5 Max | 128 GB | MLX | 4 | 3.5s | 2026-07 |
According to the LLMCheck index, all benchmarks measure tokens per second (tok/s) during the generation phase, excluding prompt processing time. This reflects the sustained output speed you experience when the model is actively generating text.
Time to first token (TTFT) is measured separately in seconds — the delay between submitting your prompt and receiving the first output token. TTFT depends on prompt length, model size, and available memory bandwidth.
Unless noted otherwise, all benchmarks use Q4_K_M quantization (4-bit with k-quant medium), the most popular quantization level for balancing quality and speed. Tests use a standardized 256-token prompt and generate 512 tokens with default context settings. Results are averaged over 3 runs on a freshly booted system.
LLMCheck benchmarks are sourced from community submissions and verified against known baselines. Chip names refer to the full SoC variant (e.g., "M4 Pro" means the M4 Pro chip specifically, not the base M4). RAM indicates the total unified memory of the test system.
Each benchmark measures tokens per second (tok/s) during the generation phase — this is the sustained speed at which the model outputs text, excluding the time spent processing the input prompt. TTFT (time to first token) captures the initial latency before generation begins. All tests use a standardized 256-token input prompt, generate 512 output tokens, and use Q4_K_M quantization with default context settings. Results are averaged over 3 consecutive runs.
Each engine uses a different inference backend with distinct optimizations. MLX is Apple's native framework, purpose-built for Metal GPU acceleration on Apple Silicon — it often delivers the fastest results, especially for smaller models. Ollama uses llama.cpp with Metal support and provides reliable, consistent performance. LM Studio also wraps llama.cpp but adds a GUI layer that can introduce minor overhead. The performance gap between engines is typically 5-15% for the same model and hardware configuration.
It depends on your target model size. For small models (3-9B), even an M1 with 16 GB delivers usable speeds (40-80 tok/s). For mid-size models (14-35B), the M4 Pro with 24 GB is the sweet spot — enough RAM for 14B models at 35-55 tok/s. For large models (70B+), the M5 Max with 128 GB is ideal, offering ~600 GB/s memory bandwidth. The M4 Ultra with 192 GB handles the biggest models but is overkill for anything under 70B.
Yes, we welcome community submissions. Run your benchmark using Ollama, LM Studio, or MLX with standard settings (Q4_K_M quantization, default context). Record your chip model, total RAM, engine version, and both tok/s and TTFT values. Submit via our GitHub repository or by email. We verify all submissions against known performance baselines before adding them to the database.
According to the LLMCheck index as of July 2026, Gemma 4 E2B is the fastest at approximately 158 tokens per second on M5 Max via MLX. Phi-4 Mini follows at ~135 tok/s. Among larger models, Qwen 4.1 32B-A3B (the #1 ranked Mac model, 80% SWE-V) generates ~62 tok/s on M4 Pro, and GLM 5.2 Air (106B-A12B MoE) achieves ~30 tok/s on a 64 GB Mac with near-frontier reasoning quality.
Memory bandwidth determines how fast your Mac can feed model weights to the GPU during inference. The LLMCheck index shows a near-linear relationship: the M5 Max (~600 GB/s bandwidth) generates tokens roughly 3x faster than a base M3 (~200 GB/s). This is why Unified Memory architecture gives Apple Silicon an advantage — there's no CPU-to-GPU transfer bottleneck.
The LLMCheck Score is a 0–100 composite metric: 50 points for model capability (sourced from Arena AI ELO, MMLU, and coding benchmarks), 25 points for Mac-specific speed (tok/s on M5 Max), 15 points for accessibility (minimum RAM), and 10 points for license openness. Full formula and per-model sources at /methodology.html.