According to LLMCheck, this open dataset covers 248 benchmark data points across 61 local LLMs and 16 Apple Silicon chips — real tokens-per-second and time-to-first-token for each. Every figure is labelled with its provenance: 5 vendor-published, 5 linked third-party runs, and 217 derived from the published memory-bandwidth model at Q4_K_M. Free to download as CSV or JSON.
🔍 Not sure what your Mac can run? Check your Mac in 10 seconds →
ⓘ Figures are transparent estimates unless marked sourced/community. Own a Mac? Submit a real benchmark →
Tokens-per-second figures — estimated, sourced, and community-submitted, each row labeled — across 56 models, 16 Apple Silicon chips, and 3 inference engines. Find exactly how fast your model runs on your Mac.
| Model↕ | Params↕ | Quant↕ | Chip↕ | RAM↕ | Engine↕ | tok/s (est.)↓ | TTFT↕ | Date↕ |
|---|---|---|---|---|---|---|---|---|
| Phi-4 Mini | 3.8B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated168 | 0.3s | 2026-03 |
| Phi-4 Mini | 3.8B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated88 | 0.4s | 2026-03 |
| Phi-4 Mini | 3.8B | Q4_K_M | M3 | 16 GB | MLX | estimated35 | 0.3s | 2026-02 |
| Phi-4 Mini | 3.8B | Q4_K_M | M2 | 8 GB | Ollama | estimated35 | 0.5s | 2026-01 |
| Phi-4 Mini | 3.8B | Q4_K_M | M1 | 16 GB | Ollama | estimated24 | 0.6s | 2025-12 |
| Qwen 3.5 4B | 4B | Q4_K_M | M5 Max | 64 GB | MLX | estimated161 | 0.2s | 2026-03 |
| Qwen 3.5 4B | 4B | Q4_K_M | M4 | 16 GB | Ollama | estimated40 | 0.4s | 2026-02 |
| Qwen 3 4B | 4B | Q4_K_M | M2 | 8 GB | Ollama | estimated33 | 0.7s | 2026-01 |
| Qwen 3 4B | 4B | Q4_K_M | M4 Pro | 24 GB | MLX | estimated84 | 0.3s | 2026-02 |
| Gemma 4 E2B | 2.3B | Q4_K_M | M5 Max | 128 GB | MLX | estimated261 | 0.1s | 2026-04 |
| Gemma 4 E2B | 2.3B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated150 | 0.2s | 2026-04 |
| Gemma 4 E2B | 2.3B | Q4_K_M | M3 | 16 GB | Ollama | estimated64 | 0.3s | 2026-04 |
| Gemma 4 E2B | 2.3B | Q4_K_M | M1 | 8 GB | Ollama | estimated45 | 0.5s | 2026-04 |
| Gemma 4 E4B | 4B | Q4_K_M | M5 Max | 128 GB | MLX | estimated161 | 0.2s | 2026-04 |
| Gemma 4 E4B | 4B | Q4_K_M | M5 Pro | 24 GB | Ollama | estimated84 | 0.3s | 2026-04 |
| Gemma 4 E4B | 4B | Q4_K_M | M4 Pro | 24 GB | MLX | estimated84 | 0.3s | 2026-04 |
| Gemma 4 E4B | 4B | Q4_K_M | M3 | 16 GB | Ollama | estimated33 | 0.4s | 2026-04 |
| Gemma 4 E4B | 4B | Q4_K_M | M1 | 8 GB | Ollama | estimated23 | 0.6s | 2026-04 |
| Gemma 4 26B-A4B | 26B | Q4_K_M | M5 Max | 128 GB | MLX | estimated50 | 0.5s | 2026-04 |
| Gemma 4 26B-A4B | 26B | Q4_K_M | M5 Pro | 24 GB | Ollama | estimated35 | 0.8s | 2026-04 |
| Gemma 4 26B-A4B | 26B | Q4_K_M | M4 Max | 48 GB | MLX | estimated40 | 0.7s | 2026-04 |
| Gemma 4 26B-A4B | 26B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated28 | 1.0s | 2026-04 |
| Gemma 4 31B | 31B | Q4_K_M | M5 Max | 128 GB | MLX | estimated26 | 0.7s | 2026-04 |
| Gemma 4 31B | 31B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated26 | 0.9s | 2026-04 |
| Gemma 4 31B | 31B | Q4_K_M | M4 Max | 48 GB | MLX | estimated24 | 1.1s | 2026-04 |
| Gemma 4 31B | 31B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated12 | 1.4s | 2026-04 |
| Gemma 3 4B | 4B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated161 | 0.3s | 2026-03 |
| Gemma 3 4B | 4B | Q4_K_M | M1 | 8 GB | Ollama | estimated23 | 0.8s | 2025-12 |
| Gemma 3 4B | 4B | Q4_K_M | M3 Pro | 18 GB | MLX | estimated49 | 0.4s | 2026-01 |
| Qwen 3.5 9B | 9B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated82 | 0.5s | 2026-03 |
| Qwen 3.5 9B | 9B | Q4_K_M | M4 | 16 GB | LM Studio | estimated18 | 0.6s | 2026-02 |
| Qwen 3.5 9B | 9B | Q4_K_M | M3 | 16 GB | Ollama | estimated15 | 0.7s | 2026-01 |
| Qwen 3.5 9B | 9B | Q4_K_M | M1 | 16 GB | Ollama | estimated10 | 1.1s | 2025-12 |
| Qwen 3 8B | 8B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated91 | 0.4s | 2026-03 |
| Qwen 3 8B | 8B | Q8_0 | M4 Pro | 24 GB | MLX | estimated45 | 0.5s | 2026-02 |
| Qwen 3 8B | 8B | Q4_K_M | M2 | 16 GB | Ollama | estimated17 | 0.7s | 2026-01 |
| DeepSeek R1 8B | 8B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated91 | 0.5s | 2026-03 |
| DeepSeek R1 8B | 8B | Q4_K_M | M4 | 16 GB | MLX | estimated20 | 0.5s | 2026-02 |
| DeepSeek R1 8B | 8B | Q4_K_M | M2 | 16 GB | Ollama | estimated17 | 0.8s | 2026-01 |
| DeepSeek R1 8B | 8B | Q4_K_M | M1 | 16 GB | Ollama | estimated12 | 1.2s | 2025-11 |
| Mistral 7B | 7B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated102 | 0.3s | 2026-03 |
| Mistral 7B | 7B | Q4_K_M | M4 Pro | 24 GB | MLX | estimated51 | 0.4s | 2026-02 |
| Mistral 7B | 7B | Q4_K_M | M3 | 16 GB | Ollama | estimated20 | 0.6s | 2026-01 |
| Mistral 7B | 7B | Q4_K_M | M1 | 16 GB | Ollama | estimated13 | 1.2s | 2025-12 |
| Llama 3.1 8B | 8B | Q4_K_M | M5 Max | 128 GB | MLX | estimated91 | 0.3s | 2026-03 |
| Llama 3.1 8B | 8B | Q4_K_M | M4 | 16 GB | Ollama | estimated20 | 0.6s | 2026-02 |
| Llama 3.1 8B | 8B | Q4_K_M | M3 Pro | 18 GB | Ollama | estimated25 | 0.7s | 2026-01 |
| Llama 3.1 8B | 8B | Q4_K_M | M1 | 16 GB | Ollama | estimated12 | 1.1s | 2025-12 |
| Ministral 8B | 8B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated91 | 0.4s | 2026-03 |
| Ministral 8B | 8B | Q4_K_M | M3 | 16 GB | LM Studio | estimated17 | 0.7s | 2026-01 |
| Gemma 3 12B | 12B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated64 | 0.6s | 2026-03 |
| Gemma 3 12B | 12B | Q4_K_M | M4 Pro | 24 GB | MLX | estimated31 | 0.7s | 2026-02 |
| Gemma 3 12B | 12B | Q4_K_M | M3 | 16 GB | Ollama | estimated12 | 1.1s | 2026-01 |
| Gemma 3 12B | 12B | Q4_K_M | M2 | 16 GB | Ollama | estimated12 | 1.3s | 2025-12 |
| Qwen 3 14B | 14B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated55 | 0.8s | 2026-03 |
| Qwen 3 14B | 14B | Q4_K_M | M4 Pro | 24 GB | LM Studio | estimated26 | 1.0s | 2026-02 |
| Qwen 3 14B | 14B | Q4_K_M | M3 | 16 GB | Ollama | estimated10 | 1.2s | 2026-01 |
| Phi-4 14B | 14B | Q4_K_M | M5 Max | 64 GB | MLX | estimated55 | 0.6s | 2026-03 |
| Phi-4 14B | 14B | Q4_K_M | M4 | 16 GB | Ollama | estimated12 | 1.0s | 2026-02 |
| Phi-4 14B | 14B | Q4_K_M | M2 | 16 GB | MLX | estimated10 | 1.3s | 2026-01 |
| Ministral 3 14B | 14B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated55 | 0.7s | 2026-03 |
| Ministral 3 14B | 14B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated26 | 0.9s | 2026-02 |
| Gemma 3 27B | 27B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated30 | 0.9s | 2026-03 |
| Gemma 3 27B | 27B | Q4_K_M | M4 Pro | 24 GB | LM Studio | estimated14 | 1.5s | 2026-02 |
| Gemma 3 27B | 27B | Q4_K_M | M4 Max | 48 GB | MLX | estimated27 | 1.1s | 2026-02 |
| Qwen 3 30B-A3B | 30B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated62 | 0.7s | 2026-03 |
| Qwen 3 30B-A3B | 30B | Q4_K_M | M4 Max | 48 GB | Ollama | estimated42 | 0.9s | 2026-02 |
| Qwen 3 30B-A3B | 30B | Q4_K_M | M4 Pro | 24 GB | MLX | estimated35 | 1.0s | 2026-02 |
| Qwen 3 30B-A3B | 30B | Q4_K_M | M3 Max | 36 GB | Ollama | estimated41 | 1.3s | 2026-01 |
| Qwen 3.5 35B-A3B | 35B | Q4_K_M | M5 Max | 64 GB | MLX | estimated52 | 0.9s | 2026-03 |
| Qwen 3.5 35B-A3B | 35B | Q4_K_M | M4 Max | 48 GB | Ollama | estimated34 | 1.2s | 2026-02 |
| Qwen 3.5 35B-A3B | 35B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated48 | 0.9s | 2026-03 |
| Qwen 3 32B | 32B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated25 | 1.1s | 2026-03 |
| Qwen 3 32B | 32B | Q4_K_M | M4 Max | 64 GB | MLX | estimated23 | 1.4s | 2026-02 |
| Qwen 3 32B | 32B | Q4_K_M | M4 Pro | 32 GB | Ollama | estimated12 | 1.8s | 2026-01 |
| DeepSeek R1 32B | 32B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated25 | 1.2s | 2026-03 |
| DeepSeek R1 32B | 32B | Q4_K_M | M4 Max | 48 GB | LM Studio | estimated23 | 1.8s | 2026-01 |
| DeepSeek R1 32B | 32B | Q4_K_M | M3 Max | 36 GB | Ollama | estimated17 | 2.0s | 2025-12 |
| Llama 3.3 70B | 70B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated12 | 2.8s | 2026-03 |
| Llama 3.3 70B | 70B | Q4_K_M | M4 Ultra | 192 GB | MLX | estimated21 | 2.0s | 2026-02 |
| Llama 3.3 70B | 70B | Q4_K_M | M5 Max | 128 GB | MLX | estimated12 | 2.4s | 2026-03 |
| DeepSeek R1 70B | 70B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated12 | 3.0s | 2026-03 |
| DeepSeek R1 70B | 70B | Q4_K_M | M4 Ultra | 192 GB | MLX | estimated21 | 2.2s | 2026-02 |
| Qwen 2.5 72B | 72B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated12 | 3.2s | 2026-03 |
| Qwen 2.5 72B | 72B | Q4_K_M | M4 Ultra | 192 GB | Ollama | estimated21 | 2.5s | 2026-02 |
| GPT-oss 120B | 120B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated7 | 5.5s | 2026-03 |
| GPT-oss 120B | 120B | Q4_K_M | M4 Ultra | 192 GB | MLX | estimated13 | 4.2s | 2026-02 |
| Llama 4 Scout | 109B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated22 | 1.8s | 2026-03 |
| Llama 4 Scout | 109B | Q4_K_M | M4 Ultra | 192 GB | MLX | estimated30 | 1.3s | 2026-02 |
| Llama 4 Scout | 109B | Q4_K_M | M5 Max | 128 GB | MLX | estimated26 | 1.5s | 2026-03 |
| Mistral 7B | 7B | Q8_0 | M5 Max | 64 GB | MLX | estimated102 | 0.4s | 2026-03 |
| Mistral 7B | 7B | Q8_0 | M4 Pro | 24 GB | Ollama | estimated51 | 0.5s | 2026-02 |
| Qwen 3.5 9B | 9B | Q8_0 | M5 Max | 128 GB | MLX | estimated82 | 0.5s | 2026-03 |
| Llama 3.1 8B | 8B | Q8_0 | M5 Max | 64 GB | Ollama | estimated91 | 0.4s | 2026-03 |
| Qwen 3 14B | 14B | Q8_0 | M5 Max | 128 GB | MLX | estimated55 | 0.9s | 2026-03 |
| Phi-4 Mini | 3.8B | Q8_0 | M5 Max | 64 GB | MLX | estimated168 | 0.3s | 2026-03 |
| Phi-4 Mini | 3.8B | Q4_K_M | M4 Max | 48 GB | MLX | estimated156 | 0.3s | 2026-02 |
| Gemma 3 4B | 4B | Q8_0 | M4 Pro | 24 GB | MLX | estimated84 | 0.3s | 2026-02 |
| Qwen 3.5 35B-A3B | 35B | Q4_K_M | M3 Max | 96 GB | Ollama | estimated22 | 1.5s | 2026-01 |
| DeepSeek R1 8B | 8B | Q8_0 | M5 Max | 64 GB | MLX | estimated91 | 0.5s | 2026-03 |
| Qwen 3 8B | 8B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated45 | 0.5s | 2026-02 |
| Qwen 3 8B | 8B | Q4_K_M | M1 | 16 GB | Ollama | estimated12 | 1.0s | 2025-12 |
| Ministral 8B | 8B | Q4_K_M | M4 | 16 GB | MLX | estimated20 | 0.5s | 2026-02 |
| Ministral 3 14B | 14B | Q4_K_M | M3 | 16 GB | LM Studio | estimated10 | 1.2s | 2026-01 |
| Gemma 3 27B | 27B | Q4_K_M | M3 Max | 96 GB | MLX | estimated20 | 1.3s | 2026-01 |
| Qwen 3 32B | 32B | Q4_K_M | M4 Ultra | 192 GB | Ollama | estimated45 | 1.0s | 2026-02 |
| Llama 3.1 8B | 8B | Q4_K_M | M2 | 8 GB | Ollama | estimated17 | 0.8s | 2025-12 |
| Qwen 3.5 9B | 9B | Q4_K_M | M4 Pro | 24 GB | MLX | estimated40 | 0.4s | 2026-03 |
| Qwen 3 4B | 4B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated161 | 0.2s | 2026-03 |
| Qwen 3.6-35B-A3B | 35B | Q4_K_M | M5 Max | 128 GB | MLX | estimated55 | 0.6s | 2026-04 |
| Qwen 3.6-35B-A3B | 35B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated48 | 0.8s | 2026-04 |
| Qwen 3.6-35B-A3B | 35B | Q4_K_M | M4 Max | 48 GB | MLX | estimated42 | 0.9s | 2026-04 |
| Qwen 3.6-35B-A3B | 35B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated32 | 1.2s | 2026-04 |
| Mistral Small 4 | 119B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated38 | 0.9s | 2026-04 |
| Mistral Small 4 | 119B | Q4_K_M | M5 Max | 128 GB | MLX | estimated42 | 0.8s | 2026-04 |
| Mistral Small 4 | 119B | Q4_K_M | M4 Ultra | 192 GB | MLX | estimated45 | 0.7s | 2026-04 |
| Qwen3-235B-A22B | 235B | Q4_K_M | M5 Max | 128 GB | Ollama | estimated15 | 2.2s | 2026-04 |
| Qwen3-235B-A22B | 235B | Q4_K_M | M5 Max | 128 GB | MLX | estimated18 | 1.8s | 2026-04 |
| Qwen3-235B-A22B | 235B | Q4_K_M | M4 Ultra | 192 GB | MLX | estimated22 | 1.5s | 2026-04 |
| Nemotron-Cascade 2 | 30B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated35 | 0.9s | 2026-04 |
| Nemotron-Cascade 2 | 30B | Q4_K_M | M4 Max | 48 GB | MLX | estimated28 | 1.2s | 2026-04 |
| Nemotron-Cascade 2 | 30B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated22 | 1.5s | 2026-04 |
| Mistral Small 3.2 24B | 24B | Q4_K_M | M5 Max | 128 GB | MLX | estimated33 | 0.6s | 2026-05 |
| Mistral Small 3.2 24B | 24B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated33 | 0.7s | 2026-05 |
| Mistral Small 3.2 24B | 24B | Q4_K_M | M4 Max | 48 GB | MLX | estimated31 | 0.8s | 2026-05 |
| Mistral Small 3.2 24B | 24B | Q4_K_M | M4 Pro | 32 GB | Ollama | estimated16 | 1.0s | 2026-05 |
| Hermes 4 70B | 70B | Q4_K_M | M5 Max | 128 GB | MLX | estimated12 | 1.8s | 2026-05 |
| Hermes 4 70B | 70B | Q4_K_M | M4 Max | 128 GB | MLX | estimated11 | 2.1s | 2026-05 |
| Hermes 4 70B | 70B | Q4_K_M | M4 Ultra | 192 GB | Ollama | estimated21 | 1.5s | 2026-05 |
| SmolLM3 3B | 3B | Q4_K_M | M5 Max | 64 GB | MLX | estimated199 | 0.1s | 2026-05 |
| SmolLM3 3B | 3B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated108 | 0.2s | 2026-05 |
| SmolLM3 3B | 3B | Q4_K_M | M3 | 16 GB | Ollama | estimated44 | 0.3s | 2026-05 |
| SmolLM3 3B | 3B | Q4_K_M | M2 | 8 GB | Ollama | estimated44 | 0.4s | 2026-05 |
| SmolLM3 3B | 3B | Q4_K_M | M1 | 8 GB | Ollama | estimated30 | 0.5s | 2026-05 |
| Devstral Small 24B | 24B | Q4_K_M | M5 Max | 128 GB | MLX | estimated33 | 0.6s | 2026-05 |
| Devstral Small 24B | 24B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated33 | 0.7s | 2026-05 |
| Devstral Small 24B | 24B | Q4_K_M | M4 Max | 48 GB | MLX | estimated31 | 0.8s | 2026-05 |
| Devstral Small 24B | 24B | Q4_K_M | M4 Pro | 32 GB | Ollama | estimated16 | 1.0s | 2026-05 |
| GLM-4.5-Air | 106B | Q4_K_M | M5 Max | 128 GB | MLX | estimated34 | 0.9s | 2026-07 |
| GLM-4.5-Air | 106B | Q4_K_M | M5 Max | 64 GB | Ollama | estimated30 | 1.1s | 2026-07 |
| GLM-4.5-Air | 106B | Q4_K_M | M4 Max | 128 GB | MLX | estimated26 | 1.3s | 2026-07 |
| GLM-4.5-Air | 106B | Q4_K_M | M4 Ultra | 192 GB | MLX | estimated38 | 0.8s | 2026-07 |
| DeepSeek V4 Flash | 284B-A13B | Q2_K | M5 Max | 128 GB | MLX | community39 | 0.4s | 2026-08 |
| DeepSeek V4 Flash | 284B-A13B | Q2_K | M3 Max | 128 GB | MLX | community27 | 0.6s | 2026-08 |
| GLM 5.2 | 753B-A40B | IQ1_S | M3 Ultra | 256 GB | LM Studio | community22 | 1.5s | 2026-07 |
| GLM 5.2 | 753B-A40B | Q4_K_M | M3 Ultra | 512 GB | MLX | community15 | 2.0s | 2026-07 |
| Muse Glimmer 30B | 30B | Q4_K_M | M4 Pro | 24 GB | LM Studio | community10 | 0.8s | 2026-08 |
| Muse Glimmer 30B | 30B | Q4_K_M | M5 Max | 64 GB | MLX | sourced27 | 0.4s | 2026-08 |
| Muse Glimmer 30B | 30B | Q4_K_M | M4 Max | 48 GB | MLX | sourced24 | 0.5s | 2026-08 |
| LFM2.5-2.6B | 2.6B | Q4_K_M | M5 Max | 64 GB | MLX | sourced220 | 0.1s | 2026-08 |
| Maple Preview 20B-A1B | 20B-A1B | Ternary | M5 Pro | 24 GB | MLX | sourced281 | 0.1s | 2026-08 |
| Maple Preview 20B-A1B | 20B-A1B | Ternary | M4 | 16 GB | MLX | sourced200 | 0.1s | 2026-08 |
| Qwen 3.6-27B | 27B | Q4_K_M | M5 Max | 64 GB | MLX | estimated30 | 0.3s | 2026-08 |
| Qwen 3.6-27B | 27B | Q4_K_M | M4 Max | 64 GB | MLX | estimated27 | 0.3s | 2026-08 |
| Qwen 3.6-27B | 27B | Q4_K_M | M3 Max | 64 GB | Ollama | estimated20 | 0.4s | 2026-08 |
| Qwen 3.6-27B | 27B | Q4_K_M | M5 Pro | 24 GB | MLX | estimated14 | 0.5s | 2026-08 |
| Qwen 3.6-27B | 27B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated14 | 0.5s | 2026-08 |
| KAT-Coder-V2.5 | 35B-A3B | Q4_K_M | M5 Max | 64 GB | MLX | estimated52 | 0.3s | 2026-08 |
| KAT-Coder-V2.5 | 35B-A3B | Q4_K_M | M4 Max | 48 GB | MLX | estimated47 | 0.3s | 2026-08 |
| KAT-Coder-V2.5 | 35B-A3B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated24 | 0.4s | 2026-08 |
| Nemotron 3.5 Lightning | 30B-A3B | Q4_K_M | M5 Max | 64 GB | MLX | estimated60 | 0.2s | 2026-08 |
| Nemotron 3.5 Lightning | 30B-A3B | Q4_K_M | M4 Max | 48 GB | MLX | estimated55 | 0.3s | 2026-08 |
| Nemotron 3.5 Lightning | 30B-A3B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated28 | 0.4s | 2026-08 |
| Laguna S 2.1 | 118B-A8B | Q4_K_M | M5 Max | 128 GB | MLX | estimated26 | 0.6s | 2026-08 |
| Laguna S 2.1 | 118B-A8B | Q4_K_M | M4 Max | 128 GB | MLX | estimated24 | 0.7s | 2026-08 |
| Laguna XS 2.1 | 33B-A3B | Q4_K_M | M5 Max | 64 GB | MLX | estimated55 | 0.3s | 2026-08 |
| Laguna XS 2.1 | 33B-A3B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated25 | 0.4s | 2026-08 |
| Inkling-Small | 276B-A12B | Q2_K | M5 Max | 128 GB | MLX | estimated22 | 0.8s | 2026-08 |
| Bonsai 27B | 27B | 1-bit | M5 Max | 64 GB | MLX | estimated30 | 0.2s | 2026-08 |
| Bonsai 27B | 27B | 1-bit | M4 | 16 GB | MLX | estimated6 | 0.3s | 2026-08 |
| Bonsai 27B | 27B | 1-bit | M2 | 8 GB | MLX | estimated5 | 0.5s | 2026-08 |
| Nanbeige4.2-3B | 3B | Q4_K_M | M5 Max | 64 GB | MLX | estimated199 | 0.2s | 2026-08 |
| Nanbeige4.2-3B | 3B | Q4_K_M | M4 | 16 GB | Ollama | estimated52 | 0.3s | 2026-08 |
| Nanbeige4.2-3B | 3B | Q4_K_M | M2 | 8 GB | Ollama | estimated44 | 0.4s | 2026-08 |
| Apertus 1.5 8B | 8B | Q4_K_M | M5 Max | 64 GB | MLX | estimated91 | 0.3s | 2026-08 |
| Apertus 1.5 8B | 8B | Q4_K_M | M4 | 16 GB | Ollama | estimated20 | 0.4s | 2026-08 |
| Apertus 1.5 70B | 70B | Q4_K_M | M5 Max | 128 GB | MLX | estimated12 | 0.9s | 2026-08 |
| Apertus 1.5 70B | 70B | Q4_K_M | M4 Ultra | 96 GB | MLX | estimated21 | 0.6s | 2026-08 |
| GLM-4.7-Flash | 31B | Q4_K_M | M5 Max | 64 GB | MLX | estimated26 | 0.3s | 2026-08 |
| GLM-4.7-Flash | 31B | Q4_K_M | M4 Max | 48 GB | MLX | estimated24 | 0.4s | 2026-08 |
| GLM-4.7-Flash | 31B | Q4_K_M | M4 Pro | 24 GB | Ollama | estimated12 | 0.5s | 2026-08 |
| MiniMax M2.5 | 230B-A10B | Q4_K_M | M4 Ultra | 192 GB | MLX | estimated33 | 0.7s | 2026-08 |
| Llama 3.3 70B | 70B | Q4_K_M | M1 Ultra | 128 GB | Ollama | estimated16 | 0.8s | 2026-08 |
| DeepSeek R1 70B | 70B | Q4_K_M | M1 Ultra | 128 GB | Ollama | estimated16 | 0.9s | 2026-08 |
| Qwen 3.6-35B-A3B | 35B-A3B | Q4_K_M | M1 Ultra | 64 GB | MLX | estimated64 | 0.3s | 2026-08 |
| Qwen 3.6-27B | 27B | Q4_K_M | M1 Ultra | 64 GB | MLX | estimated39 | 0.4s | 2026-08 |
| Gemma 4 26B-A4B | 26B-A4B | Q4_K_M | M1 Ultra | 64 GB | Ollama | estimated67 | 0.3s | 2026-08 |
| GPT-oss 120B | 117B | Q4_K_M | M1 Ultra | 128 GB | Ollama | estimated9 | 1.0s | 2026-08 |
| Llama 3.3 70B | 70B | Q4_K_M | M2 Max | 96 GB | Ollama | estimated8 | 1.2s | 2026-08 |
| Qwen 3.6-35B-A3B | 35B-A3B | Q4_K_M | M2 Max | 64 GB | MLX | estimated32 | 0.5s | 2026-08 |
| Qwen 3.6-27B | 27B | Q4_K_M | M2 Max | 32 GB | MLX | estimated20 | 0.6s | 2026-08 |
| Gemma 3 27B | 27B | Q4_K_M | M2 Max | 32 GB | Ollama | estimated20 | 0.6s | 2026-08 |
| Llama 3.1 8B | 8B | Q4_K_M | M2 Max | 32 GB | Ollama | estimated64 | 0.3s | 2026-08 |
| Mistral Small 3.2 24B | 24B | Q4_K_M | M2 Max | 32 GB | Ollama | estimated23 | 0.5s | 2026-08 |
| Llama 3.3 70B | 70B | Q4_K_M | M3 Ultra | 256 GB | Ollama | estimated16 | 0.7s | 2026-08 |
| DeepSeek V4 Flash | 284B-A13B | Q4_K_M | M3 Ultra | 256 GB | MLX | estimated30 | 0.5s | 2026-08 |
| Inkling-Small | 276B-A12B | Q4_K_M | M3 Ultra | 512 GB | MLX | estimated30 | 0.9s | 2026-08 |
| Qwen3-235B-A22B | 235B-A22B | Q4_K_M | M3 Ultra | 256 GB | MLX | estimated19 | 0.8s | 2026-08 |
| Hunyuan Hy3 | 295B-A21B | Q4_K_M | M3 Ultra | 256 GB | LM Studio | estimated16 | 0.9s | 2026-08 |
| Qwen3-Coder-Next | 80B-A3B | Q4_K_M | M5 Max | 64 GB | MLX | estimated35 | 0.4s | 2026-08 |
| Qwen3-Coder-Next | 80B-A3B | Q4_K_M | M4 Max | 64 GB | MLX | estimated32 | 0.4s | 2026-08 |
| Qwen3-Coder-Next | 80B-A3B | Q4_K_M | M4 Ultra | 96 GB | MLX | estimated58 | 0.3s | 2026-08 |
| Qwen3.8-27B | 27.8B | Q4_K_M | M6 | 24 GB | MLX | estimated8 | — | 2026-08 |
| Qwen 3.6-27B | 27B | Q4_K_M | M6 | 24 GB | MLX | estimated9 | — | 2026-08 |
| Muse Glimmer 30B | 30B | Q4_K_M | M6 | 32 GB | MLX | estimated8 | — | 2026-08 |
| Gemma 4 26B-A4B | 26B | Q4_K_M | M6 | 24 GB | MLX | estimated14 | — | 2026-08 |
| KAT-Coder-V2.5 | 35B | Q4_K_M | M6 | 32 GB | MLX | estimated15 | — | 2026-08 |
| Qwen 3.6-35B-A3B | 35B | Q4_K_M | M6 | 32 GB | MLX | estimated14 | — | 2026-08 |
| Nemotron 3.5 Lightning | 30B | Q4_K_M | M6 | 32 GB | MLX | estimated17 | — | 2026-08 |
| DeepSeek R1 8B | 8B | Q4_K_M | M6 | 16 GB | MLX | estimated29 | — | 2026-08 |
| Qwen 3.5 9B | 9B | Q4_K_M | M6 | 16 GB | MLX | estimated26 | — | 2026-08 |
| Phi-4 14B | 14B | Q4_K_M | M6 | 16 GB | MLX | estimated17 | — | 2026-08 |
| Gemma 4 E4B | 4B | Q4_K_M | M6 | 16 GB | MLX | estimated55 | — | 2026-08 |
| LFM2.5-2.6B | 2.6B | Q4_K_M | M6 | 16 GB | MLX | estimated81 | — | 2026-08 |
| DeepSeek V4 Flash | 284B-A13B | Q4_K_M | M5 Ultra | 256 GB | MLX | estimated47 | — | 2026-08 |
| Inkling-Small | 276B | Q4_K_M | M5 Ultra | 256 GB | MLX | estimated45 | — | 2026-08 |
| Qwen3-235B-A22B | 235B | Q4_K_M | M5 Ultra | 256 GB | MLX | estimated37 | — | 2026-08 |
| Mistral Small 4 | 119B | Q4_K_M | M5 Ultra | 96 GB | MLX | estimated86 | — | 2026-08 |
| GPT-oss 120B | 117B | Q4_K_M | M5 Ultra | 96 GB | MLX | estimated14 | — | 2026-08 |
| Llama 3.3 70B | 70B | Q4_K_M | M5 Ultra | 96 GB | MLX | estimated24 | — | 2026-08 |
| DeepSeek R1 70B | 70B | Q4_K_M | M5 Ultra | 96 GB | MLX | estimated24 | — | 2026-08 |
| Qwen3-Coder-Next | 80B | Q4_K_M | M5 Ultra | 96 GB | MLX | estimated72 | — | 2026-08 |
| GLM-4.5-Air | 106B | Q4_K_M | M5 Ultra | 96 GB | MLX | estimated61 | — | 2026-08 |
| Laguna S 2.1 | 118B | Q4_K_M | M5 Ultra | 96 GB | MLX | estimated53 | — | 2026-08 |
| Llama 3.1 405B | 405B | Q4_K_M | M5 Ultra | 512 GB | MLX | estimated4 | — | 2026-08 |
| Qwen3.8-27B | 27.8B | Q4_K_M | M5 Ultra | 96 GB | MLX | estimated57 | — | 2026-08 |
| Qwen 2.5 72B | 72B | Q4_K_M | M5 Ultra | 96 GB | MLX | estimated23 | — | 2026-08 |
| GLM-5.3-Flash | 320B-A18B | IQ3_XXS | M5 Max | 128 GB | MLX | estimated27 | — | 2026-09 |
| GLM-5.3-Flash | 320B-A18B | IQ4_XS | M4 Ultra | 192 GB | MLX | estimated32 | — | 2026-09 |
| GLM-5.3-Flash | 320B-A18B | Q4_K_M | M3 Ultra | 256 GB | MLX | estimated25 | — | 2026-09 |
| GLM-5.3-Flash | 320B-A18B | Q4_K_M | M5 Ultra | 256 GB | MLX | estimated35 | — | 2026-09 |
| Qwen3.8-Flash-Next | 125B-A6B | Q4_K_M | M5 Max | 128 GB | MLX | estimated49 | — | 2026-09 |
| Qwen3.8-Flash-Next | 125B-A6B | Q4_K_M | M4 Max | 128 GB | MLX | estimated45 | — | 2026-09 |
| Qwen3.8-Flash-Next | 125B-A6B | Q4_K_M | M4 Ultra | 192 GB | MLX | estimated78 | — | 2026-09 |
| Qwen3.8-Flash-Next | 125B-A6B | Q4_K_M | M3 Ultra | 256 GB | MLX | estimated63 | — | 2026-09 |
| Qwen3.8-Flash-Next | 125B-A6B | Q4_K_M | M5 Ultra | 256 GB | MLX | estimated85 | — | 2026-09 |
| DeepSeek V4 Flash Vision-Exp | 305B-A13B | Q2_K | M5 Max | 128 GB | llama.cpp | estimated39 | — | 2026-09 |
| DeepSeek V4 Flash Vision-Exp | 305B-A13B | Q4_K_M | M4 Ultra | 192 GB | llama.cpp | estimated42 | — | 2026-09 |
| DeepSeek V4 Flash Vision-Exp | 305B-A13B | Q4_K_M | M3 Ultra | 256 GB | llama.cpp | estimated33 | — | 2026-09 |
| DeepSeek V4 Flash Vision-Exp | 305B-A13B | Q4_K_M | M5 Ultra | 256 GB | llama.cpp | estimated47 | — | 2026-09 |
| Qwen3.8-27B | 27.8B | Q4_K_M | M5 Max | 128 GB | MLX | estimated29 | — | 2026-09 |
| Qwen3.8-27B | 27.8B | Q4_K_M | M4 Max | 64 GB | MLX | estimated27 | — | 2026-09 |
| Qwen3.8-27B | 27.8B | Q4_K_M | M3 Max | 64 GB | MLX | estimated20 | — | 2026-09 |
| Qwen3.8-27B | 27.8B | Q4_K_M | M4 Pro | 48 GB | Ollama | estimated14 | — | 2026-09 |
| GLM-5.3 | 753B-A40B | Q2_K | M5 Ultra | 256 GB | MLX | estimated29 | — | 2026-09 |
| GLM-5.3 | 753B-A40B | Q2_K | M3 Ultra | 256 GB | MLX | estimated20 | — | 2026-09 |
| GLM-5.3 | 753B-A40B | Q4_K_M | M5 Ultra | 512 GB | MLX | estimated17 | — | 2026-09 |
| GLM-5.3 | 753B-A40B | Q4_K_M | M3 Ultra | 512 GB | MLX | estimated12 | — | 2026-09 |
According to the LLMCheck index, all benchmarks measure tokens per second (tok/s) during the generation phase, excluding prompt processing time. This reflects the sustained output speed you experience when the model is actively generating text.
Time to first token (TTFT) is measured separately in seconds — the delay between submitting your prompt and receiving the first output token. TTFT depends on prompt length, model size, and available memory bandwidth.
Unless noted otherwise, figures assume Q4_K_M quantization (4-bit with k-quant medium), the most popular level for balancing quality and speed. The reference protocol for a measured row is a standardized 256-token prompt generating 512 tokens at default context settings, averaged over 3 runs on an otherwise idle machine; that is what vendors and contributors are asked to report. Estimated rows are not measured at all — they are computed from the model's memory footprint and the chip's bandwidth. Check the mark on each speed cell.
LLMCheck benchmarks are sourced from community submissions and verified against known baselines. Chip names refer to the full SoC variant (e.g., "M4 Pro" means the M4 Pro chip specifically, not the base M4). RAM indicates the total unified memory of the test system.
Next step
You have the tok/s figure. The two questions it usually raises next:
Already own the Mac — see every model that fits your exact chip and RAM, ranked on these same figures →
Still choosing one — the Mac Advisor turns a budget into a specific config →
Comparing the machines themselves? The Mac hardware guide sets out memory bandwidth, RAM tiers and prices side by side.
On an Intel Mac? These figures are Apple Silicon only — what an Intel Mac can realistically run, and how fast.
Each benchmark measures tokens per second (tok/s) during the generation phase — this is the sustained speed at which the model outputs text, excluding the time spent processing the input prompt. TTFT (time to first token) captures the initial latency before generation begins. The reference protocol for a measured row is a standardized 256-token input prompt, 512 output tokens, Q4_K_M quantization and default context settings, averaged over 3 consecutive runs on an otherwise idle machine — what vendors and contributors are asked to report. Estimated rows are computed from memory footprint and bandwidth instead; the mark on each speed cell says which you are looking at.
Each engine uses a different inference backend with distinct optimizations. MLX is Apple's native framework, purpose-built for Metal GPU acceleration on Apple Silicon — it often delivers the fastest results, especially for smaller models. Ollama uses llama.cpp with Metal support and provides reliable, consistent performance. LM Studio also wraps llama.cpp but adds a GUI layer that can introduce minor overhead. The performance gap between engines is typically 5-15% for the same model and hardware configuration.
It depends on your target model size. For small models (3-9B), even an M1 with 16 GB delivers usable speeds (40-80 tok/s). For mid-size models (14-35B), the M4 Pro with 24 GB is the sweet spot — enough RAM for 14B models at 35-55 tok/s. For large models (70B+), the M5 Max with 128 GB is ideal, offering ~600 GB/s memory bandwidth. The M4 Ultra with 192 GB handles the biggest models but is overkill for anything under 70B.
Yes, we welcome community submissions. Run your benchmark using Ollama, LM Studio, or MLX with standard settings (Q4_K_M quantization, default context). Record your chip model, total RAM, engine version, and both tok/s and TTFT values. Submit via our GitHub repository or by email. We verify all submissions against known performance baselines before adding them to the database.
According to the LLMCheck index as of August 2026, Maple Preview 20B-A1B is the fastest entry at 281 tokens per second on an M5 Pro (vendor-reported), with LFM2.5-2.6B at 220 tok/s on M5 Max (vendor-reported) and Gemma 4 E2B the fastest pure-estimate entry at ~261 tok/s. Among larger models, Qwen 3.6-27B (the #1 ranked Mac model, 77.2% SWE-bench Verified) generates ~30 tok/s estimated on an M5 Max, and DeepSeek V4 Flash (284B-A13B MoE) achieves ~39 tok/s community-reported on a 128 GB M5 Max at 2-bit.
Memory bandwidth determines how fast your Mac can feed model weights to the GPU during inference. The LLMCheck index shows a near-linear relationship: the M5 Max (~600 GB/s bandwidth) generates tokens roughly 3x faster than a base M3 (~200 GB/s). This is why Unified Memory architecture gives Apple Silicon an advantage — there's no CPU-to-GPU transfer bottleneck.
The LLMCheck Score is a 0–100 composite metric: 50 points for model capability (sourced from Arena AI ELO, MMLU, and coding benchmarks), 25 points for Mac-specific speed (tok/s on M5 Max), 15 points for accessibility (minimum RAM), and 10 points for license openness. Full formula and per-model sources at /methodology.html.
Every measurement on this page in CSV and JSON, free under CC BY 4.0 — including the provenance field, so you can filter to sourced rows only.