Evaluate the throughput (tokens per second), time-to-first-token (TTFT), and cost efficiency tradeoffs across industry-leading models.
| Model | Speed Class | Tokens / Sec (TPS) | Est. TTFT | Input $/1M | Output $/1M | Primary Use Case |
|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | Instant | ~165 tps | 120ms | $1.50 | $7.50 | High-Volume Real-Time |
| DeepSeek V4 Flash | Instant | ~145 tps | 180ms | $0.44 | $1.32 | Budget Speed |
| GPT-5.6 Luna | Fast | ~130 tps | 150ms | $0.20 | $1.20 | Low-Latency Classification |
| Claude Haiku 4.5 | Fast | ~125 tps | 160ms | $1.00 | $5.00 | Budget Support |
| GPT-5.6 Terra | Standard | ~85 tps | 240ms | $2.00 | $12.00 | Production General |
| Claude Sonnet 5 | Standard | ~78 tps | 280ms | $2.00 | $10.00 | Balanced Frontier |
| Gemini 3.1 Pro | Standard | ~75 tps | 310ms | $2.00 | $12.00 | Deep Context |
| GPT-5.6 Sol | Deep | ~55 tps | 450ms | $5.00 | $30.00 | Flagship Frontier |
| Claude Opus 5 | Deep | ~48 tps | 520ms | $5.00 | $25.00 | Flagship Reasoning |
| o3 (Reasoning Frontier) | Reasoning | ~32 tps | 1200ms | $10.00 | $40.00 | Heavy Chain-of-Thought |
Coding composite score vs output price. Models toward the top-left deliver the most quality per dollar — the budget-tier sweet spot most teams should target first.
| Model | Intelligence | Coding | Agentic | Output $/1M | Coding / $1 output |
|---|---|---|---|---|---|
| GLM-5.3-Flash (Z.ai) | 57.5 | 71.5 | 58.2 | $0.25 | 286.0 |
| DeepSeek V3.2 (OpenRouter) | — | 44.2 | — | $0.38 | 116.3 |
| DeepSeek V3 (Chat) | 15.2 | 21.2 | 1.6 | $0.28 | 75.7 |
| Llama 3.1 8B Instruct | — | 5.4 | — | $0.08 | 67.5 |
| GPT-5.6 Luna | 52.3 | 71.4 | 46.9 | $1.20 | 59.5 |
| Gemma 4 31B Instruct | 29.7 | 43.4 | 14.4 | $0.75 | 57.9 |
| MiniMax M3 (OpenRouter) | 45.4 | 58.6 | 36.1 | $1.20 | 48.8 |
| Qwen3 Coder Next (OpenRouter) | 21.3 | 36.2 | 8.9 | $0.80 | 45.3 |
| GPT-5.4 nano | 39.7 | 56.1 | 29.7 | $1.25 | 44.9 |
| MiniMax M2.7 (OpenRouter) | 38.9 | 52.6 | 25.9 | $1.20 | 43.8 |
| DeepSeek V4 Flash | 42.1 | 56.2 | 33.7 | $1.32 | 42.6 |
| Cerebras — GPT OSS 120B | 24.1 | 30.4 | 13.4 | $0.75 | 40.5 |
| DeepInfra — Llama 3.3 70B | — | 11.9 | — | $0.30 | 39.7 |
| Grok Build 0.1 | 40.7 | 51.5 | 28.9 | $2.00 | 25.8 |
| GLM-5 (Z.ai) | 59.5 | 74.8 | 59.1 | $3.20 | 23.4 |
| Gemini 3.1 Flash Lite (OpenRouter) | 25.6 | 34.7 | 6.5 | $1.50 | 23.1 |
| GLM-4.6 (Z.ai) | 29.3 | 45.8 | 18.6 | $2.20 | 20.8 |
| Qwen3.5 397B A17B (OpenRouter) | 34.3 | 48.2 | 19.8 | $2.34 | 20.6 |
| GLM 4.7 (Zhipu) | 34.5 | 45.3 | 26.2 | $2.20 | 20.6 |
| Llama 3.3 70B Instruct | — | 11.9 | — | $0.59 | 20.2 |
| Gemini 3.5 Flash-Lite | 37.4 | 49.3 | 27.2 | $2.50 | 19.7 |
| GPT-4o mini | — | 11.4 | 1 | $0.60 | 19.0 |
| Llama 4 Scout (109B MoE) | 10.3 | 8.2 | 1.1 | $0.45 | 18.2 |
| Together AI — Llama 4 Maverick | 14.5 | 16.3 | 1.2 | $0.90 | 18.1 |
| Kimi K2.7 Code (OpenRouter) | 43 | 60.8 | 30.3 | $3.40 | 17.9 |
| DeepSeek V4 Pro | 53.2 | 68.8 | 49.6 | $3.96 | 17.4 |
| GLM-5.3 (Z.ai) | 59.5 | 74.8 | 59.1 | $4.40 | 17.0 |
| Grok 4.3 | 37.9 | 42.2 | 24.2 | $2.50 | 16.9 |
| GLM-5.2 (Z.ai) | 52.6 | 68.8 | 45.7 | $4.40 | 15.6 |
| Devstral 2 (2512) (OpenRouter) | 19.2 | 31.3 | 10.6 | $2.20 | 14.2 |
| Llama 4 Maverick (400B MoE) | 14.5 | 16.3 | 1.2 | $1.25 | 13.0 |
| Grok 4.6 Flagship | 60.9 | 76.8 | 58.7 | $6.00 | 12.8 |
| Gemini 3.7 Flash | 56 | 76.1 | 45.1 | $6.00 | 12.7 |
| GLM-5.1 (Z.ai) | 41 | 55.8 | 30.6 | $4.40 | 12.7 |
| GPT-5.4 mini | 40.9 | 56.1 | 31.5 | $4.50 | 12.5 |
| Grok 4.5 | 55.8 | 72.4 | 48.9 | $6.00 | 12.1 |
| Qwen 3.8 Max (2.4T MoE) | 58.1 | 71.8 | 58.4 | $6.00 | 12.0 |
| Kimi K2.6 | 45.1 | 61.8 | 31.2 | $6.00 | 10.3 |
| Gemini 3.6 Flash | 51.6 | 69.2 | 40.5 | $7.50 | 9.2 |
| Claude Haiku 4.5 | 29.9 | 43.9 | 16.5 | $5.00 | 8.8 |
| Gemini 3.5 Flash (OpenRouter) | 52 | 70.1 | 39.7 | $9.00 | 7.8 |
| Claude Sonnet 5 | 55.3 | 71.5 | 49.7 | $10.00 | 7.2 |
| GPT-5.6 Terra | 56.6 | 76.7 | 50.2 | $12.00 | 6.4 |
| Mistral Medium 3.5 | 30.4 | 46.9 | 19.2 | $7.50 | 6.3 |
| Gemini 3.1 Pro | 47.7 | 68.8 | 23 | $12.00 | 5.7 |
| Kimi K3 (Moonshot) | 59.7 | 76.2 | 54.3 | $15.00 | 5.1 |
| GPT-5.4 Workhorse | 53.1 | 71.1 | 44.2 | $15.00 | 4.7 |
| Claude Sonnet 4.6 (OpenRouter) | 48.4 | 63 | 42.1 | $15.00 | 4.2 |
| o3-mini | 15.7 | 16.3 | 1.7 | $4.40 | 3.7 |
| Gemini 2.5 Pro | 25.9 | 33.3 | 7.2 | $10.00 | 3.3 |
| Claude Opus 5 | 63.1 | 78 | 59.2 | $25.00 | 3.1 |
| Claude Opus 4.8 (OpenRouter) | 57.3 | 74.3 | 49.4 | $25.00 | 3.0 |
| GPT-5.6 Sol | 60.9 | 77.4 | 57.8 | $30.00 | 2.6 |
| GPT-5.5 Standard | 56.3 | 74.9 | 47.4 | $30.00 | 2.5 |
| Claude Fable 5 | 62.1 | 76.5 | 56.6 | $50.00 | 1.5 |
| GPT-4o (Omni) | — | 11.4 | 1 | $10.00 | 1.1 |
| GPT-4 Turbo | — | 21.5 | — | $30.00 | 0.7 |
| o1 (Reasoning) | — | 39.7 | — | $60.00 | 0.7 |
| o3 (Reasoning Frontier) | 14.5 | 16.2 | 2.9 | $40.00 | 0.4 |
Artificial Analysis composite fields exposed by OpenRouter's live catalog, last verified 2026-08-28. Ox Alpha has no published score yet.
| Model | Intelligence | Coding | Agentic | Evidence |
|---|---|---|---|---|
| Claude Opus 5 | 63.1 | 78 | 59.2 | Artificial Analysis via OpenRouter |
| Claude Fable 5 | 62.1 | 76.5 | 56.6 | Artificial Analysis via OpenRouter |
| GPT-5.6 Sol | 60.9 | 77.4 | 57.8 | Artificial Analysis via OpenRouter |
| Grok 4.6 Flagship | 60.9 | 76.8 | 58.7 | Artificial Analysis via OpenRouter |
| Kimi K3 (Moonshot) | 59.7 | 76.2 | 54.3 | Artificial Analysis via OpenRouter |
| GLM-5.3 (Z.ai) | 59.5 | 74.8 | 59.1 | Artificial Analysis via OpenRouter |
| GLM-5 (Z.ai) | 59.5 | 74.8 | 59.1 | Artificial Analysis via OpenRouter |
| Qwen 3.8 Max (2.4T MoE) | 58.1 | 71.8 | 58.4 | Artificial Analysis via OpenRouter |
| GLM-5.3-Flash (Z.ai) | 57.5 | 71.5 | 58.2 | Artificial Analysis via OpenRouter |
| Claude Opus 4.8 (OpenRouter) | 57.3 | 74.3 | 49.4 | Artificial Analysis via OpenRouter |
| GPT-5.6 Terra | 56.6 | 76.7 | 50.2 | Artificial Analysis via OpenRouter |
| GPT-5.5 Standard | 56.3 | 74.9 | 47.4 | Artificial Analysis via OpenRouter |
| Gemini 3.7 Flash | 56 | 76.1 | 45.1 | Artificial Analysis via OpenRouter |
| Grok 4.5 | 55.8 | 72.4 | 48.9 | Artificial Analysis via OpenRouter |
| Claude Sonnet 5 | 55.3 | 71.5 | 49.7 | Artificial Analysis via OpenRouter |
| DeepSeek V4 Pro | 53.2 | 68.8 | 49.6 | Artificial Analysis via OpenRouter |
| GPT-5.4 Workhorse | 53.1 | 71.1 | 44.2 | Artificial Analysis via OpenRouter |
| GLM-5.2 (Z.ai) | 52.6 | 68.8 | 45.7 | Artificial Analysis via OpenRouter |
| GPT-5.6 Luna | 52.3 | 71.4 | 46.9 | Artificial Analysis via OpenRouter |
| Gemini 3.5 Flash (OpenRouter) | 52 | 70.1 | 39.7 | Artificial Analysis via OpenRouter |
| Gemini 3.6 Flash | 51.6 | 69.2 | 40.5 | Artificial Analysis via OpenRouter |
| Claude Sonnet 4.6 (OpenRouter) | 48.4 | 63 | 42.1 | Artificial Analysis via OpenRouter |
| Gemini 3.1 Pro | 47.7 | 68.8 | 23 | Artificial Analysis via OpenRouter |
| MiniMax M3 (OpenRouter) | 45.4 | 58.6 | 36.1 | Artificial Analysis via OpenRouter |
| Kimi K2.6 | 45.1 | 61.8 | 31.2 | Artificial Analysis via OpenRouter |
| Kimi K2.7 Code (OpenRouter) | 43 | 60.8 | 30.3 | Artificial Analysis via OpenRouter |
| DeepSeek V4 Flash | 42.1 | 56.2 | 33.7 | Artificial Analysis via OpenRouter |
| GLM-5.1 (Z.ai) | 41 | 55.8 | 30.6 | Artificial Analysis via OpenRouter |
| GPT-5.4 mini | 40.9 | 56.1 | 31.5 | Artificial Analysis via OpenRouter |
| Grok Build 0.1 | 40.7 | 51.5 | 28.9 | Artificial Analysis via OpenRouter |
| GPT-5.4 nano | 39.7 | 56.1 | 29.7 | Artificial Analysis via OpenRouter |
| MiniMax M2.7 (OpenRouter) | 38.9 | 52.6 | 25.9 | Artificial Analysis via OpenRouter |
| Grok 4.3 | 37.9 | 42.2 | 24.2 | Artificial Analysis via OpenRouter |
| Gemini 3.5 Flash-Lite | 37.4 | 49.3 | 27.2 | Artificial Analysis via OpenRouter |
| GLM 4.7 (Zhipu) | 34.5 | 45.3 | 26.2 | Artificial Analysis via OpenRouter |
| Qwen3.5 397B A17B (OpenRouter) | 34.3 | 48.2 | 19.8 | Artificial Analysis via OpenRouter |
| Mistral Medium 3.5 | 30.4 | 46.9 | 19.2 | Artificial Analysis via OpenRouter |
| Claude Haiku 4.5 | 29.9 | 43.9 | 16.5 | Artificial Analysis via OpenRouter |
| Gemma 4 31B Instruct | 29.7 | 43.4 | 14.4 | Artificial Analysis via OpenRouter |
| GLM-4.6 (Z.ai) | 29.3 | 45.8 | 18.6 | Artificial Analysis via OpenRouter |
| Gemini 2.5 Pro | 25.9 | 33.3 | 7.2 | Artificial Analysis via OpenRouter |
| Gemini 3.1 Flash Lite (OpenRouter) | 25.6 | 34.7 | 6.5 | Artificial Analysis via OpenRouter |
| Cerebras — GPT OSS 120B | 24.1 | 30.4 | 13.4 | Artificial Analysis via OpenRouter |
| Qwen3 Coder Next (OpenRouter) | 21.3 | 36.2 | 8.9 | Artificial Analysis via OpenRouter |
| Devstral 2 (2512) (OpenRouter) | 19.2 | 31.3 | 10.6 | Artificial Analysis via OpenRouter |
| o3-mini | 15.7 | 16.3 | 1.7 | Artificial Analysis via OpenRouter |
| DeepSeek V3 (Chat) | 15.2 | 21.2 | 1.6 | Artificial Analysis via OpenRouter |
| o3 (Reasoning Frontier) | 14.5 | 16.2 | 2.9 | Artificial Analysis via OpenRouter |
| Llama 4 Maverick (400B MoE) | 14.5 | 16.3 | 1.2 | Artificial Analysis via OpenRouter |
| Together AI — Llama 4 Maverick | 14.5 | 16.3 | 1.2 | Artificial Analysis via OpenRouter |
| Llama 4 Scout (109B MoE) | 10.3 | 8.2 | 1.1 | Artificial Analysis via OpenRouter |
| GPT-4o (Omni) | — | 11.4 | 1 | Artificial Analysis via OpenRouter |
| GPT-4o mini | — | 11.4 | 1 | Artificial Analysis via OpenRouter |
| o1 (Reasoning) | — | 39.7 | — | Artificial Analysis via OpenRouter |
| GPT-4 Turbo | — | 21.5 | — | Artificial Analysis via OpenRouter |
| Llama 3.3 70B Instruct | — | 11.9 | — | Artificial Analysis via OpenRouter |
| Llama 3.1 8B Instruct | — | 5.4 | — | Artificial Analysis via OpenRouter |
| OpenRouter Free Tier (Llama 3.3) | — | 11.9 | — | Artificial Analysis via OpenRouter |
| DeepSeek V3.2 (OpenRouter) | — | 44.2 | — | Artificial Analysis via OpenRouter |
| DeepInfra — Llama 3.3 70B | — | 11.9 | — | Artificial Analysis via OpenRouter |
| Qwen3.8-Flash (QwenCloud preview) | — | — | — | Vendor-reported task scores, not third-party composite indices. |
Lightweight architectures with high MoE sparsity or distilled parameter counts. Essential for voice agents, interactive inline autocomplete, and high-concurrency bots.
The workhorse class: solid throughput with deep world knowledge and reasoning capabilities. Comfortably delivers real-time conversational streaming for humans reading at ~30 tps.
Generates long hidden verification chains and recursive step trees before producing final answers. Latency is sacrificed in favor of state-of-the-art accuracy.
Throughput is measured in generated tokens per second (tps). Flash/Lite models typically output 80–180 tokens/sec, while large reasoning and flagship models generate at 30–60 tokens/sec due to complex parameter execution and chain-of-thought verification.
Time to First Token (TTFT) is the latency before the model begins outputting its response, dictated by input token processing and KV caching. Generation speed is the sustained rate at which output tokens are streamed to the client.
Budget models like Gemini 3.5 Flash Lite, DeepSeek V4 Flash, and GPT-5.6 Luna deliver over 100 tokens/sec at under $0.50 per million input tokens, offering the highest throughput-to-cost ratio in the market.
Prompt caching dramatically slashes TTFT (time-to-first-token) because the provider doesn't need to recompute the attention matrices for cached prefix tokens. However, the output token generation speed remains unchanged once generation begins.