An IDE or code-review assistant sends the open file plus relevant repository context and expects long, precise code output — output tokens dominate the bill.
Input / request
12,000
Output / request
2,000
Cacheable input
60%
Requests / user / day
40
Cost by model
| Model | Per request | Per user / month | 500 users / month | vs cheapest |
|---|---|---|---|---|
| bestGLM-4.7-Flash (Z.ai) | Free | Free | Free | — |
| GLM-4.5-Flash (Z.ai) | Free | Free | Free | Not comparable |
| GLM-4.6V-Flash (Z.ai) | Free | Free | Free | Not comparable |
| OpenRouter Free Tier (Llama 3.3) | Free | Free | Free | Not comparable |
| Ox Alpha (Z.ai GLM preview) | Free | Free | Free | Not comparable |
| Text Embedding 3 (Small) | $0.00024 | $0.288 | $144.00 | Not comparable |
| Text Embedding 004 | $0.00024 | $0.288 | $144.00 | Not comparable |
| Llama 3.2 3B Instruct | $0.00046 | $0.552 | $276.00 | Not comparable |
| Amazon Nova Micro | $0.000511 | $0.6132 | $306.60 | Not comparable |
| Qwen 2.5 Turbo | $0.000676 | $0.8112 | $405.60 | Not comparable |
| Llama 3.2 1B Instruct (OpenRouter) | $0.000726 | $0.8712 | $435.60 | Not comparable |
| Llama 3.1 8B Instruct | $0.00076 | $0.912 | $456.00 | Not comparable |
| Groq LPU — Llama 3.1 8B Instant | $0.00076 | $0.912 | $456.00 | Not comparable |
| Amazon Nova Lite | $0.000876 | $1.051 | $525.60 | Not comparable |
| Cohere Command R7B | $0.0009 | $1.08 | $540.00 | Not comparable |
| GLM-5.3-Flash (Z.ai) | $0.000968 | $1.162 | $580.80 | Not comparable |
| Together AI — GPT-OSS-20B | $0.001 | $1.20 | $600.00 | Not comparable |
| GLM-4.6V-FlashX (Z.ai) | $0.001021 | $1.225 | $612.48 | Not comparable |
| Gemini 2.0 Flash-Lite | $0.001095 | $1.314 | $657.00 | Not comparable |
| Gemini 1.5 Flash | $0.001095 | $1.314 | $657.00 | Not comparable |
| Ministral 3 8B | $0.001128 | $1.354 | $676.80 | Not comparable |
| GLM-4.7-FlashX (Z.ai) | $0.001208 | $1.45 | $724.80 | Not comparable |
| Mistral Small 3.2 24B (OpenRouter) | $0.0013 | $1.56 | $780.00 | Not comparable |
| DeepSeek V3 (Chat) | $0.001333 | $1.599 | $799.68 | Not comparable |
| DeepSeek Coder V2.5 | $0.001333 | $1.599 | $799.68 | Not comparable |
| GLM-4-32B-0414-128K (Z.ai) | $0.0014 | $1.68 | $840.00 | Not comparable |
| DeepInfra — Qwen 2.5 Coder 32B | $0.00144 | $1.728 | $864.00 | Not comparable |
| Gemini 2.5 Flash-Lite | $0.00146 | $1.752 | $876.00 | Not comparable |
| Gemini 2.0 Flash | $0.00146 | $1.752 | $876.00 | Not comparable |
| Hy-MT2-30B-A3B (OpenRouter) | $0.001478 | $1.774 | $886.80 | Not comparable |
| Ministral 3 14B | $0.001504 | $1.805 | $902.40 | Not comparable |
| Fireworks AI — Llama 4 Scout | $0.001512 | $1.814 | $907.20 | Not comparable |
| Text Embedding 3 (Large) | $0.00156 | $1.872 | $936.00 | Not comparable |
| Muse Spark 1.2 Contributor (OpenRouter) | $0.0016 | $1.92 | $960.00 | Not comparable |
| Groq LPU — Llama 4 Scout | $0.001604 | $1.925 | $962.40 | Not comparable |
| Microsoft Phi-4 (14B) | $0.0018 | $2.16 | $1,080.00 | Not comparable |
| DeepInfra — Llama 3.3 70B | $0.0018 | $2.16 | $1,080.00 | Not comparable |
| Yi-Lightning (01.AI) | $0.00196 | $2.352 | $1,176.00 | Not comparable |
| Mistral Small 4 | $0.002028 | $2.434 | $1,216.80 | Not comparable |
| Llama 3.2 11B Vision | $0.00224 | $2.688 | $1,344.00 | Not comparable |
| Grok 4.1 Fast | $0.002248 | $2.698 | $1,348.80 | Not comparable |
| Qwen 2.5 Coder 32B | $0.002304 | $2.765 | $1,382.40 | Not comparable |
| GPT-4o mini | $0.00246 | $2.952 | $1,476.00 | Not comparable |
| Qwen3 Coder Next (OpenRouter) | $0.00268 | $3.216 | $1,608.00 | Not comparable |
| Llama 4 Scout (109B MoE) | $0.0027 | $3.24 | $1,620.00 | Not comparable |
| Gemma 2 9B Instruct | $0.0028 | $3.36 | $1,680.00 | Not comparable |
| Qwen3.8-Flash (QwenCloud preview) | $0.00286 | $3.432 | $1,716.00 | Not comparable |
| Groq LPU — Llama 4 Maverick | $0.00288 | $3.456 | $1,728.00 | Not comparable |
| DeepSeek V3.2 (OpenRouter) | $0.002944 | $3.533 | $1,766.40 | Not comparable |
| Cohere Command R | $0.003 | $3.60 | $1,800.00 | Not comparable |
| Microsoft Phi-3.5 MoE | $0.003 | $3.60 | $1,800.00 | Not comparable |
| Qwen3 Coder Flash (OpenRouter) | $0.003167 | $3.80 | $1,900.08 | Not comparable |
| AI21 Jamba 1.5 Mini | $0.0032 | $3.84 | $1,920.00 | Not comparable |
| Qwen 2.5 72B Instruct | $0.003332 | $3.998 | $1,999.20 | Not comparable |
| Llama 3.3 70B Instruct | $0.00334 | $4.008 | $2,004.00 | Not comparable |
| GLM-4.5-Air (Z.ai) | $0.003376 | $4.051 | $2,025.60 | Not comparable |
| MiniMax-01 (4M Context) | $0.003448 | $4.138 | $2,068.80 | Not comparable |
| Codestral 2501 | $0.003456 | $4.147 | $2,073.60 | Not comparable |
| Codestral 2508 (OpenRouter) | $0.003456 | $4.147 | $2,073.60 | Not comparable |
| GPT-5.6 Luna | $0.003504 | $4.205 | $2,102.40 | Not comparable |
| GPT-5.6 Luna Pro (OpenRouter) | $0.003504 | $4.205 | $2,102.40 | Not comparable |
| GLM-4.6V (Z.ai) | $0.0036 | $4.32 | $2,160.00 | Not comparable |
| GPT-5.4 nano | $0.003604 | $4.325 | $2,162.40 | Not comparable |
| Qwen 3 32B Instruct | $0.003808 | $4.57 | $2,284.80 | Not comparable |
| Claude 3 Haiku | $0.00388 | $4.656 | $2,328.00 | Not comparable |
| Groq LPU — QwQ 32B Reasoner | $0.00426 | $5.112 | $2,556.00 | Not comparable |
| MiniMax M2.7 (OpenRouter) | $0.004272 | $5.126 | $2,563.20 | Not comparable |
| MiniMax M3 (OpenRouter) | $0.004272 | $5.126 | $2,563.20 | Not comparable |
| Gemini 3.1 Flash Lite (OpenRouter) | $0.00438 | $5.256 | $2,628.00 | Not comparable |
| Gemma 4 31B Instruct | $0.0045 | $5.40 | $2,700.00 | Not comparable |
| QwQ 32B (Reasoner) | $0.004608 | $5.53 | $2,764.80 | Not comparable |
| DeepSeek V4 Flash | $0.004853 | $5.823 | $2,911.68 | Not comparable |
| DeepSeek V4 Flash Vision Exp | $0.004853 | $5.823 | $2,911.68 | Not comparable |
| NVIDIA Llama 3.1 Nemotron 70B | $0.0056 | $6.72 | $3,360.00 | Not comparable |
| Llama 3.1 70B Instruct (OpenRouter) | $0.0056 | $6.72 | $3,360.00 | Not comparable |
| Cerebras — GPT OSS 120B | $0.0057 | $6.84 | $3,420.00 | Not comparable |
| Mistral Large 3 | $0.00576 | $6.912 | $3,456.00 | Not comparable |
| Together AI — Llama 4 Maverick | $0.006 | $7.20 | $3,600.00 | Not comparable |
| Cerebras — Qwen 3 32B | $0.0064 | $7.68 | $3,840.00 | Not comparable |
| Gemini 3.5 Flash-Lite | $0.006656 | $7.987 | $3,993.60 | Not comparable |
| Devstral 2 (2512) (OpenRouter) | $0.006829 | $8.195 | $4,097.28 | Not comparable |
| Gemini 2.5 Flash | $0.00698 | $8.376 | $4,188.00 | Not comparable |
| GLM-4.5V (Z.ai) | $0.007272 | $8.726 | $4,363.20 | Not comparable |
| Llama 4 Maverick (400B MoE) | $0.0079 | $9.48 | $4,740.00 | Not comparable |
| DeepSeek R1 (Reasoner) | $0.008028 | $9.634 | $4,816.80 | Not comparable |
| GLM-4.6 (Z.ai) | $0.008072 | $9.686 | $4,843.20 | Not comparable |
| GLM-4.5 (Z.ai) | $0.008072 | $9.686 | $4,843.20 | Not comparable |
| GLM 4.7 (Zhipu) | $0.008072 | $9.686 | $4,843.20 | Not comparable |
| Groq LPU — Llama 3.3 70B | $0.00866 | $10.392 | $5,196.00 | Not comparable |
| GPT-3.5 Turbo | $0.009 | $10.80 | $5,400.00 | Not comparable |
| Together AI — DeepSeek V4 | $0.009 | $10.80 | $5,400.00 | Not comparable |
| Qwen3.5 397B A17B (OpenRouter) | $0.00936 | $11.232 | $5,616.00 | Not comparable |
| Grok Build 0.1 | $0.0102 | $12.288 | $6,144.00 | Not comparable |
| Databricks DBRX Instruct | $0.0108 | $12.96 | $6,480.00 | Not comparable |
| Fireworks AI — DeepSeek R1 | $0.011 | $13.176 | $6,588.00 | Not comparable |
| Qwen3.8 27B (OpenRouter) | $0.011 | $13.248 | $6,624.00 | Not comparable |
| Kimi K2.7 Code (OpenRouter) | $0.0114 | $13.661 | $6,830.40 | Not comparable |
| Amazon Nova Pro | $0.0117 | $14.016 | $7,008.00 | Not comparable |
| Claude 3.5 Haiku | $0.0124 | $14.899 | $7,449.60 | Not comparable |
| Grok 4.3 | $0.0124 | $14.928 | $7,464.00 | Not comparable |
| Llama 3.2 90B Vision | $0.0126 | $15.12 | $7,560.00 | Not comparable |
| GLM-5 (Z.ai) | $0.0126 | $15.168 | $7,584.00 | Not comparable |
| Qwen3 VL 235B Thinking (OpenRouter) | $0.0128 | $15.36 | $7,680.00 | Not comparable |
| GPT-5.4 mini | $0.0131 | $15.768 | $7,884.00 | Not comparable |
| Perplexity Sonar | $0.014 | $16.80 | $8,400.00 | Not comparable |
| DeepSeek V4 Pro | $0.0146 | $17.487 | $8,743.68 | Not comparable |
| Cerebras — Gemma 4 31B | $0.0149 | $17.832 | $8,916.00 | Not comparable |
| GLM-5-Turbo (Z.ai) | $0.0155 | $18.586 | $9,292.80 | Not comparable |
| GLM-5V-Turbo (Z.ai) | $0.0155 | $18.586 | $9,292.80 | Not comparable |
| Claude Haiku 4.5 | $0.0155 | $18.624 | $9,312.00 | Not comparable |
| GLM-4.5-AirX (Z.ai) | $0.0159 | $19.037 | $9,518.40 | Not comparable |
| o4-mini | $0.0161 | $19.272 | $9,636.00 | Not comparable |
| GLM-5.3 (Z.ai) | $0.0174 | $20.87 | $10,435.20 | Not comparable |
| GLM-5.2 (Z.ai) | $0.0174 | $20.87 | $10,435.20 | Not comparable |
| GLM-5.1 (Z.ai) | $0.0174 | $20.87 | $10,435.20 | Not comparable |
| OpenRouter Auto-Best Router | $0.018 | $21.60 | $10,800.00 | Not comparable |
| o3-mini | $0.018 | $21.648 | $10,824.00 | Not comparable |
| o1-mini | $0.018 | $21.648 | $10,824.00 | Not comparable |
| Gemini 1.5 Pro | $0.0183 | $21.90 | $10,950.00 | Not comparable |
| Gemini 3.7 Flash | $0.0203 | $24.336 | $12,168.00 | Not comparable |
| Kimi K2.6 | $0.0203 | $24.336 | $12,168.00 | Not comparable |
| Qwen 2.5 Max | $0.0216 | $25.958 | $12,979.20 | Not comparable |
| Pixtral Large | $0.023 | $27.648 | $13,824.00 | Not comparable |
| Mistral Large 2 (2411) | $0.023 | $27.648 | $13,824.00 | Not comparable |
| Qwen 3.8 Max (2.4T MoE) | $0.023 | $27.648 | $13,824.00 | Not comparable |
| Gemini 3.6 Flash | $0.0233 | $27.936 | $13,968.00 | Not comparable |
| Mistral Medium 3.5 | $0.0233 | $27.936 | $13,968.00 | Not comparable |
| Grok 4.5 | $0.0238 | $28.512 | $14,256.00 | Not comparable |
| NVIDIA Nemotron-4 340B | $0.024 | $28.80 | $14,400.00 | Not comparable |
| Grok 4.6 Flagship | $0.0252 | $30.24 | $15,120.00 | Not comparable |
| Gemini 3.5 Flash (OpenRouter) | $0.0263 | $31.536 | $15,768.00 | Not comparable |
| Amazon Nova Premier | $0.027 | $32.448 | $16,224.00 | Not comparable |
| Llama 3.1 405B Instruct | $0.028 | $33.60 | $16,800.00 | Not comparable |
| Gemini 2.5 Pro | $0.0282 | $33.90 | $16,950.00 | Not comparable |
| Claude Sonnet 5 | $0.031 | $37.248 | $18,624.00 | Not comparable |
| GPT-5.6 Sol Pro (OpenRouter) | $0.031 | $37.248 | $18,624.00 | Not comparable |
| GLM-4.5-X (Z.ai) | $0.0316 | $37.92 | $18,960.00 | Not comparable |
| Cohere Command A+ | $0.0338 | $40.56 | $20,280.00 | Not comparable |
| GPT-5.6 Terra | $0.035 | $42.048 | $21,024.00 | Not comparable |
| Gemini 3.1 Pro | $0.035 | $42.048 | $21,024.00 | Not comparable |
| GPT-5.6 Terra Pro (OpenRouter) | $0.035 | $42.048 | $21,024.00 | Not comparable |
| GPT-5.3 Codex | $0.0377 | $45.192 | $22,596.00 | Not comparable |
| Perplexity Sonar Reasoning Pro | $0.04 | $48.00 | $24,000.00 | Not comparable |
| Perplexity Sonar Deep Research | $0.04 | $48.00 | $24,000.00 | Not comparable |
| AI21 Jamba 1.5 Large | $0.04 | $48.00 | $24,000.00 | Not comparable |
| GPT-4o (Omni) | $0.041 | $49.20 | $24,600.00 | Not comparable |
| GPT-5.4 Workhorse | $0.0438 | $52.56 | $26,280.00 | Not comparable |
| Grok 2 | $0.044 | $52.80 | $26,400.00 | Not comparable |
| Grok 2 Vision | $0.044 | $52.80 | $26,400.00 | Not comparable |
| Claude 3.7 Sonnet (Hybrid Reasoning) | $0.0466 | $55.872 | $27,936.00 | Not comparable |
| Claude 3.5 Sonnet | $0.0466 | $55.872 | $27,936.00 | Not comparable |
| Kimi K3 (Moonshot) | $0.0466 | $55.872 | $27,936.00 | Not comparable |
| Claude Sonnet 4.6 (OpenRouter) | $0.0466 | $55.872 | $27,936.00 | Not comparable |
| Cohere Command R+ | $0.05 | $60.00 | $30,000.00 | Not comparable |
| Perplexity Sonar Pro | $0.066 | $79.20 | $39,600.00 | Not comparable |
| Claude Opus 5 | $0.0776 | $93.12 | $46,560.00 | Not comparable |
| Claude Opus 4.8 (OpenRouter) | $0.0776 | $93.12 | $46,560.00 | Not comparable |
| GPT-5.6 Sol | $0.0876 | $105.12 | $52,560.00 | Not comparable |
| GPT-5.5 Standard | $0.0876 | $105.12 | $52,560.00 | Not comparable |
| o3 (Reasoning Frontier) | $0.1352 | $162.24 | $81,120.00 | Not comparable |
| GPT-4 Turbo | $0.144 | $172.80 | $86,400.00 | Not comparable |
| Claude Fable 5 | $0.1552 | $186.24 | $93,120.00 | Not comparable |
| GPT-5.6 Cyber | $0.219 | $262.80 | $131,400.00 | Not comparable |
| Claude 3 Opus | $0.2328 | $279.36 | $139,680.00 | Not comparable |
| o1 (Reasoning) | $0.246 | $295.20 | $147,600.00 | Not comparable |
| o3-pro (Frontier Reasoning) | $0.2704 | $324.48 | $162,240.00 | Not comparable |
| GPT-5.5 Pro | $0.5256 | $630.72 | $315,360.00 | Not comparable |
Assumes the typical cacheable share (60% of input at cached rates where published). 40 requests/user/day. Adjust everything in the monthly calculator.
Best value picks for AI coding assistant
| Model | Fit score | Cost / 1K requests | Value (fit ÷ cost) |
|---|---|---|---|
| best valueGLM-5.3-Flash (Z.ai) | 66.0 | $0.968 | 68.2 |
| GPT-5.6 Luna | 63.2 | $3.504 | 18.0 |
| DeepSeek V3.2 (OpenRouter) | 44.2 | $2.944 | 15.0 |
| GPT-5.4 nano | 48.5 | $3.604 | 13.5 |
| DeepSeek V3 (Chat) | 17.4 | $1.333 | 13.1 |
Fit = weighted blend of third-party composite indices (intelligence, coding, agentic) for this use case; value = fit ÷ cost per 1,000 requests. Models without a verified composite are excluded. Methodology · Benchmark hub.
How to spend less
Related workflow costs
FAQ
Using a typical profile of 12,000 input and 2,000 output tokens with 60% cacheable input: from Free on GLM-4.7-Flash (Z.ai) up to $0.5256 on GPT-5.5 Pro. See the table for every model.
At 40 requests per user per day and the typical token profile, budget from Free per active user per month on GLM-4.7-Flash (Z.ai). A team of 500 active users lands around Free/month at that tier. Model your exact numbers in the monthly cost calculator.
Output is the expensive side — prefer models with cheap output for autocomplete-style calls. Cache repository context between keystrokes; diffs change far less than the full file. Measure acceptance rate: paying for output users delete is pure waste.