Retrieval-augmented generation embeds a query, retrieves top-k chunks, and asks the model to answer grounded in those chunks. Input is dominated by retrieved context.
Input / request
8,000
Output / request
500
Cacheable input
50%
Requests / user / day
10
Cost by model
| Model | Per request | Per user / month | 500 users / month | vs cheapest |
|---|---|---|---|---|
| bestGLM-4.7-Flash (Z.ai) | Free | Free | Free | — |
| GLM-4.5-Flash (Z.ai) | Free | Free | Free | Not comparable |
| GLM-4.6V-Flash (Z.ai) | Free | Free | Free | Not comparable |
| OpenRouter Free Tier (Llama 3.3) | Free | Free | Free | Not comparable |
| Ox Alpha (Z.ai GLM preview) | Free | Free | Free | Not comparable |
| Text Embedding 3 (Small) | $0.00016 | $0.048 | $24.00 | Not comparable |
| Text Embedding 004 | $0.00016 | $0.048 | $24.00 | Not comparable |
| Amazon Nova Micro | $0.000245 | $0.0735 | $36.75 | Not comparable |
| Llama 3.2 3B Instruct | $0.000265 | $0.0795 | $39.75 | Not comparable |
| Llama 3.2 1B Instruct (OpenRouter) | $0.000317 | $0.0949 | $47.475 | Not comparable |
| Qwen 2.5 Turbo | $0.00032 | $0.096 | $48.00 | Not comparable |
| GLM-4.6V-FlashX (Z.ai) | $0.000376 | $0.1128 | $56.40 | Not comparable |
| Amazon Nova Lite | $0.00042 | $0.126 | $63.00 | Not comparable |
| Llama 3.1 8B Instruct | $0.00044 | $0.132 | $66.00 | Not comparable |
| Groq LPU — Llama 3.1 8B Instant | $0.00044 | $0.132 | $66.00 | Not comparable |
| Cohere Command R7B | $0.000475 | $0.1425 | $71.25 | Not comparable |
| GLM-5.3-Flash (Z.ai) | $0.000485 | $0.1455 | $72.75 | Not comparable |
| Together AI — GPT-OSS-20B | $0.0005 | $0.15 | $75.00 | Not comparable |
| GLM-4.7-FlashX (Z.ai) | $0.00052 | $0.156 | $78.00 | Not comparable |
| Gemini 2.0 Flash-Lite | $0.000525 | $0.1575 | $78.75 | Not comparable |
| Gemini 1.5 Flash | $0.000525 | $0.1575 | $78.75 | Not comparable |
| Gemini 2.5 Flash-Lite | $0.0007 | $0.21 | $105.00 | Not comparable |
| Gemini 2.0 Flash | $0.0007 | $0.21 | $105.00 | Not comparable |
| Mistral Small 3.2 24B (OpenRouter) | $0.0007 | $0.21 | $105.00 | Not comparable |
| Ministral 3 8B | $0.000735 | $0.2205 | $110.25 | Not comparable |
| Hy-MT2-30B-A3B (OpenRouter) | $0.000739 | $0.2218 | $110.925 | Not comparable |
| DeepSeek V3 (Chat) | $0.000756 | $0.2268 | $113.40 | Not comparable |
| DeepSeek Coder V2.5 | $0.000756 | $0.2268 | $113.40 | Not comparable |
| DeepInfra — Qwen 2.5 Coder 32B | $0.00076 | $0.228 | $114.00 | Not comparable |
| Fireworks AI — Llama 4 Scout | $0.00078 | $0.234 | $117.00 | Not comparable |
| Groq LPU — Llama 4 Scout | $0.00083 | $0.249 | $124.50 | Not comparable |
| GLM-4-32B-0414-128K (Z.ai) | $0.00085 | $0.255 | $127.50 | Not comparable |
| Muse Spark 1.2 Contributor (OpenRouter) | $0.0009 | $0.27 | $135.00 | Not comparable |
| Microsoft Phi-4 (14B) | $0.00095 | $0.285 | $142.50 | Not comparable |
| DeepInfra — Llama 3.3 70B | $0.00095 | $0.285 | $142.50 | Not comparable |
| Mistral Small 4 | $0.00096 | $0.288 | $144.00 | Not comparable |
| Ministral 3 14B | $0.00098 | $0.294 | $147.00 | Not comparable |
| Text Embedding 3 (Large) | $0.00104 | $0.312 | $156.00 | Not comparable |
| Qwen3 Coder Next (OpenRouter) | $0.00116 | $0.348 | $174.00 | Not comparable |
| Qwen 2.5 Coder 32B | $0.00118 | $0.354 | $177.00 | Not comparable |
| Yi-Lightning (01.AI) | $0.00119 | $0.357 | $178.50 | Not comparable |
| GPT-4o mini | $0.0012 | $0.36 | $180.00 | Not comparable |
| Grok 4.1 Fast | $0.00121 | $0.363 | $181.50 | Not comparable |
| Llama 3.2 11B Vision | $0.00136 | $0.408 | $204.00 | Not comparable |
| Qwen3 Coder Flash (OpenRouter) | $0.001424 | $0.4271 | $213.525 | Not comparable |
| Llama 4 Scout (109B MoE) | $0.001425 | $0.4275 | $213.75 | Not comparable |
| GLM-4.5-Air (Z.ai) | $0.00147 | $0.441 | $220.50 | Not comparable |
| GPT-5.6 Luna | $0.00148 | $0.444 | $222.00 | Not comparable |
| GPT-5.6 Luna Pro (OpenRouter) | $0.00148 | $0.444 | $222.00 | Not comparable |
| Cohere Command R | $0.0015 | $0.45 | $225.00 | Not comparable |
| Microsoft Phi-3.5 MoE | $0.0015 | $0.45 | $225.00 | Not comparable |
| Groq LPU — Llama 4 Maverick | $0.0015 | $0.45 | $225.00 | Not comparable |
| GPT-5.4 nano | $0.001505 | $0.4515 | $225.75 | Not comparable |
| MiniMax-01 (4M Context) | $0.00151 | $0.453 | $226.50 | Not comparable |
| Qwen3.8-Flash (QwenCloud preview) | $0.001515 | $0.4545 | $227.25 | Not comparable |
| Gemma 2 9B Instruct | $0.0017 | $0.51 | $255.00 | Not comparable |
| Claude 3 Haiku | $0.001725 | $0.5175 | $258.75 | Not comparable |
| Llama 3.3 70B Instruct | $0.001735 | $0.5205 | $260.25 | Not comparable |
| DeepSeek V3.2 (OpenRouter) | $0.00175 | $0.525 | $262.50 | Not comparable |
| Codestral 2501 | $0.00177 | $0.531 | $265.50 | Not comparable |
| Codestral 2508 (OpenRouter) | $0.00177 | $0.531 | $265.50 | Not comparable |
| AI21 Jamba 1.5 Mini | $0.0018 | $0.54 | $270.00 | Not comparable |
| GLM-4.6V (Z.ai) | $0.00185 | $0.555 | $277.50 | Not comparable |
| Gemini 3.1 Flash Lite (OpenRouter) | $0.00185 | $0.555 | $277.50 | Not comparable |
| Qwen 2.5 72B Instruct | $0.00189 | $0.567 | $283.50 | Not comparable |
| MiniMax M2.7 (OpenRouter) | $0.00204 | $0.612 | $306.00 | Not comparable |
| MiniMax M3 (OpenRouter) | $0.00204 | $0.612 | $306.00 | Not comparable |
| Qwen 3 32B Instruct | $0.00216 | $0.648 | $324.00 | Not comparable |
| QwQ 32B (Reasoner) | $0.00236 | $0.708 | $354.00 | Not comparable |
| Gemma 4 31B Instruct | $0.002375 | $0.7125 | $356.25 | Not comparable |
| DeepSeek V4 Flash | $0.002476 | $0.7428 | $371.40 | Not comparable |
| DeepSeek V4 Flash Vision Exp | $0.002476 | $0.7428 | $371.40 | Not comparable |
| Groq LPU — QwQ 32B Reasoner | $0.002515 | $0.7545 | $377.25 | Not comparable |
| Gemini 3.5 Flash-Lite | $0.00257 | $0.771 | $385.50 | Not comparable |
| Gemini 2.5 Flash | $0.00275 | $0.825 | $412.50 | Not comparable |
| Mistral Large 3 | $0.00295 | $0.885 | $442.50 | Not comparable |
| Devstral 2 (2512) (OpenRouter) | $0.003036 | $0.9108 | $455.40 | Not comparable |
| NVIDIA Llama 3.1 Nemotron 70B | $0.00315 | $0.945 | $472.50 | Not comparable |
| Cerebras — GPT OSS 120B | $0.003175 | $0.9525 | $476.25 | Not comparable |
| Together AI — Llama 4 Maverick | $0.00325 | $0.975 | $487.50 | Not comparable |
| Llama 3.1 70B Instruct (OpenRouter) | $0.0034 | $1.02 | $510.00 | Not comparable |
| Cerebras — Qwen 3 32B | $0.0036 | $1.08 | $540.00 | Not comparable |
| GLM-4.5V (Z.ai) | $0.00374 | $1.122 | $561.00 | Not comparable |
| DeepSeek R1 (Reasoner) | $0.003855 | $1.157 | $578.25 | Not comparable |
| GLM-4.6 (Z.ai) | $0.00394 | $1.182 | $591.00 | Not comparable |
| GLM-4.5 (Z.ai) | $0.00394 | $1.182 | $591.00 | Not comparable |
| GLM 4.7 (Zhipu) | $0.00394 | $1.182 | $591.00 | Not comparable |
| Llama 4 Maverick (400B MoE) | $0.004225 | $1.268 | $633.75 | Not comparable |
| Qwen3.5 397B A17B (OpenRouter) | $0.00429 | $1.287 | $643.50 | Not comparable |
| GPT-3.5 Turbo | $0.00475 | $1.425 | $712.50 | Not comparable |
| Together AI — DeepSeek V4 | $0.00475 | $1.425 | $712.50 | Not comparable |
| Qwen3.8 27B (OpenRouter) | $0.00486 | $1.458 | $729.00 | Not comparable |
| Groq LPU — Llama 3.3 70B | $0.005115 | $1.535 | $767.25 | Not comparable |
| Kimi K2.7 Code (OpenRouter) | $0.00514 | $1.542 | $771.00 | Not comparable |
| Qwen3 VL 235B Thinking (OpenRouter) | $0.0052 | $1.56 | $780.00 | Not comparable |
| Fireworks AI — DeepSeek R1 | $0.005495 | $1.648 | $824.25 | Not comparable |
| Claude 3.5 Haiku | $0.00552 | $1.656 | $828.00 | Not comparable |
| GPT-5.4 mini | $0.00555 | $1.665 | $832.50 | Not comparable |
| Amazon Nova Pro | $0.0056 | $1.68 | $840.00 | Not comparable |
| Databricks DBRX Instruct | $0.0057 | $1.71 | $855.00 | Not comparable |
| Grok Build 0.1 | $0.0058 | $1.74 | $870.00 | Not comparable |
| GLM-5 (Z.ai) | $0.0064 | $1.92 | $960.00 | Not comparable |
| Claude Haiku 4.5 | $0.0069 | $2.07 | $1,035.00 | Not comparable |
| Grok 4.3 | $0.00705 | $2.115 | $1,057.50 | Not comparable |
| DeepSeek V4 Pro | $0.007436 | $2.231 | $1,115.40 | Not comparable |
| GLM-4.5-AirX (Z.ai) | $0.00753 | $2.259 | $1,129.50 | Not comparable |
| Llama 3.2 90B Vision | $0.00765 | $2.295 | $1,147.50 | Not comparable |
| o4-mini | $0.0077 | $2.31 | $1,155.00 | Not comparable |
| GLM-5-Turbo (Z.ai) | $0.00776 | $2.328 | $1,164.00 | Not comparable |
| GLM-5V-Turbo (Z.ai) | $0.00776 | $2.328 | $1,164.00 | Not comparable |
| Perplexity Sonar | $0.0085 | $2.55 | $1,275.00 | Not comparable |
| Cerebras — Gemma 4 31B | $0.008665 | $2.60 | $1,299.75 | Not comparable |
| Gemini 1.5 Pro | $0.00875 | $2.625 | $1,312.50 | Not comparable |
| o3-mini | $0.0088 | $2.64 | $1,320.00 | Not comparable |
| o1-mini | $0.0088 | $2.64 | $1,320.00 | Not comparable |
| GLM-5.3 (Z.ai) | $0.00884 | $2.652 | $1,326.00 | Not comparable |
| GLM-5.2 (Z.ai) | $0.00884 | $2.652 | $1,326.00 | Not comparable |
| GLM-5.1 (Z.ai) | $0.00884 | $2.652 | $1,326.00 | Not comparable |
| OpenRouter Auto-Best Router | $0.0095 | $2.85 | $1,425.00 | Not comparable |
| Gemini 3.7 Flash | $0.0096 | $2.88 | $1,440.00 | Not comparable |
| Kimi K2.6 | $0.0096 | $2.88 | $1,440.00 | Not comparable |
| Qwen 2.5 Max | $0.0102 | $3.072 | $1,536.00 | Not comparable |
| Gemini 3.6 Flash | $0.0104 | $3.105 | $1,552.50 | Not comparable |
| Mistral Medium 3.5 | $0.0104 | $3.105 | $1,552.50 | Not comparable |
| Gemini 3.5 Flash (OpenRouter) | $0.0111 | $3.33 | $1,665.00 | Not comparable |
| Gemini 2.5 Pro | $0.0113 | $3.375 | $1,687.50 | Not comparable |
| Pixtral Large | $0.0118 | $3.54 | $1,770.00 | Not comparable |
| Mistral Large 2 (2411) | $0.0118 | $3.54 | $1,770.00 | Not comparable |
| Qwen 3.8 Max (2.4T MoE) | $0.0118 | $3.54 | $1,770.00 | Not comparable |
| Grok 4.5 | $0.0122 | $3.66 | $1,830.00 | Not comparable |
| Amazon Nova Premier | $0.0128 | $3.84 | $1,920.00 | Not comparable |
| Grok 4.6 Flagship | $0.013 | $3.90 | $1,950.00 | Not comparable |
| NVIDIA Nemotron-4 340B | $0.0135 | $4.05 | $2,025.00 | Not comparable |
| Claude Sonnet 5 | $0.0138 | $4.14 | $2,070.00 | Not comparable |
| GPT-5.6 Sol Pro (OpenRouter) | $0.0138 | $4.14 | $2,070.00 | Not comparable |
| GPT-5.3 Codex | $0.0147 | $4.41 | $2,205.00 | Not comparable |
| GPT-5.6 Terra | $0.0148 | $4.44 | $2,220.00 | Not comparable |
| Gemini 3.1 Pro | $0.0148 | $4.44 | $2,220.00 | Not comparable |
| GPT-5.6 Terra Pro (OpenRouter) | $0.0148 | $4.44 | $2,220.00 | Not comparable |
| GLM-4.5-X (Z.ai) | $0.0151 | $4.515 | $2,257.50 | Not comparable |
| Llama 3.1 405B Instruct | $0.0158 | $4.725 | $2,362.50 | Not comparable |
| Cohere Command A+ | $0.016 | $4.80 | $2,400.00 | Not comparable |
| GPT-5.4 Workhorse | $0.0185 | $5.55 | $2,775.00 | Not comparable |
| GPT-4o (Omni) | $0.02 | $6.00 | $3,000.00 | Not comparable |
| Perplexity Sonar Reasoning Pro | $0.02 | $6.00 | $3,000.00 | Not comparable |
| Perplexity Sonar Deep Research | $0.02 | $6.00 | $3,000.00 | Not comparable |
| AI21 Jamba 1.5 Large | $0.02 | $6.00 | $3,000.00 | Not comparable |
| Claude 3.7 Sonnet (Hybrid Reasoning) | $0.0207 | $6.21 | $3,105.00 | Not comparable |
| Claude 3.5 Sonnet | $0.0207 | $6.21 | $3,105.00 | Not comparable |
| Kimi K3 (Moonshot) | $0.0207 | $6.21 | $3,105.00 | Not comparable |
| Claude Sonnet 4.6 (OpenRouter) | $0.0207 | $6.21 | $3,105.00 | Not comparable |
| Grok 2 | $0.021 | $6.30 | $3,150.00 | Not comparable |
| Grok 2 Vision | $0.021 | $6.30 | $3,150.00 | Not comparable |
| Cohere Command R+ | $0.025 | $7.50 | $3,750.00 | Not comparable |
| Perplexity Sonar Pro | $0.0315 | $9.45 | $4,725.00 | Not comparable |
| Claude Opus 5 | $0.0345 | $10.35 | $5,175.00 | Not comparable |
| Claude Opus 4.8 (OpenRouter) | $0.0345 | $10.35 | $5,175.00 | Not comparable |
| GPT-5.6 Sol | $0.037 | $11.10 | $5,550.00 | Not comparable |
| GPT-5.5 Standard | $0.037 | $11.10 | $5,550.00 | Not comparable |
| o3 (Reasoning Frontier) | $0.064 | $19.20 | $9,600.00 | Not comparable |
| Claude Fable 5 | $0.069 | $20.70 | $10,350.00 | Not comparable |
| GPT-4 Turbo | $0.075 | $22.50 | $11,250.00 | Not comparable |
| GPT-5.6 Cyber | $0.0925 | $27.75 | $13,875.00 | Not comparable |
| Claude 3 Opus | $0.1035 | $31.05 | $15,525.00 | Not comparable |
| o1 (Reasoning) | $0.12 | $36.00 | $18,000.00 | Not comparable |
| o3-pro (Frontier Reasoning) | $0.128 | $38.40 | $19,200.00 | Not comparable |
| GPT-5.5 Pro | $0.222 | $66.60 | $33,300.00 | Not comparable |
Assumes the typical cacheable share (50% of input at cached rates where published). 10 requests/user/day. Adjust everything in the monthly calculator.
Best value picks for RAG / search-augmented answers
| Model | Fit score | Cost / 1K requests | Value (fit ÷ cost) |
|---|---|---|---|
| best valueGLM-5.3-Flash (Z.ai) | 60.5 | $0.485 | 124.7 |
| GPT-5.6 Luna | 54.5 | $1.48 | 36.8 |
| GPT-5.4 nano | 40.0 | $1.505 | 26.6 |
| DeepSeek V3.2 (OpenRouter) | 44.2 | $1.75 | 25.3 |
| MiniMax M3 (OpenRouter) | 45.3 | $2.04 | 22.2 |
Fit = weighted blend of third-party composite indices (intelligence, coding, agentic) for this use case; value = fit ÷ cost per 1,000 requests. Models without a verified composite are excluded. Methodology · Benchmark hub.
How to spend less
Related workflow costs
FAQ
Using a typical profile of 8,000 input and 500 output tokens with 50% cacheable input: from Free on GLM-4.7-Flash (Z.ai) up to $0.222 on GPT-5.5 Pro. See the table for every model.
At 10 requests per user per day and the typical token profile, budget from Free per active user per month on GLM-4.7-Flash (Z.ai). A team of 500 active users lands around Free/month at that tier. Model your exact numbers in the monthly cost calculator.
retrieved-context dominates cost — tune top-k and chunk size before switching models. Re-rank and drop marginal chunks; halving context roughly halves input cost. Deduplicate repeated chunks across queries to raise the cache hit rate.