A support bot answers customer questions using product documentation. Each turn sends a system prompt plus retrieved docs as input and generates a short helpful reply.
Input / request
3,500
Output / request
350
Cacheable input
70%
Requests / user / day
6
Cost by model
| Model | Per request | Per user / month | 500 users / month | vs cheapest |
|---|---|---|---|---|
| bestGLM-4.7-Flash (Z.ai) | Free | Free | Free | — |
| GLM-4.5-Flash (Z.ai) | Free | Free | Free | Not comparable |
| GLM-4.6V-Flash (Z.ai) | Free | Free | Free | Not comparable |
| OpenRouter Free Tier (Llama 3.3) | Free | Free | Free | Not comparable |
| Ox Alpha (Z.ai GLM preview) | Free | Free | Free | Not comparable |
| Text Embedding 3 (Small) | $0.000070 | $0.0126 | $6.30 | Not comparable |
| Text Embedding 004 | $0.000070 | $0.0126 | $6.30 | Not comparable |
| Amazon Nova Micro | $0.000107 | $0.0193 | $9.647 | Not comparable |
| Llama 3.2 3B Instruct | $0.000123 | $0.0221 | $11.025 | Not comparable |
| Qwen 2.5 Turbo | $0.000135 | $0.0243 | $12.128 | Not comparable |
| Llama 3.2 1B Instruct (OpenRouter) | $0.000165 | $0.0297 | $14.837 | Not comparable |
| Amazon Nova Lite | $0.000184 | $0.0331 | $16.538 | Not comparable |
| GLM-4.6V-FlashX (Z.ai) | $0.000192 | $0.0345 | $17.262 | Not comparable |
| Llama 3.1 8B Instruct | $0.000203 | $0.0365 | $18.27 | Not comparable |
| Groq LPU — Llama 3.1 8B Instant | $0.000203 | $0.0365 | $18.27 | Not comparable |
| GLM-5.3-Flash (Z.ai) | $0.000203 | $0.0365 | $18.27 | Not comparable |
| Cohere Command R7B | $0.000228 | $0.041 | $20.475 | Not comparable |
| Gemini 2.0 Flash-Lite | $0.00023 | $0.0413 | $20.672 | Not comparable |
| Gemini 1.5 Flash | $0.00023 | $0.0413 | $20.672 | Not comparable |
| GLM-4.7-FlashX (Z.ai) | $0.000238 | $0.0428 | $21.42 | Not comparable |
| Together AI — GPT-OSS-20B | $0.000245 | $0.0441 | $22.05 | Not comparable |
| Ministral 3 8B | $0.000247 | $0.0444 | $22.207 | Not comparable |
| DeepSeek V3 (Chat) | $0.000279 | $0.0503 | $25.137 | Not comparable |
| DeepSeek Coder V2.5 | $0.000279 | $0.0503 | $25.137 | Not comparable |
| Gemini 2.5 Flash-Lite | $0.000306 | $0.0551 | $27.563 | Not comparable |
| Gemini 2.0 Flash | $0.000306 | $0.0551 | $27.563 | Not comparable |
| Fireworks AI — Llama 4 Scout | $0.000326 | $0.0586 | $29.295 | Not comparable |
| Ministral 3 14B | $0.000329 | $0.0592 | $29.61 | Not comparable |
| Mistral Small 3.2 24B (OpenRouter) | $0.000333 | $0.0599 | $29.925 | Not comparable |
| Hy-MT2-30B-A3B (OpenRouter) | $0.000362 | $0.0652 | $32.603 | Not comparable |
| DeepInfra — Qwen 2.5 Coder 32B | $0.000364 | $0.0655 | $32.76 | Not comparable |
| Groq LPU — Llama 4 Scout | $0.000369 | $0.0665 | $33.233 | Not comparable |
| GLM-4-32B-0414-128K (Z.ai) | $0.000385 | $0.0693 | $34.65 | Not comparable |
| Mistral Small 4 | $0.000404 | $0.0728 | $36.383 | Not comparable |
| Muse Spark 1.2 Contributor (OpenRouter) | $0.00042 | $0.0756 | $37.80 | Not comparable |
| Text Embedding 3 (Large) | $0.000455 | $0.0819 | $40.95 | Not comparable |
| Microsoft Phi-4 (14B) | $0.000455 | $0.0819 | $40.95 | Not comparable |
| DeepInfra — Llama 3.3 70B | $0.000455 | $0.0819 | $40.95 | Not comparable |
| Qwen 2.5 Coder 32B | $0.000469 | $0.0844 | $42.21 | Not comparable |
| Grok 4.1 Fast | $0.000483 | $0.0869 | $43.47 | Not comparable |
| Yi-Lightning (01.AI) | $0.000539 | $0.097 | $48.51 | Not comparable |
| GPT-4o mini | $0.000551 | $0.0992 | $49.613 | Not comparable |
| Qwen3 Coder Next (OpenRouter) | $0.000578 | $0.104 | $51.975 | Not comparable |
| Llama 3.2 11B Vision | $0.000616 | $0.1109 | $55.44 | Not comparable |
| Qwen3 Coder Flash (OpenRouter) | $0.000642 | $0.1155 | $57.74 | Not comparable |
| Groq LPU — Llama 4 Maverick | $0.000665 | $0.1197 | $59.85 | Not comparable |
| GLM-4.5-Air (Z.ai) | $0.000669 | $0.1203 | $60.165 | Not comparable |
| GPT-5.6 Luna | $0.000679 | $0.1222 | $61.11 | Not comparable |
| GPT-5.6 Luna Pro (OpenRouter) | $0.000679 | $0.1222 | $61.11 | Not comparable |
| Llama 4 Scout (109B MoE) | $0.000683 | $0.1228 | $61.425 | Not comparable |
| MiniMax-01 (4M Context) | $0.000693 | $0.1247 | $62.37 | Not comparable |
| GPT-5.4 nano | $0.000697 | $0.1254 | $62.685 | Not comparable |
| Qwen 2.5 72B Instruct | $0.000698 | $0.1257 | $62.842 | Not comparable |
| Codestral 2501 | $0.000703 | $0.1266 | $63.315 | Not comparable |
| Codestral 2508 (OpenRouter) | $0.000703 | $0.1266 | $63.315 | Not comparable |
| Qwen3.8-Flash (QwenCloud preview) | $0.000724 | $0.1304 | $65.205 | Not comparable |
| DeepSeek V3.2 (OpenRouter) | $0.000725 | $0.1304 | $65.205 | Not comparable |
| Cohere Command R | $0.000735 | $0.1323 | $66.15 | Not comparable |
| Microsoft Phi-3.5 MoE | $0.000735 | $0.1323 | $66.15 | Not comparable |
| GLM-4.6V (Z.ai) | $0.000752 | $0.1355 | $67.725 | Not comparable |
| Claude 3 Haiku | $0.000761 | $0.137 | $68.513 | Not comparable |
| Gemma 2 9B Instruct | $0.00077 | $0.1386 | $69.30 | Not comparable |
| Qwen 3 32B Instruct | $0.000798 | $0.1436 | $71.82 | Not comparable |
| Llama 3.3 70B Instruct | $0.000836 | $0.1506 | $75.285 | Not comparable |
| AI21 Jamba 1.5 Mini | $0.00084 | $0.1512 | $75.60 | Not comparable |
| Gemini 3.1 Flash Lite (OpenRouter) | $0.000849 | $0.1528 | $76.388 | Not comparable |
| MiniMax M2.7 (OpenRouter) | $0.000882 | $0.1588 | $79.38 | Not comparable |
| MiniMax M3 (OpenRouter) | $0.000882 | $0.1588 | $79.38 | Not comparable |
| QwQ 32B (Reasoner) | $0.000938 | $0.1688 | $84.42 | Not comparable |
| DeepSeek V4 Flash | $0.000958 | $0.1725 | $86.247 | Not comparable |
| DeepSeek V4 Flash Vision Exp | $0.000958 | $0.1725 | $86.247 | Not comparable |
| Gemma 4 31B Instruct | $0.001137 | $0.2047 | $102.375 | Not comparable |
| Groq LPU — QwQ 32B Reasoner | $0.001151 | $0.2073 | $103.635 | Not comparable |
| Mistral Large 3 | $0.001173 | $0.2111 | $105.525 | Not comparable |
| Gemini 3.5 Flash-Lite | $0.001263 | $0.2274 | $113.715 | Not comparable |
| Devstral 2 (2512) (OpenRouter) | $0.00134 | $0.2412 | $120.582 | Not comparable |
| Gemini 2.5 Flash | $0.001374 | $0.2473 | $123.638 | Not comparable |
| NVIDIA Llama 3.1 Nemotron 70B | $0.00147 | $0.2646 | $132.30 | Not comparable |
| Cerebras — GPT OSS 120B | $0.001487 | $0.2677 | $133.875 | Not comparable |
| GLM-4.5V (Z.ai) | $0.00153 | $0.2753 | $137.655 | Not comparable |
| Together AI — Llama 4 Maverick | $0.00154 | $0.2772 | $138.60 | Not comparable |
| Llama 3.1 70B Instruct (OpenRouter) | $0.00154 | $0.2772 | $138.60 | Not comparable |
| GLM-4.6 (Z.ai) | $0.00167 | $0.3005 | $150.255 | Not comparable |
| GLM-4.5 (Z.ai) | $0.00167 | $0.3005 | $150.255 | Not comparable |
| GLM 4.7 (Zhipu) | $0.00167 | $0.3005 | $150.255 | Not comparable |
| Cerebras — Qwen 3 32B | $0.00168 | $0.3024 | $151.20 | Not comparable |
| DeepSeek R1 (Reasoner) | $0.001687 | $0.3037 | $151.83 | Not comparable |
| Llama 4 Maverick (400B MoE) | $0.002013 | $0.3623 | $181.125 | Not comparable |
| Qwen3.5 397B A17B (OpenRouter) | $0.002184 | $0.3931 | $196.56 | Not comparable |
| Grok Build 0.1 | $0.00224 | $0.4032 | $201.60 | Not comparable |
| GPT-3.5 Turbo | $0.002275 | $0.4095 | $204.75 | Not comparable |
| Together AI — DeepSeek V4 | $0.002275 | $0.4095 | $204.75 | Not comparable |
| Groq LPU — Llama 3.3 70B | $0.002342 | $0.4215 | $210.735 | Not comparable |
| Kimi K2.7 Code (OpenRouter) | $0.002359 | $0.4246 | $212.31 | Not comparable |
| Claude 3.5 Haiku | $0.002436 | $0.4385 | $219.24 | Not comparable |
| Amazon Nova Pro | $0.00245 | $0.441 | $220.50 | Not comparable |
| Qwen3.8 27B (OpenRouter) | $0.00252 | $0.4536 | $226.80 | Not comparable |
| GPT-5.4 mini | $0.002546 | $0.4583 | $229.163 | Not comparable |
| GLM-5 (Z.ai) | $0.00266 | $0.4788 | $239.40 | Not comparable |
| Grok 4.3 | $0.002677 | $0.4819 | $240.975 | Not comparable |
| Fireworks AI — DeepSeek R1 | $0.002692 | $0.4845 | $242.235 | Not comparable |
| Databricks DBRX Instruct | $0.00273 | $0.4914 | $245.70 | Not comparable |
| Qwen3 VL 235B Thinking (OpenRouter) | $0.0028 | $0.504 | $252.00 | Not comparable |
| DeepSeek V4 Pro | $0.00288 | $0.5184 | $259.182 | Not comparable |
| Claude Haiku 4.5 | $0.003045 | $0.5481 | $274.05 | Not comparable |
| GLM-5-Turbo (Z.ai) | $0.003248 | $0.5846 | $292.32 | Not comparable |
| GLM-5V-Turbo (Z.ai) | $0.003248 | $0.5846 | $292.32 | Not comparable |
| GLM-4.5-AirX (Z.ai) | $0.003269 | $0.5884 | $294.21 | Not comparable |
| o4-mini | $0.003369 | $0.6064 | $303.188 | Not comparable |
| Llama 3.2 90B Vision | $0.003465 | $0.6237 | $311.85 | Not comparable |
| GLM-5.3 (Z.ai) | $0.003647 | $0.6565 | $328.23 | Not comparable |
| GLM-5.2 (Z.ai) | $0.003647 | $0.6565 | $328.23 | Not comparable |
| GLM-5.1 (Z.ai) | $0.003647 | $0.6565 | $328.23 | Not comparable |
| Gemini 1.5 Pro | $0.003828 | $0.6891 | $344.531 | Not comparable |
| Perplexity Sonar | $0.00385 | $0.693 | $346.50 | Not comparable |
| Cerebras — Gemma 4 31B | $0.003987 | $0.7176 | $358.785 | Not comparable |
| Gemini 3.7 Flash | $0.004043 | $0.7277 | $363.825 | Not comparable |
| Kimi K2.6 | $0.004043 | $0.7277 | $363.825 | Not comparable |
| o3-mini | $0.004043 | $0.7277 | $363.825 | Not comparable |
| o1-mini | $0.004043 | $0.7277 | $363.825 | Not comparable |
| Qwen 2.5 Max | $0.004312 | $0.7762 | $388.08 | Not comparable |
| OpenRouter Auto-Best Router | $0.00455 | $0.819 | $409.50 | Not comparable |
| Gemini 3.6 Flash | $0.004568 | $0.8222 | $411.075 | Not comparable |
| Mistral Medium 3.5 | $0.004568 | $0.8222 | $411.075 | Not comparable |
| Pixtral Large | $0.00469 | $0.8442 | $422.10 | Not comparable |
| Mistral Large 2 (2411) | $0.00469 | $0.8442 | $422.10 | Not comparable |
| Qwen 3.8 Max (2.4T MoE) | $0.00469 | $0.8442 | $422.10 | Not comparable |
| Grok 4.5 | $0.004935 | $0.8883 | $444.15 | Not comparable |
| Gemini 3.5 Flash (OpenRouter) | $0.005093 | $0.9167 | $458.325 | Not comparable |
| Amazon Nova Premier | $0.00539 | $0.9702 | $485.10 | Not comparable |
| Grok 4.6 Flagship | $0.005425 | $0.9765 | $488.25 | Not comparable |
| Gemini 2.5 Pro | $0.005578 | $1.004 | $502.031 | Not comparable |
| Claude Sonnet 5 | $0.00609 | $1.096 | $548.10 | Not comparable |
| GPT-5.6 Sol Pro (OpenRouter) | $0.00609 | $1.096 | $548.10 | Not comparable |
| NVIDIA Nemotron-4 340B | $0.0063 | $1.134 | $567.00 | Not comparable |
| GLM-4.5-X (Z.ai) | $0.006528 | $1.175 | $587.475 | Not comparable |
| Cohere Command A+ | $0.006737 | $1.213 | $606.375 | Not comparable |
| GPT-5.6 Terra | $0.00679 | $1.222 | $611.10 | Not comparable |
| Gemini 3.1 Pro | $0.00679 | $1.222 | $611.10 | Not comparable |
| GPT-5.6 Terra Pro (OpenRouter) | $0.00679 | $1.222 | $611.10 | Not comparable |
| GPT-5.3 Codex | $0.007166 | $1.29 | $644.963 | Not comparable |
| Llama 3.1 405B Instruct | $0.00735 | $1.323 | $661.50 | Not comparable |
| GPT-5.4 Workhorse | $0.008488 | $1.528 | $763.875 | Not comparable |
| Claude 3.7 Sonnet (Hybrid Reasoning) | $0.009135 | $1.644 | $822.15 | Not comparable |
| Claude 3.5 Sonnet | $0.009135 | $1.644 | $822.15 | Not comparable |
| Kimi K3 (Moonshot) | $0.009135 | $1.644 | $822.15 | Not comparable |
| Claude Sonnet 4.6 (OpenRouter) | $0.009135 | $1.644 | $822.15 | Not comparable |
| GPT-4o (Omni) | $0.009188 | $1.654 | $826.875 | Not comparable |
| Perplexity Sonar Reasoning Pro | $0.0098 | $1.764 | $882.00 | Not comparable |
| Perplexity Sonar Deep Research | $0.0098 | $1.764 | $882.00 | Not comparable |
| AI21 Jamba 1.5 Large | $0.0098 | $1.764 | $882.00 | Not comparable |
| Grok 2 | $0.0105 | $1.89 | $945.00 | Not comparable |
| Grok 2 Vision | $0.0105 | $1.89 | $945.00 | Not comparable |
| Cohere Command R+ | $0.0123 | $2.205 | $1,102.50 | Not comparable |
| Claude Opus 5 | $0.0152 | $2.741 | $1,370.25 | Not comparable |
| Claude Opus 4.8 (OpenRouter) | $0.0152 | $2.741 | $1,370.25 | Not comparable |
| Perplexity Sonar Pro | $0.0158 | $2.835 | $1,417.50 | Not comparable |
| GPT-5.6 Sol | $0.017 | $3.056 | $1,527.75 | Not comparable |
| GPT-5.5 Standard | $0.017 | $3.056 | $1,527.75 | Not comparable |
| o3 (Reasoning Frontier) | $0.0269 | $4.851 | $2,425.50 | Not comparable |
| Claude Fable 5 | $0.0304 | $5.481 | $2,740.50 | Not comparable |
| GPT-4 Turbo | $0.0333 | $5.985 | $2,992.50 | Not comparable |
| GPT-5.6 Cyber | $0.0424 | $7.639 | $3,819.375 | Not comparable |
| Claude 3 Opus | $0.0457 | $8.222 | $4,110.75 | Not comparable |
| o3-pro (Frontier Reasoning) | $0.0539 | $9.702 | $4,851.00 | Not comparable |
| o1 (Reasoning) | $0.0551 | $9.923 | $4,961.25 | Not comparable |
| GPT-5.5 Pro | $0.1019 | $18.333 | $9,166.50 | Not comparable |
Assumes the typical cacheable share (70% of input at cached rates where published). 6 requests/user/day. Adjust everything in the monthly calculator.
Best value picks for Customer support chatbot
| Model | Fit score | Cost / 1K requests | Value (fit ÷ cost) |
|---|---|---|---|
| best valueGLM-5.3-Flash (Z.ai) | 59.2 | $0.203 | 291.6 |
| GPT-5.6 Luna | 52.1 | $0.679 | 76.7 |
| DeepSeek V3.2 (OpenRouter) | 44.2 | $0.7245 | 61.0 |
| GPT-5.4 nano | 37.3 | $0.6965 | 53.6 |
| MiniMax M3 (OpenRouter) | 43.0 | $0.882 | 48.8 |
Fit = weighted blend of third-party composite indices (intelligence, coding, agentic) for this use case; value = fit ÷ cost per 1,000 requests. Models without a verified composite are excluded. Methodology · Benchmark hub.
How to spend less
Related workflow costs
FAQ
Using a typical profile of 3,500 input and 350 output tokens with 70% cacheable input: from Free on GLM-4.7-Flash (Z.ai) up to $0.1019 on GPT-5.5 Pro. See the table for every model.
At 6 requests per user per day and the typical token profile, budget from Free per active user per month on GLM-4.7-Flash (Z.ai). A team of 500 active users lands around Free/month at that tier. Model your exact numbers in the monthly cost calculator.
Cache the system prompt and static documentation chunks — cached input is often 4–10× cheaper. Route simple FAQ turns to a nano-tier model and escalate only complex tickets. Cap max_output per reply; support answers rarely need more than a few hundred tokens.