
2026年最便宜的 LLM API:19 个模型完整价格对比
发布于 2026年7月25日
如果你选 LLM API 纯粹看价格,这个价差比大多数人想象的要大得多。把本站 LLM API 定价计算器跟踪的全部 19 个模型放在一起比较——OpenAI、Anthropic、Google、DeepSeek、Qwen、Moonshot/Kimi、Zhipu/GLM 和 xAI——最便宜和最贵的模型在同口径下相差超过 60 倍。这个差距比你习惯用哪家厂商的产品重要得多。
排名
为了公平比较,下面每个模型都按混合费率打分:每 100 万总 token 中 75 万输入 token + 25 万输出 token,大致对应一个典型的对话式请求场景(回复比提问短)。价格按每 100 万 token 计算,已核对各厂商官方定价页。
| 排名 | 模型 | 提供商 | 输入 | 输出 | 混合 (3:1) |
|---|---|---|---|---|---|
| 1 | Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.175 | |
| 1 | DeepSeek V4 Flash | DeepSeek | $0.14 | $0.28 | $0.175 |
| 3 | Qwen3.6 Flash | Qwen | $0.19 | $1.13 | $0.42 |
| 4 | GPT-5.4 Nano | OpenAI | $0.20 | $1.25 | $0.46 |
| 5 | DeepSeek V4 Pro | DeepSeek | $0.44 | $0.87 | $0.54 |
| 6 | Grok Code Fast 1 | xAI | $1.00 | $2.00 | $1.25 |
| 7 | GPT-5.4 Mini | OpenAI | $0.75 | $4.50 | $1.69 |
| 8 | Claude Haiku 4.5 | Anthropic | $1.00 | $5.00 | $2.00 |
| 9 | GLM-5.2 | Zhipu | $1.40 | $4.40 | $2.15 |
| 10 | GPT-5.6 Luna | OpenAI | $1.00 | $6.00 | $2.25 |
| 11 | Grok 4.5 | xAI | $2.00 | $6.00 | $3.00 |
| 12 | Gemini 3.5 Flash | $1.50 | $9.00 | $3.38 | |
| 13 | Qwen3.7 Max | Qwen | $2.50 | $7.50 | $3.75 |
| 14 | Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | $4.00 |
| 15 | Gemini 3.1 Pro Preview | $2.00 | $12.00 | $4.50 | |
| 16 | GPT-5.6 Terra | OpenAI | $2.50 | $15.00 | $5.63 |
| 17 | Kimi K3 | Moonshot | $3.00 | $15.00 | $6.00 |
| 18 | Claude Opus 5 | Anthropic | $5.00 | $25.00 | $10.00 |
| 19 | GPT-5.6 Sol | OpenAI | $5.00 | $30.00 | $11.25 |
有几点值得注意。每家厂商——不只是某一家——都同时有入门档和旗舰档,两者相差好几倍,所以“哪家厂商最便宜”本身就是个错的问题,“哪个具体模型”才是。第二,最便宜的两个模型(Gemini 2.5 Flash-Lite 和 DeepSeek V4 Flash)来自完全不相关的两家公司,却落在完全相同的混合费率上——在价格最低的这一端,入门档定价已经趋同,而不是某一家厂商刻意把价格打到全场最低。
为什么最便宜的模型不一定是对的选择
单看价格无法告诉你一个模型是否够用。入门档模型通常足以应付分类、抽取、简短回复这类任务边界清晰、定义明确的工作——旗舰模型多出来的推理能力在这类任务上根本用不上。但它们不太适合开放式推理、长链路的多步骤 agent 工作流,或者一旦答错代价很高、事后很难发现的任务;一个答错了需要重试(或者需要人工纠正)的便宜模型,最终花的钱可能比一个一次做对的贵模型还多。
一个合理的默认做法:先用你最熟悉的模型做原型,等任务需求定型之后,再测试同一张表里入门档的模型能不能产出可接受的相近结果——如果可以,规模化之后省下的钱会累积起来;如果不行,那说明价格差本来就不是真正的成本驱动因素。
算出你自己的真实数字
这张表用固定的 3:1 混合比是为了让排名成为可能,但你实际的输入/输出 token 比例几乎肯定不是 3:1——摘要任务可能是 10:1,代码生成任务可能更接近 1:2。上面的混合排名是挑选候选模型去测试的合理起点,不能替代计算你自己的具体成本。
要算具体成本,直接用 LLM API 定价计算器:输入你实际的输入和输出 token 数,它会算出这 19 个模型中任意一个的准确成本,如果你大致知道每月请求量,还能给出月度预估。如果你还不知道自己的 token 数,AI Token 计数器工具能从实际的 prompt 里给出真实数字,而不是粗略估算。两个工具都完全在你的浏览器里运行——不需要 API key,不需要账号,什么都不会上传。