Gemini API的价格不能只看输入和输出token单价。Google官方定价页同时列出免费层、付费层、Standard、Batch、Priority、上下文缓存和搜索 grounding 等项目,实际账单还取决于模型、请求长度、工具调用和服务等级。本文资料核验日期为2026年8月5日,帮助开发者按任务选择模式。

先给结论:先按时效和吞吐分流,再比较单价
| 模式 | 适合的任务 | 主要权衡 | 上线前核对 |
|---|---|---|---|
| Standard | 在线问答、交互式Agent | 响应及时,单位价格按模型计 | 配额、峰值延迟、缓存 |
| Batch | 离线分类、批量摘要、数据标注 | 官方写明付费层可降低成本,但不适合强实时 | 完成时限、重试、结果回写 |
| Priority | 对延迟更敏感的关键请求 | 价格更高,需要稳定预算 | 业务SLA、并发和故障降级 |

读懂官方价格表的四个层次
1. 免费层与付费层
Google定价页写明,免费层提供部分模型的免费输入输出token和AI Studio访问,内容可能用于改进产品;付费层提供更高的生产限额、上下文缓存、Batch API以及更先进模型,付费服务内容不用于改进产品。团队需要同时评估额度和数据处理条款。
2. 模型单价
以定价页列出的Gemini 3.6 Flash为例,Standard付费层输入每百万token 1.50美元、输出7.50美元;同一页面还列出不同模型和长上下文区间的价格。模型名称与价格会变化,本文不把一组数字当作长期承诺。
3. 工具与缓存
上下文缓存有存储和读取费用,Google Search grounding 也有独立计费规则。若一个请求触发多次搜索,费用按实际查询次数计算。预算表要把模型token、缓存、搜索和重试分开记录。

按任务做一轮小规模评测
- 记录输入分布:统计短请求、长文档、图片和音频的比例。
- 固定验收标准:关注正确率、引用完整度、响应时间和失败恢复。
- 分别试跑模式:在线请求用Standard,离线队列用Batch,对延迟敏感的少量请求再评估Priority。
- 测算真实成本:把token、缓存、搜索、工具调用和重试放进同一张账单表。
适用条件
- 团队能拿到脱敏样本,并能重复提交同一任务。
- 业务允许对离线任务设置完成窗口。
- 有监控、配额预警和超预算自动降级策略。
限制与风险
- 定价页面会更新,采购或上线前要重新查看官方页面和账户地区。
- Batch的成本优势不等于所有任务都适合排队,实时客服仍要优先考虑延迟。
- Free层与Paid层的数据使用条款不同,敏感资料不能只按价格选择。
- Google Search、Maps等工具可能产生额外费用和请求额度。
FAQ
Batch一定比Standard便宜吗?
Google官方在付费层说明Batch API可降低成本,但最终仍取决于模型、请求规模和失败重试。上线前应拿自己的样本核算。
Priority适合全部请求吗?
不建议。Priority应留给对时延有明确业务价值的请求,其余任务可用Standard或离线队列,避免预算被峰值流量放大。
如何避免定价表读错?
先确认模型ID、上下文长度、输入输出模态和服务等级,再记录页面更新时间;不要把不同模型的单价放在同一行比较。
