资料说明:本文资料核验日期为2026年8月25日,价格和可用模型以Google AI for Developers页面实时信息为准。
Gemini 3.6 Flash和Gemini 3.5 Flash-Lite已经正式发布(GA)。从官方定位看,3.6 Flash适合多步骤智能体、代码生成和多模态推理;3.5 Flash-Lite适合高吞吐、低延迟、低成本的提取和子代理任务。两者都提供100万 token上下文、最多64000 token输出、思考能力和电脑使用支持。
选型时可以先看工作负载:需要更强规划和多轮工具调用,优先考虑3.6 Flash;大量分类、结构化提取、简单路由和批量文档处理,3.5 Flash-Lite更容易控制成本。
价格与能力先对齐

| 维度 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| 模型ID | gemini-3.6-flash |
gemini-3.5-flash-lite |
| 官方输入价 | 1.50美元/100万 token | 0.30美元/100万 token |
| 官方输出价 | 7.50美元/100万 token | 2.50美元/100万 token |
| 默认思考等级 | medium | minimal |
| 官方侧重点 | 代码、多步骤智能体、多模态和空间推理 | 高吞吐执行、文档解析、结构化提取和子代理 |
价格取自Google官方“使用最新的Gemini模型”页面,实际账单还会受服务、区域、缓存、批处理和输入输出量影响。上线前应再次核对Gemini API价格页。
两款模型的使用感受应如何理解?

3.6 Flash:更适合复杂任务链
官方文档强调3.6 Flash会减少多步骤流程中的推理步骤、对话轮次和工具调用次数,并改进代码生成、指令遵循和多模态空间推理。它还更倾向于在修改前运行程序化检查,这可能增加简单前端任务的探索步骤。
3.5 Flash-Lite:优先解决吞吐和成本
Flash-Lite面向低延迟和高吞吐执行,支持文本、图片、视频、音频与PDF输入,适合文档解析、结构化JSON输出、批量分类、路由和子代理编排。默认思考等级为minimal;涉及工具调用或多步推理时,官方建议提高到medium或high,降低任务过早终止的概率。
模型选择不是一次性决定
同一产品可以使用双模型路由:简单请求交给Flash-Lite,遇到复杂规划、长代码或视觉推理再切换3.6 Flash。这样可以将质量和预算拆开管理,前提是应用能识别任务难度并记录升级原因。
迁移时最容易漏掉的四项改动

- 移除抽样参数:
temperature、top_p和top_k已弃用,后续模型可能返回错误。 - 改用思考等级:用
thinking_level替代旧的thinking_budget,并按任务设为minimal、medium或high。 - 取消模型回合预填充:Interactions API不再支持以模型角色回合结束的请求,旧版对话模板要重新检查。
- 检查函数响应:多模态函数响应、call_id、name和工具前文本格式都要按3.x规则复核。
适用条件、限制与建议
更适合3.6 Flash的场景
- 需要多轮工具调用、代码生成或网页布局规划。
- 输入包含图表、视觉蓝图和多个互相关联的素材。
- 希望减少代理循环,但可以接受更高单次调用成本。
更适合3.5 Flash-Lite的场景
- 批量文档解析、分类、字段提取和JSON输出。
- 请求量大、响应时间和单价优先。
- 可以把复杂任务拆成多个轻量子任务。
共同限制
- 官方文档说明Gemini 3.x不支持图像分割,需要此能力时应选择其他型号并单独测试。
- 3.5 Flash的官方FAQ给出2025年1月知识截止日期,实时信息应配合Search Grounding。
- 价格、配额和地区可用性会变化,本文数字仅代表2026年7月30日官方页面记录。
FAQ
Flash-Lite是不是所有任务都更划算?
不一定。高吞吐提取很适合Flash-Lite,但复杂规划、长代码和多工具链可能需要更高思考等级或切换3.6 Flash。应以自己的输入长度、重试率和人工返工成本计算。
迁移后还可以保留temperature吗?
官方建议移除这些已弃用参数。即使当前请求仍能运行,也应在迁移时清理,避免未来模型代际变更导致400错误。
如何做上线前对比?
准备一组脱敏样本,分别记录任务成功率、工具调用完成率、平均输入输出 token、延迟、重试和人工修改量,再按业务权重选择。
