“Gemini 3.6 Flash和3.5 Flash-Lite哪个好”是一个典型的选型问题。两者都支持开发者入口,但Google对它们的定位不同:3.6 Flash偏通用Agent、编码和多模态工作,3.5 Flash-Lite偏高吞吐与低延迟。本文以Google在2026年7月21日公布的能力和价格为基础,给出可复现的评测方案;资料核验日期为2026年8月7日,不把官方基准当作个人实测。

先给结论:复杂任务选3.6 Flash,批量任务先试Flash-Lite
| 比较项 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| 官方定位 | 编码、知识工作、多模态、Agent | 高吞吐、低延迟、批量处理 |
| 价格/百万token | 输入$1.50;输出$7.50 | 输入$0.30;输出$2.50 |
| 官方强调 | 相较3.5 Flash减少17%输出token;改进计算机使用等能力 | 引用输出速度350 token/s;适合收据、检索和批量摘要 |
| 优先验证 | 任务完成率、工具链稳定性、长上下文质量 | 吞吐、延迟、单次成本和批量错误率 |

评测维度一:复杂度与答案质量
先准备三组脱敏样本:需要多步推理的分析任务、需要读取图像或PDF的多模态任务、只需结构化抽取的批量任务。固定系统提示词、输出格式和工具权限,同一任务分别运行两款模型,记录完成率、缺失字段、引用准确度和人工返工时长。
什么时候优先3.6 Flash
- 任务要连续调用工具,且中途结果会改变下一步计划。
- 需要读取长文档、图表、图片或视频并综合回答。
- 代码迁移、复杂调试或知识工作对一次成功的价值较高。
什么时候优先Flash-Lite
- 任务结构固定,输入输出字段清楚,可批量并行。
- 延迟和单位成本比少量复杂错误更关键。
- 需要做高频分类、收据翻译、商品特征抽取或短摘要。

评测维度二:速度、费用与工具调用
Google AI Studio的快速入门文档说明,Run settings可以调整模型参数、安全设置、结构化输出、函数调用、代码执行和grounding。评测时要把这些设置记录在表格中,因为工具调用、外部检索和重试会改变总耗时与账单。
| 指标 | 记录方法 | 避免的误判 |
|---|---|---|
| 端到端延迟 | 从请求发出到最终可用结果,分开首token和完成时间 | 只看模型生成速度,忽略排队和工具耗时 |
| 单位成本 | 记录输入、输出、缓存、工具与重试费用 | 只用公开单价乘平均token |
| 质量 | 字段完整、引用正确、人工返工和安全拒答分别评分 | 把一次漂亮回答当作稳定能力 |
| 吞吐 | 逐步增加并发,记录限流、超时、队列和失败 | 在单请求低并发下得出结论 |
在Google AI Studio中怎样做小样本评测?
- 建立两个提示词:固定系统说明、输出JSON结构和评判标准,只替换模型。
- 保存同一批输入:至少覆盖正常、边界和需要拒答的样本。
- 打开必要设置:按任务需要启用结构化输出、函数调用或grounding,并记录设置。
- 导出结果:比较字段完整度、引用、延迟和token;把失败原因归类。
- 决定路由:复杂任务走3.6 Flash,结构固定且高频的任务走Flash-Lite,低置信度时转人工。
适用条件
- 你能获取Google AI Studio或Gemini API,并查看账户配额。
- 团队有脱敏样本、明确评分表和人工复核。
- 服务端可以记录模型版本、请求配置、token和工具调用。
限制与风险
- 官方价格和模型版本会更新,评测报告应写明日期并定期重跑。
- Google发布页中的基准由官方引用,不能代替你的领域数据。
- 高并发场景可能受地区、配额和队列影响,需提前做压力测试。
- 向AI Studio或API发送企业资料前,要检查数据处理、保留和权限政策。
FAQ
3.6 Flash价格更高,是否一定更划算?
它的价值取决于一次成功能否减少返工、工具往返或人工审核。用真实任务的总成本比较,单价只能作为起点。
Flash-Lite能处理图片和PDF吗?
Google把Flash-Lite用于多模态收据分析等示例,具体输入类型、文件大小和账户限制要以当前模型页与API文档为准。
如何避免评测被提示词影响?
固定提示词、样本顺序和输出格式,保留原始结果,分开统计正常样本与边界样本,并在不同日期复跑。
