【事件】Google 7 月 21 日同时将 Gemini 3.6 Flash 与 3.5 Flash-Lite 推向 GA,稳定型号分别为 `gemini-3.6-flash` 和 `gemini-3.5-flash-lite`。两者均支持约 100 万 token 输入与 64K 输出;3.6 Flash 每百万输入/输出 token 为 1.50/7.50 美元,Flash-Lite 为 0.30/2.50 美元。
【背景】发布稿引用 Artificial Analysis 称 3.6 Flash 比 3.5 Flash 少用 17% 输出 token,Flash-Lite 达 350 输出 token/秒;这些是指定环境结果,不是通用 SLA。两款模型构成质量与吞吐分层,而不是两个互不相关的发布事件。Google 推荐 3.6 Flash 承接复杂代理、编码和多模态任务,Flash-Lite 承接抽取、结构化解析和高并发子代理。
【信号】共同迁移约束包括弃用 temperature、top_p、top_k,未来版本会把这些参数升级为 400 错误;以 model 角色结尾的预填充也不再接受。Reuters 同日指出旗舰 3.5 Pro 仍延迟,Google 页面写的是 partner testing/coming soon;Gemini 4 仅有预训练路线,二者都不是今天的发布。采购应把两款模型放入同一流量路由实验,按“每个合格结果”比较质量、有效 token、P95、工具轮次和人工返工。