谷歌发布三款新AI模型,Flash系列登场但Pro仍缺席
谷歌今日发布了三款新AI模型:Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。然而,此前在Google I/O 2026上承诺的Gemini 3.5 Pro版本却因未达到内部目标而悄然延期。据彭博社报道,Gemini 3.5 Pro在编码任务上表现不佳,尽管6月底尝试通过更新训练数据来补救,但结果令人失望。消息传出后,Alphabet股价下跌约4.4%,单日市值蒸发约2000亿美元。
谷歌上次发布的Pro级别模型还是今年2月的Gemini 3.1 Pro。Flash系列是谷歌针对速度优化的模型线,特点是快速、成本低,适合AI代理任务;而Pro模型则更注重复杂推理能力。
Gemini 3.6 Flash:主要更新
Gemini 3.6 Flash是本次的核心发布。据Artificial Analysis Index,其输出token数比3.5 Flash减少17%,价格也更低:输入每百万token 1.50美元,输出每百万token 7.50美元(3.5 Flash输出端为9美元)。在基准测试中,3.6 Flash在DeepSWE v1.1上得分为49%(3.5 Flash为37%),在MLE-Bench上得分为63.9%(3.5 Flash为49.7%),在OSWorld-Verified上以83.0%领先Claude Sonnet 5(81.2%)和GPT-5.6 Luna(72.6%)。

不过,竞争对手在某些领域仍占优势:GPT-5.6 Luna在DeepSWE上达67%,Claude Sonnet 5在GDPval-AA v2上的Elo评分为1607,高于3.6 Flash的1421。实际编码测试中,我们的尝试结果不理想:生成的HTML格式错误,元素渲染异常。

随后我们请Deepseek修复,它识别出11个bug并实施了8个关键修复,最终得到一个可玩的游戏。

这说明Gemini的核心思路正确,但细节不准确导致结果不可用。如果打算用该模型进行长时间vibe coding,可能需要做好心理准备。

Gemini 3.5 Flash-Lite:专为高吞吐量设计
该模型每秒输出350个token,输入每百万token 0.30美元,输出每百万token 2.50美元,适合大规模文档处理或代理搜索系统。在Terminal-Bench 2.1上得分为54%,远超旧版3 Flash的31%。
Gemini 3.5 Flash Cyber:仅限政府合作
这款模型不会公开,谷歌仅向政府及经过审查的合作伙伴开放,用于发现和修复软件漏洞,以避免滥用。
与此同时,谷歌DeepMind团队已开始“Gemini 4最雄心勃勃的预训练运行”。预训练是模型学习海量数据的基础阶段,意味着Gemini 4已在建设中。
目前,Gemini 3.6 Flash和3.5 Flash-Lite已在Gemini应用、Google AI Studio和API中上线。至于Gemini 3.5 Pro,谷歌表示“准备就绪后就会发布”。
