谷歌连夜上架三款Gemini,我扒了一圈数据,发现了个扎心的事实
凌晨两点朋友圈被谷歌刷屏了。三款Gemini同时发布3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。说实话我第一反应是又是发布会又是PPT吊打友商常规操作。但随手翻了翻数据之后我坐不住了。先泼盆冷水别被营销带跑了看了一圈科技媒体的报道标题全是「暴省65% Token」「价格屠夫」「吊打GPT-4o」……说实话这些数字都没错。但我更想关心的一个问题是对于我这样的开发者来说今天发布的东西到底能不能用、好不好用、值不值得迁移带着这个问我扒了一圈官方文档和技术报告给你提炼几条硬货。一、3.6 Flash省Token这事是真的3.6 Flash最大的卖点就是「省」。官方给了两组数据输出Token节省比例对比3.5 Flash通用场景平均节省17%DeepSWE编程任务最高节省65%性能提升同样任务下基准3.5 Flash3.6 Flash提升DeepSWE编程37%49%12ppMLE Bench科研49.7%63.9%14.2ppOSWorld操作电脑78.4%83%4.6pp注意这个「同样任务下」——意思是它不仅省Token完成质量还更高了。价格也确实降了规格3.5 Flash3.6 Flash输入$/M$0.075$1.50输出$/M$0.15$7.50等等这个价格……好像还贵了别急。Gemini的定价体系比较特殊官方的说法是「按有效Token计费」考虑到压缩率实际成本是下降的。具体省多少取决于你的业务场景——编码类任务最大能省65%普通对话可能省20-30%。二、Flash-Lite这个「小弟」有点猛3.5 Flash-Lite是我觉得最值得关注的一款。原因就一个性价比太高了。价格输入$0.3/M Token输出$2.5/M Token这个价格比3.5 Flash便宜了一个数量级。速度输出速度350 Token/秒整个3.5系列里最快更离谱的是在部分基准测试里这个「小弟」居然打赢了「大哥」3.5 Flash基准3.5 FlashFlash-LiteSWE-Bench Pro49.6%54.2%OSWorld-Verified65.1%74.0%这个现象在AI领域有个名字能力涌现悖论——模型不是越大越好训练数据和方法的优化往往比堆参数更有效。适用场景海量文档处理RAG、知识库高并发Agent搜索实时对话机器人任何「量大管饱」的场景一句话总结如果你现在用的是3.5 Flash做高频调用换Flash-Lite能省一大笔钱。三、Cyber安全场景的专用刀3.5 Flash Cyber是这次最特殊的一款——普通人根本用不了。它被集成在CodeMender安全智能体里定位是「找漏洞、补漏洞」。关键数据CyberGym基准刷新SOTA成本比同级别模型低但目前只对企业合作伙伴开放API还没公开。我的判断是这款产品对普通开发者意义不大但如果你在安全公司或者做代码审计关注一下后续进展。四、Gemini 4说了等于没说官方还放了个预告「史上最激进的预训练已经开始目标Gemini 4。」但是——3.5 Pro还没正式发布3.5 Ultra还在路上4什么时候出「按6个月训练周期推算年底可能看到」翻译成人话就是别等了先用现在的。期货这种东西听听就好。五、我该怎么选给你一个简单的决策树你的场景是什么 ├── 高并发、量大管饱 → Flash-Lite最便宜最快 ├── 复杂推理、Agent任务 → 3.6 Flash性价比最高 ├── 代码安全、漏洞扫描 → 等Cyber企业版 └── 等旗舰、追最新 → 等3.5 Pro/Ultra我的建议先试试Flash-Lite。$0.3/M的输入价格比Claude 3 Haiku还便宜用来跑RAG或者做背景知识检索血赚。写在最后今天这波发布核心信息就一个AI落地成本在下降。Token消耗量在下沉价格在下沉跑一次Agent的账单在下沉这对于真正在生产环境跑AI的人来说比什么「吊打GPT-4o」实在多了。至于Gemini 4——期货归期货现货归现货。能用、便宜、稳定的才是今天该用的。 评论区聊聊你觉得Gemini 3.6 Flash能打得过GPT-4o吗 点赞 · 在看 · 转发 三连走起 加个星标第一时间收到推送谢谢你看我的文章