Gemini 3.8 Flash:谷歌把价格战打进了token消耗层

Wait 5 sec.

文 | AI唱反调大模型价格战,进入了暗战阶段。9月2日,谷歌发布Gemini 3.8 Flash,单价一分没涨:输入每百万token 0.75美元,输出3.75美元。Artificial Analysis当天的实测却发现,完成同一个任务的总成本涨了40%——模型每个任务多消耗了30%的输出token。价格表没动,账单动了。这个矛盾里,藏着下一代模型竞争的真正战场。Gemini 3.8 Flash在DeepSWE上追到离Opus 5只差0.3分,价格不到对方1/6,代价是单任务token消耗上升30%、明年初单价翻倍。Agentic推理越多,账单越厚——成本竞争的口径正在从"每token价格"切换到"每任务成本"。一款什么样的模型先把公开资料能确认的规格摆清楚。Gemini 3.8 Flash是谷歌43天里的第三款Flash:3.6在七月下旬,3.7在八月十三日,3.8在九月二日。皮查伊在财报电话会上说过,Flash的目标是尽量接近月更节奏。基准成绩集中在四类任务上:DeepSWE v1.1长周期软件工程73.7%,距离Claude Opus 5的74.0%只差0.3分;HLE-Verified综合推理54.9%,高于Opus 5的54.4%和GPT-5.6 Sol的54.5%;Vals金融智能体61.4%排第一;生成速度约305 token/秒,是独立机构测过最快的商用模型。定价上,当前优惠价输入0.75美元、输出3.75美元每百万token,有效期到12月31日。作为参照,Opus 5是5美元/25美元,GPT-5.6 Sol是4美元/20美元。模型现已进入Gemini App、AI Studio和Antigravity编程平台,Cursor、Vercel等开发工具在发布当天完成接入。技术机制:为什么会"多用30%的token"这次升级的核心设计,谷歌自己的表述是模型会"更努力地完成任务"。拆开讲就是agentic推理深度的提升。面对复杂任务,模型执行更多推理步骤、更频繁地迭代调用工具。数据流的变化大致是这样: 每一步都跑测试、查输出,最终答案的错误率被压下去了——DeepSWE能追平旗舰靠的就是这个。但每一轮"推理-工具-验证"循环都要消耗输出token,步骤翻倍,token消耗自然上去。高算力模式下,这个放大效应更明显。Artificial Analysis测出的数字链条是完整的:单任务输出token增加约30%,折算成单任务总成本上升约40%。即便涨完,单任务约0.58美元的成本,仍然落在"智能-成本"性价比前沿上——高推理档综合智能指数59分,比上代提高3分。另一层价格变化在明年:优惠价到期后,单价将翻倍至输入1.50美元、输出7.50美元。用量涨一轮、单价再涨一轮,两波叠加才是完整的价格路径。谷歌同时保留3.7 Flash作为低成本选项,承诺继续支持。为什么是现在Flash系列的升级节奏,指向的是开发者入口的争夺。编程Agent和自动化工作流是当前token消耗增长最快的场景,也是各家API收入的主战场。这个场景的采购逻辑很现实:单位智能成本谁低用谁,迁移成本极低。DeepSWE追到离Opus 5只差0.3分、价格不到六分之一,等于直接把"旗舰级编程能力"的商品价格打穿了一个量级。同天发布的Gemini 3.8 Flash Cyber则补了另一条战线:CWE-Bench漏洞修复47.2%,与领跑的Fable 5基本持平;Chrome安全团队实测其有效补丁产出是更大商业模型的2.6倍;Wiz内部渗透测试召回率高出7.5到9.7个百分点,同等成绩花费仅为竞对的1/2.3到1/5.2。这个版本不公开售卖,只通过Fairwind计划向约650家受信机构开放——与Anthropic把Mythos 5.1锁进可信访问计划的门控逻辑一致。前沿网安能力正在变成需要资质审核的战略资源。合理推演是,谷歌的账算在规模上:Flash承担开发者生态的走量任务,把使用习惯和工具链锁定在自家平台上,Pro级别的利润款可以等能力差距真正拉开再发。这也解释了为什么六月预告的Gemini 3.5 Pro至今没有发布——Flash太强,Pro的价格锚点立不住。边界要摆上桌基准口径的边界需要先讲清。官方主打的四个基准全部领先,但第三方核对了完整榜单后,画面并不均匀。开放式Agent任务是明显短板:Terminal-Bench 4.0上Opus 5拿到51.8%,3.8 Flash只有19.1%;OSWorld电脑操作75.4%对59.0%。Harvey法律基准上10.0%的"领先",实际是全榜模型集体不及格下的相对值。规律大致是:边界清晰、终点明确的专业任务,它能贴着旗舰打;需要自主规划下一步的开放任务,差距会被拉开。沃顿教授Ethan Mollick的初步评价是"一个很好的Flash模型,但并不等于前沿模型"。另外,所有对比数据均为厂商自测口径,发布日基准与生产环境表现历来存在差距。成本侧的实际影响也取决于任务结构:短问答场景几乎不受token放大影响,长链路Agent任务才是成本上升的重灾区。社区传闻称部分团队已在评估回迁3.7 Flash控制预算,尚无官方数据印证。写在最后这次发布可以确认的产品事实是:Flash系列的迭代周期压缩到三周级,能力触及旗舰边缘,网安版本进入资质门控。更值得注意的是成本竞争口径的迁移。当各家每token单价逐渐咬平,"完成一个任务烧多少token"就成了新的定价杠杆——推理更深、步骤更多的模型天然更贵,即便价目表一动不动。Anthropic两天前把缓存读取价砍了75%,打的也是同一本账。对开发者的实际建议只剩一条:选型时盯住单任务成本,而不是单价。价格战的第二阶段,比的是谁的账单更会"藏"。更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App