领导层洗牌后,Argon能否助谷歌重回前沿?

Wait 5 sec.

文 | 影子备忘录2026年的AI赛道,用“瞬息万变”来形容已经远远不够。如果你每隔两周没有关注前沿模型的动态,打开排行榜时大概率会怀疑自己是不是错过了整整一个季度。就在这样近乎疯狂的产品迭代节奏中,谷歌DeepMind于9月30日正式发布了Gemini 4系列的首款旗舰模型Argon。距离上一代旗舰Gemini 3系列亮相,已经过去了将近十个月。对于一个头部AI实验室来说,十个月的沉默几乎等同于一次豪赌。但在讨论Argon之前,有一个更值得回看的背景,然而这场豪赌的筹码,其实在两个月前就已经被重新洗过一遍了。一场“静悄悄的权力交接”2026年8月5日,Alphabet CEO桑达尔·皮查伊通过内部信宣布了一项令业界震动的架构调整:Google DeepMind联合创始人兼CEO德米斯·哈萨比斯卸下日常运营管理职责,转任DeepMind董事长及Alphabet首席科学家。首席技术官科雷·卡武克丘奥卢升任DeepMind高级副总裁,直接向皮查伊汇报。而在这家公司工作了27年的首席科学家杰夫·迪恩,选择离开谷歌,与老搭档桑杰·格玛沃特共同创办一家独立的公益企业。这组信息放在一起看,远不止几个人换个头衔那么简单。哈萨比斯是DeepMind的灵魂人物,从AlphaGo到AlphaFold,他的个人品牌几乎等同于DeepMind的公众形象。把他从日常管理中“解放”出来,转而专注AGI长期战略和前沿科学,释放的信号非常明确:谷歌希望DeepMind从一家“顶级研究机构”变成一台“高效产品引擎”。卡武克丘奥卢是深度学习的实干派,在DeepMind工作13年,从组建深度学习团队到主导WaveNet和DQN等突破,其履历横跨研究与工程两端。让他掌舵日常运营,本质上是把“交付能力”提到了比“探索自由度”更高的优先级上。更值得注意的是这次调整的空间维度。多家媒体分析指出,权力正在从伦敦向加州转移,谷歌联合创始人谢尔盖·布林的影响力也在回归。这意味着DeepMind正在被更深地整合进谷歌的全球产品体系,而不是作为一座“研究飞地”独立运转。对于一个需要在搜索、地图、Gmail、Chrome等十亿级用户产品中落地AI能力的公司来说,这种整合是必然的,但代价是DeepMind失去了相当程度的自主权。 Argon的牌面理解了这次架构调整的底层逻辑,再来看Argon的表现,就能读出更多东西。从纸面数据看,谷歌官方在19项基准测试中宣称Argon取得了13项领先,涵盖长周期软件工程、企业知识工作、网络安全漏洞修复等多个维度。在衡量真实世界长期软件工程能力的DeepSWE v1.1测试中,Argon拿到了77.9%,超过了Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。在Zapier的AutomationBench——这个衡量企业端到端业务流程自动化执行能力的基准上,Argon以51.3%排名第一,比Claude Opus 5.5高出近9个百分点。但Argon真正让人侧目的,不是某个单独的跑分数字,而是它把输出Token上限从上一代的6.4万直接拉到了100万。输出上限和上下文窗口是两个完全不同的概念,前者决定的是模型在一次推理轨迹中能生成多长的内容。100万Token的输出意味着模型可以在单次任务中持续推理、生成接近百万Token的结果,而不是被迫把复杂任务拆成好几轮来做。这对大型代码库迁移、深度研究、多步骤企业流程这类场景的意义是结构性的。实际落地的案例也在印证这一点。谷歌披露,Argon已经参与了内部C/C++代码库向Rust的迁移工作,覆盖超过80万行代码的Fuchsia Zircon内核。在开源视频解码器libgav1项目中,Argon通过多轮性能测试和编译器分析,重写了约3.2万行SIMD代码,新的Rust版本运行速度达到原版本的2.7倍。这些不是demo级别的展示,而是进入了谷歌核心基础设施的真实工程任务。定价方面,Argon的推广期价格是每百万输入Token 2美元、每百万输出Token 10美元,缓存输入的价格更是比标准输入低了95%。根据Artificial Analysis的测算,在折扣价下,Argon完成单个任务的成本约为1.99美元,比GPT-6 Astra低了约40%。这个价格策略的进攻性非常明显,谷歌是在告诉企业客户:你不一定需要最强的模型,但你一定需要性价比最高的那个。跑分之外,裂缝同样清晰Argon的问题和它的亮点一样突出,而且这些问题恰恰暴露了谷歌在AI战略上的深层矛盾。首先,Argon并非在所有维度上都领先。在FrontierSWE v2和Terminal-Bench Science 0.1这两个终端和科学推理相关的测试中,GPT-6 Astra领先Argon超过10个百分点;在Terminal-bench 4.0上,Claude Opus 5.5以66.4%大幅领先Argon的57.4%。The Decoder的评论更是一针见血:Argon“缩小了与OpenAI和Anthropic的差距,但并未取得明显领先”。另外,彭博社在Argon发布当天报道称,部分谷歌员工对该模型在实际编程工作中的表现存在质疑。据知情人士透露,尽管Argon在标准基准测试上成绩不错,但当员工真正将其用于日常编码任务时,表现并不尽如人意,尤其是在前端设计等领域存在明显短板。这种“跑分亮眼、实战存疑”的落差,引发了外界对谷歌是否存在“benchmaxxing”(为跑分而优化)的质疑。这里面有一个容易被忽略的技术细节。Argon在DeepSWE v1.1上拿到77.9%的高分,但在更接近真实工程复杂度的FrontierSWE v2上只有55.0%,被GPT-6 Astra的65.5%拉开了超过10个百分点。两个测试的核心差异在于任务链条的长度和环境的不确定性,即前者在相对结构化的条件下评估代码生成能力,后者更接近开发者在实际项目中面对的混乱状态。这个差距指向一个可能性:Argon在受控环境中的表现出色,但面对真实世界中模糊的需求、不完整的代码上下文和跨模块依赖时,能力衰减比竞品更明显。这恰好解释了为什么谷歌选择分阶段发布。Argon目前仅通过Fairwind计划向受信任的网络安全防御者开放,普通开发者和消费者还需要等待。谷歌的官方说法是需要进一步加固安全防护,但这个理由背后可能还有一层考量:先在小范围内收集真实场景反馈,用实际使用数据来校准模型在非受控环境中的表现。部分开发者对此表达了不满,有人在社交平台上直言:“跑分是领先了,但普通开发者连API都用不上,又要排队。”掉队的谷歌,追赶的代价要客观评估Argon能否帮谷歌“重回前沿”,需要先理解谷歌是怎么“掉队”的。2025年11月,Gemini 3发布后收获了不错的评价,一度被认为是谷歌追赶OpenAI和Anthropic的转折点。2026年5月的I/O开发者大会上,谷歌公布了迭代版本Gemini 3.5 Pro,并承诺6月正式发布,然而这个承诺从未兑现。据多家媒体报道,Gemini 3.5 Pro的训练周期超出预期但结果不理想,项目最终被搁置。有分析师估算,这一级别的大模型单次训练运行的开销最高可达4亿美元。一次失败的训练不仅意味着金钱和时间的损失,更意味着在竞争对手加速迭代的窗口期内,谷歌被迫按下了暂停键。与此同时,2026年的竞争格局呈现出前所未有的胶着态势。年初Anthropic凭借极致的智能体产品架构和编程能力实现反超;第二季度OpenAI通过限量发布GPT-5.5、GPT-5.6系列重新夺回制高点。7月Anthropic又推出Claude Sonnet 5,号称“最具代理能力”的中端模型。到9月下旬,Anthropic发布Claude Opus 5.5,常规负载成本比上一代下降40%,输出速度提升超过30%。各大巨头交替领先,没有任何一方能保持超过一个季度的优势。在这个背景下审视Argon,它更像是谷歌在经历了一次代价高昂的“跳票”之后,用一次架构重组和一款新模型发起的双重反击。但反击的效果,取决于一个比跑分更根本的问题:谷歌是否找到了适合自己的竞争策略?不过谷歌有一个其他竞争对手不具备的优势,那就是它拥有超过十亿用户的产品矩阵。Gemini模型支撑着搜索页面的AI回答、谷歌地图、Gmail和Chrome,Gemini应用月活用户已突破9.5亿。这种分发能力意味着,即使模型本身不是绝对最强,谷歌也能让AI能力触达比任何竞争对手都多的用户。但问题在于,分发优势只有在模型“够好”的时候才能转化为竞争力。如果用户在使用谷歌搜索的AI回答时觉得不如ChatGPT准确,在使用Gemini应用时觉得不如Claude顺手,那么庞大的用户基数反而会加速负面口碑的传播。OpenAI和Anthropic已经不再仅仅出售模型,而是越来越多地打造自有产品和编程智能体。如果谷歌拿不出一款顶尖的新一代模型,竞争对手就会获得更多机会去说服消费者和开发者,让他们相信未来的搜索和软件应该搭建在竞争对手的平台上。Argon的策略选择很有意思:它没有追求“全能冠军”,而是把资源集中在企业知识工作、软件工程和网络安全这三个高价值场景上。这或许反映了一个务实的判断,也就是在通用能力上全面碾压对手的窗口期可能已经过去了,与其追求面面俱到,不如在几个关键战场上打出差异化。Argon在网络安全方面的表现尤其值得关注。在CWE-bench v1漏洞修复评测中,Argon以68%的成绩并列第一。更具体地说,谷歌称Argon曾发现一项影响全球医院所用医疗软件的严重漏洞,而此前的前沿模型未能识别出这一风险。在网络安全这个领域,“发现别人发现不了的漏洞”比“跑分高几个百分点”有说服力得多。定价策略同样体现了务实的转向。过去几个月,谷歌的对外沟通重心已经从“展示Gemini的尖端能力”转向“强调与竞品相比的成本优势”。这是一个信号:在模型能力差距缩小到几个百分点的当下,谷歌选择用性价比来争夺开发者生态和企业客户。回到牌桌上的前提Argon的发布,至少证明了三件事:谷歌仍然具备训练前沿级别模型的能力;新的管理架构能够在相对短的时间内交付产品;谷歌在网络安全等垂直场景中找到了差异化的切入角度。但Argon也暴露了谷歌尚未解决的问题。内部对模型实战能力的争议、在部分关键基准上的落后、以及“先给少数人用”的分阶段策略,都说明Argon不是一个“一锤定音”的产品。它更像是一张入场券,看似让谷歌重新回到了前沿模型竞争的第一梯队,但距离“重回前沿”还有相当的距离。AI行业的迭代速度已经快到令人窒息的程度。从ChatGPT上线至今,OpenAI和Anthropic已经累计发布了超过40个重磅模型,平均每6天就有一个新旗舰诞生。在这个节奏下,任何一款模型的技术领先窗口都极其短暂。Argon今天在DeepSWE上的77.9%可能下周就会被刷新,Vals Index上的领先可能下个月就会被反超。谷歌真正的考验不在发布日,而在发布之后。Argon能否在真实开发者的工作流中证明自己,能否在安全护栏加固后顺利开放给更广泛的用户群体,能否在下一轮竞争中以更快的节奏交付迭代……这些问题的答案,不取决于谷歌的官方博客怎么写,也不取决于基准测试的数字有多好看,而是取决于市场会给出最终的判断。不过市场的耐心,从来都是有限度的。更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App