Claude把“回忆”砍到2毛5,OpenAI的万亿参数正在失去护城河

Wait 5 sec.

当Ramp的工程师在监控屏上看到那条38小时无人值守的机器学习任务曲线平稳收尾时,他们第一次觉得,让AI"睡着觉干活"这件事终于不再是实验室里的行为艺术。支撑这场"睡眠实验"的,不是OpenAI那套越打越便宜的算力组合拳,而是Anthropic悄悄改动的一个小数点——缓存读取价从每百万token 1美元跌到0.25美元,一刀砍掉75%。2026年9月,当所有人都在盯着Claude Fable 5.1那翻倍的benchmark分数时,真正让华尔街量化基金和硅谷极客彻夜难眠的,恰恰是这张价格表上最不起眼的一行字。同一套底层模型被拆成两条发布轨道,Fable 5.1面向公众与企业全量开放,Mythos 5.1只对经审核的网络安全与生命科学伙伴放行。输入输出价格分文未动,缓存读取价却打到了脚踝斩。这一刀的位置,才是整场发布真正的题眼,也是Anthropic对整个AI行业下的一份战书。OpenAI在卷"智商税",Anthropic在卷"租金"长久以来,AI模型的定价叙事围绕"单次智能"展开——输入多少钱、输出多少钱,比拼的是谁的单价比谁低。OpenAI在2026年6月推出GPT-5.6家族,把旗舰Sol定在5美元输入、30美元输出,随后在7月把Luna砍价80%,8月再给Sol降超两成,一路把"每单位智能"的价格往死里压。Anthropic却反其道而行。它没有动那根最显眼的输入输出价签,而是把降价火力集中在一个更隐蔽、却更决定Agent经济命脉的地方——缓存读取。先看几组数字。Claude Fable 5.1的输入价仍为每百万token 10美元,输出价50美元,与上一代完全持平,普通输入甚至是自家Opus 5的两倍。表面上看,它更贵了。但缓存读取价从1美元跌到0.25美元,降幅75%,而这个0.25美元只相当于Fable正常输入价的2.5%,远低于其他Claude模型普遍采用的10%折扣系数。这是整篇文章最反直觉的一个逻辑:Anthropic在对"新想法"收最贵的税,却在对"旧回忆"做最狠的补贴。传统上,我们习惯把模型成本等同于"吞吐",输入和输出像水流过水表,流多少付多少。但长时域Agent的成本曲线是另一条形状。它在一个项目上跑几小时、几十小时,每一步都在往同一个上下文里叠加状态,而这些状态里真正新产生的token只占很小一部分,绝大多数是反复读取的、已经算过一遍的旧信息。缓存读取,就是为这种"重复记忆"单独开的价。Anthropic官方给出的账本是:典型任务整体成本下降约25%,高度Agent化的任务最高下降约45%。这个数字的分母和分子都在指向同一件事——当一个Agent不再是一次问答,而是反复回到同一套代码库、同一批工具定义、同一段不断累积的对话历史时,成本的大头早已不是"生成一个新token",而是"把已经处理过的上下文再读一遍"。这就好比一家航空公司,头等舱票价涨到天价,但"燃油费"突然打0.25折。因为Anthropic赌的是,未来的AI不是坐一次就下飞机的过客,而是包机飞越太平洋的常驻机长。对于机长而言,占大头的永远不是起飞那一下的推力,而是平流层里持续几十个小时的巡航油耗。当OpenAI用Luna的80%降价、Sol的两成让利去争夺"单次智能"的性价比高地时,Anthropic把赌注押在了另一个变量上。它赌的是,Agent的下一阶段不是"更快地答对一道题",而是"连续几十小时不跑偏地做完一件事",而在那个世界里,决定账单的不是模型有多聪明,而是模型记东西、读旧东西有多便宜。比"答对"更重要的,是"不跑偏"降价之外,Fable 5.1的能力跃升同样值得拆开看。最显眼的一行是Terminal-Bench-Science 0.1——一项让模型在终端里独立规划、执行并核验一套科学研究流程的评测。Fable 5.1拿到52.6%,上一代Fable 5只有24.7%,翻了一倍还多。作为参照,OpenAI的旗舰GPT-5.6 Sol在这一项上是22.4%,Anthropic自家的Opus 5是29.0%。即便把±3.5到4.5分的标准误差算进去,这个翻倍也经得起推敲。AutomationBench从17.1%涨到31.4%,Terminal-Bench 4.0从42.0%涨到55.8%,Mythos 5.1更是摸到60.9%。一个容易被忽略的细节是,Fable 5.1的评测是在"生产级安全防护开启"的状态下完成的。 也就是说,这些分数是模型被安全网箍着跑出来的——在OSWorld和AutomationBench上,但凡防护机制出手拦截,直接记零分。这反而意味着真实的上限还要更高。但能力的真正变化,藏在那批早期客户的只言片语里。Jane Street的量化研究主管Craig Falls说,Fable 5.1比Fable 5和Opus 5解决了更多他们的编码难题,而且"以前的模型跑得越久越难读懂,Fable 5.1在漫长的多步任务里始终可读"。Millennium的一位高级基金经理讲了一个更具体的案例:一段大约百万分之一概率触发的罕见崩溃,团队里没人能在四五年里解释清楚,所有他们试过的模型包括Fable 5都错过了,Fable 5.1是第一个找到的——它把外部供应商的库反汇编、和core dump对上了号,把崩溃追溯到了那个库的bug。Ramp记录了一次38小时无人值守的机器学习任务,模型中途自行纠正了一个问题,连夜启动了六组实验,带着结果和下一步方案回来。MongoDB的工程师描述了一个三天搭建复杂原型、夜里无人值守跑数小时的场景。把这几件事连起来,结论已经非常清晰了:Fable 5.1的"翻倍"不是靠把模型做得更大,而是靠把模型做得更"能撑"。 它不再追求在单点上多答对几分,而是追求在长链条上少崩、少偏、少让人重来。这恰恰是Agent商业化的真正门槛——一个能在三小时内答对难题的模型,和一个能连续三天不跑偏的模型,卖的是两种完全不同的东西。最强引擎配两副刹车:安全变成了一项可调参数Fable 5.1与Mythos 5.1的关系,是理解Anthropic战略意图的另一把钥匙。官方表述极为克制:两者是同一模型,只是防护等级不同。Fable 5.1全量开放,Mythos 5.1只进"可信访问计划",护栏专门为网络安全和生命科学工作而调校。换句话说,Anthropic把"能力"和"护栏"做了一次解耦。 过去安全策略倾向于给不同风险场景分配不同能力的模型,而这次的做法是,让同一个能力最强的模型,以不同的安全配置出现在不同的市场。这背后的逻辑与缓存降价是相通的。当模型能力开始跨过"能连续工作数十小时"这条线,它对现实世界能做的事就不再是可控的玩具。同一个引擎,交给公众企业和交给网络安全、生物科学这类高风险领域,需要的约束完全不同。与其造两套能力不同的模型,不如造一套能力、两套护栏——既省了研发资源,也把安全治理的成本从"能力层"下移到了"准入层"。数据保留政策是同一思路的延伸。Anthropic同时推出的Enterprise Frontier Safeguards(EFS),让企业把监控数据存在自己控制的云基础设施里,达到"等同于零数据保留"的隐私水平,同时仍能保持顶级的对抗性滥用防护。这项功能从今年秋天起分阶段落地。在此之前,符合条件的企业可以先用零数据保留的方式跑Fable 5.1。安全误报也在被系统地压低:网络安全领域对良性内容的误拦减少了约60%,基础生物学和医学问题的降级率降低了约85%。把这些拼在一起,Anthropic实际在做的,是把"安全"从一个贴在模型外面的补丁,变成一个可以按客户分层配置的参数。对普通企业,少拦一点、跑得更顺;对高风险领域,多拦一点、准入更严。同一台引擎,不同的方向盘。谁在为"记性好"买单?把定价、能力和发布策略三条线合起来看,2026年AI竞争的下半场轮廓就清晰了。上半年,主战场是"单次智能的价格"。OpenAI用GPT-5.6的Sol、Terra、Luna三档把性价比算到极致,Luna降到输入加输出合计每百万token 1.4美元,逼着整个行业往低价走。这是一场看得见的战争,比拼的是训练成本、推理效率和规模经济。但Anthropic的这记缓存降价,把战争从"生成"转移到了"记忆"。在它的叙事里,未来的Agent不是被调用一次就结束的API,而是一个持续几小时、几天、甚至更久的工作主体。这样的主体,其成本结构里占比最大的不是"想出新话",而是"记住旧话、反复读旧话"。谁能让"记忆"更便宜,谁就能让长时域Agent真正跑得动。对真正在做长时域Agent的公司来说,Anthropic这张牌的分量已经显现。Cognition的联合创始人Walden Yan说得很直白:他们要在发布日当天把Devin里的Opus 5流量迁到Fable 5.1,原因是"有了新的缓存读价,Fable级模型终于对这类工作负载经济可用,从代码审查开始"。这句话里藏着一个行业信号——此前,很多本可以上最强模型的重度工作,因为缓存成本不划算,被迫降级到次一档的模型。如今这个约束被拆掉了。换句话说,Anthropic降价降的不是模型,是"把最强模型当常驻Agent用"的门槛。 这比单纯便宜更有杀伤力,因为它直接改变了客户的选型逻辑,从"够用就好"变成"最强也养得起"。这场定价变局里,真正该紧张的未必是OpenAI。OpenAI的Luna、Terra降价瞄准的是长尾用户和大规模推理,它有自己的缓存折扣,也在8月给Sol临时降超两成。但它降价的主体仍是"输入输出",缓存仍按输入价的固定比例折扣。Anthropic则把缓存读单独拉到地板价,相当于在"持续型Agent"这个细分场景里建立了一个价格锚点。短期内,两家在各自的主场都不会受致命伤。更危险的是那些夹在中间的模型厂商——既没有OpenAI的规模去玩普惠降价,也没有Anthropic的纵深去重构成本结构。当头部玩家开始对"记忆成本"这个此前隐形的变量动刀时,跟随者会发现自己在两条战线上同时失血:单次智能比不过前者便宜,持续智能比不过后者便宜。对用户和开发者,信号很明确:接下来评估一个模型,不能只看那张输入输出价签,还要把"你的工作负载里,有多少是反复读取的上下文"算进去。如果你的场景是一次性问答,Anthropic的降价与你关系不大;如果你的场景是一个要跑几小时的Agent,那这75%可能比任何benchmark分数都更值钱。小结曾几何时,我们评判AI只看MMLU分数,那是"脑容量"的时代;半年前,我们比拼输入输出每百万token的价格,那是"脑转速"的时代;而今天,Anthropic用这0.25美元划出了一条新起跑线——"记忆的租金"。缓存读取价,这个长期待在价格表最不起眼角落的数字,正在成为AI竞争的新刻度尺。当模型足够聪明到能连续工作数十小时,决定它能不能规模化落地的,就不再是它想得有多快,而是它记得有多便宜。当AI的记忆比人类的遗忘还便宜时,Agent才真正从"玩具"变成了"工具"。这场关于记忆成本的定价战,比任何一次参数升级都更接近AI商业的真相——因为它回答的不是"AI能做多难的事",而是"我们能放心让AI做多久的事"。Anthropic用一刀75%把这个问题摆到了台面上,而台面下的答案,将决定未来一年Agent经济到底属于谁。(本文首发钛媒体APP,作者 | 硅谷Tech-news,编辑 | 赵虹宇)更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App