中国大模型简史03:百模大战开场,不是每张牌都长得一样

Wait 5 sec.

文 | AI资本观从2023年春天开始,中国科技圈几乎每隔一阵子就会冒出一个新的大模型。发布会越来越多,模型的名字越来越多。有人看发布会演示,有人申请内测,也有人已经能通过API或者开发者工具试到其中一些能力。但对大多数普通用户来说,它们仍然隔着一层。不少产品仍停在邀请测试或有限开放。于是我们不断听说“大模型来了”,却一直很难像打开一个普通网站或App那样,直接进去问一句。这种情况,一直持续了几个月。8月底,几款此前还需要邀请资格或有限测试的国产生成式AI产品,开始直接向普通用户开放。半年前,投资人一天看二十个项目时,许多团队还在组队、融资,真正把模型发布出来、开放测试的还不多。那时候,能把东西拿出来就已经算上了桌。等大家陆续都上了桌,人们才发现:这些牌是不是有点多?而且打法也不一样。这段“百模大战”却“见不得人”的故事,可以从3月14日开始讲。01|模型走出实验室2023年3月14日,OpenAI发布了GPT-4。距离ChatGPT上线才三个多月。GPT-4已经可以接收图像和文字输入,OpenAI公布的多项专业测试成绩也明显高于GPT-3.5。也是在这一天,从OpenAI出走的达里奥·阿莫代伊,带领Anthropic团队结束早期小范围闭测,推出了其旗舰大模型助手Claude及轻量版 Claude Instant,正式迈入前沿大语言模型的公众竞争舞台。中国这边,同一天发生的另一件事看上去小得多——清华和智谱团队在GitHub公开了ChatGLM-6B的模型文件和代码。几个月前,GLM-130B还是一个1300亿参数的大模型,团队曾经为训练发散和推理门槛吃过不少苦头。ChatGLM-6B只有62亿参数,单看数字,它甚至像是在往回走。但它的意义不一样。团队同时给出了训练好的模型文件、调用方式、Web Demo和命令行Demo。开发者可以把模型下载到本地运行,也可以围绕自己的任务继续调试和开发。2023年3月,ChatGLM-6B开放权重和代码这个首发版本还远谈不上“谁的电脑都能跑”,默认版本大约需要13GB显存,许可证也仍然限定在非商业研究,但模型文件和代码真正到了开发者手里。随后一周多里,更省显存的量化版本、API部署和更省资源的微调方式陆续补进项目,外部开发者也开始提交新的网页Demo等工具,其中一个量化版本把显存需求压到大约6GB。ChatGLM-6B成为当年开发者最先“可以玩起来”的中国大模型之一。接着动起来的是百度。2022年底,李彦宏在百度内部已经说过,“这个事情很难,但百度必须要做”,并启动了内部冲刺。3月16日,百度召开文心一言发布会,李彦宏走上台亲自介绍。但发布会上展示的文心一言几项核心能力,采用的都是提前录好的视频,而不是现场输入Prompt实时演示。李彦宏自己测试过产品,也知道还有不少问题,他上台以后甚至直接承认:“不能说百度完全准备好了。”至于为什么不再等,百度给出的理由是“有市场需求”。百度内部的产品线和合作伙伴都在等。李彦宏认为有了“真实的人类反馈”,也能够帮助产品继续迭代。发布会进行期间,百度股价一度跌了约10%,后来收盘跌幅有所收窄。尽管股价变化很难只归到这一件事上,但外界当时对用录制的视频演示有不少讨论。这一天之后,文心一言先进入邀请测试,少数用户可以通过邀请码体验,但真正向全社会全面开放还要再等五个多月。02|“距离ChatGPT发布,已经第131天了”也是在这一周,新一批创业者开始逐渐“上桌”,其中声势最盛的,来自创新工场创始人李开复和前搜狗CEO王小川。3月19日,李开复公开宣布自己“正在亲自筹组Project AI 2.0”,并称“资金、算力陆续到位”。3月14日一次创新工场活动上,他刚把这一轮变化称作“绝对不能错过的一次革命”,几天后招聘已经开始,招聘方向包括大模型、多模态、NLP、算法研究和工程、分布式计算与Infrastructure等。那时公司还没有后来定下的“零一万物”这个名字,但李开复已经把目标说得很大:一家面向全球的AI 2.0公司,既想做新的AI平台,也想做以AI为核心的生产力应用,而不是只做一个“中文版ChatGPT”。王小川的团队动作也很快。4月10日,北京海淀,搜狐网络大厦二层,王小川穿着一件橙色帽衫,走进一间不到30平方米的会议室。2023年4月10日,王小川首次公开介绍百川智能|图源:红星新闻没有PPT,他拿着一台iPad讲,楼上不时传来电钻声——楼上正在装修的,正是王慧文的新公司光年之外。他们几天前刚搬进来。二月中旬,王小川回复外界追问时还在说“正在快速筹备中”。现在,公司已经成立,名字叫百川智能。公司主体在3月24日完成注册。4月10日这天,王小川第一次公开亮相。当天公开信的开头,他先数了一遍时间:“今天距离ChatGPT发布,已经第131天了。”接着他写,百川准备了5000万美元启动资金,一部分来自王小川个人,一部分来自好友个人支持。王小川说,这笔钱足够公司完成从0到1,他也不希望一开始就背上太大的资本压力。公司筹建还不到两个月。王小川当时预计,到4月底团队会接近50人,模型训练也已经启动。王小川公开谈到的方向也不只是一款基础模型,还有搜索、多模态、教育、医疗,以及未来可能出现的超级应用。整个沟通会期间,楼上的电钻声仍不时响起。03|百模大战,“像在炼丹”王小川公开亮相百川智能前后,大模型消息突然密了起来。4月9日,360智脑开始面向企业用户开放内测。4月10日,商汤发布“日日新”大模型体系,昆仑万维宣布“天工”3.5。4月11日,阿里正式展示通义千问,钉钉、天猫精灵将率先接入,阿里云还向企业开放测试,让客户可以用自己的数据做定制模型。加上百川智能,同期媒体报道把这几天新大模型亮相概括成“3天4款”,说AI赛道已经变得“熙熙攘攘”,国产大模型进入了密集发布期。再后面,4月13日,知乎和面壁智能公布共同训练的中文大模型“知海图AI”,并开始尝试把它用于知乎热榜摘要;还有5月6日科大讯飞发布讯飞星火,把它接进学习机、办公和汽车等既有产品。与这些IT、互联网背景的公司不同的“异类”,是来自量化投资行业的幻方——4月11日宣布下场以后,一个多月里,它没有先发布产品。直到5月24日,幻方创始人梁文锋第一次面向科技媒体36氪比较完整地解释他们准备怎么做。此时,新公司的名字已经出现:深度求索,DeepSeek。梁文锋当时说,他们“不会过早设计基于模型的一些应用”,准备先把精力放在大模型本身。他也谈到,VC的钱有退出要求,会关心什么时候能够产品化、什么时候形成价值;如果先把很长时间花在基础研究上,双方的周期未必一致。这种选择有一个重要前提:幻方已经有自己的资金、算力和技术团队,这是作为国内量化投资头部玩家的家底。梁文锋说,人不够时会从幻方临时借调;核心技术岗位里有不少应届或毕业一两年的年轻人,他更看重基础能力、创造性和兴趣。梁文锋把这种条件说得很直白:他顺手讲过幻方积累计算卡的过程:最初1张,后来100张、1000张,再到1万张。至少在那次采访里,梁文锋谈得更多的仍然是研究,而不是先选一个行业做应用。到了5月,零一万物成立。它就是李开复3月公开筹组的Project AI 2.0。李开复的身份也从投资人和孵化者,变成了这家新公司的创始人。到这个时期,已经很难只盯着几家公司看了。5月28日,中关村论坛“人工智能大模型发展”平行论坛发布《中国人工智能大模型地图研究报告》。据不完全统计,当时中国已经发布79个10亿参数规模以上的大模型,相关团队分布在14个省市和地区,其中北京38个,广东20个。这79个并不是ChatGPT出现以后几个月里突然造出来的,里面也包括此前几年已经启动、已经发布的研究成果。报告甚至已经开始同时统计模型分布、人才、服务器采购和开源情况——到这一步,“百模大战”已经不只是发布会数量的问题。论坛现场,一位参会者被记者问起这波大模型创业热时,先说“中国企业非常热情”,随后又补了一句:这当然是句黑话,说的是GPU算力像“炉火”,训练模型的过程常常要靠反复实验和调参一点点试出来。到了6月,“百模大战”已经直接出现在公开活动和新闻标题里。6月2日,一场公开活动上,北京师范大学新闻传播学院院长张洪忠说,“国内现在是‘百模大战’”。6月13日,360智脑正式发布时,“正式加入‘百模大战’”已经可以直接出现在权威新闻的标题里。04|“基础大模型其实不需要那么多”时间线继续向后。6月15日,百川智能发布Baichuan-7B,相关模型文件、配置和代码直接出现在GitHub。当天就有外部开发者开始讨论怎样在RTX 3090这样的高端消费级显卡上继续微调它。这时距离王小川手拿iPad在那间不到30平方米的会议室里说“模型训练已经启动”,刚过两个月。6月25日,智谱升级发布ChatGLM2-6B,距离第一代3月开放只有三个多月。6月28日,字节跳动旗下火山引擎发布火山方舟,把百川、MiniMax、智谱等多家模型接进同一个平台。有同期报道把它形容成一个“大模型商场”,企业可以在里面选择和调用不同模型。差不多就在这个时候,百度集团副总裁侯震宇公开说,“每一家企业是否都需要自己做一个大模型?我觉得不一定”,给从业者的建议是“量力而行”。他还留下一句广为流传的话:这并不能代表行业共识,新玩家上桌,老巨头迭代,大家都不肯落后。但至少到6月底,“是不是每家公司都需要自己训练基础模型”,已经成了公开问题。另一件值得记录的事是:6月29日晚,美团发布公告,与光年之外签署收购协议,交易真正完成还要到8月。美团说,这笔交易希望获得AGI技术和人才,并表示会继续支持团队从事大模型研究。几个月前,王慧文还写着“即便只有一个人,我也要出发”;到6月底,光年之外已经组起大约70人的团队,但那个掀起半个科技圈热潮的“老王”自己,却因为身体原因暂时离开了一线。到了7月,此前分散在各家公司发布会、产品和报道里的很多大模型,被摆进了同一个展馆——世界人工智能大会(WAIC)。这届WAIC专门设置了“迈向通用人工智能”主题展区,30多个大模型团队集中亮相。大厂、AI公司、高校和创业团队的模型挨在一起,旁边还有算力、应用和基础设施。观众可以在5分钟之内纵览全国最新大模型,边看边对比;也有人逛到“脚都走麻了”。阿里、百度、腾讯的展台几乎连在一起,形成“三连座”。大会结束后,又有记者写,大模型已经“随处可见,目不暇接”,但整个展会走下来,很难说哪一个大模型应用留下了特别深刻的印象。种种迹象表明,做出一个“聊得还不错”的大模型,似乎已经没有几个月前那么难,也不稀奇了。由于普通用户这时候仍然难以直接用上各家模型,很难直观对比,到底哪家模型更强、彼此到底差在哪儿,是很多技术社区的热门话题。05|不是每张牌都长得一样WAIC举行的同一周,7月7日,华为云发布盘古大模型3.0和昇腾AI云服务。和当时各家争相展示“会聊天、能作诗”的通用助手不同,华为拿出来的盘古,一看就不是给普通用户“玩”的产品。华为云CEO张平安在现场说:盘古3.0分成三层:基础大模型、行业大模型,再到具体的场景模型。华为当时列出的方向包括矿山、铁路、气象、药物研发。发布会上出现的是行业模型、场景模型、算力和云服务,并没有统一的聊天产品。2023年7月7日,张平安发布华为云盘古大模型3.0|图源:华为云两年前,田奇谈企业使用AI时,曾经用过从“作坊式”走向“工业化”的说法(详见中国大模型简史01:模型越做越大,却没人知道它该变成什么)。到了2023年,这条路已经写进盘古3.0的产品结构里:把模型、算力、云和行业场景绑在一起。另一批公司,交出的却是另一张完全不同的牌——它们把模型文件直接交到开发者手里。几个月前,智谱已经把ChatGLM-6B的模型文件和代码公开。首发许可只限非商业研究;到了7月中旬,智谱又调整了ChatGLM-6B和ChatGLM2-6B的商用规则,企业按当时要求完成登记和授权后,也可以把它们用于商业项目。行业里通常把这种做法叫“开放权重”:不是多开一个网页入口,而是把训练好的模型文件提供给开发者,让他们自己下载、部署,再接进自己的应用。这是美国OpenAI、Anthropic等闭源路线之外的另一种形态,构成了大模型实验室的另一条主流路线。7月18日,Facebook母公司Meta发布Llama 2。这是Meta当时新一代的大语言模型系列。几个月前的第一代Llama主要面向研究使用,Llama 2则把预训练模型和对话模型的权重开放出来,允许更广泛的研究使用,也允许在许可范围内商用。不到三周后,阿里也公开了自己的模型权重。4月第一次展示通义千问时,阿里先宣布让钉钉、天猫精灵接入,并通过阿里云向企业开放测试。8月3日,阿里又把通义千问的Qwen-7B和Qwen-7B-Chat权重和代码公开给开发者,外部开发者也可以直接下载和部署。2023年8月3日,阿里Qwen-7B / Qwen-7B-Chat 首次公开模型越来越多,模型评测平台也不得不迭代。2023年夏天,OpenCompass这个开源大模型评测平台持续把新模型加入评测范围。7—8月,它不断增加新的Benchmark(模型评测)、模型结果和模型对比功能。Qwen-7B在8月3日发布后不久,也进入了它的评测范围。今天回头看,“百模大战”这个词很容易让人产生一个错觉:仿佛2023年夏天,中国突然出现了一大批相似的大模型公司,大家只是拿着不同的模型参加同一场竞争。事实没有那么整齐。百度把模型做成面向用户的产品,并计划接进搜索等既有业务;华为把模型、算力、云和行业任务放在一起;智谱、Meta、阿里把模型权重交给公司之外的开发者;DeepSeek仍愿意把更多时间花在基础模型研究上。这些选择未来会影响产品、成本乃至战略,但在2023年夏天,很难说哪条路是唯一正确的。但无论如何,经过数月喧嚣,大模型真正面向普通用户的门终于开始打开。7月13日,七部门公布《生成式人工智能服务管理暂行办法》,8月15日起施行。办法第二条写得很清楚:适用的是向中国境内公众提供生成文本、图片、音频、视频等内容的生成式AI服务。企业和科研机构如果只是研发和应用,没有向境内公众提供服务,则不适用。8月31日前后,第一批通过备案的生成式AI服务开始集中面向公众。百度当天宣布文心一言向全社会全面开放,智谱清言、百川等服务也在这一时期开始面向公众。曾经在闲鱼上炒得火热的测试资格不再抢手。接下来,普通用户已经可以直接打开网页,开始提问。(未完待续)|本章关键来源附录OpenAI关于GPT-4的官方研究材料;Anthropic关于Claude、Claude Instant早期开放的官方材料;ChatGLM-6B、ChatGLM2-6B官方GitHub、Hugging Face仓库及历史版本记录百度3月16日文心一言发布材料、李彦宏相关公开表述,以及第一财经、彭博等对发布会和同期市场反应的报道创新工场Project AI 2.0相关公开材料、零一万物官方资料;百川智能公开信、Baichuan-7B官方仓库及王小川4月10日首次公开亮相的同期现场报道36氪旗下《暗涌Waves》等对梁文锋、幻方与DeepSeek早期路线的同期访谈;幻方关于进入大模型领域的公开材料知乎、面壁智能关于“知海图AI”的公开信息;《中国人工智能大模型地图研究报告》及2023年5—6月“百模大战”相关同期报道世界人工智能大会官方材料,以及第一财经等对2023年WAIC大模型展区、“三连座”“像在炼丹”等现场的同期报道火山引擎关于火山方舟的发布材料;美团6月29日港交所收购公告及相关公开资料华为云关于盘古大模型3.0、昇腾AI云服务的官方材料;Meta关于Llama 2的官方发布与许可证;Qwen官方仓库历史记录;OpenCompass News / Changelog国家网信办《生成式人工智能服务管理暂行办法》及生成式AI服务备案相关公开材料;百度、智谱、百川等关于8月31日前后面向公众开放的官方信息更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App