Binance Square
动察Beating
130 Публикации

动察Beating

Square Verified+
金融秩序如何被技术、资本与野心重塑|律动 BlockBeats 旗下深度报道账号
0 подписок(и/а)
46 подписчиков(а)
47 понравилось
Посты
·
--
Статья
李飞飞的World Labs新发布的世界模型,是真的世界模型吗?原文标题:《李飞飞的World Labs新发布的世界模型,是真的世界模型吗?》 原文作者:动察Beating 9 月 1 日,李飞飞的 World Labs 发布了 Atlas。 发布页上有一组画面确实好看。几台手机架在三脚架和夹具上,从三到五个角度对着同一个现场,然后时间停住,镜头开始移动,绕过人物,走到真实摄影机从未站过的位置。 子弹时间,这个手法这两年不算稀奇。差别在 Atlas 同时交出来的另外三样东西。 第一样是 depth。给画面里每一个像素标上它离镜头有多远,一张普通照片就变成一张按远近上色的地形图。 第二样是 point cloud。在空间里撒下几百万个点,每个点记住自己的三维坐标,凑到一起就是这间屋子的形状。 第三样是 3D Gaussian Splat。它不用三角面片搭模型,而是拿大量带颜色、带透明度、有朝向也有胖瘦的小光斑堆出整个场景,换任何一个角度都能重新渲染一遍。 这三样东西的共同点是可测量。杯子的直径、桌子到墙的距离,都能从里面直接读出数值。生成的结果不再只是给人看的画面,可以送进游戏引擎、设计软件,或者一段机械臂的控制代码。 World Labs 干脆把 Atlas 叫做世界模拟器。 模拟器这个词他们用得不随便。三个月前,他们自己写过一篇文章,专门规定什么样的系统才配叫这个名字。 看得见和碰得到 那篇文章发在今年 6 月,讨论的是什么才算世界模型,结论是把市面上的系统分成三级,渲染器、模拟器、规划器。 这种分类方法的源头很老。1943 年,英国心理学家 Kenneth Craik 说过一个观点,人能提前想明白一件事会怎么发展,是因为脑子里有一个缩小版的现实世界。这个说法后来被控制论、神经网络和强化学习一路接过去,变成三个词,state、observation、action。 用一间厨房来说。 杯子摆在桌上的哪个位置、离桌沿几厘米、桌子离墙多远、门开着还是关着,这些加起来是这间厨房此刻的 state。 人站在门口,只看得到状态里的一部分。被冰箱挡住的那块地面他看不见,杯子里还剩多少水他也不知道。他眼睛收进来的这一份信息叫 observation。 他走过去把杯子推开,这是 action。 state、observation、action,一个系统能管几样,就决定了它属于哪一级。 渲染器管画面。人往前走一步,它算出这一步该看见什么,画得像、和上一帧接得上,事情就办完了。杯子有多高、桌子离墙多远,它不需要知道,因为它交出来的只是一张图。 模拟器管状态。杯子的位置、桌子的尺寸、门开到多大会撞上墙,这些数字它得一直存着,随时能被调出来。也正因为存着这些数字,别的程序才接得进来,一只机械臂才能在这间厨房里伸手。 规划器管动作。它不光知道杯子在桌上、碰倒了会怎么样,还要判断现在该不该伸手、先拿哪一个、从哪个角度下手最稳。 按这套标准,Google DeepMind 的 Genie 3 被归进最低一级,只是个渲染器。一起归进去的,还有 World Labs 自己在 2025 年 10 月发布的 RTFM。 在这之前,「世界模型」这个词几乎什么都能装。输入一句话,生成一段能走进去的画面,是世界模型。把官网口号改成用 AI 模拟世界,也是世界模型。这篇文章第一次给它划了条线,画面归画面,世界归世界。 过去一年那些演示大多停在第一级。比起纯文字生成视频,它们确实前进了一大截,按一下方向键,画面会跟着变。 但是渲染器交出来的东西,人看着够用,机器用不了。 Atlas 要够的是模拟器那一级。按他们自己的定义,模拟器得维护这个世界的全部状态,物理也算在里面。 目前公布的测试集中在相机条件生成和三维重建,复杂材料、流体、布料这类多物理相互作用还没解决,整个行业都没有解决。 Atlas 的技术上的名字是 multimodal autoregressive diffusion transformer,四个词拆开来都不新鲜。 transformer 和 autoregressive 是大语言模型那一套,看着已经生成的内容一个接一个往下续。diffusion 是图像和视频生成那一套,画面由它画出来。multimodal 指的是它同时接收好几种输入。 新的地方在 multimodal 具体包括了文字、图片、相机位姿和深度图四类。 相机位姿说的是拍这张照片的时候,相机站在三维空间的哪个位置、朝着哪个方向,六个数字就写得清楚。配上深度图,每一张照片都不再是孤零零的一张图,而是一张标好了拍摄位置的图。 所有照片标在同一套坐标上,这套坐标就是 Atlas 的 shared spatial context,共享空间上下文。 举例来说,站在客厅门口拍一张沙发,再走到窗边拍一张。两张照片里的沙发大小不同、角度不同,还有一半被茶几挡着。普通模型看到的是两张不一样的图。人看到的是同一个沙发,因为人知道自己走了几步、转了多少度。 Atlas 拿到的,正是「走了几步、转了多少度」这份数据。 这份数据还有另一个用处,World Labs 上一代产品 RTFM 已经试过。它的目标是在单张 H100 上实时生成一个能一直逛下去的世界。往前走它往前生成,转弯视角跟着变。麻烦出在记忆上。 假设有人在这栋虚拟房子里逛了半小时。如果把这半小时生成的画面全部塞进上下文,模型确实什么都不会忘,但上下文越堆越长,算力会先撑不住。如果只留最近几十帧,算力省下来了,可从卧室绕一圈走回厨房,模型已经不记得二十分钟前桌子摆在哪儿,同一间厨房会被生成成两个样子。 World Labs 给 RTFM 的做法叫 posed frames as spatial memory。每一帧除了画面,还存下拍它的时候相机在空间里的位置和朝向。模型走到某个位置,系统不必把全部记忆翻一遍,只按位置就近取回几帧,拼出这一次生成需要的上下文。 位置在这里当的是索引。想知道厨房长什么样,把在厨房附近拍下的帧找出来就够了,它们是什么时候拍的不重要。 人用记忆其实也是这个路子。让你回想上周三下午做了什么,多半想不起来,但走进那间会议室,谁坐在对面、白板上写了什么,很快就能对上。按时间检索要从头数一遍,按地点检索一步到位。 重建与生成 Atlas 的发布页上还有一个实验。先只给一张花园的照片,让模型生成从高空往下看的画面。照片里只有花园,周围什么样没拍到,于是花园的部分照实还原,旁边的建筑靠它在训练数据里见过的常识补出来。 第二张照片拍到了旁边的小屋,这一块不用补了。第三张屋子露出来了,要补的地方又少一块。 World Labs 的总结是,the more it sees, the less it imagines。按他们给出的数据,两三张照片通常够把场景还原到能用,一次最多可以放进一百多张。 这个实验把两件本来分得很开的事做进了同一个模型。 想在电脑里得到一个三维场景,过去有两条路。一条叫重建,拿现场拍回来的照片,把一个真实存在的地方按原样还原出来,哪个角落没拍到就空着,宁可留一个洞。另一条叫生成,模型凭训练时见过的房子和草坪,造一个从来不存在的地方。 Atlas 两头都占。没拍到的地方先按常识补上,等新照片补进来,再把编的那部分换成真的。照片少就多编,照片多就少编。 我一直很喜欢一个叫 Funes World 的项目。他们带着相机满世界拍建筑,庞贝、特洛伊、科隆大教堂、天坛祈年殿,也拍那些不出名的房子,就是某天改造完就再没人记得原来长什么样的那种。他们会绕着建筑走,从各个方向拍,照片之间留够重叠,再用摄影测量、NeRF、Gaussian Splatting 拼回三维模型。公开档案现在有 2100 多个模型,覆盖 19 个以上的国家。 他们说自己在给真实世界做备份,做一个物理世界的 GitHub。 Funes 走的是纯粹重建那条路。他们抢在推土机前面按快门,要的是那栋房子确实长成那样。哪怕缺一块,也不能让模型替它补。 Atlas 面对的是另一种用户。一间厨房里的墙,只要位置和尺寸对得上,机械臂伸手撞上去的结果就一样,墙上的花纹是拍来的还是编的机械臂不关心。 于是问题落到了另一个地方。一个有一部分靠编的世界,能不能拿来训练一台要在现实里干活的机器。至于编出来的房子像不像真的,这里可以先不管。 7 月,World Labs 买下了机器人公司 SceniX。收购之后公布的第一批结果,回答的正是这个问题。 几组机器人完全在模拟器里训练,没有用一条真实世界的数据,然后直接装到真实机械臂上,做装箱、绕线、搬试管。其中几台连续自主运行了 1 小时,中途没有人干预。 更值得看的是他们怎么判断这个模拟器算不算合格。 有一条听上去很自然的标准,模拟器里成功率八成,真机上也该是八成。这条他们没用。模拟器里的墙和真墙的摩擦不一样,零件的重量分布也对不上,成功率必然差一截。 他们改成这样做。先在模拟器里把几种方案各跑 2000 次,按表现排出高下,再把这几种方案搬到真机上各跑 100 次,然后只对两件事。模拟器里 A 方案比 B 方案好,真机上是不是也这样;模拟器说某个动作在哪一步最容易失手,真机是不是也在那一步失手。 在公布的任务里,这两项都对上了。至于两边的成功率差多少反倒不用管,按 World Labs 自己的说法,有用的模拟器不需要和现实的成功率一致,只需要支持和现实一样的决策。 这个方式一百多年前就有人用过。 1901 年秋天,莱特兄弟照着 Lilienthal 发表的机翼数据造出滑翔机,实际升力只有预测值的三分之一。前人的数据有问题,可要重新测就得一次次把人送上天。于是他们用木头做了一个六英尺长的风洞,一个下午能试好几副机翼,一个冬天试了 100 多种。 风洞里那点风和北卡罗来纳的海风不是一回事,但哪副机翼更好是能比较出来的。 世界模型不必复制整个宇宙。它只需要留住和决策有关的那部分结构。 失败的经验 到这一步,World Labs 的生意轮廓就出来了。他们 2025 年推出的产品 Marble,已经能从文字、图片和视频生成可探索的三维世界,World API 开放之后开发者可以直接调用,Atlas 是这些产品底下的那层模型。 今年 2 月那轮 10 亿美元融资,出钱的公司分布得很杂。NVIDIA 要 Physical AI,Autodesk 要建筑、工业设计和数字孪生,此外还有 AMD、Fidelity 和 Sea。同一个三维世界,导演在意机位和光线,建筑师在意结构和尺度,机器人要的是一个能实验的环境。 一个世界只要足够通用,就能横跨今天彼此分开的好几套软件产业。 至于把那些说自己在做世界模型的公司塞进同一张 benchmark 表已经没什么意义了。 Genie 3 在生成画面,Meta 的 V-JEPA 2 干脆不画画面,直接从视频里学规律,NVIDIA 的 Cosmos 把视觉推理、世界生成和动作预测装进同一个模型,Runway 从视频生成转身去做模拟。用的是同一个词,解的不是同一道题。 分歧只有一条。一派相信把世界预测得足够好,三维结构自己会从数据里长出来,视频里本来就藏着这些规律。另一派把相机位置、几何和物理约束直接塞进模型,让世界从第一天就带着结构。Atlas 把相机位姿和深度做成原生输入,就是这么做的。 这条路上有一件事绕不开,训练数据从哪来。 大语言模型拿到过一份馈赠。几十年里,人类写网页、写代码、在论坛上吵架,无意之间攒出一个巨大的语料库。 三维世界没有这份东西。空间关系很少被系统地记录下来,一块地板的摩擦系数不会自己写进网页。更难的是交互。机器人把线插歪了,现实里那根线是真的歪了,下一次尝试之前,得有人走过去把它扶正。文本可以无限复制,现实里的经验每一次都要重新发生一遍。 所以过去机器人最缺的其实是失败。在现实里犯错太贵,模拟器一旦好用,机器人就可以在里面跑几千次几万次,快速积攒经验。 李飞飞和这个问题打了快 20 年交道。 2009 年,她和团队做了 ImageNet,把互联网上散落的图片按 WordNet 的概念体系重新整理了一遍。完整索引里有 1419 万张图片、21841 个 synset,后来引爆深度学习的 ILSVRC 只用了其中 1000 类。那一代计算机视觉的题目很简单,给机器一张照片,让它说出里面有什么、属于哪一类、在画面的什么位置。 十七年过去,这道题早就不算问题。前面那间厨房里的杯子,今天的模型不但认得出来,还能凭空生成 100 只从来没有存在过的杯子。 难的变成了这只杯子在屋里的什么位置,绕到桌子背后再去观测它还是不是同一只,有人把它推走之后,下一次看过去它应该在哪里、是什么状态。认得出一样东西,和知道这样东西在世界里怎么待着,是两件事。 从 ImageNet 到 Atlas,中间有一条出人意料的连续线:人到底要往机器里塞多少关于世界的信息,它才长成自己的世界。 1940 年,阿根廷作家阿道夫·比奥伊·卡萨雷斯写过一本小说,《莫雷尔的发明》。 主角逃到一座荒岛,遇见一群奇怪的人。这些人每天散步、聊天、跳舞,一切看起来都正常,但没有人能看见他。更古怪的是,同一段谈话过几天会原样再发生一次,连停顿的位置都不差。 后来他才知道,岛上的科学家莫雷尔造了一台机器,把一群人在岛上的一周完整录了下来。声音录下来了,形象录下来了,莫雷尔相信连触觉、气味和温度也一并保住。机器由潮汐驱动,那一周在岛上循环播放。 莫雷尔相信,当所有感官同步时,灵魂便出现了。 八十多年前写下的这台机器,已经很像一个夸张到荒唐的 multimodal model。它保存了现实的全部感官证据,做出一份任何观察者都分不出真假的复制品。 主角爱上了投影里的女人 Faustine。他每天站到她面前跟她说话,想让她看见自己。她一次也没有回应,因为她所在的那一周早就录完了。机器能把那一周重放一万遍,却放不出一件当时没有发生过的事。 按 World Labs 自己那张表,莫雷尔造的是一台完美的渲染器。 今天的模型已经能把一个地方还原到挑不出毛病。难的是那件从来没有被谁拍下来过的事,有人走进去,伸手,把桌上那只杯子碰倒。 莫雷尔的岛上什么都有,只差这一下。 -****END- 原文链接

李飞飞的World Labs新发布的世界模型,是真的世界模型吗?

原文标题:《李飞飞的World Labs新发布的世界模型,是真的世界模型吗?》
原文作者:动察Beating
9 月 1 日,李飞飞的 World Labs 发布了 Atlas。
发布页上有一组画面确实好看。几台手机架在三脚架和夹具上,从三到五个角度对着同一个现场,然后时间停住,镜头开始移动,绕过人物,走到真实摄影机从未站过的位置。
子弹时间,这个手法这两年不算稀奇。差别在 Atlas 同时交出来的另外三样东西。
第一样是 depth。给画面里每一个像素标上它离镜头有多远,一张普通照片就变成一张按远近上色的地形图。
第二样是 point cloud。在空间里撒下几百万个点,每个点记住自己的三维坐标,凑到一起就是这间屋子的形状。
第三样是 3D Gaussian Splat。它不用三角面片搭模型,而是拿大量带颜色、带透明度、有朝向也有胖瘦的小光斑堆出整个场景,换任何一个角度都能重新渲染一遍。
这三样东西的共同点是可测量。杯子的直径、桌子到墙的距离,都能从里面直接读出数值。生成的结果不再只是给人看的画面,可以送进游戏引擎、设计软件,或者一段机械臂的控制代码。
World Labs 干脆把 Atlas 叫做世界模拟器。
模拟器这个词他们用得不随便。三个月前,他们自己写过一篇文章,专门规定什么样的系统才配叫这个名字。
看得见和碰得到
那篇文章发在今年 6 月,讨论的是什么才算世界模型,结论是把市面上的系统分成三级,渲染器、模拟器、规划器。
这种分类方法的源头很老。1943 年,英国心理学家 Kenneth Craik 说过一个观点,人能提前想明白一件事会怎么发展,是因为脑子里有一个缩小版的现实世界。这个说法后来被控制论、神经网络和强化学习一路接过去,变成三个词,state、observation、action。
用一间厨房来说。
杯子摆在桌上的哪个位置、离桌沿几厘米、桌子离墙多远、门开着还是关着,这些加起来是这间厨房此刻的 state。
人站在门口,只看得到状态里的一部分。被冰箱挡住的那块地面他看不见,杯子里还剩多少水他也不知道。他眼睛收进来的这一份信息叫 observation。
他走过去把杯子推开,这是 action。
state、observation、action,一个系统能管几样,就决定了它属于哪一级。
渲染器管画面。人往前走一步,它算出这一步该看见什么,画得像、和上一帧接得上,事情就办完了。杯子有多高、桌子离墙多远,它不需要知道,因为它交出来的只是一张图。
模拟器管状态。杯子的位置、桌子的尺寸、门开到多大会撞上墙,这些数字它得一直存着,随时能被调出来。也正因为存着这些数字,别的程序才接得进来,一只机械臂才能在这间厨房里伸手。
规划器管动作。它不光知道杯子在桌上、碰倒了会怎么样,还要判断现在该不该伸手、先拿哪一个、从哪个角度下手最稳。
按这套标准,Google DeepMind 的 Genie 3 被归进最低一级,只是个渲染器。一起归进去的,还有 World Labs 自己在 2025 年 10 月发布的 RTFM。
在这之前,「世界模型」这个词几乎什么都能装。输入一句话,生成一段能走进去的画面,是世界模型。把官网口号改成用 AI 模拟世界,也是世界模型。这篇文章第一次给它划了条线,画面归画面,世界归世界。
过去一年那些演示大多停在第一级。比起纯文字生成视频,它们确实前进了一大截,按一下方向键,画面会跟着变。
但是渲染器交出来的东西,人看着够用,机器用不了。
Atlas 要够的是模拟器那一级。按他们自己的定义,模拟器得维护这个世界的全部状态,物理也算在里面。
目前公布的测试集中在相机条件生成和三维重建,复杂材料、流体、布料这类多物理相互作用还没解决,整个行业都没有解决。
Atlas 的技术上的名字是 multimodal autoregressive diffusion transformer,四个词拆开来都不新鲜。
transformer 和 autoregressive 是大语言模型那一套,看着已经生成的内容一个接一个往下续。diffusion 是图像和视频生成那一套,画面由它画出来。multimodal 指的是它同时接收好几种输入。
新的地方在 multimodal 具体包括了文字、图片、相机位姿和深度图四类。
相机位姿说的是拍这张照片的时候,相机站在三维空间的哪个位置、朝着哪个方向,六个数字就写得清楚。配上深度图,每一张照片都不再是孤零零的一张图,而是一张标好了拍摄位置的图。
所有照片标在同一套坐标上,这套坐标就是 Atlas 的 shared spatial context,共享空间上下文。
举例来说,站在客厅门口拍一张沙发,再走到窗边拍一张。两张照片里的沙发大小不同、角度不同,还有一半被茶几挡着。普通模型看到的是两张不一样的图。人看到的是同一个沙发,因为人知道自己走了几步、转了多少度。
Atlas 拿到的,正是「走了几步、转了多少度」这份数据。
这份数据还有另一个用处,World Labs 上一代产品 RTFM 已经试过。它的目标是在单张 H100 上实时生成一个能一直逛下去的世界。往前走它往前生成,转弯视角跟着变。麻烦出在记忆上。
假设有人在这栋虚拟房子里逛了半小时。如果把这半小时生成的画面全部塞进上下文,模型确实什么都不会忘,但上下文越堆越长,算力会先撑不住。如果只留最近几十帧,算力省下来了,可从卧室绕一圈走回厨房,模型已经不记得二十分钟前桌子摆在哪儿,同一间厨房会被生成成两个样子。
World Labs 给 RTFM 的做法叫 posed frames as spatial memory。每一帧除了画面,还存下拍它的时候相机在空间里的位置和朝向。模型走到某个位置,系统不必把全部记忆翻一遍,只按位置就近取回几帧,拼出这一次生成需要的上下文。
位置在这里当的是索引。想知道厨房长什么样,把在厨房附近拍下的帧找出来就够了,它们是什么时候拍的不重要。
人用记忆其实也是这个路子。让你回想上周三下午做了什么,多半想不起来,但走进那间会议室,谁坐在对面、白板上写了什么,很快就能对上。按时间检索要从头数一遍,按地点检索一步到位。
重建与生成
Atlas 的发布页上还有一个实验。先只给一张花园的照片,让模型生成从高空往下看的画面。照片里只有花园,周围什么样没拍到,于是花园的部分照实还原,旁边的建筑靠它在训练数据里见过的常识补出来。
第二张照片拍到了旁边的小屋,这一块不用补了。第三张屋子露出来了,要补的地方又少一块。
World Labs 的总结是,the more it sees, the less it imagines。按他们给出的数据,两三张照片通常够把场景还原到能用,一次最多可以放进一百多张。
这个实验把两件本来分得很开的事做进了同一个模型。
想在电脑里得到一个三维场景,过去有两条路。一条叫重建,拿现场拍回来的照片,把一个真实存在的地方按原样还原出来,哪个角落没拍到就空着,宁可留一个洞。另一条叫生成,模型凭训练时见过的房子和草坪,造一个从来不存在的地方。
Atlas 两头都占。没拍到的地方先按常识补上,等新照片补进来,再把编的那部分换成真的。照片少就多编,照片多就少编。
我一直很喜欢一个叫 Funes World 的项目。他们带着相机满世界拍建筑,庞贝、特洛伊、科隆大教堂、天坛祈年殿,也拍那些不出名的房子,就是某天改造完就再没人记得原来长什么样的那种。他们会绕着建筑走,从各个方向拍,照片之间留够重叠,再用摄影测量、NeRF、Gaussian Splatting 拼回三维模型。公开档案现在有 2100 多个模型,覆盖 19 个以上的国家。
他们说自己在给真实世界做备份,做一个物理世界的 GitHub。
Funes 走的是纯粹重建那条路。他们抢在推土机前面按快门,要的是那栋房子确实长成那样。哪怕缺一块,也不能让模型替它补。
Atlas 面对的是另一种用户。一间厨房里的墙,只要位置和尺寸对得上,机械臂伸手撞上去的结果就一样,墙上的花纹是拍来的还是编的机械臂不关心。
于是问题落到了另一个地方。一个有一部分靠编的世界,能不能拿来训练一台要在现实里干活的机器。至于编出来的房子像不像真的,这里可以先不管。
7 月,World Labs 买下了机器人公司 SceniX。收购之后公布的第一批结果,回答的正是这个问题。
几组机器人完全在模拟器里训练,没有用一条真实世界的数据,然后直接装到真实机械臂上,做装箱、绕线、搬试管。其中几台连续自主运行了 1 小时,中途没有人干预。
更值得看的是他们怎么判断这个模拟器算不算合格。
有一条听上去很自然的标准,模拟器里成功率八成,真机上也该是八成。这条他们没用。模拟器里的墙和真墙的摩擦不一样,零件的重量分布也对不上,成功率必然差一截。
他们改成这样做。先在模拟器里把几种方案各跑 2000 次,按表现排出高下,再把这几种方案搬到真机上各跑 100 次,然后只对两件事。模拟器里 A 方案比 B 方案好,真机上是不是也这样;模拟器说某个动作在哪一步最容易失手,真机是不是也在那一步失手。
在公布的任务里,这两项都对上了。至于两边的成功率差多少反倒不用管,按 World Labs 自己的说法,有用的模拟器不需要和现实的成功率一致,只需要支持和现实一样的决策。
这个方式一百多年前就有人用过。
1901 年秋天,莱特兄弟照着 Lilienthal 发表的机翼数据造出滑翔机,实际升力只有预测值的三分之一。前人的数据有问题,可要重新测就得一次次把人送上天。于是他们用木头做了一个六英尺长的风洞,一个下午能试好几副机翼,一个冬天试了 100 多种。
风洞里那点风和北卡罗来纳的海风不是一回事,但哪副机翼更好是能比较出来的。
世界模型不必复制整个宇宙。它只需要留住和决策有关的那部分结构。
失败的经验
到这一步,World Labs 的生意轮廓就出来了。他们 2025 年推出的产品 Marble,已经能从文字、图片和视频生成可探索的三维世界,World API 开放之后开发者可以直接调用,Atlas 是这些产品底下的那层模型。
今年 2 月那轮 10 亿美元融资,出钱的公司分布得很杂。NVIDIA 要 Physical AI,Autodesk 要建筑、工业设计和数字孪生,此外还有 AMD、Fidelity 和 Sea。同一个三维世界,导演在意机位和光线,建筑师在意结构和尺度,机器人要的是一个能实验的环境。
一个世界只要足够通用,就能横跨今天彼此分开的好几套软件产业。
至于把那些说自己在做世界模型的公司塞进同一张 benchmark 表已经没什么意义了。
Genie 3 在生成画面,Meta 的 V-JEPA 2 干脆不画画面,直接从视频里学规律,NVIDIA 的 Cosmos 把视觉推理、世界生成和动作预测装进同一个模型,Runway 从视频生成转身去做模拟。用的是同一个词,解的不是同一道题。
分歧只有一条。一派相信把世界预测得足够好,三维结构自己会从数据里长出来,视频里本来就藏着这些规律。另一派把相机位置、几何和物理约束直接塞进模型,让世界从第一天就带着结构。Atlas 把相机位姿和深度做成原生输入,就是这么做的。
这条路上有一件事绕不开,训练数据从哪来。
大语言模型拿到过一份馈赠。几十年里,人类写网页、写代码、在论坛上吵架,无意之间攒出一个巨大的语料库。
三维世界没有这份东西。空间关系很少被系统地记录下来,一块地板的摩擦系数不会自己写进网页。更难的是交互。机器人把线插歪了,现实里那根线是真的歪了,下一次尝试之前,得有人走过去把它扶正。文本可以无限复制,现实里的经验每一次都要重新发生一遍。
所以过去机器人最缺的其实是失败。在现实里犯错太贵,模拟器一旦好用,机器人就可以在里面跑几千次几万次,快速积攒经验。
李飞飞和这个问题打了快 20 年交道。
2009 年,她和团队做了 ImageNet,把互联网上散落的图片按 WordNet 的概念体系重新整理了一遍。完整索引里有 1419 万张图片、21841 个 synset,后来引爆深度学习的 ILSVRC 只用了其中 1000 类。那一代计算机视觉的题目很简单,给机器一张照片,让它说出里面有什么、属于哪一类、在画面的什么位置。
十七年过去,这道题早就不算问题。前面那间厨房里的杯子,今天的模型不但认得出来,还能凭空生成 100 只从来没有存在过的杯子。
难的变成了这只杯子在屋里的什么位置,绕到桌子背后再去观测它还是不是同一只,有人把它推走之后,下一次看过去它应该在哪里、是什么状态。认得出一样东西,和知道这样东西在世界里怎么待着,是两件事。
从 ImageNet 到 Atlas,中间有一条出人意料的连续线:人到底要往机器里塞多少关于世界的信息,它才长成自己的世界。
1940 年,阿根廷作家阿道夫·比奥伊·卡萨雷斯写过一本小说,《莫雷尔的发明》。
主角逃到一座荒岛,遇见一群奇怪的人。这些人每天散步、聊天、跳舞,一切看起来都正常,但没有人能看见他。更古怪的是,同一段谈话过几天会原样再发生一次,连停顿的位置都不差。
后来他才知道,岛上的科学家莫雷尔造了一台机器,把一群人在岛上的一周完整录了下来。声音录下来了,形象录下来了,莫雷尔相信连触觉、气味和温度也一并保住。机器由潮汐驱动,那一周在岛上循环播放。
莫雷尔相信,当所有感官同步时,灵魂便出现了。
八十多年前写下的这台机器,已经很像一个夸张到荒唐的 multimodal model。它保存了现实的全部感官证据,做出一份任何观察者都分不出真假的复制品。
主角爱上了投影里的女人 Faustine。他每天站到她面前跟她说话,想让她看见自己。她一次也没有回应,因为她所在的那一周早就录完了。机器能把那一周重放一万遍,却放不出一件当时没有发生过的事。
按 World Labs 自己那张表,莫雷尔造的是一台完美的渲染器。
今天的模型已经能把一个地方还原到挑不出毛病。难的是那件从来没有被谁拍下来过的事,有人走进去,伸手,把桌上那只杯子碰倒。
莫雷尔的岛上什么都有,只差这一下。
-****END-
原文链接
Статья
库克卸任,苹果留下了什么原文标题:《库克卸任,苹果留下了什么》 原文作者:动察Beating 苹果这家公司,从不擅长告别。 上一次换帅,从乔布斯辞职到去世,只有六个星期。没来得及办一场派对。 这一次它办了。约两百人聚在苹果总部 Apple Park,送别一个在这里干了二十八年的人。 乐队 OneRepublic 现场演出,他的继任者约翰·特努斯上台致辞,翻来覆去一个词,延续。 据在场者向媒体描述,他的伴侣 Mike 第一次公开站在他身边。这段关系藏了很多年,到离职这天,才走进镜头。有报道写,轮到他上台,这个在财报会上从不失态的人,红了眼眶。 他叫蒂姆·库克。今天是他在苹果担任 CEO 的最后一天。 罗伯茨代尔 1960 年,库克出生在阿拉巴马州的港口城市莫比尔,墨西哥湾北岸,红土地,他家几代人靠造船吃饭。他的父亲就在造船厂做工,母亲在药店上班。家里三个儿子,他排中间。父母对他没有别的指望,就是把书读好。 他确实把书读得挺好。老师回忆里的库克,安静,守规矩,作业永远交得最早。 大学他去了奥本,学工业工程。这门学问研究的是流水线、库存、生产节奏,怎么让一批零件以最小的浪费流动起来,准时变成一台成品。 这门学问他学了一辈子,也用了一辈子。 毕业后的十二年在 IBM,他从基层做到北美履约总监,管的还是那件事,让电脑准时出现在该出现的地方。同事回忆,那些年他几乎不休假,别人过节他加班。 再往后是康柏,当时全世界最大的个人电脑公司,他做到副总裁,管物料。他的职业生涯是一条看得见的上升曲线,下一步就该是哪一家公司 CEO 的位子。 阿拉巴马的口音他一直没改。后来站在全世界面前开发布会,一开口,还是那个南方小镇的腔调。 一个造船厂工人的儿子,把「让东西流动」这门手艺练到了行业顶尖。 他跟母校的关系一直没断。后来名气大了,进了奥本的校董会,回去演讲,讲的都不是生意,是「把事情做对」。 六十年代的阿拉巴马不是一块温和的土地。种族隔离刚刚废除,但是敌意还没散。库克说他小时候见过三 K 党在夜里烧十字架,那是他最早明白「有些事不对」的时刻。 南方小镇能给一个孩子的东西不多,但给得很早。 1998 年,他接到一个电话。 灯光外的人 电话是乔布斯打来的。 1998 年的苹果,还没有今天的神话外壳。前一年它亏掉 10 亿多美元,市值不足 30 亿。媒体甚至都不再去聊它是否会破产了,他们讨论的是它什么时候会破产。 从如日中天的康柏跳槽去这样一家公司,身边所有人认为库克疯了。 他在康柏只待了半年。他自己后来回忆,跟乔布斯面谈,不到五分钟,他就知道自己要去这家公司。这个决定有些冲动,没有经过什么缜密的思考。 十二年后他回奥本大学演讲说,人这辈子最重要的决定,很多时候都是不经过多思考的。 那一年他 37 岁,把一条看得见的上升曲线掐断,跳上一艘正在下沉的船。 他进苹果后,关掉了苹果自己的工厂,把生产交给外面代工;仓库一间一间关掉,库存从堆几个月,压到只剩几天。 他说过一句话: 「库存即邪恶。」 后来,全世界知道了那些代工厂的名字,富士康、和硕,郑州的「iPhone 城」。几十万工人在流水线上组装,零件从几百家供应商飞来,成品在几周内铺到全球的货架。 这台机器,总设计师是库克。乔布斯负责想象下一个产品,库克负责让上一个产品赚到足够多的钱,去养下一个想象。 那几年硅谷的共识是,苹果的成功无法复制,因为乔布斯无法复制。 乔布斯站在舞台的灯光下下,一年发布几款产品,全世界仰着头看。库克站在灯光外,让那些产品准时出现在全世界。 报道写苹果,写乔布斯的天才,写乔纳森·艾维的设计。轮到库克,形容词只剩四个字,运营专家。他只会算账,用硅谷当时的话说,他是个拧螺丝的。 两个人的脾气也是两个极端。乔布斯发火整层楼都听得见,库克却很少这样爆发。员工回忆,开会时他发现问题,不说话,就那么看着你,沉默,一直沉默。 他几乎不接受采访,不上封面,不讲自己的故事。乔布斯三次病休,三次把公司交给他代理。2009 年那一次,乔布斯休了半年病假,回来时公司市值比走之前涨了一大截。 每次乔布斯回来,他都把位子还回去,重新站回灯光外。 做你认为对的事 2011 年 8 月 24 日,乔布斯辞职,库克接任 CEO。六个星期后,乔布斯去世。 临终前,乔布斯给他留下一句话,这句话库克后来在无数次采访里转述过: 「不要问我会怎么做,做你认为对的事。」 他上任的第一年,几乎所有人都在等苹果犯第一个大错,等媒体写完「后乔布斯时代」的悼词,等公司像所有失去创始人的公司一样,慢慢熄火。 他上任后的十五年里,苹果每出一款新品,头条都是同一句「乔布斯不会这么做」。 iPhone 把屏幕做大,乔布斯不会;发布手表,乔布斯不会;给股东分红、回购股票,乔布斯更不会。他活在一场漫长的比照里。 他做的几件事,都不像乔布斯。 苹果地图出了大问题,他公开道歉,甚至建议用户在苹果修好之前,先用别家的地图。 供应商工厂里查出童工和超时加班,他把审计报告年年挂到官网上。 2016 年,FBI 要求苹果解锁一起枪击案凶手的 iPhone,他宁可把官司打到全世界面前也不开这个口子。他说,这个先例一开,每个人的手机都将不再安全。那场官司最后不了了之,政府自己花钱找了第三方,把手机解开了。 他把自己的日子压缩到只剩工作。几十年如此。 他任内去了二十多趟中国。去郑州看工厂、去北京看门店、去杭州见开发者,这条横跨太平洋的供应链,是他一年一年挖出来的一条运河。 一年几亿部 iPhone 经由这条运河流向全世界。在硅谷谈论未来的年代里,他一半的时间花在工厂和货架上。 「做你认为对的事」,他用在道歉上,用在官司上,也用在生意上。但最需要勇气的一次,跟这些都没关系。 库克一向把隐私看得极重,不接受采访,不写自传,伴侣的名字从不公开。 但 2014 年 10 月,他破了一次例。他回到老家阿拉巴马发表演讲,批评家乡对 LGBT 群体的歧视。10 月 30 日,他在彭博商业周刊撰文,承认自己是同性恋。财富 500 强的 CEO 里,他是第一个。 他说,如果苹果 CEO 是同性恋这件事,能让一个正在为身份挣扎的孩子少一点孤独,能让一个被欺负的人得到一点安慰,那么拿隐私去换,值得。 信里有一句话: 「我为自己是同性恋而自豪。我认为这是上帝给我的最好的礼物之一。」 那时候阿拉巴马还没有承认同性婚姻,美国多数州的法律仍允许雇主仅因性取向解雇员工。 第二年,美国全境同性婚姻合法化。 牙刷头 质疑声从来没有停过。但财报上的数字,讲了另一个故事。 2014 年秋天的发布会上,库克说出了「One more thing」。乔布斯走后,这句话已经三年没人用过。话音落下,大屏幕亮起,一块手表出现。那是库克时代的第一款全新产品,虽然揭晓时用的还是乔布斯的招牌句式。 第二年手表上市,媒体质疑谁会需要这个东西。那时没人想到,它后来不声不响地长成了全世界最大的手表生意,按只数算,超过整个瑞士钟表业。 2016 年,AirPods 上市,全网嘲笑它像一对被剪断线的牙刷头。后来据外界估算,这对「牙刷头」一年销量上亿。 到 2017 年,iPhone 上市十年,累计卖出约 14 亿部。但销量的增长在 2015 财年到了顶,那一年卖出 2.31 亿部,此后再没超过,苹果也不再公布销量数字。两年后的 iPhone X 把起售价抬高到 999 美元,既然卖不出更多部,就把每一部卖得更贵。 应用商店、iCloud、音乐、支付,这些长在 iPhone 生态里的生意,也从零做到了年收入近千亿美元。 当然也有没做成的。2014 年启动的造车项目「泰坦」,秘密研发十年,2024 年 2 月被库克内部叫停,两千名工程师转去做 AI。同一年上市的 Vision Pro,售价 3499 美元,技术规格拉满,却叫好不叫座,全年只卖出约四十万台。这十五年,也不全是赢。 华尔街那边,有巴菲特从 2016 年开始买苹果,一路买成伯克希尔最大的重仓。这个一辈子说自己不懂科技、不碰科技股的老头,把最多的钱押在了这个一直被诟病「没有创新」的苹果上。 2017 年,苹果搬进新总部 Apple Park,那栋著名的环形大楼。图纸是乔布斯生前画的,把它从图纸变成现实的是库克。九年后的告别派对,也办在这栋楼里。 2020 年,Mac 跟合作了十五年的英特尔分手,换上苹果自研的 M 系列芯片。当时大家更多的是从经济角度来解读这个决策,成本更低,续航更长。没有人觉得它跟未来有太大关系。 苹果的市值这些年一步一个台阶,2018 年破万亿,2020 年破两万亿,2022 年破三万亿。每一个数字,都是人类商业史上的第一次。 他接任那天,苹果市值 3500 亿美元。他离开这天,4.5 万亿。十五年里,苹果市值平均每小时上涨 3200 万美元。 他还在任期内累计拿出 8770 亿美元回购自家股票,全球公司之最。乔布斯一辈子不肯分红回购,觉得钱应该攥在手里做产品。库克不这么想。他把利润还给股东,用回购推高股价。 「没有创新」的质疑,和这条市值一路向上的曲线,并排走了十五年。 补考费 2010 年,苹果买下一款叫 Siri 的语音助手,那是乔布斯亲自拍板的几笔收购之一。2011 年 10 月 4 日,乔布斯去世前一天,iPhone 4S 发布,主角就是那个会说话的 Siri。 语音助手第一次走进大众的口袋,那时候 OpenAI 还不存在,离 ChatGPT 出来还有十一年。但 Siri 从发布起就带着争议,因为它那时的功能还比较有限,并不能很好地满足用户的需求。 这个赛道,是苹果趟出来的。可十五年后库克离开时,外界对苹果最大的质疑,还是 Siri。 ChatGPT 出来以后,Siri 迅速从先驱变成笑柄。发布这么多年,用户最多的使用场景还是定闹钟,干不了其他的正事。2024 年,苹果推出 Apple Intelligence 应战,可发布会上演示的功能一次次延期,拍好的广告片悄悄下架,AI 团队几番换血,新版 Siri 的日期一推再推。 2026 年,市场的焦虑集中爆发了一次,苹果市值短时间蒸发 2300 亿美元。有媒体把这个数字称为「股民替苹果 AI 交的补考费」。 过去十五年,人们拿库克跟乔布斯比;现在,人们拿他跟奥特曼比,跟英伟达的黄仁勋比。 但库克这辈子都在被人说慢。手表上市被说慢,耳机被说慢,自研芯片也被说慢,可这些产品后来都成了。他的回答从来都是同一句,苹果不需要第一个做,要做对了再放出来。 这一次在 AI 上,他的选择也和别人不一样。别家把数据传到云端,用最大的模型换最好的效果;苹果坚持把模型塞进用户的手机,在本地运行,数据不出设备。外界说这是能力不够,他说这是立场如此。隐私是他守了十几年的底线,他不打算为赶这趟车,把底线丢了。 只是这一次能不能做成,没有人敢替他打包票。 工棚 他离职这一周,答案从一个最不起眼的角落冒了出来。 据媒体报道,OpenAI 购入了数万台 Mac,主力是最便宜的 Mac mini,用于人工智能的强化学习训练。 训练新一代的智能体,需要让 AI 在海量真实的电脑环境里练习,像人一样使用电脑。所谓强化学习,就是让 AI 在亿万次试错里自己学会做事,这种练习需要的是几万台便宜、省电、内存够大的整机。 Mac mini 是苹果产品线上最不起眼的一个。一个方盒子,不带屏幕,不带键盘,发布会上一笔带过,摆在苹果店的角落里。二十年来,没有人指望它做什么大事。 现在,它成批成批地走进 AI 的机房。 整个市场上,能同时做到这几点的只有苹果。芯片自己设计,系统自己写,整机自己造,供应链和库存都握在手里。别家只能给你其中一样,只有苹果,从芯片到货架,整条供应链都是自己的。这是库克十五年里一环一环扣上的,当年每扣一环,都被嘲笑成「只会拧螺丝」。 这些能力,没有一项是为 AI 准备的。它们是当年为了摆脱英特尔、为了利润率、为了续航做的那些「无聊」决定,十五年后,反而成了别人训练人工智能的地基。 库克做了十五年「没有创新」的 CEO。到头来,最有创新精神的那个行业,训练自己的下一代时,站在他打的地基上。 这场 AI 淘金热里,人人都看见卖铲子的英伟达赚了最大的钱。挖到后来人们才发现,金矿需要的不再只是铲子,还有成千上万间能住人的工棚。 延续 卸任当天,库克给苹果全体员工写了最后一封信。 信不长,几百个字。第一句说,今天是我在苹果做 CEO 的最后一天。他说这一天他早就知道会来,可真把这句话写下来,还是不敢相信。苹果这次留了七个月做交接,是它历史上准备得最充分的一次告别。 他略过了十五年的市值增长,也没有解释 Siri 和 AI。 信里写,自己最骄傲的是「年报永远无法记录的东西」。 他说这家公司证明了文化胜过一切。他说这批人相信自己做的东西有分量,也相信自己有责任让这个世界变得更好一点。他借了乔布斯那句在宇宙上留下一个凹痕,说这事真做成了,靠的是这些人的信念。写到这他说,我们何其幸运,我何其幸运。 他说自己并没有离开苹果,只是离开一个爱了很久的位子。他说他会想念这份工作,想念到什么程度他自己都还想象不出来,可他心里是平静的。 信的后半段,库克把话留给了特努斯。他说,很少有人像他那样懂得如何造出改变世界的产品,把掌舵权交给他,自己感到非常安心。 接替库克的约翰·特努斯,在苹果干了二十五年。 他 2001 年进公司,那年 iPod 刚刚问世。他从硬件工程师做起,一路负责过 iMac、MacBook、iPad 的硬件。那对「牙刷头」AirPods,就是他手里推出来的核心产品。2021 年,他升任硬件工程高级副总裁。 媒体说,苹果从「运营者的时代」进入「硬件狂人的时代」。告别派对上,他自己只强调了一个词,延续。 这也是一个站在灯光外二十五年的人。发布会上他讲芯片的封装、讲钛金属的边框,语速和库克一样。 库克将以董事长的身份再留一阵子,扶新任一程。 石黑一雄写过一本小说,叫《长日将尽》。一个英国老管家史蒂文斯,伺候一位勋爵几十年,永远站在主人身后,站在门背后,站在所有灯光的阴影里,做着勋爵交代的事。 书的最后,他独自坐在海边的码头上,看傍晚的灯一盏一盏亮起来。一个陌生人跟他说,傍晚是一天中最美好的时光。 库克的故事,是这个故事的另一半。他站在乔布斯身后,让产品一年一年准时出现在全世界的货架上。人们记住了那些产品,就像记住了老宅里亮着的灯;却没人记得,每天把灯擦亮的是谁。 派对散场,环形大楼的灯一层层暗下去。而在千里之外的机房里,数万台 Mac mini 正被一台台插上机架,通电,开机,指示灯一颗接一颗亮起来。 他一辈子站在灯光外。这一次,这些灯是他点亮的。 傍晚是一天中最美好的时光。 原文链接

库克卸任,苹果留下了什么

原文标题:《库克卸任,苹果留下了什么》
原文作者:动察Beating
苹果这家公司,从不擅长告别。
上一次换帅,从乔布斯辞职到去世,只有六个星期。没来得及办一场派对。
这一次它办了。约两百人聚在苹果总部 Apple Park,送别一个在这里干了二十八年的人。
乐队 OneRepublic 现场演出,他的继任者约翰·特努斯上台致辞,翻来覆去一个词,延续。
据在场者向媒体描述,他的伴侣 Mike 第一次公开站在他身边。这段关系藏了很多年,到离职这天,才走进镜头。有报道写,轮到他上台,这个在财报会上从不失态的人,红了眼眶。
他叫蒂姆·库克。今天是他在苹果担任 CEO 的最后一天。
罗伯茨代尔
1960 年,库克出生在阿拉巴马州的港口城市莫比尔,墨西哥湾北岸,红土地,他家几代人靠造船吃饭。他的父亲就在造船厂做工,母亲在药店上班。家里三个儿子,他排中间。父母对他没有别的指望,就是把书读好。
他确实把书读得挺好。老师回忆里的库克,安静,守规矩,作业永远交得最早。
大学他去了奥本,学工业工程。这门学问研究的是流水线、库存、生产节奏,怎么让一批零件以最小的浪费流动起来,准时变成一台成品。
这门学问他学了一辈子,也用了一辈子。
毕业后的十二年在 IBM,他从基层做到北美履约总监,管的还是那件事,让电脑准时出现在该出现的地方。同事回忆,那些年他几乎不休假,别人过节他加班。
再往后是康柏,当时全世界最大的个人电脑公司,他做到副总裁,管物料。他的职业生涯是一条看得见的上升曲线,下一步就该是哪一家公司 CEO 的位子。
阿拉巴马的口音他一直没改。后来站在全世界面前开发布会,一开口,还是那个南方小镇的腔调。
一个造船厂工人的儿子,把「让东西流动」这门手艺练到了行业顶尖。
他跟母校的关系一直没断。后来名气大了,进了奥本的校董会,回去演讲,讲的都不是生意,是「把事情做对」。
六十年代的阿拉巴马不是一块温和的土地。种族隔离刚刚废除,但是敌意还没散。库克说他小时候见过三 K 党在夜里烧十字架,那是他最早明白「有些事不对」的时刻。
南方小镇能给一个孩子的东西不多,但给得很早。
1998 年,他接到一个电话。
灯光外的人
电话是乔布斯打来的。
1998 年的苹果,还没有今天的神话外壳。前一年它亏掉 10 亿多美元,市值不足 30 亿。媒体甚至都不再去聊它是否会破产了,他们讨论的是它什么时候会破产。
从如日中天的康柏跳槽去这样一家公司,身边所有人认为库克疯了。
他在康柏只待了半年。他自己后来回忆,跟乔布斯面谈,不到五分钟,他就知道自己要去这家公司。这个决定有些冲动,没有经过什么缜密的思考。
十二年后他回奥本大学演讲说,人这辈子最重要的决定,很多时候都是不经过多思考的。
那一年他 37 岁,把一条看得见的上升曲线掐断,跳上一艘正在下沉的船。
他进苹果后,关掉了苹果自己的工厂,把生产交给外面代工;仓库一间一间关掉,库存从堆几个月,压到只剩几天。
他说过一句话:
「库存即邪恶。」
后来,全世界知道了那些代工厂的名字,富士康、和硕,郑州的「iPhone 城」。几十万工人在流水线上组装,零件从几百家供应商飞来,成品在几周内铺到全球的货架。
这台机器,总设计师是库克。乔布斯负责想象下一个产品,库克负责让上一个产品赚到足够多的钱,去养下一个想象。
那几年硅谷的共识是,苹果的成功无法复制,因为乔布斯无法复制。
乔布斯站在舞台的灯光下下,一年发布几款产品,全世界仰着头看。库克站在灯光外,让那些产品准时出现在全世界。
报道写苹果,写乔布斯的天才,写乔纳森·艾维的设计。轮到库克,形容词只剩四个字,运营专家。他只会算账,用硅谷当时的话说,他是个拧螺丝的。
两个人的脾气也是两个极端。乔布斯发火整层楼都听得见,库克却很少这样爆发。员工回忆,开会时他发现问题,不说话,就那么看着你,沉默,一直沉默。
他几乎不接受采访,不上封面,不讲自己的故事。乔布斯三次病休,三次把公司交给他代理。2009 年那一次,乔布斯休了半年病假,回来时公司市值比走之前涨了一大截。
每次乔布斯回来,他都把位子还回去,重新站回灯光外。
做你认为对的事
2011 年 8 月 24 日,乔布斯辞职,库克接任 CEO。六个星期后,乔布斯去世。
临终前,乔布斯给他留下一句话,这句话库克后来在无数次采访里转述过:
「不要问我会怎么做,做你认为对的事。」
他上任的第一年,几乎所有人都在等苹果犯第一个大错,等媒体写完「后乔布斯时代」的悼词,等公司像所有失去创始人的公司一样,慢慢熄火。
他上任后的十五年里,苹果每出一款新品,头条都是同一句「乔布斯不会这么做」。
iPhone 把屏幕做大,乔布斯不会;发布手表,乔布斯不会;给股东分红、回购股票,乔布斯更不会。他活在一场漫长的比照里。
他做的几件事,都不像乔布斯。
苹果地图出了大问题,他公开道歉,甚至建议用户在苹果修好之前,先用别家的地图。
供应商工厂里查出童工和超时加班,他把审计报告年年挂到官网上。
2016 年,FBI 要求苹果解锁一起枪击案凶手的 iPhone,他宁可把官司打到全世界面前也不开这个口子。他说,这个先例一开,每个人的手机都将不再安全。那场官司最后不了了之,政府自己花钱找了第三方,把手机解开了。
他把自己的日子压缩到只剩工作。几十年如此。
他任内去了二十多趟中国。去郑州看工厂、去北京看门店、去杭州见开发者,这条横跨太平洋的供应链,是他一年一年挖出来的一条运河。
一年几亿部 iPhone 经由这条运河流向全世界。在硅谷谈论未来的年代里,他一半的时间花在工厂和货架上。
「做你认为对的事」,他用在道歉上,用在官司上,也用在生意上。但最需要勇气的一次,跟这些都没关系。
库克一向把隐私看得极重,不接受采访,不写自传,伴侣的名字从不公开。
但 2014 年 10 月,他破了一次例。他回到老家阿拉巴马发表演讲,批评家乡对 LGBT 群体的歧视。10 月 30 日,他在彭博商业周刊撰文,承认自己是同性恋。财富 500 强的 CEO 里,他是第一个。
他说,如果苹果 CEO 是同性恋这件事,能让一个正在为身份挣扎的孩子少一点孤独,能让一个被欺负的人得到一点安慰,那么拿隐私去换,值得。
信里有一句话:
「我为自己是同性恋而自豪。我认为这是上帝给我的最好的礼物之一。」
那时候阿拉巴马还没有承认同性婚姻,美国多数州的法律仍允许雇主仅因性取向解雇员工。
第二年,美国全境同性婚姻合法化。
牙刷头
质疑声从来没有停过。但财报上的数字,讲了另一个故事。
2014 年秋天的发布会上,库克说出了「One more thing」。乔布斯走后,这句话已经三年没人用过。话音落下,大屏幕亮起,一块手表出现。那是库克时代的第一款全新产品,虽然揭晓时用的还是乔布斯的招牌句式。
第二年手表上市,媒体质疑谁会需要这个东西。那时没人想到,它后来不声不响地长成了全世界最大的手表生意,按只数算,超过整个瑞士钟表业。
2016 年,AirPods 上市,全网嘲笑它像一对被剪断线的牙刷头。后来据外界估算,这对「牙刷头」一年销量上亿。
到 2017 年,iPhone 上市十年,累计卖出约 14 亿部。但销量的增长在 2015 财年到了顶,那一年卖出 2.31 亿部,此后再没超过,苹果也不再公布销量数字。两年后的 iPhone X 把起售价抬高到 999 美元,既然卖不出更多部,就把每一部卖得更贵。
应用商店、iCloud、音乐、支付,这些长在 iPhone 生态里的生意,也从零做到了年收入近千亿美元。
当然也有没做成的。2014 年启动的造车项目「泰坦」,秘密研发十年,2024 年 2 月被库克内部叫停,两千名工程师转去做 AI。同一年上市的 Vision Pro,售价 3499 美元,技术规格拉满,却叫好不叫座,全年只卖出约四十万台。这十五年,也不全是赢。
华尔街那边,有巴菲特从 2016 年开始买苹果,一路买成伯克希尔最大的重仓。这个一辈子说自己不懂科技、不碰科技股的老头,把最多的钱押在了这个一直被诟病「没有创新」的苹果上。
2017 年,苹果搬进新总部 Apple Park,那栋著名的环形大楼。图纸是乔布斯生前画的,把它从图纸变成现实的是库克。九年后的告别派对,也办在这栋楼里。
2020 年,Mac 跟合作了十五年的英特尔分手,换上苹果自研的 M 系列芯片。当时大家更多的是从经济角度来解读这个决策,成本更低,续航更长。没有人觉得它跟未来有太大关系。
苹果的市值这些年一步一个台阶,2018 年破万亿,2020 年破两万亿,2022 年破三万亿。每一个数字,都是人类商业史上的第一次。
他接任那天,苹果市值 3500 亿美元。他离开这天,4.5 万亿。十五年里,苹果市值平均每小时上涨 3200 万美元。
他还在任期内累计拿出 8770 亿美元回购自家股票,全球公司之最。乔布斯一辈子不肯分红回购,觉得钱应该攥在手里做产品。库克不这么想。他把利润还给股东,用回购推高股价。
「没有创新」的质疑,和这条市值一路向上的曲线,并排走了十五年。
补考费
2010 年,苹果买下一款叫 Siri 的语音助手,那是乔布斯亲自拍板的几笔收购之一。2011 年 10 月 4 日,乔布斯去世前一天,iPhone 4S 发布,主角就是那个会说话的 Siri。
语音助手第一次走进大众的口袋,那时候 OpenAI 还不存在,离 ChatGPT 出来还有十一年。但 Siri 从发布起就带着争议,因为它那时的功能还比较有限,并不能很好地满足用户的需求。
这个赛道,是苹果趟出来的。可十五年后库克离开时,外界对苹果最大的质疑,还是 Siri。
ChatGPT 出来以后,Siri 迅速从先驱变成笑柄。发布这么多年,用户最多的使用场景还是定闹钟,干不了其他的正事。2024 年,苹果推出 Apple Intelligence 应战,可发布会上演示的功能一次次延期,拍好的广告片悄悄下架,AI 团队几番换血,新版 Siri 的日期一推再推。
2026 年,市场的焦虑集中爆发了一次,苹果市值短时间蒸发 2300 亿美元。有媒体把这个数字称为「股民替苹果 AI 交的补考费」。
过去十五年,人们拿库克跟乔布斯比;现在,人们拿他跟奥特曼比,跟英伟达的黄仁勋比。
但库克这辈子都在被人说慢。手表上市被说慢,耳机被说慢,自研芯片也被说慢,可这些产品后来都成了。他的回答从来都是同一句,苹果不需要第一个做,要做对了再放出来。
这一次在 AI 上,他的选择也和别人不一样。别家把数据传到云端,用最大的模型换最好的效果;苹果坚持把模型塞进用户的手机,在本地运行,数据不出设备。外界说这是能力不够,他说这是立场如此。隐私是他守了十几年的底线,他不打算为赶这趟车,把底线丢了。
只是这一次能不能做成,没有人敢替他打包票。
工棚
他离职这一周,答案从一个最不起眼的角落冒了出来。
据媒体报道,OpenAI 购入了数万台 Mac,主力是最便宜的 Mac mini,用于人工智能的强化学习训练。
训练新一代的智能体,需要让 AI 在海量真实的电脑环境里练习,像人一样使用电脑。所谓强化学习,就是让 AI 在亿万次试错里自己学会做事,这种练习需要的是几万台便宜、省电、内存够大的整机。
Mac mini 是苹果产品线上最不起眼的一个。一个方盒子,不带屏幕,不带键盘,发布会上一笔带过,摆在苹果店的角落里。二十年来,没有人指望它做什么大事。
现在,它成批成批地走进 AI 的机房。
整个市场上,能同时做到这几点的只有苹果。芯片自己设计,系统自己写,整机自己造,供应链和库存都握在手里。别家只能给你其中一样,只有苹果,从芯片到货架,整条供应链都是自己的。这是库克十五年里一环一环扣上的,当年每扣一环,都被嘲笑成「只会拧螺丝」。
这些能力,没有一项是为 AI 准备的。它们是当年为了摆脱英特尔、为了利润率、为了续航做的那些「无聊」决定,十五年后,反而成了别人训练人工智能的地基。
库克做了十五年「没有创新」的 CEO。到头来,最有创新精神的那个行业,训练自己的下一代时,站在他打的地基上。
这场 AI 淘金热里,人人都看见卖铲子的英伟达赚了最大的钱。挖到后来人们才发现,金矿需要的不再只是铲子,还有成千上万间能住人的工棚。
延续
卸任当天,库克给苹果全体员工写了最后一封信。
信不长,几百个字。第一句说,今天是我在苹果做 CEO 的最后一天。他说这一天他早就知道会来,可真把这句话写下来,还是不敢相信。苹果这次留了七个月做交接,是它历史上准备得最充分的一次告别。
他略过了十五年的市值增长,也没有解释 Siri 和 AI。
信里写,自己最骄傲的是「年报永远无法记录的东西」。
他说这家公司证明了文化胜过一切。他说这批人相信自己做的东西有分量,也相信自己有责任让这个世界变得更好一点。他借了乔布斯那句在宇宙上留下一个凹痕,说这事真做成了,靠的是这些人的信念。写到这他说,我们何其幸运,我何其幸运。
他说自己并没有离开苹果,只是离开一个爱了很久的位子。他说他会想念这份工作,想念到什么程度他自己都还想象不出来,可他心里是平静的。
信的后半段,库克把话留给了特努斯。他说,很少有人像他那样懂得如何造出改变世界的产品,把掌舵权交给他,自己感到非常安心。
接替库克的约翰·特努斯,在苹果干了二十五年。
他 2001 年进公司,那年 iPod 刚刚问世。他从硬件工程师做起,一路负责过 iMac、MacBook、iPad 的硬件。那对「牙刷头」AirPods,就是他手里推出来的核心产品。2021 年,他升任硬件工程高级副总裁。
媒体说,苹果从「运营者的时代」进入「硬件狂人的时代」。告别派对上,他自己只强调了一个词,延续。
这也是一个站在灯光外二十五年的人。发布会上他讲芯片的封装、讲钛金属的边框,语速和库克一样。
库克将以董事长的身份再留一阵子,扶新任一程。
石黑一雄写过一本小说,叫《长日将尽》。一个英国老管家史蒂文斯,伺候一位勋爵几十年,永远站在主人身后,站在门背后,站在所有灯光的阴影里,做着勋爵交代的事。
书的最后,他独自坐在海边的码头上,看傍晚的灯一盏一盏亮起来。一个陌生人跟他说,傍晚是一天中最美好的时光。
库克的故事,是这个故事的另一半。他站在乔布斯身后,让产品一年一年准时出现在全世界的货架上。人们记住了那些产品,就像记住了老宅里亮着的灯;却没人记得,每天把灯擦亮的是谁。
派对散场,环形大楼的灯一层层暗下去。而在千里之外的机房里,数万台 Mac mini 正被一台台插上机架,通电,开机,指示灯一颗接一颗亮起来。
他一辈子站在灯光外。这一次,这些灯是他点亮的。
傍晚是一天中最美好的时光。
原文链接
Статья
MiniMax股价回弹92%之后:模型公司减去模型,还剩什么原文标题:《MiniMax股价回弹92%之后:模型公司减去模型,还剩什么》 原文作者:动察Beating 8 月 31 日,MiniMax 暴涨 16.18%。从 7 月低点算起,这只股票已经反弹 92%,市值重新回到 1249 亿中国香港元。 三个月前,市场刚给这家公司开过一场追悼会。股价较高点跌去八成以上,3000 亿中国香港元市值随之蒸发。 8 月 26 日,MiniMax 发布中报,收入同比增长 283%,B 端收入增长 703%;到 8 月,公司 ARR 已经超过 8 亿美元,7 月 token 消耗量是 1 月的 20 倍。 几天之后,把 MiniMax 重新推回讨论中心的,是一个它自己没有做出来的模型。 H3 Max。 无限频道 8 月 3 日,MiniMax 开源了 H3,一个 33 B 参数、能够同时处理文本、图像、视频和语音的全模态模型。fal 拿走它的开源权重,继续做后训练,再和自己的推理基础设施一起优化,最后做出了 H3 Max。 按照 fal 的说法,同样生成一段 5 秒视频,H3 Max 的吞吐量可以达到 MiniMax 官方端点的大约 35 倍。 8 月 29 日,美国生成式 AI 基础设施公司 fal 的工程师 Rehan Sheikh,把 H3 Max 接到了 Twitch 上开始直播。直播的内容不是预先准备好的视频。画面一边播放,模型一边往后生成。5 秒一段,768 p,带同步声音,生成时间大约 3 秒。 生成比播放更快。 正因如此,观众可以在弹幕里决定剧情走向,几秒钟后,新的情节就会出现在屏幕上。只要机器不停,这个频道理论上可以一直播下去。一个周末吸引了约 500 万次围观,也有不喜欢 AI 生成内容的人给它起了个名字,叫「无限泔水机」。 底层来自同一个模型,真正把差距拉开的,是模型交付出去之后的后训练、推理优化、硬件调度、部署方式。 有个媒体在报道的时候直接把标题写成: 《Post-Train Beats Parent》 后训练打败亲爹 这件事看起来只是一次很漂亮的工程优化,却碰到了 MiniMax 这轮反弹背后一个更大的问题。 如果模型可以被开源、拿走、继续训练,甚至被别人做得更快、更好,那么市场究竟应该给一家模型公司的什么东西定价? 要回答这个问题,让我们先看看 fal 这家公司。 这家公司不训练基础模型。它的生意是把其他公司训练好的模型接进来,跑在自己的基础设施上,再卖给开发者。新模型出来得越快,它的货架更新得越快。 模型接进来之后,fal 会重新做推理优化、硬件调度和部署,把速度和成本压到一个更适合商业调用的位置。超过 250 万开发者通过它调用生成式模型,公司 ARR 已经做到约 4 亿美元,团队只有 70 人。 过去一年,fal 的收入增长了大约 60 倍,估值则从 45 亿美元攀升至据传约 80 亿美元。 红杉对 fal 创始团队做过一次深度访谈,访谈中红杉资本合伙人 Pat Grady 提到,fal 团队在 2025 年第二、三季度观察到,排名前五的视频模型半衰期仅为 30 天。 「半衰期」这个词来自物理学,原指放射性物质半数原子核发生衰变所需的时间;用在这里,是指 Top 5 视频模型榜单中约有一半被新模型取代所需的时间。 一个模型刚登上榜首,一个月后就可能被下一个替代。但不管模型怎么换,开发者始终需要一个平台来运行它们。 fal 就卡住了这个位置。 开发者每生成一张图、一段视频,都按调用量付钱。接入 fal 这样的平台后,哪个模型当前最好,就可以随时切过去用,不用重新对接 API、搭建基础设施。模型可以月月换,平台的位置却很难被替代。 fal 的 CEO Burkay Gur 说过一句话:「当内容生成变得无限时,有限的东西反而更有价值。」 这家公司本身就是模型快速贬值之后诞生出来的一门生意。H3 是 MiniMax 做的,但 H3 Max 的用户、收入和调用数据会首先留在 fal。H3 Max 越成功,这个问题就越尖锐。 而且 fal 还是一家私有公司,公开市场买不到它。 从 1100 港元到 200 港元 MiniMax 上市时,市场相信的是另一套故事。 这家公司同时做文本、语音和视频模型,C 端有 Talkie 和海螺 AI,B 端有 API。相比只做单一模型的创业公司,它看起来更接近一个完整的多模态商业闭环。 今年 1 月 9 日,MiniMax 上市,发行价 165 港元,公开认购超购 1848 倍,首日收涨 109%。3 月 10 日,股价盘中冲破 1100 港元,市值一度超过百度。 那是市场最相信这个故事的时候。 转折出现在 6 月。6 月 1 日,MiniMax 发布旗舰模型 M3,428 B 参数。和同期的 GLM-5.2、DeepSeek V4 相比,它的模型规模更小。官方最强调的是训练和工程效率,一套系统可以连续 12 小时无人干预,自主训练出 4 个模型,并把 CUDA 内核加速到 9.4 倍。 然后问题就来了。社区发现,部分官方公布的成绩来自自测,第三方实际测试和公开数字存在明显差距。同步调整的计费规则,又让部分老用户的额度消耗速度大幅增加。 6 月 5 日,公司公开致歉称「M3 需要更多算力,是我们工作不到位」,十天后上线仅两周的旗舰模型永久降价 50%;紧接着 6 月 16 日智谱发布 GLM-5.2,开源榜第一随即易主,M3 的领先只维持了两个星期。到 7 月 9 日解禁首日,MiniMax 跌了 20%,几天后股价较高点已经跌去八成以上。 就在暴跌后的第二天,闫俊杰宣布,在实现 AGI 之前不再领取薪酬,同时拿出个人股份奖励团队和支持开源。当天,公司完成一笔 160 亿中国香港元配售,获得约 7 倍认购。 到了 8 月 26 日,MiniMax 拿出了一份足够漂亮的中报,收入同比增长 283%,B 端收入增长 703%,研发投入继续快速增长。第二天,股价只涨了 4%。 市场显然还在等别的东西。 核心资产 模型公司最大的麻烦,是产品更新得太快。 6 月初,M3 刚登上榜首,半个月后就被 GLM-5.2 反超;紧接着 DeepSeek V4、GLM-5.3、Kimi K3 轮番发布。现在的第一名,可能到下一个模型出来就易主了,领先窗口只有几周。 领先只能按周算,单靠一个模型显然撑不起一家公司的长期估值。 于是过去一年,市场一直在寻找模型公司真正的核心资产。 最直接的答案是下一代模型,但下一代也会很快过时。只要行业还在高速迭代,「造出新模型」这件事只能保证公司不被淘汰,却解释不了它为什么值得长期持有。 更有说服力的答案,是制造模型的能力。 今年很多模型发布已经证明,同一个基座,只靠后训练和环境,也能产生巨大的能力跃迁。 智谱 GLM-5.3 和 GLM-5.2 使用的是同一个 753 B 参数基座,真正发生变化的,是更大规模的训练环境和强化学习后训练。Terminal-Bench 3.0 成绩从 4.6 跳到 28.3,基座没有重新训练,效果却大大提升。 唐杰后来把这称作一次「控制变量实验」。 Kimi K3 在训练和评测过程中建立了超过 5000 万个沙箱环境,大量机器时间都花在等待模型推理。冻结、恢复、分叉这些操作被压到几十毫秒级,目的就是让模型可以在海量真实环境里反复尝试、失败、重来。 Cline 甚至让 K3 自己修改训练自己的脚手架。17 个小时无人干预后,成绩从 77.5 提升到 88.8。 模型公司真正难复制的部分,开始从一份权重,变成生产权重、后训练权重、评测权重的整套系统。 Anthropic 一年在强化学习环境上花掉超过 10 亿美元。OpenAI 为 computer-use agent 购买数万台 Mac,也是同样的原因。 建这套系统的门槛和投入都在快速攀升,而且它并不只掌握在模型公司手里。 Cursor 的 Composer 2 是一个很典型的例子。它的底层基于月之暗面开源的 Kimi K2.5,但市场最终给 Cursor 的估值,显然和 Kimi K2.5 无关。 Cursor 积累了大量真实编程行为、开发者工作流,以及围绕这些数据训练出来的强化学习系统。基础模型来自别人,真正关键的是模型被使用之后留下的东西。 fal 也是如此。它拿走 H3 权重,做出 H3 Max。用户在 fal 上生成视频,调用收入先进入 fal,使用数据也先留在 fal。 上游模型公司提供了最贵的原材料,下游却有可能把真正能复利的东西攒下来。技术复杂度和价值捕获能力并不天然对应。 三十年前,个人电脑行业发生过类似的事情。芯片是机器里最复杂的部分,但普通消费者认的是戴尔和康柏。Intel 后来花了十几年,才通过「Intel Inside」把自己重新塞进消费者的视野。 模型公司减去模型 所以判断一家模型公司的价值,或许可以做一道减法。减去模型权重、可复制的推理优化和能被第三方接走的后训练能力之后,剩下的才是这家公司真正能长期占有的东西。 MiniMax 恰好主动做了一次这样的实验。8 月 3 日,它把 H3 开源。短时间内出现数百个衍生模型,下载量达到数千万次,华为昇腾、沐曦、AMD 等芯片平台快速完成适配,大量开发者和合作伙伴接入。 权重虽然开源了,但企业合同和 API 收入都没有流失——就在 H3 开源前的 7 月,MiniMax 的 token 消耗已经是 1 月的 20 倍,这些仍然记在自己账上。 更重要的是,H3 并没有把所有东西都放出去。H3-Context-IR 和 Regenerate-2 K 两个托管模块仍然掌握在 MiniMax 手里。想要输出更高规格的 2 K 视频,依然需要调用官方服务。这是一种很典型的开源策略,底层能力扩散出去,让生态长起来,把真正能够形成商业回流的部分留在服务端。 也因此,H3 Max 对 MiniMax 的意义不只是「别人把我的模型优化得更快了」,它第一次向市场演示了那道减法。 中报给出了一部分答案,B 端收入增长 703%,ARR 超过 8 亿美元,至少到目前为止,开源并没有让所有价值流失。但 H3 Max 也展示了另一半风险,用户关系、调用收入和使用数据,可能在下游平台沉淀。 多空对决 8 月下旬,MiniMax 股价从低点反弹接近一倍,做空比例却同时升到约 20%,创下高位。 多头看到的是做了减法之后剩下来的东西。比如企业客户、API 收入、真实调用、数据回流,以及继续训练下一代模型的系统能力。在公开市场里,这类资产并不多,可以买到的模型公司有限,MiniMax 因而带着明显的稀缺性溢价。 H3 Max 的爆红,又给了这笔钱一个非常直观的参照物。如果 fal 这种公司值 80 亿美元,而 fal 最热门的新产品之一建立在 H3 上,那么 H3 背后的公司值多少钱? 这是多头的思路。 空头的思路则是,如果权重可以免费拿走,后训练可以由 fal 完成,推理速度能被第三方提高 35 倍,那么这些能力为什么还要全部留在 MiniMax 的估值里? 这也解释了 MiniMax 过去几个月的反常走势财报只能反映这家公司现在赚了多少钱,但市场真正关心的是开源之后它还能留住什么。H3 Max 第一次把这个答案摆到了台面上。 回流 把 H3 放出去之后,MiniMax 面临的其实是一个很古老的商业问题。一家公司可以主动放弃一层稀缺性,前提是它知道下一层的钱在哪里。 Red Hat 做过一次这样的选择。 Linux 的源代码从来不属于 Red Hat,任何人都可以免费下载、修改和重新发行。Red Hat 最后卖掉的也不是 Linux 本身,而是企业愿意付钱买的稳定版本、长期维护、技术支持和认证体系。 开源软件铺得越广,这套服务的市场反而越大。2019 年,IBM 花 340 亿美元收购 Red Hat,买的当然不是一份任何人都可以下载的 Linux 源代码。 放出去的东西必须能把价值带回来。 这也是 H3 开源之后,MiniMax 接下来真正需要证明的事情。 现在市场已经看见了扩散。模型被下载,被适配,被二次训练,也开始长出 H3 Max 这样的第三方产品。 接下来要看的,是这种扩散能不能最终反映在 MiniMax 自己的收入和资产里。 可能是更多企业客户,可能是持续增长的 API 消耗,也可能是开发者使用过程中留下的数据和反馈,最后重新进入后训练,变成下一代模型的一部分。 如果这些东西能够形成循环,H3 被拿走得越多,MiniMax 得到的入口反而越多。 如果循环没有形成,情况就完全不同。 模型的影响力可能越来越大,生态也可能越来越繁荣,但最值钱的客户关系、使用数据和交易入口最终沉淀在别人手里。到那时,MiniMax 提供了底层能力,却没有拿到这轮扩散产生的大部分价值。 所以 H3 开源真正要检验的,不是下载量,也不是有多少家公司宣布适配。那些数字只能证明它传得够远。 接下来几个季度需要看的,是传出去以后,有多少钱还能回来。Red Hat 有企业服务合同,Google 有搜索和广告。MiniMax 也需要找到自己的那根管道。 ----END- 原文链接

MiniMax股价回弹92%之后:模型公司减去模型,还剩什么

原文标题:《MiniMax股价回弹92%之后:模型公司减去模型,还剩什么》
原文作者:动察Beating
8 月 31 日,MiniMax 暴涨 16.18%。从 7 月低点算起,这只股票已经反弹 92%,市值重新回到 1249 亿中国香港元。
三个月前,市场刚给这家公司开过一场追悼会。股价较高点跌去八成以上,3000 亿中国香港元市值随之蒸发。
8 月 26 日,MiniMax 发布中报,收入同比增长 283%,B 端收入增长 703%;到 8 月,公司 ARR 已经超过 8 亿美元,7 月 token 消耗量是 1 月的 20 倍。
几天之后,把 MiniMax 重新推回讨论中心的,是一个它自己没有做出来的模型。
H3 Max。
无限频道
8 月 3 日,MiniMax 开源了 H3,一个 33 B 参数、能够同时处理文本、图像、视频和语音的全模态模型。fal 拿走它的开源权重,继续做后训练,再和自己的推理基础设施一起优化,最后做出了 H3 Max。
按照 fal 的说法,同样生成一段 5 秒视频,H3 Max 的吞吐量可以达到 MiniMax 官方端点的大约 35 倍。
8 月 29 日,美国生成式 AI 基础设施公司 fal 的工程师 Rehan Sheikh,把 H3 Max 接到了 Twitch 上开始直播。直播的内容不是预先准备好的视频。画面一边播放,模型一边往后生成。5 秒一段,768 p,带同步声音,生成时间大约 3 秒。
生成比播放更快。
正因如此,观众可以在弹幕里决定剧情走向,几秒钟后,新的情节就会出现在屏幕上。只要机器不停,这个频道理论上可以一直播下去。一个周末吸引了约 500 万次围观,也有不喜欢 AI 生成内容的人给它起了个名字,叫「无限泔水机」。
底层来自同一个模型,真正把差距拉开的,是模型交付出去之后的后训练、推理优化、硬件调度、部署方式。
有个媒体在报道的时候直接把标题写成:
《Post-Train Beats Parent》
后训练打败亲爹
这件事看起来只是一次很漂亮的工程优化,却碰到了 MiniMax 这轮反弹背后一个更大的问题。
如果模型可以被开源、拿走、继续训练,甚至被别人做得更快、更好,那么市场究竟应该给一家模型公司的什么东西定价?
要回答这个问题,让我们先看看 fal 这家公司。
这家公司不训练基础模型。它的生意是把其他公司训练好的模型接进来,跑在自己的基础设施上,再卖给开发者。新模型出来得越快,它的货架更新得越快。
模型接进来之后,fal 会重新做推理优化、硬件调度和部署,把速度和成本压到一个更适合商业调用的位置。超过 250 万开发者通过它调用生成式模型,公司 ARR 已经做到约 4 亿美元,团队只有 70 人。
过去一年,fal 的收入增长了大约 60 倍,估值则从 45 亿美元攀升至据传约 80 亿美元。
红杉对 fal 创始团队做过一次深度访谈,访谈中红杉资本合伙人 Pat Grady 提到,fal 团队在 2025 年第二、三季度观察到,排名前五的视频模型半衰期仅为 30 天。
「半衰期」这个词来自物理学,原指放射性物质半数原子核发生衰变所需的时间;用在这里,是指 Top 5 视频模型榜单中约有一半被新模型取代所需的时间。
一个模型刚登上榜首,一个月后就可能被下一个替代。但不管模型怎么换,开发者始终需要一个平台来运行它们。
fal 就卡住了这个位置。
开发者每生成一张图、一段视频,都按调用量付钱。接入 fal 这样的平台后,哪个模型当前最好,就可以随时切过去用,不用重新对接 API、搭建基础设施。模型可以月月换,平台的位置却很难被替代。
fal 的 CEO Burkay Gur 说过一句话:「当内容生成变得无限时,有限的东西反而更有价值。」
这家公司本身就是模型快速贬值之后诞生出来的一门生意。H3 是 MiniMax 做的,但 H3 Max 的用户、收入和调用数据会首先留在 fal。H3 Max 越成功,这个问题就越尖锐。
而且 fal 还是一家私有公司,公开市场买不到它。
从 1100 港元到 200 港元
MiniMax 上市时,市场相信的是另一套故事。
这家公司同时做文本、语音和视频模型,C 端有 Talkie 和海螺 AI,B 端有 API。相比只做单一模型的创业公司,它看起来更接近一个完整的多模态商业闭环。
今年 1 月 9 日,MiniMax 上市,发行价 165 港元,公开认购超购 1848 倍,首日收涨 109%。3 月 10 日,股价盘中冲破 1100 港元,市值一度超过百度。
那是市场最相信这个故事的时候。
转折出现在 6 月。6 月 1 日,MiniMax 发布旗舰模型 M3,428 B 参数。和同期的 GLM-5.2、DeepSeek V4 相比,它的模型规模更小。官方最强调的是训练和工程效率,一套系统可以连续 12 小时无人干预,自主训练出 4 个模型,并把 CUDA 内核加速到 9.4 倍。
然后问题就来了。社区发现,部分官方公布的成绩来自自测,第三方实际测试和公开数字存在明显差距。同步调整的计费规则,又让部分老用户的额度消耗速度大幅增加。
6 月 5 日,公司公开致歉称「M3 需要更多算力,是我们工作不到位」,十天后上线仅两周的旗舰模型永久降价 50%;紧接着 6 月 16 日智谱发布 GLM-5.2,开源榜第一随即易主,M3 的领先只维持了两个星期。到 7 月 9 日解禁首日,MiniMax 跌了 20%,几天后股价较高点已经跌去八成以上。
就在暴跌后的第二天,闫俊杰宣布,在实现 AGI 之前不再领取薪酬,同时拿出个人股份奖励团队和支持开源。当天,公司完成一笔 160 亿中国香港元配售,获得约 7 倍认购。
到了 8 月 26 日,MiniMax 拿出了一份足够漂亮的中报,收入同比增长 283%,B 端收入增长 703%,研发投入继续快速增长。第二天,股价只涨了 4%。
市场显然还在等别的东西。
核心资产
模型公司最大的麻烦,是产品更新得太快。
6 月初,M3 刚登上榜首,半个月后就被 GLM-5.2 反超;紧接着 DeepSeek V4、GLM-5.3、Kimi K3 轮番发布。现在的第一名,可能到下一个模型出来就易主了,领先窗口只有几周。
领先只能按周算,单靠一个模型显然撑不起一家公司的长期估值。
于是过去一年,市场一直在寻找模型公司真正的核心资产。
最直接的答案是下一代模型,但下一代也会很快过时。只要行业还在高速迭代,「造出新模型」这件事只能保证公司不被淘汰,却解释不了它为什么值得长期持有。
更有说服力的答案,是制造模型的能力。
今年很多模型发布已经证明,同一个基座,只靠后训练和环境,也能产生巨大的能力跃迁。
智谱 GLM-5.3 和 GLM-5.2 使用的是同一个 753 B 参数基座,真正发生变化的,是更大规模的训练环境和强化学习后训练。Terminal-Bench 3.0 成绩从 4.6 跳到 28.3,基座没有重新训练,效果却大大提升。
唐杰后来把这称作一次「控制变量实验」。
Kimi K3 在训练和评测过程中建立了超过 5000 万个沙箱环境,大量机器时间都花在等待模型推理。冻结、恢复、分叉这些操作被压到几十毫秒级,目的就是让模型可以在海量真实环境里反复尝试、失败、重来。
Cline 甚至让 K3 自己修改训练自己的脚手架。17 个小时无人干预后,成绩从 77.5 提升到 88.8。
模型公司真正难复制的部分,开始从一份权重,变成生产权重、后训练权重、评测权重的整套系统。
Anthropic 一年在强化学习环境上花掉超过 10 亿美元。OpenAI 为 computer-use agent 购买数万台 Mac,也是同样的原因。
建这套系统的门槛和投入都在快速攀升,而且它并不只掌握在模型公司手里。
Cursor 的 Composer 2 是一个很典型的例子。它的底层基于月之暗面开源的 Kimi K2.5,但市场最终给 Cursor 的估值,显然和 Kimi K2.5 无关。
Cursor 积累了大量真实编程行为、开发者工作流,以及围绕这些数据训练出来的强化学习系统。基础模型来自别人,真正关键的是模型被使用之后留下的东西。
fal 也是如此。它拿走 H3 权重,做出 H3 Max。用户在 fal 上生成视频,调用收入先进入 fal,使用数据也先留在 fal。
上游模型公司提供了最贵的原材料,下游却有可能把真正能复利的东西攒下来。技术复杂度和价值捕获能力并不天然对应。
三十年前,个人电脑行业发生过类似的事情。芯片是机器里最复杂的部分,但普通消费者认的是戴尔和康柏。Intel 后来花了十几年,才通过「Intel Inside」把自己重新塞进消费者的视野。
模型公司减去模型
所以判断一家模型公司的价值,或许可以做一道减法。减去模型权重、可复制的推理优化和能被第三方接走的后训练能力之后,剩下的才是这家公司真正能长期占有的东西。
MiniMax 恰好主动做了一次这样的实验。8 月 3 日,它把 H3 开源。短时间内出现数百个衍生模型,下载量达到数千万次,华为昇腾、沐曦、AMD 等芯片平台快速完成适配,大量开发者和合作伙伴接入。
权重虽然开源了,但企业合同和 API 收入都没有流失——就在 H3 开源前的 7 月,MiniMax 的 token 消耗已经是 1 月的 20 倍,这些仍然记在自己账上。
更重要的是,H3 并没有把所有东西都放出去。H3-Context-IR 和 Regenerate-2 K 两个托管模块仍然掌握在 MiniMax 手里。想要输出更高规格的 2 K 视频,依然需要调用官方服务。这是一种很典型的开源策略,底层能力扩散出去,让生态长起来,把真正能够形成商业回流的部分留在服务端。
也因此,H3 Max 对 MiniMax 的意义不只是「别人把我的模型优化得更快了」,它第一次向市场演示了那道减法。
中报给出了一部分答案,B 端收入增长 703%,ARR 超过 8 亿美元,至少到目前为止,开源并没有让所有价值流失。但 H3 Max 也展示了另一半风险,用户关系、调用收入和使用数据,可能在下游平台沉淀。
多空对决
8 月下旬,MiniMax 股价从低点反弹接近一倍,做空比例却同时升到约 20%,创下高位。
多头看到的是做了减法之后剩下来的东西。比如企业客户、API 收入、真实调用、数据回流,以及继续训练下一代模型的系统能力。在公开市场里,这类资产并不多,可以买到的模型公司有限,MiniMax 因而带着明显的稀缺性溢价。
H3 Max 的爆红,又给了这笔钱一个非常直观的参照物。如果 fal 这种公司值 80 亿美元,而 fal 最热门的新产品之一建立在 H3 上,那么 H3 背后的公司值多少钱?
这是多头的思路。
空头的思路则是,如果权重可以免费拿走,后训练可以由 fal 完成,推理速度能被第三方提高 35 倍,那么这些能力为什么还要全部留在 MiniMax 的估值里?
这也解释了 MiniMax 过去几个月的反常走势财报只能反映这家公司现在赚了多少钱,但市场真正关心的是开源之后它还能留住什么。H3 Max 第一次把这个答案摆到了台面上。
回流
把 H3 放出去之后,MiniMax 面临的其实是一个很古老的商业问题。一家公司可以主动放弃一层稀缺性,前提是它知道下一层的钱在哪里。
Red Hat 做过一次这样的选择。
Linux 的源代码从来不属于 Red Hat,任何人都可以免费下载、修改和重新发行。Red Hat 最后卖掉的也不是 Linux 本身,而是企业愿意付钱买的稳定版本、长期维护、技术支持和认证体系。
开源软件铺得越广,这套服务的市场反而越大。2019 年,IBM 花 340 亿美元收购 Red Hat,买的当然不是一份任何人都可以下载的 Linux 源代码。
放出去的东西必须能把价值带回来。
这也是 H3 开源之后,MiniMax 接下来真正需要证明的事情。
现在市场已经看见了扩散。模型被下载,被适配,被二次训练,也开始长出 H3 Max 这样的第三方产品。
接下来要看的,是这种扩散能不能最终反映在 MiniMax 自己的收入和资产里。
可能是更多企业客户,可能是持续增长的 API 消耗,也可能是开发者使用过程中留下的数据和反馈,最后重新进入后训练,变成下一代模型的一部分。
如果这些东西能够形成循环,H3 被拿走得越多,MiniMax 得到的入口反而越多。
如果循环没有形成,情况就完全不同。
模型的影响力可能越来越大,生态也可能越来越繁荣,但最值钱的客户关系、使用数据和交易入口最终沉淀在别人手里。到那时,MiniMax 提供了底层能力,却没有拿到这轮扩散产生的大部分价值。
所以 H3 开源真正要检验的,不是下载量,也不是有多少家公司宣布适配。那些数字只能证明它传得够远。
接下来几个季度需要看的,是传出去以后,有多少钱还能回来。Red Hat 有企业服务合同,Google 有搜索和广告。MiniMax 也需要找到自己的那根管道。
----END-
原文链接
Статья
对话眺月科技王方正|从实验室跳向市场,一台单腿机器人的商业冒险原文标题:《对话眺月科技王方正|从实验室跳向市场,一台单腿机器人的商业冒险》 原文作者:动察Beating 1984 年 6 月,机器人学者 Marc Raibert 和两名同事发表了一篇论文,研究对象是一台只有一条腿的机器。 机器单靠一条有弹性的腿,在空旷地面上反复起落。研究人员试图从三个角度来控制它,方向、姿态、弹跳高度。论文证明了跳跃可以被系统地控制,但是受限于那个时代的科技水平,那台机器始终拖着液压管线和数据电缆,连接着场外的动力源和计算机,无法脱离实验室独立运行。 两年后,Raibert 把这批研究写进《Legged Robots That Balance》。他从一条腿讲起,再把同样的运动原理推到两足和四足。1992 年,他从麻省理工学院的 Leg Lab 里创办波士顿动力。Spot 直到 2020 年才全面出售。 从第一台单腿机器跳起来,到一台足式机器人被客户买走,中间隔了三十多年。 2026 年 8 月,我们见到了另一台只有一条腿的机器人,它无需依赖外部设备即可实现稳定的连续跳跃,而且从论文发表到可量产落地只用了不到两年的时间。它由一根碳纤维弹性腿和四个旋翼组成,落地时压缩弹簧,离地以后用旋翼补充能量、调整姿态,遇到跨不过去的沟壑还能直接飞过去。中国香港城市大学的研究团队给它起名 Hopcopter,成立于中国香港的眺月科技把中文名定得更直接,「跳跃机」。 眺月科技源自中国香港城市大学机器人及智能系统实验室。2024 年,白松楠等人关于 Hopcopter 的论文登上《Science Robotics》。王方正随后拉上师兄白松楠和导师 Pakpong Chirarattananon 教授,把科研项目变成一家公司。公司已经拿到英诺基金独家投资的数百万元种子轮,正在推进新一轮融资。第一代遥控产品面向发烧友,未来再推出可供开发者二次开发的版本。 我们好奇的问题很简单,「这东西有什么用?」 王方正承认,眺月科技拿着一把大锤,还在找最适合它的钉子。他也坚持认为,跳跃会成为一种独立的机器人形态。投资人问利润和 PMF,他谈运动原理和未来构想。聊到最后,他说: 「更重要的是,能活到十年以后。」 一根弹簧 王方正 1999 年出生,硕士就读于帝国理工学院人类与生物机器人专业,随后到中国香港城市大学读博。眺月科技最初的技术来自他的师兄白松楠。白松楠和团队把动物奔跑时落地、压缩、再次腾空的过程抽象成弹簧倒立摆,再把一根被动伸缩腿装到四旋翼下面。 这条路线带着很浓的实验室气质,眺月科技后来面对的所有商业问题,都从这根弹簧开始。 动察 Beating:先介绍一下你自己,以及眺月科技是怎么开始的。 王方正:我叫王方正,硕士毕业于帝国理工学院,一直学机器人。毕业以后,我到中国香港城市大学跟着 Pakpong Chirarattananon 教授读博,在这里遇到了师兄白松楠博士,也接触到他研究的 Hopcopter,也就是跳跃机。 我觉得这是一个很有意义的研究成果,未来还有很多可能,或许会成为一种新的机器人形态。后来我和师兄、导师一起成立了眺月科技,一直做到现在。 动察 Beating:实验室最初想解决什么问题,最后为什么做出了跳跃机? 王方正:我们所在的实验室是世界顶尖的无人机实验室,做过很多形态。有的无人机能像轮子一样在地上滚,有的像种子一样旋转飘落,还有用一根绳子带着电机飞的,也做过能变形、合体和解体的无人机。 无人机只要一直待在空中,就绕不开重力,载重和续航很难同时解决。我们想到利用重力,让机器人落地以后反弹。这样一来,载重和续航都能有很大提升。 机器「人」不一定要像人 跳跃机的仿生藏在运动里。它没有照着某一种动物去复制外形,只取了人和动物奔跑时落地、压缩、蹬起的那个瞬间。王方正认为,机器人采用什么形态,应该由任务、成本和效率决定。 这个判断也决定了眺月科技怎样描述自己的技术。它首先是一种移动方式,负责把机器带到轮子和足式机器人不容易抵达的地方。机械臂、传感器和大模型,完全可以作为之后再考虑的事情。 动察 Beating:你为什么觉得很多任务没有必要交给人形机器人? 王方正:我一直认为,机器人可以不长得像人。人形当然有自己的好处。它能跳舞,现实里的很多环境也按照人的身体设计,人形会更容易适应这些环境。 工厂里如果需要拧螺丝,可以让一个人形机器人伸手去拧,也可以让一把螺丝刀从上方降下来,拧完以后,流水线把产品送到下一站。我更倾向后面这种做法,因为还要考虑成本和效率。 很多人说跳跃机不仿生,我必须纠正这一点。它非常仿生,只是外形不像我们熟悉的动物。它模仿的是人奔跑时落地和起跳的那个瞬间,我们把这个运动模型叫作弹簧倒立摆。仿生抓住核心特征就够了。人类造雷达,也不需要把雷达做成蝙蝠耳朵的形状。 动察 Beating:和机器狗、轮足机器人相比,哪些工作场景最适合跳跃机? 王方正:跳跃机最核心的两个优点是全地形和长续航。需要这两种能力的地方,未来都可能成为它的优势场景。 可以想象,未来生活里会有很多机器人。家里可能更适合人形,它能做家务。城市里可以使用轮足机器人,完成一些基础的越障。到了户外和更复杂的空间,目前还没有一种机器人形态可以高效率地移动,跳跃机有机会出现在这些地方。 动察 Beating:跳跃本身有没有可能成为阻碍? 王方正:现在还没有进入一个具体场景,我们很难把它的弊端说得很完整。能想到的一个限制是运送液体,跳跃会让液体晃动。 人的奔跑本身也是连续跳跃,同样经历自由落体。人在跑步时能带什么东西,跳跃机大概率也能带类似的东西。 它运动时看起来很激烈,也可以随时停下来,在一个地方作业。它不用一直悬停,可以用起落架撑在地上,不额外费电。后面还会有腿可以收起来的方案。 动察 Beating:跳跃机器人还在很早期,应该用哪些指标衡量它的进展? 王方正:稳定性肯定是一个。它要在更强的扰动和更复杂的环境里保持稳定。 再往后,跳跃机器人还会有更多形态。我们把跳跃本身研究明白以后,它未必只靠一条腿在地面上跳。具体形态现在还不能透露,大家可以期待。 可拓展性和智能化也是必然方向。未来更多的功能需要和开发者一起做,靠更多人的力量往前推进。 动察 Beating:以后会在跳跃机上加入大模型吗? 王方正:跳跃机的终局一定会有大脑和眼睛,能够自主移动,也能够自主认知。我们现在主要做下半身,也就是让它稳定地跳。你说的感知、决策和执行任务,都属于上半身。 跳跃机有很好的载重能力,未来可以把这些东西加上去。我们会先推出开放程度更高的版本,再往自主移动和自主认知的方向发展。 第一代不叫玩具 一种新的机器人形态要走出实验室,首先需要解决量产、价格和耐用性问题。眺月科技选择从遥控跳跃机切入。它没有自主导航、用户通过摇杆控制方向、高度和飞跳切换。 更现实的问题是,新鲜感过去以后,用户还会不会愿意继续使用它。王方正将产品重点放在运动性能、耐摔程度和价格上。团队甚至放弃了已经做出来的科幻外壳,换成更裸露的碳纤维结构。 动察 Beating:这么前沿的技术,第一步却是一台面向发烧友的遥控产品。科研团队会不会觉得它成了一个遥控玩具? 王方正:我先纠正一点,它不算小玩具。第一代确实是一款遥控产品,可是回头看宇树和大疆,它们最早做出来的东西也要靠遥控。 宇树最早的 Laikago 没有今天这么多能力,主要也是遥控。当时它卖几万元,因为价格高让大家觉得它很专业,也很难进入大众市场。但这不代表宇树不希望更多人看到和使用它。 我们的优势在于,跳跃机可以依托深圳成熟的无人机供应链生产,把成本降下来。我们希望用一个用户愿意接受的价格跟大家见面,让更多人看到、用到跳跃机。 动察 Beating:现在的定价可以透露吗?我们办公室已经有同事想买了。 王方正:目前还不方便透露。我们做过问卷调研,那些确实想买的人基本能接受这个价格,所以不用太担心。 动察 Beating:跳跃是一种很剧烈的运动。弹簧、机身和旋翼会不会很容易磨损,用户需要频繁更换零件? 王方正:这些问题我们都考虑过。内部测试时,我们玩得很暴力。最新的片子是在南非拍的,我们把它带到海边礁石和荒野里跳,机器都能正常运动,也能连续跳很长时间。 产品思路中间有过一次很大的转变。最初我们想做一款外观很科幻的产品,和宣传片里的概念机相似。那台机器已经能跳,也能展示。后来我们自己长时间去玩,发现大家总会想做一些激烈、精彩的操作,摔倒和操控失误很难完全避免。外壳容易在这种情况下损坏,分散的重量还会影响操控稳定性。 我们重新想了第一批用户最在意什么。他们首先在意跳跃本身,也在意它摔下去以后还能继续玩。现在这一版主要使用碳纤维,把运动性能放在第一位。 动察 Beating:它的控制精度现在能到什么程度? 王方正:有一个指标可以表现它的稳定性。不给任何方向控制时,它基本能在一个较小范围内定点跳跃,不会越跳越远。 这一代没有加额外传感器,还做不到让它精确跳多少厘米、落到哪个点。操作逻辑很简单,和遥控车相似。往前推摇杆就往前走,往后推就往后走,符合大家使用遥控产品的直觉。 动察 Beating:很多机器人公司会先找 B 端客户。你们为什么从大众市场开始? 王方正:有一句话叫「能 to C,不 to B」。to B 往往需要很多资源,背后的原因也比较复杂。to C 可以把产品直接交给市场验证,每个想买的人都有机会买到。 我们认真考虑过直接做 to B,也有不少 B 端客户找过来。可我们的团队很小,技术又处于很早期。假如一上来做巡检,团队就要花大量精力研究上面搭载的巡检设备。我们的优势在跳跃运动本身,不在巡检设备。 一开始就做巡检机器人,我们打磨跳跃技术的时间会减少,很容易走进死胡同。先做消费产品,再推出开放程度更高的版本,让更多人一起开发,我们认为这条路更合适。 动察 Beating:第一代产品主要服务发烧友,你们希望它怎样形成一个社区? 王方正:社区可以分成两部分。第一部分是发烧友,他们会分享有创意的玩法。第二部分是开发者,他们会在机器上增加功能,比如跟随、避障,或者接入大模型。 第一代产品还不具备二次开发能力,主要服务发烧友。后面会有半开源的版本,主要面向开发者。 拿着大锤找钉子 先得到技术,再寻找问题,这个顺序贯穿了公司的产品和融资。看消费电子的投资人会先问它卖给谁,硬科技投资人更愿意先看运动能力能走到哪里。 王方正把这种分歧概括成「看得近」和「看得远」。这句话带着创业者的立场,也带着一家早期公司对资金的现实需求。公司想继续做科研、准备量产,还要为产品进入市场做准备,每一件都需要钱。 动察 Beating:你们先有技术,再寻找它能解决的问题。这和很多公司的创业顺序不太一样。 王方正:这正是我们和市场上大多数公司的区别。很多公司会先看到一个痛点,再寻找能解决它的技术。我们手里先有了一把很厉害的大锤,然后再想未来有哪些钉子可以敲。 2024 年,人形机器人刚开始火。那时很多人形机器人走路还不稳定,需要有人扶,或者只能在平地上走。我们在实验室里已经接触到一些尚未公开的成果。跳跃机器人可以在校园里很快地跑,可以跨越障碍,也能适应不同地形。我觉得这是机器人领域很大的技术突破,未来的可能性或许比人形更广。 公司从第一天起就在讨论它能用在哪里。能想到的方向很多,现阶段直接进入某个场景还太早。我们有一点很明确,这项技术未来有机会改变世界,我们想推动它往前走。 动察 Beating:在场景还没有完全明确的时候,第一轮投资人为什么愿意投你们? 王方正:愿意投我们的机构,算得上愿意投早、投小、投硬科技。很多硬科技在最早期都很难说清眼前有哪个明确场景,投资人先看技术本身。 现在这一轮和种子轮相比,产品有了很大进展,我们对路径的思考也更清楚。先从发烧友开始,再形成社区,让大家共同开发这项技术、一起探索场景。我们已经把这条路和其中的几个里程碑想得更明确了。 动察 Beating:你会把眺月科技定义成商业公司,还是一个新的实验室? 王方正:我们是一家科技公司。公司这一侧负责科研成果转化,把产品做好,让技术尽快进入生活。 实验室也是很重要的一部分。我和师兄、导师一直保持合作,他们现在都在高校任教。实验室的新成果会交给公司转化,眺月科技可以持续接触到最前沿的跳跃技术。 如果只看公司一侧,科研和商业化投入大概各占一半。实验室一侧做纯科研。 动察 Beating:你们刚加入地瓜机器人的生态,也参加了「地心引力 DemoDay 2026」。现在最需要他们提供什么支持? 王方正:我们刚加入地瓜机器人的生态。参加那次 DemoDay,主要还是希望认识更多投资人。公司正在进行第二轮融资,现阶段最需要的是资金。 有了钱,我们才能招更多人,让技术发展得更快。科研要继续投入,产品量产要准备,市场也要开始做。 动察 Beating:DemoDay 的体验怎么样? 王方正:我很感谢他们。我们报名时,大部分项目好像已经定了,海报上只剩下最后两个名额。我一开始觉得自己可能是去凑数的。 后来证明,我们的产品确实很惊艳,我讲得也不错。最后拿到第三名,还带着一万元奖金回家,我挺开心的。 动察 Beating:新一轮融资推进得怎么样?投资人最常问你的问题是什么? 王方正:目前进展还算顺利。很多人上来第一个问题就是,你们这东西能干什么,场景在哪里。第一个问题这样问的人,聊到最后大概率也不会真的感兴趣。他可能长期看消费电子,还没有用硬科技的视角理解这件事。我们的第一代产品根据调研数据来看,可以卖得很好,为公司增加造血能力,但我们更希望的是投资人能以科技进步的视角来支持我们未来的发展策略。 大家对跳跃机都有兴趣,争论也很大。我听说一些投资机构内部的争论,和我们抖音评论区很像。一类人更在乎多久能盈利、什么时候找到 PMF。也有人真心热爱科技发展,他相信这项技术以后一定有用,愿意先推动它。 动察 Beating:你怎么看这两种判断的冲突? 王方正:我觉得是看得近和看得远。 宇树是一个很好的例子。和我聊过的很多投资人,以前投过宇树,或者想投却没投上。宇树在上春晚以前融资也不容易。它火起来前后,人们都很难说清它最确定的场景,除了高校实验室和开发者市场。变化最大的是市场对它的看法。 眺月科技现在可能比宇树最早期还早。宇树开始时,前面已经有波士顿动力。我们有点像波士顿动力最早把机器人跳舞视频放出来的时候,大家刚刚看见这种东西。想让世界知道跳跃机有多厉害、未来能做什么,路还很远。 泡沫里的实在 机器人是 2026 年最热的创业方向之一。王方正承认行业里有泡沫,也有人劝他顺着热度讲一个更大的故事。先拿一批 B 端意向,再把融资规模放大,等钱到手以后慢慢找方向。这套方法没有说服他。 他喜欢小米和宇树,理由都落在「实在」两个字上。他对马斯克的评价也沿着同一条线展开,佩服一个人把科技做出来的能力,同时保留对赚钱方式和企业家责任的判断。 动察 Beating:你最喜欢哪一家科技公司? 王方正:小米。首先我很佩服雷军。从早期创业受挫,到金山、小米,再到小米汽车,他一直在奋斗,也在实现更大的人生价值。 小米是一家很实在的公司。它进入一个行业以后,往往会重新洗牌,很多信息和价格会变得更透明。一家科技公司应该给普通人带来实打实的好处,我觉得小米做到了。 动察 Beating:现在机器人行业的泡沫大吗? 王方正:我觉得大。有其他 FA 找过我们,说我们现在讲的故事不对。他们觉得我们应该像一些融资很快的机器人公司一样,拿很多 to B 合作意向,再讲一个很大的故事。手里先握着五十亿元,后面想怎么发展都可以。 我们暂时不想这样做。我们认可哪条路,就讲哪条路。 汽车就是一种很好的机器人。它每天走的道路基本固定,建筑物和道路也不会突然变化,底下四个轮子,动力学相对简单。每天还有那么多汽车在收集数据,自动驾驶到现在依然没有完全实现。 人形机器人的结构复杂得多,要投入生产、进入家庭,还有很长的路。跳跃机的动力学可以完整解析,成本更低,结构也更简洁。我们有机会可以比人形机器人更早地让跳跃机进入实际的工作场景。 动察 Beating:你怎么看马斯克? 王方正:在美国的资本主义环境里,他把整套商业规则玩得很明白。他有科技理想,也很懂得怎样赚钱,币圈那一套他也会用。 只看他对科技领域的帮助和创业成绩,我非常佩服他,确实很厉害。但把一个人的全部放在一起评价,我希望未来有人能做得比他更好。 活到十年以后 采访当天上午,宇树科技在上海证券交易所科创板上市。王方正的朋友圈里,投资人纷纷发出祝贺,有些人也在这笔投资里赚到了钱。 眺月科技离那一天还很远。公司仍在收集第一代产品的用户反馈,计划找 KOL 内测,并前往美国参展。它也刚拿到地瓜机器人 DemoDay 的第三名,正在为第二轮融资见投资人。王方正谈十年后的大疆和宇树,也清楚眼前最硬的条件是什么。 动察 Beating:香港的创业环境怎么样?你们拿到过哪些政府和学校的支持? 王方正:中国香港对科技创业的支持力度很大。我们的第一笔投资来自英诺中国香港。它背后的资金和中国香港支持初创的体系有联系。 我们还入选了港深创科园的培育计划。园区位于深圳和中国香港交界处,会给公司提供场地和补贴。政策层面很支持科技创业。 学校也很重要。中国香港城市大学有 HK Tech 300 计划,扶持了很多初创团队。对学生来说,创业第一步很难迈,学校的帮助很关键。 动察 Beating:接下来准备做哪些事? 王方正:最近主要在做用户调研,收集大家对产品的期望。我们会把产品化的小功能继续打磨,让第一代更好用。 之后可能会找 KOL 做内测。产品预计在 2027 年初参加完 CES 之后发售。 动察 Beating:十年以后,你希望眺月科技成为一家什么样的公司? 王方正:如果要找参照,我会选宇树和大疆。 假如未来出现一个非常明确、我们又有绝对优势的场景,就像航拍之于无人机,我们会针对这个场景自己独立开发相关技术,并争取做到百分之八十的市场占有率。那会是一条大疆式的路。 十年以后,如果跳跃机仍然没有一个体量很大的明确场景,还需要很多人共同探索,我们可能会更像宇树。 更重要的是,能活到十年以后。 动察 Beating:宇树上市这件事给你最大的感受是什么? 王方正:我看到朋友圈里很多投资人在祝贺,可能他们也跟着赚到了钱。宇树走了一条很踏实的路。在这些机器人公司里,我最喜欢的还是宇树,它确实带动了足式机器人的发展。 很多人投资宇树,尤其是后面几轮的投资人,看中的是市场热度和市占率。他们未必认可技术本身有多前沿,也未必认可这条踏实做事的路线。对一家科技公司来说,我觉得这件事有一点可笑。 我接触过其中一些人。假如让他们早几年去和王兴兴聊,他们大概率不会投。 动察 Beating:你觉得这样的投资人在市场上占多大比重? 王方正:我没有说他们不好。投资人要对 LP 负责,当然会投认知范围内、能够理解,也更容易看到明确收益的项目。我完全理解。 这样的投资人在市场上占比还是很高。人民币基金里,比例可能更高。 Raibert 在《Legged Robots That Balance》里写的,是一条腿怎样保持平衡。那时没有人能从那台不断起落的机器上,直接看见三十多年后的 Spot。研究留下来的东西,是一套关于动态平衡的原理。它后来长出两条腿、四条腿,也长出了一家公司。 王方正正在走一条方向更直接的路。他手里已经有一台会跳的机器,接下来要把它变成有人买、有人继续用的产品。这个过程不会只靠一次漂亮的跳跃完成。 一台机器每次落地,弹簧都会压缩。想再跳起来,先得接住自己的重量。 原文链接

对话眺月科技王方正|从实验室跳向市场,一台单腿机器人的商业冒险

原文标题:《对话眺月科技王方正|从实验室跳向市场,一台单腿机器人的商业冒险》
原文作者:动察Beating
1984 年 6 月,机器人学者 Marc Raibert 和两名同事发表了一篇论文,研究对象是一台只有一条腿的机器。
机器单靠一条有弹性的腿,在空旷地面上反复起落。研究人员试图从三个角度来控制它,方向、姿态、弹跳高度。论文证明了跳跃可以被系统地控制,但是受限于那个时代的科技水平,那台机器始终拖着液压管线和数据电缆,连接着场外的动力源和计算机,无法脱离实验室独立运行。
两年后,Raibert 把这批研究写进《Legged Robots That Balance》。他从一条腿讲起,再把同样的运动原理推到两足和四足。1992 年,他从麻省理工学院的 Leg Lab 里创办波士顿动力。Spot 直到 2020 年才全面出售。
从第一台单腿机器跳起来,到一台足式机器人被客户买走,中间隔了三十多年。
2026 年 8 月,我们见到了另一台只有一条腿的机器人,它无需依赖外部设备即可实现稳定的连续跳跃,而且从论文发表到可量产落地只用了不到两年的时间。它由一根碳纤维弹性腿和四个旋翼组成,落地时压缩弹簧,离地以后用旋翼补充能量、调整姿态,遇到跨不过去的沟壑还能直接飞过去。中国香港城市大学的研究团队给它起名 Hopcopter,成立于中国香港的眺月科技把中文名定得更直接,「跳跃机」。
眺月科技源自中国香港城市大学机器人及智能系统实验室。2024 年,白松楠等人关于 Hopcopter 的论文登上《Science Robotics》。王方正随后拉上师兄白松楠和导师 Pakpong Chirarattananon 教授,把科研项目变成一家公司。公司已经拿到英诺基金独家投资的数百万元种子轮,正在推进新一轮融资。第一代遥控产品面向发烧友,未来再推出可供开发者二次开发的版本。
我们好奇的问题很简单,「这东西有什么用?」
王方正承认,眺月科技拿着一把大锤,还在找最适合它的钉子。他也坚持认为,跳跃会成为一种独立的机器人形态。投资人问利润和 PMF,他谈运动原理和未来构想。聊到最后,他说:
「更重要的是,能活到十年以后。」
一根弹簧
王方正 1999 年出生,硕士就读于帝国理工学院人类与生物机器人专业,随后到中国香港城市大学读博。眺月科技最初的技术来自他的师兄白松楠。白松楠和团队把动物奔跑时落地、压缩、再次腾空的过程抽象成弹簧倒立摆,再把一根被动伸缩腿装到四旋翼下面。
这条路线带着很浓的实验室气质,眺月科技后来面对的所有商业问题,都从这根弹簧开始。
动察 Beating:先介绍一下你自己,以及眺月科技是怎么开始的。
王方正:我叫王方正,硕士毕业于帝国理工学院,一直学机器人。毕业以后,我到中国香港城市大学跟着 Pakpong Chirarattananon 教授读博,在这里遇到了师兄白松楠博士,也接触到他研究的 Hopcopter,也就是跳跃机。
我觉得这是一个很有意义的研究成果,未来还有很多可能,或许会成为一种新的机器人形态。后来我和师兄、导师一起成立了眺月科技,一直做到现在。
动察 Beating:实验室最初想解决什么问题,最后为什么做出了跳跃机?
王方正:我们所在的实验室是世界顶尖的无人机实验室,做过很多形态。有的无人机能像轮子一样在地上滚,有的像种子一样旋转飘落,还有用一根绳子带着电机飞的,也做过能变形、合体和解体的无人机。
无人机只要一直待在空中,就绕不开重力,载重和续航很难同时解决。我们想到利用重力,让机器人落地以后反弹。这样一来,载重和续航都能有很大提升。
机器「人」不一定要像人
跳跃机的仿生藏在运动里。它没有照着某一种动物去复制外形,只取了人和动物奔跑时落地、压缩、蹬起的那个瞬间。王方正认为,机器人采用什么形态,应该由任务、成本和效率决定。
这个判断也决定了眺月科技怎样描述自己的技术。它首先是一种移动方式,负责把机器带到轮子和足式机器人不容易抵达的地方。机械臂、传感器和大模型,完全可以作为之后再考虑的事情。
动察 Beating:你为什么觉得很多任务没有必要交给人形机器人?
王方正:我一直认为,机器人可以不长得像人。人形当然有自己的好处。它能跳舞,现实里的很多环境也按照人的身体设计,人形会更容易适应这些环境。
工厂里如果需要拧螺丝,可以让一个人形机器人伸手去拧,也可以让一把螺丝刀从上方降下来,拧完以后,流水线把产品送到下一站。我更倾向后面这种做法,因为还要考虑成本和效率。
很多人说跳跃机不仿生,我必须纠正这一点。它非常仿生,只是外形不像我们熟悉的动物。它模仿的是人奔跑时落地和起跳的那个瞬间,我们把这个运动模型叫作弹簧倒立摆。仿生抓住核心特征就够了。人类造雷达,也不需要把雷达做成蝙蝠耳朵的形状。
动察 Beating:和机器狗、轮足机器人相比,哪些工作场景最适合跳跃机?
王方正:跳跃机最核心的两个优点是全地形和长续航。需要这两种能力的地方,未来都可能成为它的优势场景。
可以想象,未来生活里会有很多机器人。家里可能更适合人形,它能做家务。城市里可以使用轮足机器人,完成一些基础的越障。到了户外和更复杂的空间,目前还没有一种机器人形态可以高效率地移动,跳跃机有机会出现在这些地方。
动察 Beating:跳跃本身有没有可能成为阻碍?
王方正:现在还没有进入一个具体场景,我们很难把它的弊端说得很完整。能想到的一个限制是运送液体,跳跃会让液体晃动。
人的奔跑本身也是连续跳跃,同样经历自由落体。人在跑步时能带什么东西,跳跃机大概率也能带类似的东西。
它运动时看起来很激烈,也可以随时停下来,在一个地方作业。它不用一直悬停,可以用起落架撑在地上,不额外费电。后面还会有腿可以收起来的方案。
动察 Beating:跳跃机器人还在很早期,应该用哪些指标衡量它的进展?
王方正:稳定性肯定是一个。它要在更强的扰动和更复杂的环境里保持稳定。
再往后,跳跃机器人还会有更多形态。我们把跳跃本身研究明白以后,它未必只靠一条腿在地面上跳。具体形态现在还不能透露,大家可以期待。
可拓展性和智能化也是必然方向。未来更多的功能需要和开发者一起做,靠更多人的力量往前推进。
动察 Beating:以后会在跳跃机上加入大模型吗?
王方正:跳跃机的终局一定会有大脑和眼睛,能够自主移动,也能够自主认知。我们现在主要做下半身,也就是让它稳定地跳。你说的感知、决策和执行任务,都属于上半身。
跳跃机有很好的载重能力,未来可以把这些东西加上去。我们会先推出开放程度更高的版本,再往自主移动和自主认知的方向发展。
第一代不叫玩具
一种新的机器人形态要走出实验室,首先需要解决量产、价格和耐用性问题。眺月科技选择从遥控跳跃机切入。它没有自主导航、用户通过摇杆控制方向、高度和飞跳切换。
更现实的问题是,新鲜感过去以后,用户还会不会愿意继续使用它。王方正将产品重点放在运动性能、耐摔程度和价格上。团队甚至放弃了已经做出来的科幻外壳,换成更裸露的碳纤维结构。
动察 Beating:这么前沿的技术,第一步却是一台面向发烧友的遥控产品。科研团队会不会觉得它成了一个遥控玩具?
王方正:我先纠正一点,它不算小玩具。第一代确实是一款遥控产品,可是回头看宇树和大疆,它们最早做出来的东西也要靠遥控。
宇树最早的 Laikago 没有今天这么多能力,主要也是遥控。当时它卖几万元,因为价格高让大家觉得它很专业,也很难进入大众市场。但这不代表宇树不希望更多人看到和使用它。
我们的优势在于,跳跃机可以依托深圳成熟的无人机供应链生产,把成本降下来。我们希望用一个用户愿意接受的价格跟大家见面,让更多人看到、用到跳跃机。
动察 Beating:现在的定价可以透露吗?我们办公室已经有同事想买了。
王方正:目前还不方便透露。我们做过问卷调研,那些确实想买的人基本能接受这个价格,所以不用太担心。
动察 Beating:跳跃是一种很剧烈的运动。弹簧、机身和旋翼会不会很容易磨损,用户需要频繁更换零件?
王方正:这些问题我们都考虑过。内部测试时,我们玩得很暴力。最新的片子是在南非拍的,我们把它带到海边礁石和荒野里跳,机器都能正常运动,也能连续跳很长时间。
产品思路中间有过一次很大的转变。最初我们想做一款外观很科幻的产品,和宣传片里的概念机相似。那台机器已经能跳,也能展示。后来我们自己长时间去玩,发现大家总会想做一些激烈、精彩的操作,摔倒和操控失误很难完全避免。外壳容易在这种情况下损坏,分散的重量还会影响操控稳定性。
我们重新想了第一批用户最在意什么。他们首先在意跳跃本身,也在意它摔下去以后还能继续玩。现在这一版主要使用碳纤维,把运动性能放在第一位。
动察 Beating:它的控制精度现在能到什么程度?
王方正:有一个指标可以表现它的稳定性。不给任何方向控制时,它基本能在一个较小范围内定点跳跃,不会越跳越远。
这一代没有加额外传感器,还做不到让它精确跳多少厘米、落到哪个点。操作逻辑很简单,和遥控车相似。往前推摇杆就往前走,往后推就往后走,符合大家使用遥控产品的直觉。
动察 Beating:很多机器人公司会先找 B 端客户。你们为什么从大众市场开始?
王方正:有一句话叫「能 to C,不 to B」。to B 往往需要很多资源,背后的原因也比较复杂。to C 可以把产品直接交给市场验证,每个想买的人都有机会买到。
我们认真考虑过直接做 to B,也有不少 B 端客户找过来。可我们的团队很小,技术又处于很早期。假如一上来做巡检,团队就要花大量精力研究上面搭载的巡检设备。我们的优势在跳跃运动本身,不在巡检设备。
一开始就做巡检机器人,我们打磨跳跃技术的时间会减少,很容易走进死胡同。先做消费产品,再推出开放程度更高的版本,让更多人一起开发,我们认为这条路更合适。
动察 Beating:第一代产品主要服务发烧友,你们希望它怎样形成一个社区?
王方正:社区可以分成两部分。第一部分是发烧友,他们会分享有创意的玩法。第二部分是开发者,他们会在机器上增加功能,比如跟随、避障,或者接入大模型。
第一代产品还不具备二次开发能力,主要服务发烧友。后面会有半开源的版本,主要面向开发者。
拿着大锤找钉子
先得到技术,再寻找问题,这个顺序贯穿了公司的产品和融资。看消费电子的投资人会先问它卖给谁,硬科技投资人更愿意先看运动能力能走到哪里。
王方正把这种分歧概括成「看得近」和「看得远」。这句话带着创业者的立场,也带着一家早期公司对资金的现实需求。公司想继续做科研、准备量产,还要为产品进入市场做准备,每一件都需要钱。
动察 Beating:你们先有技术,再寻找它能解决的问题。这和很多公司的创业顺序不太一样。
王方正:这正是我们和市场上大多数公司的区别。很多公司会先看到一个痛点,再寻找能解决它的技术。我们手里先有了一把很厉害的大锤,然后再想未来有哪些钉子可以敲。
2024 年,人形机器人刚开始火。那时很多人形机器人走路还不稳定,需要有人扶,或者只能在平地上走。我们在实验室里已经接触到一些尚未公开的成果。跳跃机器人可以在校园里很快地跑,可以跨越障碍,也能适应不同地形。我觉得这是机器人领域很大的技术突破,未来的可能性或许比人形更广。
公司从第一天起就在讨论它能用在哪里。能想到的方向很多,现阶段直接进入某个场景还太早。我们有一点很明确,这项技术未来有机会改变世界,我们想推动它往前走。
动察 Beating:在场景还没有完全明确的时候,第一轮投资人为什么愿意投你们?
王方正:愿意投我们的机构,算得上愿意投早、投小、投硬科技。很多硬科技在最早期都很难说清眼前有哪个明确场景,投资人先看技术本身。
现在这一轮和种子轮相比,产品有了很大进展,我们对路径的思考也更清楚。先从发烧友开始,再形成社区,让大家共同开发这项技术、一起探索场景。我们已经把这条路和其中的几个里程碑想得更明确了。
动察 Beating:你会把眺月科技定义成商业公司,还是一个新的实验室?
王方正:我们是一家科技公司。公司这一侧负责科研成果转化,把产品做好,让技术尽快进入生活。
实验室也是很重要的一部分。我和师兄、导师一直保持合作,他们现在都在高校任教。实验室的新成果会交给公司转化,眺月科技可以持续接触到最前沿的跳跃技术。
如果只看公司一侧,科研和商业化投入大概各占一半。实验室一侧做纯科研。
动察 Beating:你们刚加入地瓜机器人的生态,也参加了「地心引力 DemoDay 2026」。现在最需要他们提供什么支持?
王方正:我们刚加入地瓜机器人的生态。参加那次 DemoDay,主要还是希望认识更多投资人。公司正在进行第二轮融资,现阶段最需要的是资金。
有了钱,我们才能招更多人,让技术发展得更快。科研要继续投入,产品量产要准备,市场也要开始做。
动察 Beating:DemoDay 的体验怎么样?
王方正:我很感谢他们。我们报名时,大部分项目好像已经定了,海报上只剩下最后两个名额。我一开始觉得自己可能是去凑数的。
后来证明,我们的产品确实很惊艳,我讲得也不错。最后拿到第三名,还带着一万元奖金回家,我挺开心的。
动察 Beating:新一轮融资推进得怎么样?投资人最常问你的问题是什么?
王方正:目前进展还算顺利。很多人上来第一个问题就是,你们这东西能干什么,场景在哪里。第一个问题这样问的人,聊到最后大概率也不会真的感兴趣。他可能长期看消费电子,还没有用硬科技的视角理解这件事。我们的第一代产品根据调研数据来看,可以卖得很好,为公司增加造血能力,但我们更希望的是投资人能以科技进步的视角来支持我们未来的发展策略。
大家对跳跃机都有兴趣,争论也很大。我听说一些投资机构内部的争论,和我们抖音评论区很像。一类人更在乎多久能盈利、什么时候找到 PMF。也有人真心热爱科技发展,他相信这项技术以后一定有用,愿意先推动它。
动察 Beating:你怎么看这两种判断的冲突?
王方正:我觉得是看得近和看得远。
宇树是一个很好的例子。和我聊过的很多投资人,以前投过宇树,或者想投却没投上。宇树在上春晚以前融资也不容易。它火起来前后,人们都很难说清它最确定的场景,除了高校实验室和开发者市场。变化最大的是市场对它的看法。
眺月科技现在可能比宇树最早期还早。宇树开始时,前面已经有波士顿动力。我们有点像波士顿动力最早把机器人跳舞视频放出来的时候,大家刚刚看见这种东西。想让世界知道跳跃机有多厉害、未来能做什么,路还很远。
泡沫里的实在
机器人是 2026 年最热的创业方向之一。王方正承认行业里有泡沫,也有人劝他顺着热度讲一个更大的故事。先拿一批 B 端意向,再把融资规模放大,等钱到手以后慢慢找方向。这套方法没有说服他。
他喜欢小米和宇树,理由都落在「实在」两个字上。他对马斯克的评价也沿着同一条线展开,佩服一个人把科技做出来的能力,同时保留对赚钱方式和企业家责任的判断。
动察 Beating:你最喜欢哪一家科技公司?
王方正:小米。首先我很佩服雷军。从早期创业受挫,到金山、小米,再到小米汽车,他一直在奋斗,也在实现更大的人生价值。
小米是一家很实在的公司。它进入一个行业以后,往往会重新洗牌,很多信息和价格会变得更透明。一家科技公司应该给普通人带来实打实的好处,我觉得小米做到了。
动察 Beating:现在机器人行业的泡沫大吗?
王方正:我觉得大。有其他 FA 找过我们,说我们现在讲的故事不对。他们觉得我们应该像一些融资很快的机器人公司一样,拿很多 to B 合作意向,再讲一个很大的故事。手里先握着五十亿元,后面想怎么发展都可以。
我们暂时不想这样做。我们认可哪条路,就讲哪条路。
汽车就是一种很好的机器人。它每天走的道路基本固定,建筑物和道路也不会突然变化,底下四个轮子,动力学相对简单。每天还有那么多汽车在收集数据,自动驾驶到现在依然没有完全实现。
人形机器人的结构复杂得多,要投入生产、进入家庭,还有很长的路。跳跃机的动力学可以完整解析,成本更低,结构也更简洁。我们有机会可以比人形机器人更早地让跳跃机进入实际的工作场景。
动察 Beating:你怎么看马斯克?
王方正:在美国的资本主义环境里,他把整套商业规则玩得很明白。他有科技理想,也很懂得怎样赚钱,币圈那一套他也会用。
只看他对科技领域的帮助和创业成绩,我非常佩服他,确实很厉害。但把一个人的全部放在一起评价,我希望未来有人能做得比他更好。
活到十年以后
采访当天上午,宇树科技在上海证券交易所科创板上市。王方正的朋友圈里,投资人纷纷发出祝贺,有些人也在这笔投资里赚到了钱。
眺月科技离那一天还很远。公司仍在收集第一代产品的用户反馈,计划找 KOL 内测,并前往美国参展。它也刚拿到地瓜机器人 DemoDay 的第三名,正在为第二轮融资见投资人。王方正谈十年后的大疆和宇树,也清楚眼前最硬的条件是什么。
动察 Beating:香港的创业环境怎么样?你们拿到过哪些政府和学校的支持?
王方正:中国香港对科技创业的支持力度很大。我们的第一笔投资来自英诺中国香港。它背后的资金和中国香港支持初创的体系有联系。
我们还入选了港深创科园的培育计划。园区位于深圳和中国香港交界处,会给公司提供场地和补贴。政策层面很支持科技创业。
学校也很重要。中国香港城市大学有 HK Tech 300 计划,扶持了很多初创团队。对学生来说,创业第一步很难迈,学校的帮助很关键。
动察 Beating:接下来准备做哪些事?
王方正:最近主要在做用户调研,收集大家对产品的期望。我们会把产品化的小功能继续打磨,让第一代更好用。
之后可能会找 KOL 做内测。产品预计在 2027 年初参加完 CES 之后发售。
动察 Beating:十年以后,你希望眺月科技成为一家什么样的公司?
王方正:如果要找参照,我会选宇树和大疆。
假如未来出现一个非常明确、我们又有绝对优势的场景,就像航拍之于无人机,我们会针对这个场景自己独立开发相关技术,并争取做到百分之八十的市场占有率。那会是一条大疆式的路。
十年以后,如果跳跃机仍然没有一个体量很大的明确场景,还需要很多人共同探索,我们可能会更像宇树。
更重要的是,能活到十年以后。
动察 Beating:宇树上市这件事给你最大的感受是什么?
王方正:我看到朋友圈里很多投资人在祝贺,可能他们也跟着赚到了钱。宇树走了一条很踏实的路。在这些机器人公司里,我最喜欢的还是宇树,它确实带动了足式机器人的发展。
很多人投资宇树,尤其是后面几轮的投资人,看中的是市场热度和市占率。他们未必认可技术本身有多前沿,也未必认可这条踏实做事的路线。对一家科技公司来说,我觉得这件事有一点可笑。
我接触过其中一些人。假如让他们早几年去和王兴兴聊,他们大概率不会投。
动察 Beating:你觉得这样的投资人在市场上占多大比重?
王方正:我没有说他们不好。投资人要对 LP 负责,当然会投认知范围内、能够理解,也更容易看到明确收益的项目。我完全理解。
这样的投资人在市场上占比还是很高。人民币基金里,比例可能更高。
Raibert 在《Legged Robots That Balance》里写的,是一条腿怎样保持平衡。那时没有人能从那台不断起落的机器上,直接看见三十多年后的 Spot。研究留下来的东西,是一套关于动态平衡的原理。它后来长出两条腿、四条腿,也长出了一家公司。
王方正正在走一条方向更直接的路。他手里已经有一台会跳的机器,接下来要把它变成有人买、有人继续用的产品。这个过程不会只靠一次漂亮的跳跃完成。
一台机器每次落地,弹簧都会压缩。想再跳起来,先得接住自己的重量。
原文链接
Статья
OpenAI投资的110亿美元估值法律AI独角兽,开始「套壳」中国开源模型原文标题:《OpenAI投资的110亿美元估值法律AI独角兽,开始「套壳」中国开源模型》 原文作者:动察Beating 8 月 20 日,OpenAI 投资的法律 AI 公司 Harvey 发布 Tenet。这家 2022 年成立的公司现在估值 110 亿美元,是全球估值最高的法律 AI 公司,服务上千家机构,股东名单里还有红杉、a16z 和 GIC。 Tenet 是它第一套自有模型,底座用的是月之暗面 7 月开放权重的 Kimi K3。Tenet 目前仍处在研究预览阶段,Harvey 计划把其中验证过的能力逐步放进产品。 Harvey 的创始人 Winston Weinberg 原本是 O'Melveny & Myers 的诉讼律师,Gabe Pereyra 做过 Google Brain 和 Meta 的大模型研究。OpenAI 很早就投了它,此后双方还一起训练过一套案例法模型,把约 100 亿 token 的美国案例法数据加入训练。OpenAI 当时发布的客户案例里,Pereyra 说 Harvey 评估过不同方案,最后只信任与 OpenAI 一起完成这次定制训练。 过去几年,它几乎一直是闭源模型在专业服务行业最典型的客户,也一直能调用全球最强的一批闭源模型。但当它第一次决定把自己的法律任务、律师的评分标准和两个月的算力真正写进一套权重,选中的底座却是一个来自中国的开放权重模型。 一个模型发布以后,行业很快就会知道两件事。它有多聪明,以及这些能力卖多少钱。几个小时之内,基准测试更新,Arena 排名变化,各种智能和价格的坐标图开始流传。一个训练了几个月、消耗大量算力的模型,最后被压缩成图上的一个点。 对多数开发者来说,这套方法依然有效。它背后的前提是,模型交到用户手里时,能力已经基本定型。闭源 API 占主流时,这个前提是成立的。模型公司完成预训练和后训练,再把能力封装成接口。下游企业可以改提示词、做检索、搭智能体,但很难继续改变模型本身。 开放权重把这个前提打破了。企业拿到权重以后,可以继续放入自己的数据和专家反馈,把真实任务和评价标准带进训练。同样是发布时拿到 90 分的两个模型,用同一批数据和算力继续训练,一个最后停在 91 分,另一个可以到 97 分。对准备投入几个月时间、算力和专家资源的公司来说,发布时相同的 90 分,已经是天壤之别了。 不过这件事有个前提。企业愿意押上几个月时间和一批算力去继续训练,首先得有一套值得训练的权重。过去几年开放模型和最前沿的闭源模型之间始终隔着一段距离,通用问答和日常写代码上差得不算多,一旦进入错误代价很高的专业场景,这段距离就会被放大。法律又是其中要求最高的那一类,过去能真正进入 Harvey 这类公司核心业务的,基本都是当时能力最强的一批闭源模型。开放权重当然更容易控制和改造,但如果连最基本的专业任务都完成不了,后面的训练空间也就无从谈起。 Kimi K3 让这道长期存在的门槛第一次被跨过。它的总参数达到 2.8 万亿,支持 100 万 token 上下文,在长程任务、工具使用和复杂推理上已经具备较好的基础能力。对 Harvey 来说,开放权重模型第一次不再只是一个成本更低、控制权更多的备选方案,开始进入了可以和前沿模型一起被认真评估的范围。 于是它们开始关心一个过去很少被单独拿出来讨论的问题,这套权重到底有多容易被继续训练。 Cursor 训练 Composer 2 时就没有按照常见的编程智能体榜单挑模型。它的判断是,智能体和长程任务能力会在强化学习过程中发生很大变化,训练开始前的排名未必能预测最后的结果。相比榜单分数,Cursor 更看重模型的编程知识、状态追踪能力、在内部代码库上的困惑度,以及它在自家基础设施里的运行效率。最后被选中的底座是 Kimi K2.5 模型。 Devin 背后的 Cognition 也有相同的判断。K3 开放权重之后,它很快把模型接进 Devin Desktop 和 CLI,在自家的 FrontierCode 1.1 Extended 上,K3 拿到 58.2% 的分数和 63.6% 的通过率。这套测试考察的是真实工程任务,代码最后能不能合进主干、质量够不够都要计入。Cognition 还提到,K3 在复现 bug 和管理自己的运行环境上表现尤其好,这两件事恰恰是长程编程任务里最容易掉链子的环节。它随后也在这套权重上做了后训练。 真正稀缺的不是法律数据 Harvey 增长很快。今年 3 月,它服务约 1300 家机构和超过 10 万名律师,五个月之后客户数量就翻了将近一倍,覆盖 70 个国家,AmLaw 100 中超过四分之三的律所都在使用 Harvey。 法律服务的项目金额高,对错误的容忍度很低。一份并购尽调报告,可能要从成百上千份文件里找到控制权变更条款,判断交易是否触发,再识别风险并附上原文依据。中间往往有几十个判断需要连续成立,只要漏掉一个真正影响交易的问题,前面做对的大部分工作都没有太大意义。 随着服务的律所越来越多,Harvey 手里也积累起一类基础模型公司很难自己获得的数据。它知道律师会怎样布置一项工作,也知道最后拿到结果的合伙人会从哪里挑错。 这些经验后来被做成了 Legal Agent Benchmark。里面已经有超过 1200 个长程法律任务,覆盖 24 个执业领域。每个任务的说明平均只有约 50 个词,模型随后会进入一个封闭的客户事项环境。相关文件和大量无关材料混在一起,它需要自己搜索、阅读、判断,最后交出一份能够被逐项检查的工作成果。 每项任务平均有约 50 条评分标准,复杂任务可以达到几百条。事实有没有找全,结论能不能成立,引用是否对应原文,风险等级和建议是否合理,都会被拆成可以单独判定的评分项。一项任务最长可以持续超过 1000 轮,消耗几十万 token。 年轻律师工作几年以后,会慢慢知道客户真正担心什么,也会记住哪些看起来不起眼的条款不能漏掉。这些经验过去很难被完整写进教材,大多留在合伙人的修改、团队内部的工作习惯,以及一份份已经交付的文件里。 Harvey 把其中一部分拆成任务、材料和评分标准,模型每一次完成工作的过程,也就有了可以被计算和比较的反馈。 提示词和检索能告诉模型去哪里找,评分标准则开始回答另一个问题,一项法律工作究竟做到什么程度才算完成。Harvey 过去几年真正积累下来的,除了客户和法律数据,还有一套能够直接用于模型训练的专业评价体系。 把法律经验写进权重 那些任务和评分标准开始真正进入训练,数据来自公开法律材料、合成数据和人类专家数据,执业律师参与任务构造、评分和合成数据复核。Harvey 一共准备了约 1750 个法律智能体任务环境。 模型进入带有材料和工具的工作空间以后,要自己阅读文件、调用工具并提交结果,系统再按照律师制定的标准检查整条工作轨迹,看具体要求完成了多少,法律问题解决到了什么程度。关键要求全部通过,还会获得额外奖励。 每个训练周期会产生超过一万条任务轨迹。Harvey 使用组序列策略优化,也就是 GSPO,让模型在同一个任务上产生多种做法,再根据结果之间的质量差异更新权重。两条轨迹得分过于接近时,系统还会重新评分,减少评价噪声对训练的影响。 整个过程持续约两个月,使用约 150 张 NVIDIA B300。预训练一套前沿模型通常要动用上万张卡,Harvey 这次投入的算力是另一个量级。Harvey 采用 rank-64 LoRA,覆盖 Kimi K3 的注意力层、前馈网络和路由专家权重,涉及约 50 万个专家张量。 长轨迹训练还面临着一个工程问题。一项法律任务可能持续几百轮,模型还在生成任务轨迹时,训练端的权重已经发生了更新。等训练器回头计算这条轨迹时,如果两边的模型状态对不上,当时每一步动作对应的概率也会发生变化,奖励就很难准确作用到原来的决策上。 Kimi K3 的混合专家结构让这个问题更复杂。每个 token 进入模型后,路由器会从 896 个专家中选择 16 个参与计算。训练端和执行端只要在数值精度、批处理方式上存在细小差异,同一个 token 就可能被分给不同的专家,原来的轨迹也就难以完整复现。 Harvey 和它的供应商因此把训练器和执行环境在内核层做了数值对齐。权重每完成一次更新,就直接热加载进执行环境,不需要反复停下任务生成。系统还会记录 token 对应的专家路由结果,让训练器重新计算时尽可能回到模型生成这条轨迹时走过的路径。 做到这里,Tenet 已经不太像一次把法律语料加入模型的常规微调。Harvey 搭起来的是一套可以反复运行的训练流程。法律任务不断进入环境,模型完成工作,律师制定的标准评价整条轨迹,权重随后更新,新模型再回到环境里做下一轮任务。 Kimi K3 能不能被稳定地继续训练,也是在这样的循环里被实际检验出来的。 训练之后,它更像一个法律 Agent Harvey 真正想提高的是模型完成长程法律工作的能力。它采用了很严格的 all-pass 口径,一项任务里的关键评分标准必须全部通过。按照 Harvey 公布的内部结果,在没有参与训练的 LAB 保留集上,Tenet 完整完成的任务数量接近原始 Kimi K3 的两倍,all-pass 率从约 11% 提高到 19.7%,增加约 9 个百分点。 在专门测试合同起草、审查和谈判的 LAB Contracts 中,完成任务数量增加约 20%,all-pass 率达到 11.3%,提高约 2 个百分点。按照 Harvey 自己的榜单,Tenet 在 LAB Contracts 排名第一,在完整 LAB 中排名第二。 它随后又把 Tenet 放进两套外部测试,Mercor 的 APEX Agents Corporate Law 和 Crosby 的 Redline Bench。前者测试模拟工作环境中的长程专业任务,后者要求模型连续修改合同,再按照律师制定的标准评分。 Tenet 没有接触过这两套测试的训练数据,成绩仍然明显高于原始 Kimi K3,说明在 Harvey 任务环境里练出来的能力,可以迁移到新的法律任务里。 不过,另一个问题是,专业后训练往往会让模型越来越擅长某一类工作,同时丢掉一部分原来的知识和推理能力。 在 LegalBench、CUAD 和 MAUD 上,Tenet 没有出现明显退步。Scale Professional Reasoning Benchmark 的困难子集中,得分还从 36.0% 小幅升到 36.8%。至少从这组结果看,Kimi K3 在法律任务上变得更强以后,没有出现明显的能力遗忘问题。 Harvey 的奖励设计会在结果质量接近时偏向更短的轨迹,因为法律智能体每多读一份文件、多调用一次工具,都会增加 token 消耗和等待时间。训练之后,Tenet 减少了一部分无效步骤,任务质量提高的同时,完成工作的成本基本保持稳定。 这次后训练改变得更多的,是 Kimi K3 处理复杂法律工作的方式。它更会安排步骤、调用工具,也更少漏掉任务里的关键要求。 Harvey 早在 2025 年就开始采用多模型策略,今年仍在持续接入 OpenAI 和 Anthropic 的新模型。Tenet 终于让这套体系里第一次多出了一套由 Harvey 自己训练、自己控制的开放权重模型。 它需要的是一套底座本身就已经过关的模型。Harvey 的法律任务可能要处理大量文件,连续执行几百甚至上千轮操作,模型还要在漫长的工作过程中维持状态。后训练可以继续塑造它处理法律工作的方式,却很难从头补上一套底座原本并不具备的能力。 另一个条件是控制权。Harvey 可以通过 API 调用 GPT 和 Claude,却没办法把 1750 个法律任务环境和律师的评价标准继续写进这些闭源模型。开放权重让它可以自己决定怎样训练、怎样设计奖励,也可以把训练出来的专业能力留在自己掌握的权重里。 不过拿到权重之后,还要考察这套模型适不适合继续训练。长轨迹强化学习能不能稳定跑下去,混合专家的路由能不能准确复现,专业能力提高以后会不会丢掉原来的知识,推理成本还能不能控制在生产可用的范围内,都要真正试过一次才知道。 Tenet 跑完两个月以后,Kimi K3 给出了这一轮答案。训练过程能够稳定运行,法律任务能力出现明显增长,没有看到显著的能力遗忘,成本也没有随着效果一起失控。 对 Harvey 来说,这些结果比「开放权重」本身更重要。权重可以下载,只说明企业有资格继续训练。训练之后还能留下多少能力,才决定这套模型值不值得继续投入算力、数据和专家时间。 模型公司的另一门生意 Harvey 说,它的目标是让律所能够在开放权重上训练自己的专有模型,并且拥有训练以后形成的能力。Tenet 交出来的与其说是一套模型,不如说是一套做法。 过去,基础模型公司的生意大多发生在模型发布以后的调用里。开放权重带来了另一种关系,一家公司可以拿现成的基础模型继续训练,把自己的行业知识留进权重,最后得到一套更接近自身业务的模型。 这类需求以前很难形成一个真正的市场。通用模型能力不够强时,垂直公司即使拿到权重,也很难只靠后训练补齐长程推理、工具调用和复杂任务处理。自己从头预训练又太贵,多数公司根本没有必要做。 Cursor 在编程里训练出了 Composer 2,Cognition 也在同一套权重上继续训练了 Devin 用的模型,Harvey 又在法律里做出了 Tenet。编程和法律相距很远,却都选择从 Kimi 已经训练好的通用能力出发,再把自己最熟悉的专业工作继续放进去。 Tenet 也让这件事的门槛变得具体。两个月,约 150 张卡,加上一套由执业律师定义的评价标准,一家公司就可以把一套通用权重推到自己行业的前沿。算力门槛已经下降了一个数量级,更难复制的部分开始落到另一端,有没有人能够说清楚,一项专业工作做到什么程度才算完成。 软件开发和法律只是已经出现的两个案例。金融、咨询、医药、会计,以及大量专业服务行业,都有自己的数据、工作流和专家判断。这些行业本身就是规模以万亿美元计算的知识工作市场。里面最头部的公司未必会自己预训练基础模型,却越来越有条件在一套成熟权重上继续训练属于自己的模型。 如果这条路径继续成立,Kimi 面对的市场就不再只是有多少人调用它。接下来更值得关注的是,Harvey、Cursor 和 Devin 之后,还会有多少公司选择在 Kimi 上训练自己的模型。 原文链接

OpenAI投资的110亿美元估值法律AI独角兽,开始「套壳」中国开源模型

原文标题:《OpenAI投资的110亿美元估值法律AI独角兽,开始「套壳」中国开源模型》
原文作者:动察Beating
8 月 20 日,OpenAI 投资的法律 AI 公司 Harvey 发布 Tenet。这家 2022 年成立的公司现在估值 110 亿美元,是全球估值最高的法律 AI 公司,服务上千家机构,股东名单里还有红杉、a16z 和 GIC。
Tenet 是它第一套自有模型,底座用的是月之暗面 7 月开放权重的 Kimi K3。Tenet 目前仍处在研究预览阶段,Harvey 计划把其中验证过的能力逐步放进产品。
Harvey 的创始人 Winston Weinberg 原本是 O'Melveny & Myers 的诉讼律师,Gabe Pereyra 做过 Google Brain 和 Meta 的大模型研究。OpenAI 很早就投了它,此后双方还一起训练过一套案例法模型,把约 100 亿 token 的美国案例法数据加入训练。OpenAI 当时发布的客户案例里,Pereyra 说 Harvey 评估过不同方案,最后只信任与 OpenAI 一起完成这次定制训练。
过去几年,它几乎一直是闭源模型在专业服务行业最典型的客户,也一直能调用全球最强的一批闭源模型。但当它第一次决定把自己的法律任务、律师的评分标准和两个月的算力真正写进一套权重,选中的底座却是一个来自中国的开放权重模型。
一个模型发布以后,行业很快就会知道两件事。它有多聪明,以及这些能力卖多少钱。几个小时之内,基准测试更新,Arena 排名变化,各种智能和价格的坐标图开始流传。一个训练了几个月、消耗大量算力的模型,最后被压缩成图上的一个点。
对多数开发者来说,这套方法依然有效。它背后的前提是,模型交到用户手里时,能力已经基本定型。闭源 API 占主流时,这个前提是成立的。模型公司完成预训练和后训练,再把能力封装成接口。下游企业可以改提示词、做检索、搭智能体,但很难继续改变模型本身。
开放权重把这个前提打破了。企业拿到权重以后,可以继续放入自己的数据和专家反馈,把真实任务和评价标准带进训练。同样是发布时拿到 90 分的两个模型,用同一批数据和算力继续训练,一个最后停在 91 分,另一个可以到 97 分。对准备投入几个月时间、算力和专家资源的公司来说,发布时相同的 90 分,已经是天壤之别了。
不过这件事有个前提。企业愿意押上几个月时间和一批算力去继续训练,首先得有一套值得训练的权重。过去几年开放模型和最前沿的闭源模型之间始终隔着一段距离,通用问答和日常写代码上差得不算多,一旦进入错误代价很高的专业场景,这段距离就会被放大。法律又是其中要求最高的那一类,过去能真正进入 Harvey 这类公司核心业务的,基本都是当时能力最强的一批闭源模型。开放权重当然更容易控制和改造,但如果连最基本的专业任务都完成不了,后面的训练空间也就无从谈起。
Kimi K3 让这道长期存在的门槛第一次被跨过。它的总参数达到 2.8 万亿,支持 100 万 token 上下文,在长程任务、工具使用和复杂推理上已经具备较好的基础能力。对 Harvey 来说,开放权重模型第一次不再只是一个成本更低、控制权更多的备选方案,开始进入了可以和前沿模型一起被认真评估的范围。
于是它们开始关心一个过去很少被单独拿出来讨论的问题,这套权重到底有多容易被继续训练。
Cursor 训练 Composer 2 时就没有按照常见的编程智能体榜单挑模型。它的判断是,智能体和长程任务能力会在强化学习过程中发生很大变化,训练开始前的排名未必能预测最后的结果。相比榜单分数,Cursor 更看重模型的编程知识、状态追踪能力、在内部代码库上的困惑度,以及它在自家基础设施里的运行效率。最后被选中的底座是 Kimi K2.5 模型。
Devin 背后的 Cognition 也有相同的判断。K3 开放权重之后,它很快把模型接进 Devin Desktop 和 CLI,在自家的 FrontierCode 1.1 Extended 上,K3 拿到 58.2% 的分数和 63.6% 的通过率。这套测试考察的是真实工程任务,代码最后能不能合进主干、质量够不够都要计入。Cognition 还提到,K3 在复现 bug 和管理自己的运行环境上表现尤其好,这两件事恰恰是长程编程任务里最容易掉链子的环节。它随后也在这套权重上做了后训练。
真正稀缺的不是法律数据
Harvey 增长很快。今年 3 月,它服务约 1300 家机构和超过 10 万名律师,五个月之后客户数量就翻了将近一倍,覆盖 70 个国家,AmLaw 100 中超过四分之三的律所都在使用 Harvey。
法律服务的项目金额高,对错误的容忍度很低。一份并购尽调报告,可能要从成百上千份文件里找到控制权变更条款,判断交易是否触发,再识别风险并附上原文依据。中间往往有几十个判断需要连续成立,只要漏掉一个真正影响交易的问题,前面做对的大部分工作都没有太大意义。
随着服务的律所越来越多,Harvey 手里也积累起一类基础模型公司很难自己获得的数据。它知道律师会怎样布置一项工作,也知道最后拿到结果的合伙人会从哪里挑错。
这些经验后来被做成了 Legal Agent Benchmark。里面已经有超过 1200 个长程法律任务,覆盖 24 个执业领域。每个任务的说明平均只有约 50 个词,模型随后会进入一个封闭的客户事项环境。相关文件和大量无关材料混在一起,它需要自己搜索、阅读、判断,最后交出一份能够被逐项检查的工作成果。
每项任务平均有约 50 条评分标准,复杂任务可以达到几百条。事实有没有找全,结论能不能成立,引用是否对应原文,风险等级和建议是否合理,都会被拆成可以单独判定的评分项。一项任务最长可以持续超过 1000 轮,消耗几十万 token。
年轻律师工作几年以后,会慢慢知道客户真正担心什么,也会记住哪些看起来不起眼的条款不能漏掉。这些经验过去很难被完整写进教材,大多留在合伙人的修改、团队内部的工作习惯,以及一份份已经交付的文件里。
Harvey 把其中一部分拆成任务、材料和评分标准,模型每一次完成工作的过程,也就有了可以被计算和比较的反馈。
提示词和检索能告诉模型去哪里找,评分标准则开始回答另一个问题,一项法律工作究竟做到什么程度才算完成。Harvey 过去几年真正积累下来的,除了客户和法律数据,还有一套能够直接用于模型训练的专业评价体系。
把法律经验写进权重
那些任务和评分标准开始真正进入训练,数据来自公开法律材料、合成数据和人类专家数据,执业律师参与任务构造、评分和合成数据复核。Harvey 一共准备了约 1750 个法律智能体任务环境。
模型进入带有材料和工具的工作空间以后,要自己阅读文件、调用工具并提交结果,系统再按照律师制定的标准检查整条工作轨迹,看具体要求完成了多少,法律问题解决到了什么程度。关键要求全部通过,还会获得额外奖励。
每个训练周期会产生超过一万条任务轨迹。Harvey 使用组序列策略优化,也就是 GSPO,让模型在同一个任务上产生多种做法,再根据结果之间的质量差异更新权重。两条轨迹得分过于接近时,系统还会重新评分,减少评价噪声对训练的影响。
整个过程持续约两个月,使用约 150 张 NVIDIA B300。预训练一套前沿模型通常要动用上万张卡,Harvey 这次投入的算力是另一个量级。Harvey 采用 rank-64 LoRA,覆盖 Kimi K3 的注意力层、前馈网络和路由专家权重,涉及约 50 万个专家张量。
长轨迹训练还面临着一个工程问题。一项法律任务可能持续几百轮,模型还在生成任务轨迹时,训练端的权重已经发生了更新。等训练器回头计算这条轨迹时,如果两边的模型状态对不上,当时每一步动作对应的概率也会发生变化,奖励就很难准确作用到原来的决策上。
Kimi K3 的混合专家结构让这个问题更复杂。每个 token 进入模型后,路由器会从 896 个专家中选择 16 个参与计算。训练端和执行端只要在数值精度、批处理方式上存在细小差异,同一个 token 就可能被分给不同的专家,原来的轨迹也就难以完整复现。
Harvey 和它的供应商因此把训练器和执行环境在内核层做了数值对齐。权重每完成一次更新,就直接热加载进执行环境,不需要反复停下任务生成。系统还会记录 token 对应的专家路由结果,让训练器重新计算时尽可能回到模型生成这条轨迹时走过的路径。
做到这里,Tenet 已经不太像一次把法律语料加入模型的常规微调。Harvey 搭起来的是一套可以反复运行的训练流程。法律任务不断进入环境,模型完成工作,律师制定的标准评价整条轨迹,权重随后更新,新模型再回到环境里做下一轮任务。
Kimi K3 能不能被稳定地继续训练,也是在这样的循环里被实际检验出来的。
训练之后,它更像一个法律 Agent
Harvey 真正想提高的是模型完成长程法律工作的能力。它采用了很严格的 all-pass 口径,一项任务里的关键评分标准必须全部通过。按照 Harvey 公布的内部结果,在没有参与训练的 LAB 保留集上,Tenet 完整完成的任务数量接近原始 Kimi K3 的两倍,all-pass 率从约 11% 提高到 19.7%,增加约 9 个百分点。
在专门测试合同起草、审查和谈判的 LAB Contracts 中,完成任务数量增加约 20%,all-pass 率达到 11.3%,提高约 2 个百分点。按照 Harvey 自己的榜单,Tenet 在 LAB Contracts 排名第一,在完整 LAB 中排名第二。
它随后又把 Tenet 放进两套外部测试,Mercor 的 APEX Agents Corporate Law 和 Crosby 的 Redline Bench。前者测试模拟工作环境中的长程专业任务,后者要求模型连续修改合同,再按照律师制定的标准评分。
Tenet 没有接触过这两套测试的训练数据,成绩仍然明显高于原始 Kimi K3,说明在 Harvey 任务环境里练出来的能力,可以迁移到新的法律任务里。
不过,另一个问题是,专业后训练往往会让模型越来越擅长某一类工作,同时丢掉一部分原来的知识和推理能力。
在 LegalBench、CUAD 和 MAUD 上,Tenet 没有出现明显退步。Scale Professional Reasoning Benchmark 的困难子集中,得分还从 36.0% 小幅升到 36.8%。至少从这组结果看,Kimi K3 在法律任务上变得更强以后,没有出现明显的能力遗忘问题。
Harvey 的奖励设计会在结果质量接近时偏向更短的轨迹,因为法律智能体每多读一份文件、多调用一次工具,都会增加 token 消耗和等待时间。训练之后,Tenet 减少了一部分无效步骤,任务质量提高的同时,完成工作的成本基本保持稳定。
这次后训练改变得更多的,是 Kimi K3 处理复杂法律工作的方式。它更会安排步骤、调用工具,也更少漏掉任务里的关键要求。
Harvey 早在 2025 年就开始采用多模型策略,今年仍在持续接入 OpenAI 和 Anthropic 的新模型。Tenet 终于让这套体系里第一次多出了一套由 Harvey 自己训练、自己控制的开放权重模型。
它需要的是一套底座本身就已经过关的模型。Harvey 的法律任务可能要处理大量文件,连续执行几百甚至上千轮操作,模型还要在漫长的工作过程中维持状态。后训练可以继续塑造它处理法律工作的方式,却很难从头补上一套底座原本并不具备的能力。
另一个条件是控制权。Harvey 可以通过 API 调用 GPT 和 Claude,却没办法把 1750 个法律任务环境和律师的评价标准继续写进这些闭源模型。开放权重让它可以自己决定怎样训练、怎样设计奖励,也可以把训练出来的专业能力留在自己掌握的权重里。
不过拿到权重之后,还要考察这套模型适不适合继续训练。长轨迹强化学习能不能稳定跑下去,混合专家的路由能不能准确复现,专业能力提高以后会不会丢掉原来的知识,推理成本还能不能控制在生产可用的范围内,都要真正试过一次才知道。
Tenet 跑完两个月以后,Kimi K3 给出了这一轮答案。训练过程能够稳定运行,法律任务能力出现明显增长,没有看到显著的能力遗忘,成本也没有随着效果一起失控。
对 Harvey 来说,这些结果比「开放权重」本身更重要。权重可以下载,只说明企业有资格继续训练。训练之后还能留下多少能力,才决定这套模型值不值得继续投入算力、数据和专家时间。
模型公司的另一门生意
Harvey 说,它的目标是让律所能够在开放权重上训练自己的专有模型,并且拥有训练以后形成的能力。Tenet 交出来的与其说是一套模型,不如说是一套做法。
过去,基础模型公司的生意大多发生在模型发布以后的调用里。开放权重带来了另一种关系,一家公司可以拿现成的基础模型继续训练,把自己的行业知识留进权重,最后得到一套更接近自身业务的模型。
这类需求以前很难形成一个真正的市场。通用模型能力不够强时,垂直公司即使拿到权重,也很难只靠后训练补齐长程推理、工具调用和复杂任务处理。自己从头预训练又太贵,多数公司根本没有必要做。
Cursor 在编程里训练出了 Composer 2,Cognition 也在同一套权重上继续训练了 Devin 用的模型,Harvey 又在法律里做出了 Tenet。编程和法律相距很远,却都选择从 Kimi 已经训练好的通用能力出发,再把自己最熟悉的专业工作继续放进去。
Tenet 也让这件事的门槛变得具体。两个月,约 150 张卡,加上一套由执业律师定义的评价标准,一家公司就可以把一套通用权重推到自己行业的前沿。算力门槛已经下降了一个数量级,更难复制的部分开始落到另一端,有没有人能够说清楚,一项专业工作做到什么程度才算完成。
软件开发和法律只是已经出现的两个案例。金融、咨询、医药、会计,以及大量专业服务行业,都有自己的数据、工作流和专家判断。这些行业本身就是规模以万亿美元计算的知识工作市场。里面最头部的公司未必会自己预训练基础模型,却越来越有条件在一套成熟权重上继续训练属于自己的模型。
如果这条路径继续成立,Kimi 面对的市场就不再只是有多少人调用它。接下来更值得关注的是,Harvey、Cursor 和 Devin 之后,还会有多少公司选择在 Kimi 上训练自己的模型。
原文链接
Статья
大厂 AI 竞赛,从技术周期走进资本周期原文标题:《大厂 AI 竞赛,从技术周期走进资本周期》 原文作者:动察Beating 8 月 23 日,阿里巴巴在中国香港市场启动新股配售,拟以每股 112.7 港元发行 7.1 亿股,募资 800 亿港元,约合 102 亿美元。若交易完成,这将成为中国香港上市公司史上规模最大的后续发行,也是 2026 年全球第三大同类融资,仅次于 Alphabet 和 Intel。 订单很快超过原定规模,主权基金入场,发行金额随需求上调。所得资金将全部投入 AI,覆盖芯片、基础设施、模型开发与部署。 三天前公布的二季度财报已经解释了这笔融资。AI 云与计算服务收入同比增长 45%,达到 484.4 亿元,资本开支同期增至 676.8 亿元,同比增长 75%。 同一个季度,经营现金流只有 229.5 亿元,自由现金流净流出 446.7 亿元。三年 3800 亿元的投资计划已经执行近半,吴泳铭上一季度又取消了原本的投入上限,称实际金额会远远超过原计划。按当前毛利水平粗算,这批 AI 基础设施大约需要三年回本。 阿里并不缺钱。截至 6 月底,公司仍持有 4745 亿元现金及其他流动性投资。这笔融资解决的是资本期限配置。经营现金流持续产生,数据中心却需要数年建设和回收,长期电力协议和二十年租约还会进一步拉长资金占用周期。长期用短期现金覆盖这类资产,会持续消耗财务弹性。权益资本没有固定到期日,更适合承担回收期漫长的投入。 AI 的资本开支开始改变互联网公司的资金结构。过去讨论的是有没有足够多的钱,现在还要讨论这笔钱应该以什么期限存在。 Alphabet 先调整的是股东回报。二季度公司收入增长 24%,Google Search 增长 17%,Google Cloud 增长 82%,集团营业利润率仍有 34%,核心业务几乎挑不出毛病。 同期经营现金流为 391 亿美元,资本开支却达到 449 亿美元,自由现金流第一次降至负 59 亿美元。董事会手里还有近 700 亿美元尚未使用的股票回购授权,2026 年上半年却没有回购一股普通股。 六年前,互联网巨头还在讨论怎么把不断积累的剩余现金还给股东。到了今年,Alphabet 把回购额度留在账上,自己重新进入资本市场融资。AI 开始改变利润在公司内部的分配顺序。 腾讯面对的是另一种压力。2026 年二季度资本开支 527 亿元,实际资本开支付款达到 593 亿元,上半年合计 847.2 亿元,半年已经超过 2025 年全年,当季自由现金流降至负 138 亿元。 腾讯在财报中补充了一种口径,剔除提前支付的 AI 算力采购款,自由现金流其实可以达到正 376 亿元。支付时间的变化,就足以制造五百多亿元的现金流差额。三个月里,腾讯净现金从 1468.6 亿元降至 581.9 亿元。 百度的问题更直接。二季度经营现金流只有 34.4 亿元,资本开支达到 113.9 亿元,自由现金流流出 79.5 亿元。 在线营销收入同比下降 19%,过去最重要的现金来源还在收缩;AI 云基础设施收入增长 50%,其中 GPU 云增长 283%,需要资本的新业务却已经进入加速期。 收入结构已经开始迁移,现金流结构还停留在过去。百度需要用一条不断收缩的旧业务现金流,为刚进入资本密集期的新业务付款。 资本开支本身也在变贵。TrendForce 在 5 月将全球九大云厂商 2026 年合计资本开支预估上调至约 8300 亿美元,同比增幅从 61% 提高到 79%。 增加的预算并不全部对应更多设备,零部件涨价已经吃掉相当一部分。微软约 1900 亿美元资本开支中,有 250 亿美元只用于消化零部件涨价;字节也因为内存价格上涨,把全年资本开支从 1600 亿元提高到超过 2000 亿元。 同一笔预算,能买到的算力比年初少了。 这些公司依然有很高的利润,也握着巨额现金,但资本已经不再宽松到可以忽略机会成本。自由现金流开始承压,回购可以推迟,融资需要增加,一笔钱投向算力,也就意味着它无法同时留给并购、旧业务或者另一条增长曲线。 过去十几年,充足的现金流给互联网公司提供了很长的试错周期。AI 正在缩短这种宽容。 资本从互联网公司的默认条件,重新变成了增长约束。 几乎所有大厂都已经选择继续投入。资本约束真正出现以后,下一轮竞争就进入了资本配置。过去可以同时下注的业务,现在开始需要分出先后。 AI 的机会成本开始 拆开阿里的报表,AI 本身已经处在不同的回报周期。 AI 云与计算服务季度经调整 EBITA 达到 56.3 亿元,同比增长 133%,已经开始贡献经营利润。模型和消费级应用仍在投入期,当季收入约 33.4 亿元,经调整 EBITA 亏损 138.6 亿元,亏损额是上年同期的四倍多。更下一轮的算力建设还在形成资产,回报尚未进入报表。 再加上即时零售和国际电商,阿里同时推进的几条增长曲线,开始争夺同一张资产负债表。 这种竞争很快会传导到旧业务。过去两年,阿里先后退出银泰和高鑫零售,8 月 17 日又与 Trustar 达成出售灵犀互娱的协议,交易据报超过 20 亿美元。灵犀仍拥有《三国志·战略版》这样的成熟产品,出售它已经很难简单解释为清理亏损资产。 字节对沐瞳的处理更明显。2021 年,字节以约 40 亿美元估值收购沐瞳;今年出售给沙特 PIF 旗下 Savvy Games 时,交易估值已经超过 60 亿美元。游戏一度是字节重点进入的新市场,沐瞳也仍在增值,但当集团内部的优先级改变,一项赚钱的资产同样可以退出。 微软甚至把这种重新排序带进了核心业务。690 亿美元收购 Activision Blizzard 还不到三年,Xbox 已经开始重新核算投入产出。7 月,微软宣布裁员 4800 人,其中约 3200 人来自游戏业务,四家工作室将被出售或分拆。 Bloomberg 披露的内部数据显示,剔除 Activision Blizzard 后,Xbox 过去五年在内容、平台和硬件补贴上的投入超过 200 亿美元,内部考核口径下的利润率已经降至 3%。 公司金融把这种状态称为资本配给。 资金足够宽松时,一项尚未被证伪的业务可以长期保留,战略可能性本身就有价值。AI 把资本开支推高以后,这种选择权开始有明确成本。每多留一项业务,就少一部分资金可以配置给算力和新的增长曲线。 出售所得未必直接流向 AI,但资本的比较标准已经改变。 战略价值已经不能单独构成继续占用资本的理由。 现金在减少,资产还在升值 AI 投资正在制造一种看起来矛盾的财务状态。现金先被数据中心和 GPU 消耗,形成的基础设施随后进入资产负债表;对 AI 公司的股权投资升值,又可能推高当期利润。 自由现金流恶化、资产扩张和利润增长,可以同时发生。 Amazon 是最极端的例子。截至今年 6 月的过去十二个月,公司经营现金流达到 1614 亿美元,同比增长 33%,设备及基础设施净采购额却同比增加 661 亿美元,自由现金流从一年前的流入 182 亿美元降至流出 76 亿美元。 同期 Amazon 净利润达到 626 亿美元,其中包含 534 亿美元非经营性税前收益,主要来自 Anthropic 投资升值。仅 Anthropic 非投票优先股的价格变化,就贡献了约 505 亿美元。 一边是 AI 基础设施吞掉现金,一边是 AI 股权重估推高利润。现金流和利润表开始讲两个不同的故事。 微软与 OpenAI 的关系更复杂。截至 2026 财年末,微软对 OpenAI 的投资承诺为 130 亿美元,其中 119 亿美元已经投入,按转换后口径持有约 25% 权益。同一个财年,微软又从双方的商业安排中确认了 241 亿美元收入,年末还有 60 亿美元应收账款。 OpenAI 既是微软的被投公司,也是它的大客户。股权上涨增加资产价值,模型调用、Azure 服务和收入分成又形成经营收入。一笔战略投资开始同时获得资本回报和经营回报。 腾讯则拥有更厚的资产存量。截至 6 月底,上市被投公司股份公允价值达到 4872 亿元,非上市被投公司账面价值还有 3879 亿元,合计接近 8751 亿元。与此同时,腾讯当季自由现金流为负 138 亿元,仍然拿出 169 亿港元回购股票。 自由现金流下降,削弱的是当期自行投入的能力,并不会同时抹掉过去积累的资产和长期盈利能力。 现金流决定一家公司能拿出多少钱,资产负债表决定它还能借到多少钱。 到了 2026 年,这两种能力开始出现明显分化。AI 投资继续扩大以后,资本市场看的已经不只是利润和现金,还包括资产质量、长期合同和未来的偿付能力。 大厂之间的融资成本,也因此开始拉开差距。 资本成本开始决定产能 AI 扩张到了这个阶段,公司能建多少数据中心,已经不只取决于芯片和电力,也取决于能以什么价格拿到多长期限的资金。 今年 6 月,Alphabet 通过公开发行和定向发行普通股,以及强制可转换优先股,连续完成三笔权益融资,合计募得 495 亿美元。同期又通过高级无担保债取得 203 亿美元净融资,仅二季度的外部融资就接近 700 亿美元,资金用途包括扩大 AI 基础设施和全球算力。 8 月 19 日,Alphabet 又首次进入澳大利亚债券市场,发行 55 亿澳元债券,最长一档达到 20 年,投资者订单超过 180 亿澳元。 一家过去主要依靠经营现金流完成投资的公司,开始同时使用股权、长期债务和不同币种的资本市场。AI 需要解决的已经不只是融资规模,还有资金期限和来源的稳定性。 整个行业都在发生类似变化。截至 7 月 7 日,Amazon、Alphabet、Meta 和 Oracle 今年已经发行约 1940 亿美元债券,比 2025 年全年高出 79%。五大云厂商新增债务相当于资本开支的比例,也从 2024 财年的 9% 升至今年 6 月的 32%。 当接近三分之一的新增资本开支需要依靠借款,信用本身就开始成为扩张条件。 问题在于,这笔钱对每家公司并不是一个价格。 Oracle 2026 财年自由现金流为负 237 亿美元,下一财年资本开支指引最高达到 950 亿美元。即使扣除客户可能返还的 250 亿美元,仍有约 700 亿美元需要自行承担。 7 月,标普将 Oracle 的信用评级下调至 BBB-,距离垃圾级只差一档。它的五年期信用违约互换一度升至 215 个基点,创十八年新高,债券收益率达到 7% 至 8%。同期 Alphabet 和 Amazon 的债券收益率只有大约 2.5% 至 3.5%。 为了维持投资级评级,Oracle 在 2026 财年已经发行 430 亿美元债券,并完成 50 亿美元股权融资,下一财年还计划再融资约 400 亿美元。 同样一批 GPU,设备采购价格不会相差太远,支撑它们的长期资金却可能相差几个百分点。 资本结构已经开始直接决定算力扩张的上限。 CoreWeave 说明,资金价格也可以通过融资结构重新定价。2023 年,公司以 GPU 作为主要信用基础融资时,利差一度高达基准利率上浮 9.62 个百分点。GPU 更新快、残值难以判断,本身并不是金融机构喜欢持有的长期抵押物。 今年 3 月,CoreWeave 通过项目公司完成 85 亿美元融资,把高性能计算基础设施和长期客户合同一起放进信用结构,贷款获得投资级评级,浮动利率降至基准利率上浮 2.25 个百分点,固定部分约为 5.9%。 两个月后,另一笔由信用较弱客户合同支持的 31 亿美元贷款,评级下降至投资级以下,利率也重新升至基准利率上浮 4.5 个百分点。 同一家 CoreWeave,同样建设 AI 算力,仅仅因为客户信用、合同期限和融资结构不同,资金价格就能相差两个百分点以上。 一家公司能够用 5% 的长期资金建设数据中心,另一家公司需要支付 9%,能够承受的回收周期、利用率和服务价格自然不同。资金越便宜,就越有能力接受更长的产能爬坡,也更有空间参与推理价格竞争。 芯片成本决定算力可以卖多便宜,资本成本决定这个价格能够维持多久。 降价能力开始成为融资能力的延伸。 真正锁住预算的是长期合同 资本开支记录的是已经发生的投资,长期合同锁定的却是未来十几年还能不能少花钱。 Meta 的财报已经拉开了这两个数字的距离。截至 6 月底,公司已经签署、但尚未开始执行的经营和融资租赁义务达到 2789.9 亿美元,主要用于数据中心、托管设施和网络基础设施,最长期限达到 30 年。7 月,Meta 又新增约 680 亿美元数据中心租赁,合同期限普遍在 18 至 20 年。 除此之外,公司还有 3493.1 亿美元不可取消的合同承诺,主要用于第三方云算力和技术基础设施。部分采购协议甚至要求提前存入保证资金,因此有 108 亿美元货币市场基金已经转为受限现金,要等到 2028 年至 2030 年相关义务完成后才能释放。 合同还没有真正开始履行,资金的自由度已经先下降了。 微软的规模更大。截至 2026 财年末,公司披露的合同义务达到 7438.2 亿美元,其中包括 3291 亿美元尚未开始的数据中心租赁,最长期限为 20 年。Alphabet 也有 852 亿美元尚未开始的数据中心租赁,最长达到 26 年,部分长期能源协议的期限同样超过二十年。 Reuters 根据五家公司最新披露计算,Microsoft、Meta、Oracle、Amazon 和 Alphabet 尚未开始的租赁付款合计约 1.09 万亿美元,接近表内已确认租赁负债的四倍。 真正把大厂锁进这一轮 AI 周期的,已经不只是今年花出去多少钱,还有今天替未来签下了多少预算。 这也改变了退出的成本。消费级应用效果不好,可以减少投放、缩小团队,甚至直接关掉。数据中心一旦进入建设,电力、土地、设备和租赁合同却不会跟着一个季度的业务判断消失。今天多建一座机房,可能意味着未来二十年都要为这个决定付款。 刘炽平在腾讯二季度业绩会上把 AI 资本开支解释为集中采购,大额投入主要发生在今年和明年,不应该简单外推成每年重复出现的固定规模。这个判断在现金支出层面成立,但长期合同有自己的时间表。采购可以集中完成,租金、电力和折旧却会继续进入此后多年的报表。 微软已经开始看到这种影响。2026 财年,公司服务器、网络设备和软件原值达到 2158.7 亿美元,上一财年还是 1328.4 亿美元;集团折旧费用也从 2024 年的 152 亿美元升至 2025 年的 220 亿美元,今年进一步达到 343 亿美元。 这里还有一层更难处理的期限错配。微软的服务器和网络设备通常按照两到六年折旧,部分数据中心租赁却长达二十年。芯片更新越来越快,如果实际经济寿命继续缩短,公司可以提前折旧甚至确认减值,但机房、电力和租赁合同不会因此缩短。 几年的芯片,开始被装进二十年的合同里。 算力开始成为一种资产 长期合同锁定了未来需求,建设资金却要在今天到位。 Morgan Stanley 测算,未来四年全球数据中心和相关硬件需要投入约 2.9 万亿美元,大型云厂商依靠自身资金只能覆盖其中约 1.4 万亿美元,剩下 1.5 万亿美元需要外部资本填补。其中约 8000 亿美元预计来自私募信贷,2000 亿美元来自投资级公司债,1500 亿美元来自数据中心证券化,其余由股权和主权资金承担。 当建设规模超过公司自身现金流,融资对象也开始发生变化。资本不再只判断一家公司值不值得借钱,而是单独判断一座数据中心、一批 GPU 和背后的长期合同值多少钱。 8 月 10 日,Nvidia 与 Apollo、BlackRock 等六家金融机构签署合作协议,计划建立算力基础设施融资平台,未来动员超过 5000 亿美元第三方资本。Nvidia 同时提出,要把算力变成一种可以被长期资金配置的资产。 这套结构已经开始落地。Valor 管理的 VCI 基金以 54 亿美元购买包括 Nvidia GB200 在内的算力设备,再长期租给 xAI;Apollo 管理的基金提供 35 亿美元资本方案,Nvidia 自己也参与出资。设备留在基金的资产端,xAI 把一次性采购转化为长期租金,未来的租金收入又成为今天融资的依据。 Meta 的 Hyperion 项目规模更大。预计约 270 亿美元的开发成本中,Blue Owl 管理的基金持有项目 80% 权益,Meta 保留 20%,建成后再长期租用。Meta 没有完全退出信用关系,还为项目运营前 16 年提供了有上限的残值保障。 资产可以移出大厂的资产负债表,信用仍然通过租约、客户合同和残值保障留在交易里。资本占用从今天被推向未来,建设资金则提前到位。 成熟的数据中心还可以进一步进入证券化市场。数据中心证券化产品的存量规模已经从 2020 年的 40 亿美元增至今年的 610 亿美元,在非传统证券化市场中的占比从 3% 升至约 12%。7 月,美国证券监管部门又进一步明确了部分数据中心证券的监管口径,符合条件的结构可以免于传统资产证券化产品的 5% 风险自留要求。 一套独立的融资市场正在形成。大厂的长期租约、模型公司的算力采购合同和数据中心本身,都可以被拆出来定价,再进入保险资金、私募信贷和基础设施基金的投资组合。 这也意味着,算力建设能够调用的资本,开始超过任何一家科技公司的经营现金流。 风险没有消失,只是被重新分配。未来需求如果低于预期,或者 GPU 残值下降,损失最终落在谁身上,取决于租约、担保和追索权如何安排。 算力金融化,就是把未来十几年的合同现金流,提前变成今天的建设资金。 重新定价风险 算力融资还没有出现大规模违约,但信用市场已经开始重新定价风险。 CoreWeave 今年完成的一笔 26 亿美元贷款很典型。贷款期限接近五年,底层客户合同平均只有三年,其中 Anthropic 相关合同约占四成。客户合同先到期,债务还没有还完,数据中心租约则可能继续十年以上。 投资人最初认购冷淡。CoreWeave 随后把收益率提高到接近 9.1%,并加入现金锁箱,要求相关合同收入优先进入受控账户偿债。条件收紧以后,订单迅速增至约 90 亿美元。 钱依然能够拿到,只是贷款人开始要求更高的收益和更强的控制权。 真正昂贵的是合同到期以后的几年。客户是否续约,旧 GPU 还能以什么价格出租,都会直接影响贷款价值。过去属于技术和运营的问题,开始进入信贷定价。 Reuters 统计,大型科技公司债券的认购倍数从 2 月接近 5 倍降至 7 月不足 2 倍。Amazon 7 月发债的认购倍数只有 1.6 倍,3 月还达到 3.4 倍。 信用收紧通常不会从「借不到钱」开始。订单先减少,新债需要给出更高收益,合同条款随后变严,发起人投入更多股本。只有当这些条件仍然无法匹配风险,新项目才会真正失去融资。 钱先变贵,然后才可能变少。 信用开始变贵以后,产业链上的其他公司也被迫承担更多风险。 8 月 10 日,黄仁勋表示,Nvidia 可以根据项目决定是否提供信用支持,上限约为潜在交易规模的 25%。一周后,OpenAI 在俄亥俄州的数据中心项目采用了更大的安排。OpenAI 签下 20 年租约,Nvidia 向项目提供最高 1050 亿美元的或有信用支持,同时向开发商 SB Energy 投资 15 亿美元。 这笔承诺覆盖部分租金、电力付款和场地残值,并不意味着 Nvidia 当期拿出同等规模的现金。但它改变了风险的归属。GPU 的销售收入可以在今天确认,下游项目未来二十年的部分履约风险,却开始进入 Nvidia 自己的信用。 资产可以转移,信用最终还要有人承担。 现在把这一轮算力金融化类比成「AI 次贷」还太早。大量核心项目最终由 Microsoft、Meta、Google 等高信用公司使用,底层信用质量与 2007 年的住房按揭市场相差很远。很多数据中心债务也要求在存续期内偿还 20% 至 40% 的本金,降低了到期时一次性再融资的压力。 真正敏感的是算力云公司和项目公司。它们往往用三到五年的客户合同支撑十几年甚至更长的数据中心租约,同时依赖持续融资扩张。客户不续约、GPU 租金下降,首先变化的就是下一笔贷款的价格和条款。 过去两年,高信用客户的长期合同一度把算力融资成本压低,甚至帮助部分项目获得投资级评级。到了 2026 年,资产规模继续扩大,投资人开始重新计算合同期限、客户信用和 GPU 残值,保护条款随之增加。 系统性违约还没有出现,信用周期已经开始。 市场仍然愿意为 AI 提供资金,只是开始重新决定什么样的合同值得借钱,一批 GPU 又究竟能抵押多少年。 谁能等到最后 中美大厂都在为回收期很长的 AI 资产寻找长期资金,可用的融资工具并不相同。 美国公司有更深的公司债市场,也可以把大型数据中心放进项目公司,用租约和客户合同融资,再由保险资金和基础设施基金持有期限更长的资产。 中国互联网公司的长期私募信贷和项目融资市场还没有形成同样的规模,股权融资、出售非核心资产和集团内部现金调配因此承担了更多作用。 阿里选择配股,Meta 和 CoreWeave 更多使用项目融资,处理的其实都是期限匹配。十年以后才能收回的投资,需要一笔愿意等十年的钱。 真正拉开差距的,也会是这种资金能够持续多久。 AI 之外,每家公司还有自己的资本负担。阿里仍在投入即时零售和国际电商,百度要在广告现金流收缩时完成 AI 转型,Meta 的 Reality Labs 也仍然需要长期投入。 算力越贵,这些原本可以并行推进的战略,就越需要重新排序。 旧业务现金流稳定、资产存量足够厚的公司,可以用更低的价格获得长期资金,也就能接受更慢的回报和更多次失败。依赖持续再融资扩张的公司,留给需求波动和判断失误的空间会小得多。 资本承受力本质上是在购买试错时间。 模型排行榜每天都在变化,一次发布就可能迅速缩小技术差距。信用评级、借款成本和已经签下的二十年合同却很难在一个季度内重来。技术落后可以追赶,资本结构留下的时间没有那么容易追回。 Carlota Perez 在《技术革命与金融资本》中把技术革命分成两个阶段。 前半程,金融资本大量涌入,新产业在需求尚未成熟时提前铺设基础设施;经过泡沫、价格调整和损失重新分配之后,已经建成的基础设施才进入更大规模的应用。 过度投资因此也是技术周期的一部分。它提前完成基础设施建设,同时把估值修正、信用损失和资本淘汰留给下一阶段。真正的问题从来不只是有没有泡沫,而是谁有能力穿过调整期。 2026 年的 AI 已经越来越接近这个阶段。资本开支开始超过经营现金流能够轻松覆盖的范围,贷款人开始给客户合同、资产残值和融资期限分别定价,科技公司的竞争也从模型能力延伸到了资产负债表。 互联网行业曾经把资本当成一种近乎无限的资源。AI 把土地、电力、芯片、折旧和二十年租约重新带回了科技公司的核心经营问题。 模型决定一家公司的技术上限,资本承受力决定它还有多少时间接近这个上限。 原文链接

大厂 AI 竞赛,从技术周期走进资本周期

原文标题:《大厂 AI 竞赛,从技术周期走进资本周期》
原文作者:动察Beating
8 月 23 日,阿里巴巴在中国香港市场启动新股配售,拟以每股 112.7 港元发行 7.1 亿股,募资 800 亿港元,约合 102 亿美元。若交易完成,这将成为中国香港上市公司史上规模最大的后续发行,也是 2026 年全球第三大同类融资,仅次于 Alphabet 和 Intel。
订单很快超过原定规模,主权基金入场,发行金额随需求上调。所得资金将全部投入 AI,覆盖芯片、基础设施、模型开发与部署。
三天前公布的二季度财报已经解释了这笔融资。AI 云与计算服务收入同比增长 45%,达到 484.4 亿元,资本开支同期增至 676.8 亿元,同比增长 75%。
同一个季度,经营现金流只有 229.5 亿元,自由现金流净流出 446.7 亿元。三年 3800 亿元的投资计划已经执行近半,吴泳铭上一季度又取消了原本的投入上限,称实际金额会远远超过原计划。按当前毛利水平粗算,这批 AI 基础设施大约需要三年回本。
阿里并不缺钱。截至 6 月底,公司仍持有 4745 亿元现金及其他流动性投资。这笔融资解决的是资本期限配置。经营现金流持续产生,数据中心却需要数年建设和回收,长期电力协议和二十年租约还会进一步拉长资金占用周期。长期用短期现金覆盖这类资产,会持续消耗财务弹性。权益资本没有固定到期日,更适合承担回收期漫长的投入。
AI 的资本开支开始改变互联网公司的资金结构。过去讨论的是有没有足够多的钱,现在还要讨论这笔钱应该以什么期限存在。
Alphabet 先调整的是股东回报。二季度公司收入增长 24%,Google Search 增长 17%,Google Cloud 增长 82%,集团营业利润率仍有 34%,核心业务几乎挑不出毛病。
同期经营现金流为 391 亿美元,资本开支却达到 449 亿美元,自由现金流第一次降至负 59 亿美元。董事会手里还有近 700 亿美元尚未使用的股票回购授权,2026 年上半年却没有回购一股普通股。
六年前,互联网巨头还在讨论怎么把不断积累的剩余现金还给股东。到了今年,Alphabet 把回购额度留在账上,自己重新进入资本市场融资。AI 开始改变利润在公司内部的分配顺序。
腾讯面对的是另一种压力。2026 年二季度资本开支 527 亿元,实际资本开支付款达到 593 亿元,上半年合计 847.2 亿元,半年已经超过 2025 年全年,当季自由现金流降至负 138 亿元。
腾讯在财报中补充了一种口径,剔除提前支付的 AI 算力采购款,自由现金流其实可以达到正 376 亿元。支付时间的变化,就足以制造五百多亿元的现金流差额。三个月里,腾讯净现金从 1468.6 亿元降至 581.9 亿元。
百度的问题更直接。二季度经营现金流只有 34.4 亿元,资本开支达到 113.9 亿元,自由现金流流出 79.5 亿元。
在线营销收入同比下降 19%,过去最重要的现金来源还在收缩;AI 云基础设施收入增长 50%,其中 GPU 云增长 283%,需要资本的新业务却已经进入加速期。
收入结构已经开始迁移,现金流结构还停留在过去。百度需要用一条不断收缩的旧业务现金流,为刚进入资本密集期的新业务付款。
资本开支本身也在变贵。TrendForce 在 5 月将全球九大云厂商 2026 年合计资本开支预估上调至约 8300 亿美元,同比增幅从 61% 提高到 79%。
增加的预算并不全部对应更多设备,零部件涨价已经吃掉相当一部分。微软约 1900 亿美元资本开支中,有 250 亿美元只用于消化零部件涨价;字节也因为内存价格上涨,把全年资本开支从 1600 亿元提高到超过 2000 亿元。
同一笔预算,能买到的算力比年初少了。
这些公司依然有很高的利润,也握着巨额现金,但资本已经不再宽松到可以忽略机会成本。自由现金流开始承压,回购可以推迟,融资需要增加,一笔钱投向算力,也就意味着它无法同时留给并购、旧业务或者另一条增长曲线。
过去十几年,充足的现金流给互联网公司提供了很长的试错周期。AI 正在缩短这种宽容。
资本从互联网公司的默认条件,重新变成了增长约束。
几乎所有大厂都已经选择继续投入。资本约束真正出现以后,下一轮竞争就进入了资本配置。过去可以同时下注的业务,现在开始需要分出先后。
AI 的机会成本开始
拆开阿里的报表,AI 本身已经处在不同的回报周期。
AI 云与计算服务季度经调整 EBITA 达到 56.3 亿元,同比增长 133%,已经开始贡献经营利润。模型和消费级应用仍在投入期,当季收入约 33.4 亿元,经调整 EBITA 亏损 138.6 亿元,亏损额是上年同期的四倍多。更下一轮的算力建设还在形成资产,回报尚未进入报表。
再加上即时零售和国际电商,阿里同时推进的几条增长曲线,开始争夺同一张资产负债表。
这种竞争很快会传导到旧业务。过去两年,阿里先后退出银泰和高鑫零售,8 月 17 日又与 Trustar 达成出售灵犀互娱的协议,交易据报超过 20 亿美元。灵犀仍拥有《三国志·战略版》这样的成熟产品,出售它已经很难简单解释为清理亏损资产。
字节对沐瞳的处理更明显。2021 年,字节以约 40 亿美元估值收购沐瞳;今年出售给沙特 PIF 旗下 Savvy Games 时,交易估值已经超过 60 亿美元。游戏一度是字节重点进入的新市场,沐瞳也仍在增值,但当集团内部的优先级改变,一项赚钱的资产同样可以退出。
微软甚至把这种重新排序带进了核心业务。690 亿美元收购 Activision Blizzard 还不到三年,Xbox 已经开始重新核算投入产出。7 月,微软宣布裁员 4800 人,其中约 3200 人来自游戏业务,四家工作室将被出售或分拆。
Bloomberg 披露的内部数据显示,剔除 Activision Blizzard 后,Xbox 过去五年在内容、平台和硬件补贴上的投入超过 200 亿美元,内部考核口径下的利润率已经降至 3%。
公司金融把这种状态称为资本配给。
资金足够宽松时,一项尚未被证伪的业务可以长期保留,战略可能性本身就有价值。AI 把资本开支推高以后,这种选择权开始有明确成本。每多留一项业务,就少一部分资金可以配置给算力和新的增长曲线。
出售所得未必直接流向 AI,但资本的比较标准已经改变。
战略价值已经不能单独构成继续占用资本的理由。
现金在减少,资产还在升值
AI 投资正在制造一种看起来矛盾的财务状态。现金先被数据中心和 GPU 消耗,形成的基础设施随后进入资产负债表;对 AI 公司的股权投资升值,又可能推高当期利润。
自由现金流恶化、资产扩张和利润增长,可以同时发生。
Amazon 是最极端的例子。截至今年 6 月的过去十二个月,公司经营现金流达到 1614 亿美元,同比增长 33%,设备及基础设施净采购额却同比增加 661 亿美元,自由现金流从一年前的流入 182 亿美元降至流出 76 亿美元。
同期 Amazon 净利润达到 626 亿美元,其中包含 534 亿美元非经营性税前收益,主要来自 Anthropic 投资升值。仅 Anthropic 非投票优先股的价格变化,就贡献了约 505 亿美元。
一边是 AI 基础设施吞掉现金,一边是 AI 股权重估推高利润。现金流和利润表开始讲两个不同的故事。
微软与 OpenAI 的关系更复杂。截至 2026 财年末,微软对 OpenAI 的投资承诺为 130 亿美元,其中 119 亿美元已经投入,按转换后口径持有约 25% 权益。同一个财年,微软又从双方的商业安排中确认了 241 亿美元收入,年末还有 60 亿美元应收账款。
OpenAI 既是微软的被投公司,也是它的大客户。股权上涨增加资产价值,模型调用、Azure 服务和收入分成又形成经营收入。一笔战略投资开始同时获得资本回报和经营回报。
腾讯则拥有更厚的资产存量。截至 6 月底,上市被投公司股份公允价值达到 4872 亿元,非上市被投公司账面价值还有 3879 亿元,合计接近 8751 亿元。与此同时,腾讯当季自由现金流为负 138 亿元,仍然拿出 169 亿港元回购股票。
自由现金流下降,削弱的是当期自行投入的能力,并不会同时抹掉过去积累的资产和长期盈利能力。
现金流决定一家公司能拿出多少钱,资产负债表决定它还能借到多少钱。
到了 2026 年,这两种能力开始出现明显分化。AI 投资继续扩大以后,资本市场看的已经不只是利润和现金,还包括资产质量、长期合同和未来的偿付能力。
大厂之间的融资成本,也因此开始拉开差距。
资本成本开始决定产能
AI 扩张到了这个阶段,公司能建多少数据中心,已经不只取决于芯片和电力,也取决于能以什么价格拿到多长期限的资金。
今年 6 月,Alphabet 通过公开发行和定向发行普通股,以及强制可转换优先股,连续完成三笔权益融资,合计募得 495 亿美元。同期又通过高级无担保债取得 203 亿美元净融资,仅二季度的外部融资就接近 700 亿美元,资金用途包括扩大 AI 基础设施和全球算力。
8 月 19 日,Alphabet 又首次进入澳大利亚债券市场,发行 55 亿澳元债券,最长一档达到 20 年,投资者订单超过 180 亿澳元。
一家过去主要依靠经营现金流完成投资的公司,开始同时使用股权、长期债务和不同币种的资本市场。AI 需要解决的已经不只是融资规模,还有资金期限和来源的稳定性。
整个行业都在发生类似变化。截至 7 月 7 日,Amazon、Alphabet、Meta 和 Oracle 今年已经发行约 1940 亿美元债券,比 2025 年全年高出 79%。五大云厂商新增债务相当于资本开支的比例,也从 2024 财年的 9% 升至今年 6 月的 32%。
当接近三分之一的新增资本开支需要依靠借款,信用本身就开始成为扩张条件。
问题在于,这笔钱对每家公司并不是一个价格。
Oracle 2026 财年自由现金流为负 237 亿美元,下一财年资本开支指引最高达到 950 亿美元。即使扣除客户可能返还的 250 亿美元,仍有约 700 亿美元需要自行承担。
7 月,标普将 Oracle 的信用评级下调至 BBB-,距离垃圾级只差一档。它的五年期信用违约互换一度升至 215 个基点,创十八年新高,债券收益率达到 7% 至 8%。同期 Alphabet 和 Amazon 的债券收益率只有大约 2.5% 至 3.5%。
为了维持投资级评级,Oracle 在 2026 财年已经发行 430 亿美元债券,并完成 50 亿美元股权融资,下一财年还计划再融资约 400 亿美元。
同样一批 GPU,设备采购价格不会相差太远,支撑它们的长期资金却可能相差几个百分点。
资本结构已经开始直接决定算力扩张的上限。
CoreWeave 说明,资金价格也可以通过融资结构重新定价。2023 年,公司以 GPU 作为主要信用基础融资时,利差一度高达基准利率上浮 9.62 个百分点。GPU 更新快、残值难以判断,本身并不是金融机构喜欢持有的长期抵押物。
今年 3 月,CoreWeave 通过项目公司完成 85 亿美元融资,把高性能计算基础设施和长期客户合同一起放进信用结构,贷款获得投资级评级,浮动利率降至基准利率上浮 2.25 个百分点,固定部分约为 5.9%。
两个月后,另一笔由信用较弱客户合同支持的 31 亿美元贷款,评级下降至投资级以下,利率也重新升至基准利率上浮 4.5 个百分点。
同一家 CoreWeave,同样建设 AI 算力,仅仅因为客户信用、合同期限和融资结构不同,资金价格就能相差两个百分点以上。
一家公司能够用 5% 的长期资金建设数据中心,另一家公司需要支付 9%,能够承受的回收周期、利用率和服务价格自然不同。资金越便宜,就越有能力接受更长的产能爬坡,也更有空间参与推理价格竞争。
芯片成本决定算力可以卖多便宜,资本成本决定这个价格能够维持多久。
降价能力开始成为融资能力的延伸。
真正锁住预算的是长期合同
资本开支记录的是已经发生的投资,长期合同锁定的却是未来十几年还能不能少花钱。
Meta 的财报已经拉开了这两个数字的距离。截至 6 月底,公司已经签署、但尚未开始执行的经营和融资租赁义务达到 2789.9 亿美元,主要用于数据中心、托管设施和网络基础设施,最长期限达到 30 年。7 月,Meta 又新增约 680 亿美元数据中心租赁,合同期限普遍在 18 至 20 年。
除此之外,公司还有 3493.1 亿美元不可取消的合同承诺,主要用于第三方云算力和技术基础设施。部分采购协议甚至要求提前存入保证资金,因此有 108 亿美元货币市场基金已经转为受限现金,要等到 2028 年至 2030 年相关义务完成后才能释放。
合同还没有真正开始履行,资金的自由度已经先下降了。
微软的规模更大。截至 2026 财年末,公司披露的合同义务达到 7438.2 亿美元,其中包括 3291 亿美元尚未开始的数据中心租赁,最长期限为 20 年。Alphabet 也有 852 亿美元尚未开始的数据中心租赁,最长达到 26 年,部分长期能源协议的期限同样超过二十年。
Reuters 根据五家公司最新披露计算,Microsoft、Meta、Oracle、Amazon 和 Alphabet 尚未开始的租赁付款合计约 1.09 万亿美元,接近表内已确认租赁负债的四倍。
真正把大厂锁进这一轮 AI 周期的,已经不只是今年花出去多少钱,还有今天替未来签下了多少预算。
这也改变了退出的成本。消费级应用效果不好,可以减少投放、缩小团队,甚至直接关掉。数据中心一旦进入建设,电力、土地、设备和租赁合同却不会跟着一个季度的业务判断消失。今天多建一座机房,可能意味着未来二十年都要为这个决定付款。
刘炽平在腾讯二季度业绩会上把 AI 资本开支解释为集中采购,大额投入主要发生在今年和明年,不应该简单外推成每年重复出现的固定规模。这个判断在现金支出层面成立,但长期合同有自己的时间表。采购可以集中完成,租金、电力和折旧却会继续进入此后多年的报表。
微软已经开始看到这种影响。2026 财年,公司服务器、网络设备和软件原值达到 2158.7 亿美元,上一财年还是 1328.4 亿美元;集团折旧费用也从 2024 年的 152 亿美元升至 2025 年的 220 亿美元,今年进一步达到 343 亿美元。
这里还有一层更难处理的期限错配。微软的服务器和网络设备通常按照两到六年折旧,部分数据中心租赁却长达二十年。芯片更新越来越快,如果实际经济寿命继续缩短,公司可以提前折旧甚至确认减值,但机房、电力和租赁合同不会因此缩短。
几年的芯片,开始被装进二十年的合同里。
算力开始成为一种资产
长期合同锁定了未来需求,建设资金却要在今天到位。
Morgan Stanley 测算,未来四年全球数据中心和相关硬件需要投入约 2.9 万亿美元,大型云厂商依靠自身资金只能覆盖其中约 1.4 万亿美元,剩下 1.5 万亿美元需要外部资本填补。其中约 8000 亿美元预计来自私募信贷,2000 亿美元来自投资级公司债,1500 亿美元来自数据中心证券化,其余由股权和主权资金承担。
当建设规模超过公司自身现金流,融资对象也开始发生变化。资本不再只判断一家公司值不值得借钱,而是单独判断一座数据中心、一批 GPU 和背后的长期合同值多少钱。
8 月 10 日,Nvidia 与 Apollo、BlackRock 等六家金融机构签署合作协议,计划建立算力基础设施融资平台,未来动员超过 5000 亿美元第三方资本。Nvidia 同时提出,要把算力变成一种可以被长期资金配置的资产。
这套结构已经开始落地。Valor 管理的 VCI 基金以 54 亿美元购买包括 Nvidia GB200 在内的算力设备,再长期租给 xAI;Apollo 管理的基金提供 35 亿美元资本方案,Nvidia 自己也参与出资。设备留在基金的资产端,xAI 把一次性采购转化为长期租金,未来的租金收入又成为今天融资的依据。
Meta 的 Hyperion 项目规模更大。预计约 270 亿美元的开发成本中,Blue Owl 管理的基金持有项目 80% 权益,Meta 保留 20%,建成后再长期租用。Meta 没有完全退出信用关系,还为项目运营前 16 年提供了有上限的残值保障。
资产可以移出大厂的资产负债表,信用仍然通过租约、客户合同和残值保障留在交易里。资本占用从今天被推向未来,建设资金则提前到位。
成熟的数据中心还可以进一步进入证券化市场。数据中心证券化产品的存量规模已经从 2020 年的 40 亿美元增至今年的 610 亿美元,在非传统证券化市场中的占比从 3% 升至约 12%。7 月,美国证券监管部门又进一步明确了部分数据中心证券的监管口径,符合条件的结构可以免于传统资产证券化产品的 5% 风险自留要求。
一套独立的融资市场正在形成。大厂的长期租约、模型公司的算力采购合同和数据中心本身,都可以被拆出来定价,再进入保险资金、私募信贷和基础设施基金的投资组合。
这也意味着,算力建设能够调用的资本,开始超过任何一家科技公司的经营现金流。
风险没有消失,只是被重新分配。未来需求如果低于预期,或者 GPU 残值下降,损失最终落在谁身上,取决于租约、担保和追索权如何安排。
算力金融化,就是把未来十几年的合同现金流,提前变成今天的建设资金。
重新定价风险
算力融资还没有出现大规模违约,但信用市场已经开始重新定价风险。
CoreWeave 今年完成的一笔 26 亿美元贷款很典型。贷款期限接近五年,底层客户合同平均只有三年,其中 Anthropic 相关合同约占四成。客户合同先到期,债务还没有还完,数据中心租约则可能继续十年以上。
投资人最初认购冷淡。CoreWeave 随后把收益率提高到接近 9.1%,并加入现金锁箱,要求相关合同收入优先进入受控账户偿债。条件收紧以后,订单迅速增至约 90 亿美元。
钱依然能够拿到,只是贷款人开始要求更高的收益和更强的控制权。
真正昂贵的是合同到期以后的几年。客户是否续约,旧 GPU 还能以什么价格出租,都会直接影响贷款价值。过去属于技术和运营的问题,开始进入信贷定价。
Reuters 统计,大型科技公司债券的认购倍数从 2 月接近 5 倍降至 7 月不足 2 倍。Amazon 7 月发债的认购倍数只有 1.6 倍,3 月还达到 3.4 倍。
信用收紧通常不会从「借不到钱」开始。订单先减少,新债需要给出更高收益,合同条款随后变严,发起人投入更多股本。只有当这些条件仍然无法匹配风险,新项目才会真正失去融资。
钱先变贵,然后才可能变少。
信用开始变贵以后,产业链上的其他公司也被迫承担更多风险。
8 月 10 日,黄仁勋表示,Nvidia 可以根据项目决定是否提供信用支持,上限约为潜在交易规模的 25%。一周后,OpenAI 在俄亥俄州的数据中心项目采用了更大的安排。OpenAI 签下 20 年租约,Nvidia 向项目提供最高 1050 亿美元的或有信用支持,同时向开发商 SB Energy 投资 15 亿美元。
这笔承诺覆盖部分租金、电力付款和场地残值,并不意味着 Nvidia 当期拿出同等规模的现金。但它改变了风险的归属。GPU 的销售收入可以在今天确认,下游项目未来二十年的部分履约风险,却开始进入 Nvidia 自己的信用。
资产可以转移,信用最终还要有人承担。
现在把这一轮算力金融化类比成「AI 次贷」还太早。大量核心项目最终由 Microsoft、Meta、Google 等高信用公司使用,底层信用质量与 2007 年的住房按揭市场相差很远。很多数据中心债务也要求在存续期内偿还 20% 至 40% 的本金,降低了到期时一次性再融资的压力。
真正敏感的是算力云公司和项目公司。它们往往用三到五年的客户合同支撑十几年甚至更长的数据中心租约,同时依赖持续融资扩张。客户不续约、GPU 租金下降,首先变化的就是下一笔贷款的价格和条款。
过去两年,高信用客户的长期合同一度把算力融资成本压低,甚至帮助部分项目获得投资级评级。到了 2026 年,资产规模继续扩大,投资人开始重新计算合同期限、客户信用和 GPU 残值,保护条款随之增加。
系统性违约还没有出现,信用周期已经开始。
市场仍然愿意为 AI 提供资金,只是开始重新决定什么样的合同值得借钱,一批 GPU 又究竟能抵押多少年。
谁能等到最后
中美大厂都在为回收期很长的 AI 资产寻找长期资金,可用的融资工具并不相同。
美国公司有更深的公司债市场,也可以把大型数据中心放进项目公司,用租约和客户合同融资,再由保险资金和基础设施基金持有期限更长的资产。
中国互联网公司的长期私募信贷和项目融资市场还没有形成同样的规模,股权融资、出售非核心资产和集团内部现金调配因此承担了更多作用。
阿里选择配股,Meta 和 CoreWeave 更多使用项目融资,处理的其实都是期限匹配。十年以后才能收回的投资,需要一笔愿意等十年的钱。
真正拉开差距的,也会是这种资金能够持续多久。
AI 之外,每家公司还有自己的资本负担。阿里仍在投入即时零售和国际电商,百度要在广告现金流收缩时完成 AI 转型,Meta 的 Reality Labs 也仍然需要长期投入。
算力越贵,这些原本可以并行推进的战略,就越需要重新排序。
旧业务现金流稳定、资产存量足够厚的公司,可以用更低的价格获得长期资金,也就能接受更慢的回报和更多次失败。依赖持续再融资扩张的公司,留给需求波动和判断失误的空间会小得多。
资本承受力本质上是在购买试错时间。
模型排行榜每天都在变化,一次发布就可能迅速缩小技术差距。信用评级、借款成本和已经签下的二十年合同却很难在一个季度内重来。技术落后可以追赶,资本结构留下的时间没有那么容易追回。
Carlota Perez 在《技术革命与金融资本》中把技术革命分成两个阶段。
前半程,金融资本大量涌入,新产业在需求尚未成熟时提前铺设基础设施;经过泡沫、价格调整和损失重新分配之后,已经建成的基础设施才进入更大规模的应用。
过度投资因此也是技术周期的一部分。它提前完成基础设施建设,同时把估值修正、信用损失和资本淘汰留给下一阶段。真正的问题从来不只是有没有泡沫,而是谁有能力穿过调整期。
2026 年的 AI 已经越来越接近这个阶段。资本开支开始超过经营现金流能够轻松覆盖的范围,贷款人开始给客户合同、资产残值和融资期限分别定价,科技公司的竞争也从模型能力延伸到了资产负债表。
互联网行业曾经把资本当成一种近乎无限的资源。AI 把土地、电力、芯片、折旧和二十年租约重新带回了科技公司的核心经营问题。
模型决定一家公司的技术上限,资本承受力决定它还有多少时间接近这个上限。
原文链接
Статья
DeepSeek发布视觉理解模型,大蓝鲸等来迟到的眼睛原文标题:《DeepSeek发布视觉理解模型,大蓝鲸等来迟到的眼睛》 原文作者:动察Beating 2026 年 8 月 21 日,DeepSeek 推出全新的视觉理解模型 deepseek-v4-flash-vision-exp,多模态 API 正式开放。开发者第一次可以把图片直接送进 DeepSeek 的官方接口。 模型保留了 V4 Flash 的 100 万 token 上下文和 38.4 万 token 最大输出,支持 JSON Output、Tool Calls、Responses API,也兼容 Anthropic API。 价格也完全沿用 V4 Flash。每百万 token 输入,缓存未命中时,高峰期 3 元,空闲期 1.5 元;缓存命中分别是 0.1 元和 0.05 元。输出高峰期 9 元,空闲期 4.5 元。北京每天 9 时至 12 时、14 时至 18 时属于高峰,其余 17 个小时半价。 图片同样按 token 结算。进入模型前,每张图片都会根据尺寸自动缩放,小于约 384×384 像素的会被放大,大图则会被压到约 800×800 像素的总像素量。单张图片最多占 384 个 token。一张 2000×2000 的图片和一张 5000×5000 的图片,最后可能花掉完全一样的 token。 按照 384 token 的上限,一张图片在高峰期、缓存未命中的输入费用约为 0.001152 元。处理一千张这样的图片,图片输入本身也只有约 1.152 元,文字和模型输出另算。 一起上线的还有 Files API。开发者可以提前上传图片,再把 file_id 放进请求。同一张图只需要传一次,之后可以在不同请求里反复引用。 这个 API 本身不收费。单个文件最大 64 MiB,每个用户最多存 25 GiB、10000 个文件。文件可以设置在 1 小时到 30 天后过期,不设置有效期则可以一直保留。目前官方也没有提供下载文件内容的接口。开发者可以上传、查询和删除,模型可以读取。它更像一个专门给推理准备的免费图片仓库,而不是普通云盘。 不过奇怪的其实不是 DeepSeek 到今天才会看图。 两条时间线 如果只看研究,DeepSeek 的视觉并不晚。 如果只看产品和 API,它又确实晚了很久。 2024 年 3 月 11 日,DeepSeek-VL 开源。 它有 1.3B 和 7B 两个版本,能看自然图片、网页、公式、图表和文档。到了 10 月,Janus 出现,把图像理解与生成放进同一套自回归框架。11 月 13 日,JanusFlow 跟进。12 月,DeepSeek-VL2 发布,换成混合专家架构,总参数量分成 3B、16B 和 27B 三档。 2025 年 1 月 28 日凌晨,除夕,Janus-Pro 开源。官方仓库按照 UTC 记在 1 月 27 日。 7B 版本在 GenEval 这项文字生成图片的指令遵循评测里拿到 0.80,超过论文所列 DALL-E 3 的 0.67。它有开源权重,可以本地部署,也有公开演示。 DeepSeek 没有把它接进自己的托管 API。 就在此前一周,R1 已经把 DeepSeek 推到了聚光灯下面。Janus 留在 GitHub 和 Hugging Face。对绝大多数普通用户来说,它很快又消失在了视野里。 2025 年 10 月 20 日,DeepSeek-OCR 开源,用视觉 token 压缩长文档。2026 年 1 月 27 日,OCR 2 发布。 从 DeepSeek-VL 开始算,两年里至少能查到 DeepSeek-VL、Janus、JanusFlow、VL2、Janus-Pro、OCR 和 OCR 2 七条公开记录。 视觉研究一直在做,也一直往外放。 只是普通开发者一直没有那个入口。 而另一边,到 2024 年 3 月,几家主要竞争对手的开发者接口都已经可以接收图片。OpenAI 在 2023 年 11 月开放 GPT-4 Turbo with Vision,图片可以直接进入 Chat Completions API;一个月后,Google 上线 Gemini Pro Vision API;2024 年 3 月,Claude 3 全系加入视觉能力。 2025 年 4 月 25 日,李彦宏在百度 Create 大会上说,「DeepSeek 也不是万能的」。随后列出的几个问题里,就有模态单一。 他的判断是,多模态会成为基础模型的标配,纯文本模型的市场会越来越小。 那时候,DeepSeek 已经做了一年视觉研究。 凌晨 2026 年 4 月 7 日和 8 日,部分用户打开 DeepSeek,界面里突然多出三个入口。 「快速」「专家」「视觉」。 4 月 29 日,DeepSeek 多模态团队负责人陈小康确认识图功能开始面向部分用户灰度。随后,DeepSeek 一名资深研究员写道,「小鲸鱼现在能看见了」。南华早报直接把这句话放进了标题。 DeepSeek 的眼睛第一次真正从产品界面里露出来。 第二天,DeepSeek 把《Thinking with Visual Primitives》放上 GitHub。几个小时以后,仓库和论文又被撤下。到了 5 月 1 日,原地址已经返回 404。DeepSeek 没有解释,网上只剩下论文镜像和媒体转述。 论文研究的是一个很具体的问题。 模型看到一张很拥挤的图片以后,常常知道自己在说什么,却说不清自己说的究竟是哪一个人、哪一条线。团队把点坐标和边界框直接插进推理过程,让模型一边指出位置,一边继续往下想。 一张 756×756 的图片先经过视觉编码器,变成 2916 个图像块 token,再通过 3×3 空间压缩合成 324 个 token。V4 Flash 的稀疏注意力继续压缩缓存,最后只留下 81 个视觉 KV 条目。 团队还为这套方法生成了超过 4000 万条训练样本,其中包括专门训练迷宫导航和路径追踪的数据。 这篇论文花了很大力气解决的,其实是「指哪儿」。 模型先得看见,再得知道自己正在看哪里。只有这样,它才能继续往下推理。 DeepSeek 这次没有说明 Vision Exp 是否完整沿用了这套 Visual Primitives 方案。更重要的是,这项研究第一次把 DeepSeek 对「视觉推理」的理解暴露在了外面。 6 月 18 日,网页和 App 的识图模式正式上线。第二天,有媒体上传梁文锋的照片测试,DeepSeek 连续两次把他认成张一鸣。换一个对话,它又把张一鸣认成寒武纪创始人陈天石。 它已经能读英文截图,也能把网页转成代码。 到了人脸面前,却连自己老板都认不出来。 8 月 19 日,DeepSeek Harness 留下一份日期明确的技术说明。官方适配器已经能够把图片序列化成 image_url,文档同时写明,默认模型目录暂时不会展示 deepseek-v4-flash-vision-exp,需要等对应的 API 端点可用。 8 月 20 日,还有开发者实测发现,给这个尚未开放的模型名传图,只会收到 400 错误。 8 月 21 日,这个限制被拿掉。Harness 把 deepseek-v4-flash-vision-exp 加进默认模型目录,对应的合并提交直接写着「publish the vision model」。随后,DeepSeek 官方 API 文档和公众号同时宣布 Vision Exp 上线。 两条线终于碰到了一起。 Agent 在今年 5 月一场投资者交流会的录音转写里,梁文锋把自己理解中的 AGI 路线排成了几级台阶:语言模型、思维链、Agent、持续学习、自我迭代,再到具身智能。 多模态被他放在组件的位置,和搜索差不多。 谈到视频生成时,转写里有一句话: 在商业上,它是个好生意。但是这跟智能没有什么关系。 他的判断是,视频生成、世界模型在当前阶段和智能上限的关系没有那么大,眼前更要紧的是 AI 训练,以及训练之后的持续学习。 多模态不一样的地方在于,它虽然也被放在「组件」的位置,却是 DeepSeek 明确说过一定会做的组件。梁文锋当时还提到,V4 以及后续版本会支持原生多模态。 视觉在 DeepSeek 的路线里一直有位置,只是排得没有那么靠前。 等路线走到第三步 Agent,情况开始有些不一样了。 DeepSeek 没有公开说过,这次视觉 API 是「为了 Agent 才上线」。但把梁文锋对路线的判断和今天的发布放在一起,两条线已经很难完全分开看。 Agent 要读屏幕,要看图表,要处理工具扔回来的截图。它不可能永远生活在纯文本里。那些已经做了两年的视觉能力,也终于从论文、仓库和测试页面里,一路走到了 API。 DeepSeek 今天给 Vision Exp 展示的三个例子也都不是传统的「看图说话」:一个 Agent 给高端客户制作西藏自驾游 PPT,一个重新设计 DeepSeek Harness 官网,还有一个根据视觉要求制作带动态效果的前端 Demo。 它们都需要模型在长流程任务里反复处理视觉信息。 API 的设计也在往这个方向靠。Responses API 同样接受 input_image,浏览器 Agent 可以拿到网页截图以后,把它重新送进下一轮推理;代码 Agent 可以检查渲染结果,图表、扫描件和软件界面也能直接成为上下文。 Files API 则解决另一件事:同一张图不用在每轮请求里重复上传。一个文件可以长期放在那里,Agent 只需要反复传 file_id。单次请求最多还能放 600 张图片。使用外部链接或 Base64 时,单张图片上限是 32 MiB,通过 Files API 引用后可以到 64 MiB。 这已经不太像给聊天框加一个「上传图片」按钮。 它更像是在补 Agent 使用视觉时需要的基础设施。 DeepSeek 公布的四项多模态 Agent 对比,也很少在考传统意义上的「看图说话」。 ApexBench 关注投行、咨询和法律等长流程任务。Agents' Last Exam 来自 55 个专业领域的真实工作。Chartography 专门考 Kaplan-Meier 曲线、K 线、等高线、桑基图和波特图。ZeroBench 则用 100 道人工设计的难题测试多步视觉推理。 Vision Exp 对 Claude Opus 4.8 拿到两胜两负。 Agents' Last Exam 是 27.3 对 25.7,ZeroBench 是 35.0 对 34.0。ApexBench 为 36.5 对 39.4,Chartography 为 64.3 对 65.0。四项差距都没有超过 3 分。 更有意思的是,加上视觉以后,原来的文本 Agent 能力没有明显掉下去。 和 7 月 31 日发布的纯文本 V4 Flash 逐项比较,官网同时给出前后成绩的五项文本 Agent 评测全部上涨。 Terminal Bench 2.1 从 82.7 涨到 83.9,NL2Repo 从 54.2 到 57.7,DeepSWE 从 54.4 到 59.3,DSBench-Hard 从 59.6 到 63.6,AutomationBench 从 25.1 到 25.7。DeepSWE 的 59.3,也超过了图中 Opus 4.8 的 58.0。 不过,这组数字来自 DeepSeek 自己的测试。官方注明,公开 Code Agent 文本任务中的 DeepSeek 系列模型使用 DeepSeek Harness 极简模式,推理档位设为 max。它们更适合用来观察 Vision Exp 相比自家 V4 Flash 的变化,而不是直接当成第三方独立排名。 模型名字后面的 exp 也还没有摘掉。 DeepSeek 明确把它标成实验模型,版本仍然可能继续变化。现在的接口只做图片理解,输出依然是文字。图片生成和视频没有开放,Files API 也只接受 JPEG、PNG、GIF 和 WebP,PDF 不能直接塞进去。 2024 年,开发者想给 DeepSeek 发一张图片,官方 API 还接不住。 到 2026 年 8 月 21 日,这张图片终于进来了。 DeepSeek 的眼睛确实睁开得晚。 等它真正睁开的时候,前面的路已经不允许它继续闭着眼睛走了。 原文链接

DeepSeek发布视觉理解模型,大蓝鲸等来迟到的眼睛

原文标题:《DeepSeek发布视觉理解模型,大蓝鲸等来迟到的眼睛》
原文作者:动察Beating
2026 年 8 月 21 日,DeepSeek 推出全新的视觉理解模型 deepseek-v4-flash-vision-exp,多模态 API 正式开放。开发者第一次可以把图片直接送进 DeepSeek 的官方接口。
模型保留了 V4 Flash 的 100 万 token 上下文和 38.4 万 token 最大输出,支持 JSON Output、Tool Calls、Responses API,也兼容 Anthropic API。
价格也完全沿用 V4 Flash。每百万 token 输入,缓存未命中时,高峰期 3 元,空闲期 1.5 元;缓存命中分别是 0.1 元和 0.05 元。输出高峰期 9 元,空闲期 4.5 元。北京每天 9 时至 12 时、14 时至 18 时属于高峰,其余 17 个小时半价。
图片同样按 token 结算。进入模型前,每张图片都会根据尺寸自动缩放,小于约 384×384 像素的会被放大,大图则会被压到约 800×800 像素的总像素量。单张图片最多占 384 个 token。一张 2000×2000 的图片和一张 5000×5000 的图片,最后可能花掉完全一样的 token。
按照 384 token 的上限,一张图片在高峰期、缓存未命中的输入费用约为 0.001152 元。处理一千张这样的图片,图片输入本身也只有约 1.152 元,文字和模型输出另算。
一起上线的还有 Files API。开发者可以提前上传图片,再把 file_id 放进请求。同一张图只需要传一次,之后可以在不同请求里反复引用。
这个 API 本身不收费。单个文件最大 64 MiB,每个用户最多存 25 GiB、10000 个文件。文件可以设置在 1 小时到 30 天后过期,不设置有效期则可以一直保留。目前官方也没有提供下载文件内容的接口。开发者可以上传、查询和删除,模型可以读取。它更像一个专门给推理准备的免费图片仓库,而不是普通云盘。
不过奇怪的其实不是 DeepSeek 到今天才会看图。
两条时间线
如果只看研究,DeepSeek 的视觉并不晚。
如果只看产品和 API,它又确实晚了很久。
2024 年 3 月 11 日,DeepSeek-VL 开源。
它有 1.3B 和 7B 两个版本,能看自然图片、网页、公式、图表和文档。到了 10 月,Janus 出现,把图像理解与生成放进同一套自回归框架。11 月 13 日,JanusFlow 跟进。12 月,DeepSeek-VL2 发布,换成混合专家架构,总参数量分成 3B、16B 和 27B 三档。
2025 年 1 月 28 日凌晨,除夕,Janus-Pro 开源。官方仓库按照 UTC 记在 1 月 27 日。
7B 版本在 GenEval 这项文字生成图片的指令遵循评测里拿到 0.80,超过论文所列 DALL-E 3 的 0.67。它有开源权重,可以本地部署,也有公开演示。
DeepSeek 没有把它接进自己的托管 API。
就在此前一周,R1 已经把 DeepSeek 推到了聚光灯下面。Janus 留在 GitHub 和 Hugging Face。对绝大多数普通用户来说,它很快又消失在了视野里。
2025 年 10 月 20 日,DeepSeek-OCR 开源,用视觉 token 压缩长文档。2026 年 1 月 27 日,OCR 2 发布。
从 DeepSeek-VL 开始算,两年里至少能查到 DeepSeek-VL、Janus、JanusFlow、VL2、Janus-Pro、OCR 和 OCR 2 七条公开记录。
视觉研究一直在做,也一直往外放。
只是普通开发者一直没有那个入口。
而另一边,到 2024 年 3 月,几家主要竞争对手的开发者接口都已经可以接收图片。OpenAI 在 2023 年 11 月开放 GPT-4 Turbo with Vision,图片可以直接进入 Chat Completions API;一个月后,Google 上线 Gemini Pro Vision API;2024 年 3 月,Claude 3 全系加入视觉能力。
2025 年 4 月 25 日,李彦宏在百度 Create 大会上说,「DeepSeek 也不是万能的」。随后列出的几个问题里,就有模态单一。
他的判断是,多模态会成为基础模型的标配,纯文本模型的市场会越来越小。
那时候,DeepSeek 已经做了一年视觉研究。
凌晨
2026 年 4 月 7 日和 8 日,部分用户打开 DeepSeek,界面里突然多出三个入口。
「快速」「专家」「视觉」。
4 月 29 日,DeepSeek 多模态团队负责人陈小康确认识图功能开始面向部分用户灰度。随后,DeepSeek 一名资深研究员写道,「小鲸鱼现在能看见了」。南华早报直接把这句话放进了标题。
DeepSeek 的眼睛第一次真正从产品界面里露出来。
第二天,DeepSeek 把《Thinking with Visual Primitives》放上 GitHub。几个小时以后,仓库和论文又被撤下。到了 5 月 1 日,原地址已经返回 404。DeepSeek 没有解释,网上只剩下论文镜像和媒体转述。
论文研究的是一个很具体的问题。
模型看到一张很拥挤的图片以后,常常知道自己在说什么,却说不清自己说的究竟是哪一个人、哪一条线。团队把点坐标和边界框直接插进推理过程,让模型一边指出位置,一边继续往下想。
一张 756×756 的图片先经过视觉编码器,变成 2916 个图像块 token,再通过 3×3 空间压缩合成 324 个 token。V4 Flash 的稀疏注意力继续压缩缓存,最后只留下 81 个视觉 KV 条目。
团队还为这套方法生成了超过 4000 万条训练样本,其中包括专门训练迷宫导航和路径追踪的数据。
这篇论文花了很大力气解决的,其实是「指哪儿」。
模型先得看见,再得知道自己正在看哪里。只有这样,它才能继续往下推理。
DeepSeek 这次没有说明 Vision Exp 是否完整沿用了这套 Visual Primitives 方案。更重要的是,这项研究第一次把 DeepSeek 对「视觉推理」的理解暴露在了外面。
6 月 18 日,网页和 App 的识图模式正式上线。第二天,有媒体上传梁文锋的照片测试,DeepSeek 连续两次把他认成张一鸣。换一个对话,它又把张一鸣认成寒武纪创始人陈天石。
它已经能读英文截图,也能把网页转成代码。
到了人脸面前,却连自己老板都认不出来。
8 月 19 日,DeepSeek Harness 留下一份日期明确的技术说明。官方适配器已经能够把图片序列化成 image_url,文档同时写明,默认模型目录暂时不会展示 deepseek-v4-flash-vision-exp,需要等对应的 API 端点可用。
8 月 20 日,还有开发者实测发现,给这个尚未开放的模型名传图,只会收到 400 错误。
8 月 21 日,这个限制被拿掉。Harness 把 deepseek-v4-flash-vision-exp 加进默认模型目录,对应的合并提交直接写着「publish the vision model」。随后,DeepSeek 官方 API 文档和公众号同时宣布 Vision Exp 上线。
两条线终于碰到了一起。
Agent
在今年 5 月一场投资者交流会的录音转写里,梁文锋把自己理解中的 AGI 路线排成了几级台阶:语言模型、思维链、Agent、持续学习、自我迭代,再到具身智能。
多模态被他放在组件的位置,和搜索差不多。
谈到视频生成时,转写里有一句话:
在商业上,它是个好生意。但是这跟智能没有什么关系。
他的判断是,视频生成、世界模型在当前阶段和智能上限的关系没有那么大,眼前更要紧的是 AI 训练,以及训练之后的持续学习。
多模态不一样的地方在于,它虽然也被放在「组件」的位置,却是 DeepSeek 明确说过一定会做的组件。梁文锋当时还提到,V4 以及后续版本会支持原生多模态。
视觉在 DeepSeek 的路线里一直有位置,只是排得没有那么靠前。
等路线走到第三步 Agent,情况开始有些不一样了。
DeepSeek 没有公开说过,这次视觉 API 是「为了 Agent 才上线」。但把梁文锋对路线的判断和今天的发布放在一起,两条线已经很难完全分开看。
Agent 要读屏幕,要看图表,要处理工具扔回来的截图。它不可能永远生活在纯文本里。那些已经做了两年的视觉能力,也终于从论文、仓库和测试页面里,一路走到了 API。
DeepSeek 今天给 Vision Exp 展示的三个例子也都不是传统的「看图说话」:一个 Agent 给高端客户制作西藏自驾游 PPT,一个重新设计 DeepSeek Harness 官网,还有一个根据视觉要求制作带动态效果的前端 Demo。
它们都需要模型在长流程任务里反复处理视觉信息。
API 的设计也在往这个方向靠。Responses API 同样接受 input_image,浏览器 Agent 可以拿到网页截图以后,把它重新送进下一轮推理;代码 Agent 可以检查渲染结果,图表、扫描件和软件界面也能直接成为上下文。
Files API 则解决另一件事:同一张图不用在每轮请求里重复上传。一个文件可以长期放在那里,Agent 只需要反复传 file_id。单次请求最多还能放 600 张图片。使用外部链接或 Base64 时,单张图片上限是 32 MiB,通过 Files API 引用后可以到 64 MiB。
这已经不太像给聊天框加一个「上传图片」按钮。
它更像是在补 Agent 使用视觉时需要的基础设施。
DeepSeek 公布的四项多模态 Agent 对比,也很少在考传统意义上的「看图说话」。
ApexBench 关注投行、咨询和法律等长流程任务。Agents' Last Exam 来自 55 个专业领域的真实工作。Chartography 专门考 Kaplan-Meier 曲线、K 线、等高线、桑基图和波特图。ZeroBench 则用 100 道人工设计的难题测试多步视觉推理。
Vision Exp 对 Claude Opus 4.8 拿到两胜两负。
Agents' Last Exam 是 27.3 对 25.7,ZeroBench 是 35.0 对 34.0。ApexBench 为 36.5 对 39.4,Chartography 为 64.3 对 65.0。四项差距都没有超过 3 分。
更有意思的是,加上视觉以后,原来的文本 Agent 能力没有明显掉下去。
和 7 月 31 日发布的纯文本 V4 Flash 逐项比较,官网同时给出前后成绩的五项文本 Agent 评测全部上涨。
Terminal Bench 2.1 从 82.7 涨到 83.9,NL2Repo 从 54.2 到 57.7,DeepSWE 从 54.4 到 59.3,DSBench-Hard 从 59.6 到 63.6,AutomationBench 从 25.1 到 25.7。DeepSWE 的 59.3,也超过了图中 Opus 4.8 的 58.0。
不过,这组数字来自 DeepSeek 自己的测试。官方注明,公开 Code Agent 文本任务中的 DeepSeek 系列模型使用 DeepSeek Harness 极简模式,推理档位设为 max。它们更适合用来观察 Vision Exp 相比自家 V4 Flash 的变化,而不是直接当成第三方独立排名。
模型名字后面的 exp 也还没有摘掉。
DeepSeek 明确把它标成实验模型,版本仍然可能继续变化。现在的接口只做图片理解,输出依然是文字。图片生成和视频没有开放,Files API 也只接受 JPEG、PNG、GIF 和 WebP,PDF 不能直接塞进去。
2024 年,开发者想给 DeepSeek 发一张图片,官方 API 还接不住。
到 2026 年 8 月 21 日,这张图片终于进来了。
DeepSeek 的眼睛确实睁开得晚。
等它真正睁开的时候,前面的路已经不允许它继续闭着眼睛走了。
原文链接
Статья
虾米音乐离开五年,阿里教会另一只「虾米」用 AI 写歌原文标题:《虾米音乐离开五年,阿里教会另一只「虾米」用 AI 写歌》 原文作者:动察Beating 8 月 17 日,虾米又回来了。 阿里巴巴发布 AI 音乐模型 HappyShrimp 1.0,中文名「快乐虾米」。用户只需要写下一句话,它就能生成一首完整的歌。 你甚至不需要知道什么是和弦、拍号或者调式。可以告诉它,想写一首送给刚毕业的自己,最好适合咖啡馆里放;也可以说,快下班了,窗外突然下雨,想要一点丧,但别太沉重。过去这些只能拿来形容心情的话,现在也能变成音乐指令。快乐虾米会试着听懂,然后创作出来。 目前,它已经上线电脑网页端测试版。阿里称,HappyShrimp 采用端到端整曲生成,把曲风、情绪、年代和人声放进同一套生成过程里处理。实际测试下来,它对中文日常表达尤其敏感。很多时候,用户说不清自己究竟想要什么音乐,只知道「再轻一点」「像十年前的夏天」「不要太苦」,它也能顺着这些模糊的描述往下做。 这让音乐生产变得很便宜。给短视频补一段配乐,替广告做个小样,给游戏、播客找背景音乐,都不再需要从头搭一套制作流程。测试页面上的标准会员价格约 30 元一个月,可以生成 150 首歌,平均下来,一首歌大约两毛钱。 上线当天,快乐虾米同时宣布与太合音乐合作。阿里还计划让它出现在今年的阿那亚虾米音乐节上。它也是阿里「Happy 加动物」系列的第三个成员,HappyHorse 做视频生成,HappyOyster 做世界模型,到了第三个,轮到音乐。 虾米音乐用了十二年,才成为后来被人怀念的虾米。 快乐虾米生成一首歌,大约只需要一分钟。 手工年代 旧虾米一开始很小。 王皓原本是阿里的程序员,也在玩乐队,网名叫「南瓜」,取自他喜欢的 Smashing Pumpkins。大学时,他弹吉他,组过一支叫「黑水」的乐队。大二暑假,有一次在排练房里被狗咬了手指,吉他暂时弹不了,他闲着没事,开始学写代码。 最早是 HTML,后来是 PHP。他甚至翻译 PHP 手册,给别人做网页赚零花钱,一个静态页面 200 块。再后来,他自己写了一个论坛,叫「声音网」,专门放杭州地下音乐和演出信息。2001 年,这个论坛已经有几万注册用户,每天几百人在线,一群玩乐队的、听摇滚的年轻人在里面约演出、找乐手、聊天。外地乐队来杭州,有时也是王皓帮忙联系场地。 他后来发现,自己可能没有成为职业音乐人的天赋,却很擅长把喜欢音乐的人聚到一起。 大学毕业后,他还和后来一起创办虾米的朱七合租在一起。两个人平时各自工作,到了周末,杭州的乐手和朋友就往这里跑,吃饭、喝酒、聊音乐,有时候一屋子都是人。王皓靠在网上卖乐器过日子,白天做生意,晚上和周末帮乐队找地方演出。 2003 年,他觉得电子商务可能真能成为一门生意,于是去了阿里学怎么做互联网。先写 Java,后来做需求分析。待了几年以后,他又开始琢磨音乐。 那时候大家下载电影会用 eMule、Kazaa、BT。王皓想,音乐能不能也做一套 P2P,只不过把那些乱七八糟的文件整理干净,再让上传的人和做音乐的人都赚到一点钱。 2007 年,他离开阿里。最初一共六个人,王皓做总经理,朱七管内容,还有运营和三个程序员。几个人出的本钱差不多,股份也差不多,每个月给自己发 3000 块工资。 他们把网站叫 EMUMO,Earn Music & Money。这个名字几乎把最初的野心全写在脸上,听音乐的人得到音乐,做音乐的人得到钱。 后来才改名叫虾米。他们给出的解释是:「我们只是小虾米,但是我们有大梦想。」 2008 年 11 月,虾米网正式上线。 第一个办公室也很像一家「小虾米」公司。地点在杭州古荡的龙都大厦,一间商住两用房,70 平米。上一家公司搬走以后没留下什么,他们也没怎么装修,搬几张桌椅进去就开始上班。服务器没地方放,就架在阳台上。每天一进办公室,都能听见风扇不停地转。王皓后来回忆,那里有一个好处,开窗能看见对面的小和山,满眼都是绿。 那是 2008 年。iPhone 3G 刚发布,智能手机还没有把所有音乐装进一个 App。中国人听歌,很多时候仍然是在百度里搜歌名,在论坛、博客、资源站之间点来点去,找到一个 MP3,下载到电脑,再塞进 MP3 播放器。搜到什么,全凭运气。 文件名可能是乱码,320K 写在名字里,点开却是一团糊;一个歌名后面跟着十几个下载链接,不知道哪个是真的。专辑信息缺页少字,合唱歌手一多就叫「群星」,曲目次序经常被打乱,一首歌到底收在哪张唱片、哪一年发行,很少有人在乎。 当时网络音乐已经是中国网民使用率最高的互联网服务之一。2008 年的 CNNIC 调查里,86.6% 的网民半年内听过网络音乐,71.2% 下载过音乐。几亿首歌正在互联网上流动,大部分时候,它们只是一个 MP3 文件。 虾米偏偏想把这些文件重新变回「唱片」。 专辑要按照原版顺序排列;多人演唱,名字得一个个写全,不能简单扔进「群星」;音质尽量保证到 320K;同一首歌的不同版本要分开;歌手、专辑、年份、厂牌、曲风,能补的都补上。 从创立开始,编辑就是虾米员工里人数最多的一群人。他们每天做的事情就是找资料,核资料,把一张唱片重新拼完整。网站只有十万用户的时候,虾米已经养了六名语种编辑,除了中文、英语、日语、韩语,还有人专门处理俄语、泰语、西班牙语。搜索时甚至可以直接使用这些语言。 公司自己的人不够,就让用户来。虾米从世界各地找来三百多名资深音乐爱好者,让他们一起补曲库。后来,用户里慢慢形成了一群专门负责资料纠错的人,大家管自己叫「维基组」。 这个名字取得一点都不夸张。他们会讨论一张唱片究竟应该算 Studio Album、EP 还是 Live Album;古典音乐的曲目名称该采用什么结构;作曲家应该写全名还是简称;欧美单曲应该按什么规则收录。有人甚至专门写规则,提醒编辑以后多参考几家古典音乐网站,「不要辜负这么多古典爱好者的期望」。 有些资料,网上根本找不到,他们就去翻 CD。唱片盒拆开,拿出内页。制作人是谁,贝斯是谁弹的,弦乐是谁编的,录音棚在哪里,一行一行看,再一个字一个字敲进虾米。后来有人问,除了买正版 CD,还有哪里能找到一首华语歌完整的制作信息。虾米员工说,很多时候唱片公司自己发来的数字资料都没有,只能靠用户翻唱片内页补。 一名叫 Desperado 的用户,曾经一个人贡献过 943 位艺人的资料和 214 份专辑资料,还做过虾米歌词组的组长。 这群人甚至给「听歌」制定了一整套民间学术规范。虾米早年的社区很像一个音乐 BBS。有人做精选集,有人写长乐评,有人纠错,有人研究怎么压出质量更好的 320K MP3。早期的乐评曾经要求至少写 300 字。你不能只留一句「好听」就走,既然专门点开来讨论一首歌,总得认真说点什么。 当用户点进一个流派之后,还能继续往下钻。Dream Pop 下面有什么,Shoegaze 又从哪里来,Post-Rock 和 Progressive Rock 到底有什么差别。对于很多人来说,虾米更像一张不断往外展开的音乐地图。他们会从一张唱片走到另一张唱片,从一个乐队走到一个从来没听说过的人,最后忘记自己最开始到底想找什么。 这套分类后来越做越大。虾米留下的曲风体系最终被用户整理成一份 436 页的文档,24 个一级分类,下面还有 548 个二级分类。很多分类,一辈子可能只有很少的人会点进去,但虾米还是给它留了格子。 它还有一个栏目,叫「荒岛唱片」。 这个栏目提出了一个有意思的问题:「如果有一天流落荒岛,只能带几张唱片,你会带什么?」 编辑借着这个问题,一张一张推荐那些不那么热门,却值得被听见的唱片。后来栏目有了自己的口号:「不让好音乐继续流浪」。2020 年,他们甚至跟盒马开过一家「荒岛唱片面包店」。 这个名字其实很像虾米自己。一大片海,中间有一座小岛。外面很吵,岛上摆着一些没人急着听的歌。愿意游过来的人,就坐一会儿。 虾米的办公室后来也越来越像这样一个地方。多位前员工回忆,休息区有个小舞台,旁边放着吉他、钢琴和键盘。晚饭的时候,有人上去弹琴唱歌;有人刚进公司不久,就拉着同事组了乐队。 一群做音乐网站的人,多少有点公器私用。他们把自己的爱好搬进办公室,然后找到一个很正当的理由,每天继续听歌。 连最初的商业模式,都带着这种理想主义。王皓想做一套封闭的 P2P 系统。用户下载一首歌,要付 0.8 元。按照早年的设计,其中一部分准备留给版权方,一部分归上传和分发音乐的人,平台自己只拿剩下的一部分。用户下载过音乐以后,自己的电脑又会成为网络里的一个节点,把这首歌继续传给别人。 虾米甚至给自己的虚拟货币起了一个很顺手的单位,「米」。 上传原创专辑、帮助传播音乐,都有机会挣到米。听歌的人同时也是音乐的分销者。王皓想把唱片工业里很长的一条链条压短,让音乐从创作者手里更直接地走到听众那里。 这套设计现在看起来有点天真。但最初几年,虾米就是这么一点一点长出来的。 麻烦也从最开始埋在里面。P2P 帮虾米迅速积累了大量曲库,却同时留下一个迟早要面对版权问题。2010 年,李志、周云蓬、万晓利、左小祖咒等数十位音乐人公开联名,抗议作品未经授权出现在虾米。 偶尔 旧虾米当然也用算法。到了 2011 年,虾米自己的推荐系统基本成形。员工后来回忆,王皓要求后台要给每个用户建立三十多个音乐标签,而同期豆瓣 FM 大约只记录四五项。 但虾米没有让算法一味讨好人。它会先给你大部分熟悉的东西,再故意掺进一点陌生的。早年的产品思路里,这个比例大约是九比一,九成尽量贴着用户已经形成的口味,剩下一成留给那些没听过音乐。 那个 10%,后来成了很多老用户最怀念的东西。 有个叫「清」的用户,平时听日本视觉系和硬核音乐。虾米给她做的每日 30 首里,有一天突然混进一首很暖的英文歌,《The High Road》。怎么看都不像她会喜欢的东西。结果她听完以后,单曲循环了三天。 另一个用户阿醋稀有段时间沉迷黑金属。虾米在「相似艺人」里给她塞进一支德国乐队 Empyrium。点开以后却是民谣,一星期以后,她成了 Empyrium 的粉丝。继续往前翻,才发现这支乐队早期确实做过黑金属,后来转向不插电民谣。音乐形式换了,那种隐居、避世的气质却一直没变。阿醋稀后来回忆,接下来一两年,自己的审美都受这次推荐影响。 这大概就是旧虾米对算法的一种理解。它会猜你喜欢什么,也允许自己偶尔不那么循规蹈矩一点。 虾米上有一群用户喜欢叫自己 Digger,他们会顺着一张专辑的制作人、厂牌和流派一路点下去。 虾米用户「抛抛」2014 年偶然听到一个意大利音乐人的作品,觉得声音很怪,也很新鲜。顺着资料找下去,他第一次知道,原来这种东西有名字,叫蒸汽波。 他继续听,后来干脆自己开始做。抛抛申请成为虾米音乐人,把作品上传上去。几首歌陆续被编辑发现,又几次出现在虾米首页。 这种事情在虾米并不少见。虾米编辑部把自己的工作叫「音乐领航员」。编辑每天听大量新歌,做专题推荐,写乐评和推荐语,挑那些还没进入大众视野的声音。到了 2020 年,他们还在做《荒岛唱片》《环球音乐地图》这样的栏目。 负责《荒岛唱片》的编辑逢夏,上大学时会自己坐两个小时的车去市中心 Livehouse 看演出,进虾米以后,她的工作变成每天继续听歌,再想办法把自己挖掘到的东西递给别人。 2013 年 7 月,「虾米音乐人」平台上线。独立音乐人和独立厂牌可以自己上传作品,给正版下载自主定价,下载收入 100% 归音乐人。第一年,超过五千名音乐人入驻。 第二年,虾米又启动「寻光计划」。计划最初准备从平台上的音乐人里挑人,帮他们把 Demo 继续往下做。缺制作人,就帮忙联系制作人;没有录音棚,就出录音棚的钱;母带、唱片发行、MV、巡演,虾米都帮忙筹备。最早公开的方案里,他们甚至计划一年做十五张专辑或 EP,这个产量已经能赶上一家专业唱片公司。 第一季最后留下了 13 组音乐人、14 张唱片,累计获得约 1.6 亿次试听。 程璧是其中一个。她后来形容虾米是自己的「伯乐」。前三张专辑都在虾米首发,第一届寻光计划开始时,她也成了寻光音乐人,后来人们才有机会认识《诗遇上歌》《我想和你虚度时光》里的程璧。 这样的故事越来越多。到后来,虾米一共吸引了四万多名原创音乐人入驻。曲库里有三千万首歌,一千多个曲风流派,用户做出了五亿多个歌单。2018 年 2 月的一份行业数据里,虾米日活有 968.5 万。规模已经不小,但和最大的几个音乐平台相比,它依旧像那只最初的小虾米。 最后一夜 然后时代变了。 版权大战越打越凶,腾讯音乐和网易云音乐花大钱买独家,虾米的曲库一批批变灰。音乐成了流量战争的弹药。2015 年,高晓松、宋柯、何炅组成的「铁三角」入主阿里音乐,第二年把天天动听改造成阿里星球,去做粉丝经济,人员从虾米调走,产品更新越来越慢。 2016 年 1 月,王皓离开了自己创办的虾米,转岗阿里钉钉。他说,音乐行业荒诞到令人发指。 他说这句话的时候,虾米还在运营。五年后它关停。到 2020 年,虾米还有约一百万日活用户。从 968 万到 100 万,中间不过几年。 2021 年 1 月 5 日,虾米宣布将在一个月后停止服务,平台给用户留出时间导出歌单,可以存成静态网页或 Excel。 宣布两天后,王皓接受品玩采访,说: 「我觉得没什么好怀念的。」 2021 年 2 月 4 日,虾米还剩最后一天。 这一天,日推第一次失去了私人属性。所有用户打开虾米,收到的都是同一份歌单。过去十二年,这个栏目每天替人挑歌;到了最后一天,编辑部替自己挑了三十首。 《好久不见》《你一直在》《我不愿让你一个人》《当爱已成往事》《我终于失去了你》《再见》。歌名已经足够直白,每首歌上方还有一小段推荐语。三十段话依次连起来,是虾米写给用户的最后一封信。里面甚至还留着一句很虾米的玩笑:「虽然我们最后还是没买到周董的版权(笑)。」 真正的告别从晚上八点开始。 虾米 App 当时有一个叫「趴间」的功能,可以理解成音乐直播间,有人主持、放歌,其他人进来听,可以点歌,也可以在屏幕上聊天。几个虾米用户群提前串联起来,约好那天晚上一起开趴,把房间取名叫「虾米星球的最后一夜」。活动介绍里写着:「我们也许无法扭转乾坤,可我们还能陪你倒数,直到最后一秒。」 数千个人挤了进去。 有人点歌,有人留言,有人什么也不做,只把 App 开着。虾米编辑部的人也来了。编辑阿鼓在直播间里一个个告别,先谢用户,又谢那些曾经待过虾米的编辑。他说,这些年在虾米做过编辑的人加起来有几十个。很多用户直到这时,才第一次和做出那些歌单的人待在同一个房间里。 大家等的是 2 月 5 日零点。 官方此前已经写得很清楚,从这一刻开始,歌曲试听、下载、评论,以及个人资料导出,都将停止。有人提前请了假,有人下班回家关上房门,一个人听了一整晚;还有人始终不肯退出 App,觉得只要页面还开着,音乐也许就能多播一会儿。 零点到了,虾米没有像拔掉插头那样瞬间安静下来。 有些人的歌还在播。于是原本等待告别的人反而兴奋起来,屏幕上的消息一条接一条: 「你们还有声音吗?」 「我还能听。」 有人试着断网,有人提醒其他人千万别关 App。所有人都在做一件有点荒唐的事,隔着不同城市、不同手机,互相确认一款软件还有没有生命体征。只要还有一个人的耳机里有声音,虾米就好像还没彻底死去。 它最终还是停了。 有人正在播放的歌突然断掉,有人的导出进度停在半路。一个小时以后,趴间里已经没有音乐,屏幕上却还在不停提示「有人加入」。 关停前的一个月里,用户其实一直在搬家。 虾米开放了个人资料导出,QQ 音乐和网易云音乐也做了歌单迁移入口。有人花六个小时,把自己收藏的六千多首歌一首首救出来;有人截下个人主页,保存自己究竟听过多少分钟、多少首歌;还有人把虾米那些复杂到近乎偏执的曲风分类整理进 Excel,给这份文件起了一个很郑重的名字:「拯救虾米的遗产」。 有人做得更直接。关停消息传出以后,几名用户跑到北京望京的阿里办公楼下,拉起两条横幅: 「虾米别走。」 「虾米别关。」 虾米创始团队成员、前产品总监稻草最后只在社交平台写了一句:「现在最好的告别,就是不说话。」创始人王皓那天发了五条微博,没有一条提到虾米。他早几年就离开了阿里,也早已经完成了自己的告别。 可用户没有。 两年后的 2023 年 2 月,还有人专门写了一篇「虾米音乐两周年祭」。一个已经不存在的 App,仍然被人按照人的方式纪念,一周年、两周年,忌日,祭文。 人们后来怀念的那个虾米,其实在关停之前就已经死过很多次了。版权一批批下架,创始人离开,管理层更换,入口被挪走,用户越来越少。活着的虾米最后只剩每天一百万人打开,在版权大战里已经算不上什么筹码。 可等它真的死了,这一百万人突然有了名字。 他们叫自己「音乐难民」。 虾米死后,「虾米」这两个字并没有跟着消失。播放器关停七个月后,大麦成立「虾米音乐娱乐」。过去那句「听见不同」,被改成了「看见不同」;原本装在耳机里的虾米,开始往剧场、舞台和音乐节上走。 2022 年,阿那亚虾米音乐节第一次在秦皇岛海边举办,主题叫「一直游到海水变蓝」。 人群重新聚在「虾米」这个名字下面,只不过这一次,他们不再隔着播放器听歌,而是真的站在海边,看乐队上台,看太阳落下去。到 2025 年第四届音乐节,已经有 6 组国际音乐人在这里完成中国内地首秀。 虾米于是有了一种很奇怪的「死后生活」。产品死了,名字还在。原来的团队散了,新的业务继续使用它。那只曾经缩在播放器图标里的小虾米,被阿里从一个地方捞出来,又放进另一个地方。 到了 2026 年,这个名字第三次出现。这一次,既没有播放器,也没有舞台,它被放到了一款 AI 音乐模型上。 HappyShrimp,快乐虾米。 十年前,创办虾米的人离开阿里,甚至远走普吉;十年后,阿里重新拿起了他留下的那个名字。只是这一次,做虾米的人已经换了一批,连「音乐」这件事本身也变了。 新的身体 快乐虾米现在还很年轻。1.0 版本里,人声偶尔还有机器味,复杂的中文歌词会唱得含混,段落控制也没有专业制作软件那么细。可这些大概只是时间问题。今天需要反复抽卡十几次才能碰到的结果,下一版可能改几个词就能得到。 真正值得注意是,写一首歌这件事,正在突然变得太容易。 Suno 每天已经能生成超过 700 万首歌曲。Deezer 今年 6 月的高峰期,每天收到接近 9 万首完全由 AI 生成的音乐,第一次超过平台全部新增音乐的一半。 音乐工业过去很少为「歌太多了」发愁。 旧虾米出生的时候,互联网当然也不缺 MP3,但一首真正想听的歌仍然来之不易。它可能藏在某张冷门唱片里,藏在一个没人认识的乐队下面,甚至连曲风叫什么都不知道。所以虾米花很多力气做一件事,找。 那时候音乐平台怕的是,好东西沉下去,快乐虾米所在的世界正好相反。 你想要一首下雨天听的歌,它可以现做;想要女声、慢一点、像十年前的夏天,也可以继续改。短视频缺 BGM,广告缺小样,游戏缺一段背景音乐,过去要先去曲库里找,或者找一个人来写,现在都可以直接生成一首。 于是音乐第一次从「找一首合适的」,慢慢变成「做一首合适的」。 这两个动作看起来只差一个字,背后的世界完全不同。 找歌的时候,总有一个陌生人在另一头。也许是一个你从没听说过的意大利音乐人,也许是刚上传第一份 Demo 的大学生,也许是一支几十年前就已经解散的德国乐队。虾米负责把你带过去。 生成音乐的时候,完全不需要人的存在。你描述情绪,模型给出旋律;你不满意,再做一首。音乐变成了一种可以按需要即时生产的东西。它不必先属于谁,也不必等着被谁发现。 这也是为什么快乐虾米这个名字放在这里,会显得有一点奇怪。 十八年前,王皓给那个网站取名 EMUMO,Earn Music & Money。他最初想解决的问题之一,是互联网时代音乐应该怎样分钱,怎样让做音乐的人拿到更多。 今天的快乐虾米面对的却是另一个问题。好音乐是否已经存在,甚至都不再重要。 版权的麻烦也因此重新出现,只是换了一副样子。以前的争议是,一首歌未经允许被上传到平台,该把钱给谁;现在的问题变成了,模型学习过谁的歌,它生成出来的新音乐又算谁的。 就在快乐虾米发布的 8 月 17 日,美国独立音乐出版商 Round Hill Music 起诉 Suno,指控它未经授权使用数百首歌曲的歌词训练模型。 旧虾米替人找歌,快乐虾米替人做歌。 前一个世界里,一首陌生的歌可能改变一个人的审美,听众顺着它一路走下去,最后甚至自己成为音乐人;后一个世界里,人只需要说出自己想听什么。 然后等一分钟,歌就来了。 游到海水变蓝 作家余华小时候住在浙江海盐,他看到的海一直是黄的。课本却说,海水是蓝色的。 他想知道蓝色到底在哪里,于是往海里游。岸一点点远了,水越来越深,他还是继续往前。小时候的人会相信很多很具体的事情,比如只要游得足够远,就能抵达课本里的那种蓝。 最后当然没有。但很多年以后,他还记得自己曾经朝那个方向游过。 我总觉得,旧虾米留下来的东西,也有一点像这件事。 它存在的那个年代,很多东西都还隔着距离。一首真正喜欢的歌,不一定第一次就喜欢。一个陌生的名字,也不会立刻变成你的审美。人会因为偶然听见的一点声音继续往下走,今天听不懂,过几个月再回来;从一个人走到另一个人,从一种音乐走到另一种音乐。 后来回头看,才发现人的很多喜好,就是在这样绕路的时候长出来的。 互联网和 AI 这些年一直在缩短这种距离。搜索让一首歌更容易被找到,推荐把陌生的音乐送到耳边。到了生成式 AI,这件事又往前走了一步:人甚至可以不用等待一首合适的歌出现,自己描述一种心情,然后让它被写出来。 一分钟以后,音乐就来了。 这当然改变了很多东西。 过去,听众和创作者之间隔着一条很长的路。有人写歌,有人录音,有人发行,有人整理,有人推荐,最后才有人偶然听见。虾米花了十二年,在这条路上搭了很多路标,让人更容易走向那些原本不会遇见的音乐。 今天,这条路正在变短。甚至有些时候,听众自己也可以走到路的另一边。一个不会乐器、不懂乐理的人,也可以第一次试着把脑子里模糊的情绪变成一首歌。也许它并不成熟,也许里面仍然有明显的机器痕迹,但「创作音乐」这件事,第一次离普通人这么近。 这可能也是快乐虾米和旧虾米之间有意思的地方。 十八年前,虾米试着让更多音乐被听见。十八年后,另一只虾米开始试着让更多人做出音乐。它们面对的已经不是同一个音乐世界,也没有必要回答同一个问题。 余华小时候没有游到蓝色的海。后来的人也许不需要再游那么远了。技术不断把远处的东西拉近,把过去只有少数人能够做到的事情,放到更多人面前。 只是人还是要决定自己往哪里游。 HappyShrimp 生成一首歌,大约只需要一分钟。 只是有些东西,可能恰恰生长在那一分钟之外。 原文链接

虾米音乐离开五年,阿里教会另一只「虾米」用 AI 写歌

原文标题:《虾米音乐离开五年,阿里教会另一只「虾米」用 AI 写歌》
原文作者:动察Beating
8 月 17 日,虾米又回来了。
阿里巴巴发布 AI 音乐模型 HappyShrimp 1.0,中文名「快乐虾米」。用户只需要写下一句话,它就能生成一首完整的歌。
你甚至不需要知道什么是和弦、拍号或者调式。可以告诉它,想写一首送给刚毕业的自己,最好适合咖啡馆里放;也可以说,快下班了,窗外突然下雨,想要一点丧,但别太沉重。过去这些只能拿来形容心情的话,现在也能变成音乐指令。快乐虾米会试着听懂,然后创作出来。
目前,它已经上线电脑网页端测试版。阿里称,HappyShrimp 采用端到端整曲生成,把曲风、情绪、年代和人声放进同一套生成过程里处理。实际测试下来,它对中文日常表达尤其敏感。很多时候,用户说不清自己究竟想要什么音乐,只知道「再轻一点」「像十年前的夏天」「不要太苦」,它也能顺着这些模糊的描述往下做。
这让音乐生产变得很便宜。给短视频补一段配乐,替广告做个小样,给游戏、播客找背景音乐,都不再需要从头搭一套制作流程。测试页面上的标准会员价格约 30 元一个月,可以生成 150 首歌,平均下来,一首歌大约两毛钱。
上线当天,快乐虾米同时宣布与太合音乐合作。阿里还计划让它出现在今年的阿那亚虾米音乐节上。它也是阿里「Happy 加动物」系列的第三个成员,HappyHorse 做视频生成,HappyOyster 做世界模型,到了第三个,轮到音乐。
虾米音乐用了十二年,才成为后来被人怀念的虾米。
快乐虾米生成一首歌,大约只需要一分钟。
手工年代
旧虾米一开始很小。
王皓原本是阿里的程序员,也在玩乐队,网名叫「南瓜」,取自他喜欢的 Smashing Pumpkins。大学时,他弹吉他,组过一支叫「黑水」的乐队。大二暑假,有一次在排练房里被狗咬了手指,吉他暂时弹不了,他闲着没事,开始学写代码。
最早是 HTML,后来是 PHP。他甚至翻译 PHP 手册,给别人做网页赚零花钱,一个静态页面 200 块。再后来,他自己写了一个论坛,叫「声音网」,专门放杭州地下音乐和演出信息。2001 年,这个论坛已经有几万注册用户,每天几百人在线,一群玩乐队的、听摇滚的年轻人在里面约演出、找乐手、聊天。外地乐队来杭州,有时也是王皓帮忙联系场地。
他后来发现,自己可能没有成为职业音乐人的天赋,却很擅长把喜欢音乐的人聚到一起。
大学毕业后,他还和后来一起创办虾米的朱七合租在一起。两个人平时各自工作,到了周末,杭州的乐手和朋友就往这里跑,吃饭、喝酒、聊音乐,有时候一屋子都是人。王皓靠在网上卖乐器过日子,白天做生意,晚上和周末帮乐队找地方演出。
2003 年,他觉得电子商务可能真能成为一门生意,于是去了阿里学怎么做互联网。先写 Java,后来做需求分析。待了几年以后,他又开始琢磨音乐。
那时候大家下载电影会用 eMule、Kazaa、BT。王皓想,音乐能不能也做一套 P2P,只不过把那些乱七八糟的文件整理干净,再让上传的人和做音乐的人都赚到一点钱。
2007 年,他离开阿里。最初一共六个人,王皓做总经理,朱七管内容,还有运营和三个程序员。几个人出的本钱差不多,股份也差不多,每个月给自己发 3000 块工资。
他们把网站叫 EMUMO,Earn Music & Money。这个名字几乎把最初的野心全写在脸上,听音乐的人得到音乐,做音乐的人得到钱。
后来才改名叫虾米。他们给出的解释是:「我们只是小虾米,但是我们有大梦想。」
2008 年 11 月,虾米网正式上线。
第一个办公室也很像一家「小虾米」公司。地点在杭州古荡的龙都大厦,一间商住两用房,70 平米。上一家公司搬走以后没留下什么,他们也没怎么装修,搬几张桌椅进去就开始上班。服务器没地方放,就架在阳台上。每天一进办公室,都能听见风扇不停地转。王皓后来回忆,那里有一个好处,开窗能看见对面的小和山,满眼都是绿。
那是 2008 年。iPhone 3G 刚发布,智能手机还没有把所有音乐装进一个 App。中国人听歌,很多时候仍然是在百度里搜歌名,在论坛、博客、资源站之间点来点去,找到一个 MP3,下载到电脑,再塞进 MP3 播放器。搜到什么,全凭运气。
文件名可能是乱码,320K 写在名字里,点开却是一团糊;一个歌名后面跟着十几个下载链接,不知道哪个是真的。专辑信息缺页少字,合唱歌手一多就叫「群星」,曲目次序经常被打乱,一首歌到底收在哪张唱片、哪一年发行,很少有人在乎。
当时网络音乐已经是中国网民使用率最高的互联网服务之一。2008 年的 CNNIC 调查里,86.6% 的网民半年内听过网络音乐,71.2% 下载过音乐。几亿首歌正在互联网上流动,大部分时候,它们只是一个 MP3 文件。
虾米偏偏想把这些文件重新变回「唱片」。
专辑要按照原版顺序排列;多人演唱,名字得一个个写全,不能简单扔进「群星」;音质尽量保证到 320K;同一首歌的不同版本要分开;歌手、专辑、年份、厂牌、曲风,能补的都补上。
从创立开始,编辑就是虾米员工里人数最多的一群人。他们每天做的事情就是找资料,核资料,把一张唱片重新拼完整。网站只有十万用户的时候,虾米已经养了六名语种编辑,除了中文、英语、日语、韩语,还有人专门处理俄语、泰语、西班牙语。搜索时甚至可以直接使用这些语言。
公司自己的人不够,就让用户来。虾米从世界各地找来三百多名资深音乐爱好者,让他们一起补曲库。后来,用户里慢慢形成了一群专门负责资料纠错的人,大家管自己叫「维基组」。
这个名字取得一点都不夸张。他们会讨论一张唱片究竟应该算 Studio Album、EP 还是 Live Album;古典音乐的曲目名称该采用什么结构;作曲家应该写全名还是简称;欧美单曲应该按什么规则收录。有人甚至专门写规则,提醒编辑以后多参考几家古典音乐网站,「不要辜负这么多古典爱好者的期望」。
有些资料,网上根本找不到,他们就去翻 CD。唱片盒拆开,拿出内页。制作人是谁,贝斯是谁弹的,弦乐是谁编的,录音棚在哪里,一行一行看,再一个字一个字敲进虾米。后来有人问,除了买正版 CD,还有哪里能找到一首华语歌完整的制作信息。虾米员工说,很多时候唱片公司自己发来的数字资料都没有,只能靠用户翻唱片内页补。
一名叫 Desperado 的用户,曾经一个人贡献过 943 位艺人的资料和 214 份专辑资料,还做过虾米歌词组的组长。
这群人甚至给「听歌」制定了一整套民间学术规范。虾米早年的社区很像一个音乐 BBS。有人做精选集,有人写长乐评,有人纠错,有人研究怎么压出质量更好的 320K MP3。早期的乐评曾经要求至少写 300 字。你不能只留一句「好听」就走,既然专门点开来讨论一首歌,总得认真说点什么。
当用户点进一个流派之后,还能继续往下钻。Dream Pop 下面有什么,Shoegaze 又从哪里来,Post-Rock 和 Progressive Rock 到底有什么差别。对于很多人来说,虾米更像一张不断往外展开的音乐地图。他们会从一张唱片走到另一张唱片,从一个乐队走到一个从来没听说过的人,最后忘记自己最开始到底想找什么。
这套分类后来越做越大。虾米留下的曲风体系最终被用户整理成一份 436 页的文档,24 个一级分类,下面还有 548 个二级分类。很多分类,一辈子可能只有很少的人会点进去,但虾米还是给它留了格子。
它还有一个栏目,叫「荒岛唱片」。
这个栏目提出了一个有意思的问题:「如果有一天流落荒岛,只能带几张唱片,你会带什么?」
编辑借着这个问题,一张一张推荐那些不那么热门,却值得被听见的唱片。后来栏目有了自己的口号:「不让好音乐继续流浪」。2020 年,他们甚至跟盒马开过一家「荒岛唱片面包店」。
这个名字其实很像虾米自己。一大片海,中间有一座小岛。外面很吵,岛上摆着一些没人急着听的歌。愿意游过来的人,就坐一会儿。
虾米的办公室后来也越来越像这样一个地方。多位前员工回忆,休息区有个小舞台,旁边放着吉他、钢琴和键盘。晚饭的时候,有人上去弹琴唱歌;有人刚进公司不久,就拉着同事组了乐队。
一群做音乐网站的人,多少有点公器私用。他们把自己的爱好搬进办公室,然后找到一个很正当的理由,每天继续听歌。
连最初的商业模式,都带着这种理想主义。王皓想做一套封闭的 P2P 系统。用户下载一首歌,要付 0.8 元。按照早年的设计,其中一部分准备留给版权方,一部分归上传和分发音乐的人,平台自己只拿剩下的一部分。用户下载过音乐以后,自己的电脑又会成为网络里的一个节点,把这首歌继续传给别人。
虾米甚至给自己的虚拟货币起了一个很顺手的单位,「米」。
上传原创专辑、帮助传播音乐,都有机会挣到米。听歌的人同时也是音乐的分销者。王皓想把唱片工业里很长的一条链条压短,让音乐从创作者手里更直接地走到听众那里。
这套设计现在看起来有点天真。但最初几年,虾米就是这么一点一点长出来的。
麻烦也从最开始埋在里面。P2P 帮虾米迅速积累了大量曲库,却同时留下一个迟早要面对版权问题。2010 年,李志、周云蓬、万晓利、左小祖咒等数十位音乐人公开联名,抗议作品未经授权出现在虾米。
偶尔
旧虾米当然也用算法。到了 2011 年,虾米自己的推荐系统基本成形。员工后来回忆,王皓要求后台要给每个用户建立三十多个音乐标签,而同期豆瓣 FM 大约只记录四五项。
但虾米没有让算法一味讨好人。它会先给你大部分熟悉的东西,再故意掺进一点陌生的。早年的产品思路里,这个比例大约是九比一,九成尽量贴着用户已经形成的口味,剩下一成留给那些没听过音乐。
那个 10%,后来成了很多老用户最怀念的东西。
有个叫「清」的用户,平时听日本视觉系和硬核音乐。虾米给她做的每日 30 首里,有一天突然混进一首很暖的英文歌,《The High Road》。怎么看都不像她会喜欢的东西。结果她听完以后,单曲循环了三天。
另一个用户阿醋稀有段时间沉迷黑金属。虾米在「相似艺人」里给她塞进一支德国乐队 Empyrium。点开以后却是民谣,一星期以后,她成了 Empyrium 的粉丝。继续往前翻,才发现这支乐队早期确实做过黑金属,后来转向不插电民谣。音乐形式换了,那种隐居、避世的气质却一直没变。阿醋稀后来回忆,接下来一两年,自己的审美都受这次推荐影响。
这大概就是旧虾米对算法的一种理解。它会猜你喜欢什么,也允许自己偶尔不那么循规蹈矩一点。
虾米上有一群用户喜欢叫自己 Digger,他们会顺着一张专辑的制作人、厂牌和流派一路点下去。
虾米用户「抛抛」2014 年偶然听到一个意大利音乐人的作品,觉得声音很怪,也很新鲜。顺着资料找下去,他第一次知道,原来这种东西有名字,叫蒸汽波。
他继续听,后来干脆自己开始做。抛抛申请成为虾米音乐人,把作品上传上去。几首歌陆续被编辑发现,又几次出现在虾米首页。
这种事情在虾米并不少见。虾米编辑部把自己的工作叫「音乐领航员」。编辑每天听大量新歌,做专题推荐,写乐评和推荐语,挑那些还没进入大众视野的声音。到了 2020 年,他们还在做《荒岛唱片》《环球音乐地图》这样的栏目。
负责《荒岛唱片》的编辑逢夏,上大学时会自己坐两个小时的车去市中心 Livehouse 看演出,进虾米以后,她的工作变成每天继续听歌,再想办法把自己挖掘到的东西递给别人。
2013 年 7 月,「虾米音乐人」平台上线。独立音乐人和独立厂牌可以自己上传作品,给正版下载自主定价,下载收入 100% 归音乐人。第一年,超过五千名音乐人入驻。
第二年,虾米又启动「寻光计划」。计划最初准备从平台上的音乐人里挑人,帮他们把 Demo 继续往下做。缺制作人,就帮忙联系制作人;没有录音棚,就出录音棚的钱;母带、唱片发行、MV、巡演,虾米都帮忙筹备。最早公开的方案里,他们甚至计划一年做十五张专辑或 EP,这个产量已经能赶上一家专业唱片公司。
第一季最后留下了 13 组音乐人、14 张唱片,累计获得约 1.6 亿次试听。
程璧是其中一个。她后来形容虾米是自己的「伯乐」。前三张专辑都在虾米首发,第一届寻光计划开始时,她也成了寻光音乐人,后来人们才有机会认识《诗遇上歌》《我想和你虚度时光》里的程璧。
这样的故事越来越多。到后来,虾米一共吸引了四万多名原创音乐人入驻。曲库里有三千万首歌,一千多个曲风流派,用户做出了五亿多个歌单。2018 年 2 月的一份行业数据里,虾米日活有 968.5 万。规模已经不小,但和最大的几个音乐平台相比,它依旧像那只最初的小虾米。
最后一夜
然后时代变了。
版权大战越打越凶,腾讯音乐和网易云音乐花大钱买独家,虾米的曲库一批批变灰。音乐成了流量战争的弹药。2015 年,高晓松、宋柯、何炅组成的「铁三角」入主阿里音乐,第二年把天天动听改造成阿里星球,去做粉丝经济,人员从虾米调走,产品更新越来越慢。
2016 年 1 月,王皓离开了自己创办的虾米,转岗阿里钉钉。他说,音乐行业荒诞到令人发指。
他说这句话的时候,虾米还在运营。五年后它关停。到 2020 年,虾米还有约一百万日活用户。从 968 万到 100 万,中间不过几年。
2021 年 1 月 5 日,虾米宣布将在一个月后停止服务,平台给用户留出时间导出歌单,可以存成静态网页或 Excel。
宣布两天后,王皓接受品玩采访,说:
「我觉得没什么好怀念的。」
2021 年 2 月 4 日,虾米还剩最后一天。
这一天,日推第一次失去了私人属性。所有用户打开虾米,收到的都是同一份歌单。过去十二年,这个栏目每天替人挑歌;到了最后一天,编辑部替自己挑了三十首。
《好久不见》《你一直在》《我不愿让你一个人》《当爱已成往事》《我终于失去了你》《再见》。歌名已经足够直白,每首歌上方还有一小段推荐语。三十段话依次连起来,是虾米写给用户的最后一封信。里面甚至还留着一句很虾米的玩笑:「虽然我们最后还是没买到周董的版权(笑)。」
真正的告别从晚上八点开始。
虾米 App 当时有一个叫「趴间」的功能,可以理解成音乐直播间,有人主持、放歌,其他人进来听,可以点歌,也可以在屏幕上聊天。几个虾米用户群提前串联起来,约好那天晚上一起开趴,把房间取名叫「虾米星球的最后一夜」。活动介绍里写着:「我们也许无法扭转乾坤,可我们还能陪你倒数,直到最后一秒。」
数千个人挤了进去。
有人点歌,有人留言,有人什么也不做,只把 App 开着。虾米编辑部的人也来了。编辑阿鼓在直播间里一个个告别,先谢用户,又谢那些曾经待过虾米的编辑。他说,这些年在虾米做过编辑的人加起来有几十个。很多用户直到这时,才第一次和做出那些歌单的人待在同一个房间里。
大家等的是 2 月 5 日零点。
官方此前已经写得很清楚,从这一刻开始,歌曲试听、下载、评论,以及个人资料导出,都将停止。有人提前请了假,有人下班回家关上房门,一个人听了一整晚;还有人始终不肯退出 App,觉得只要页面还开着,音乐也许就能多播一会儿。
零点到了,虾米没有像拔掉插头那样瞬间安静下来。
有些人的歌还在播。于是原本等待告别的人反而兴奋起来,屏幕上的消息一条接一条:
「你们还有声音吗?」
「我还能听。」
有人试着断网,有人提醒其他人千万别关 App。所有人都在做一件有点荒唐的事,隔着不同城市、不同手机,互相确认一款软件还有没有生命体征。只要还有一个人的耳机里有声音,虾米就好像还没彻底死去。
它最终还是停了。
有人正在播放的歌突然断掉,有人的导出进度停在半路。一个小时以后,趴间里已经没有音乐,屏幕上却还在不停提示「有人加入」。
关停前的一个月里,用户其实一直在搬家。
虾米开放了个人资料导出,QQ 音乐和网易云音乐也做了歌单迁移入口。有人花六个小时,把自己收藏的六千多首歌一首首救出来;有人截下个人主页,保存自己究竟听过多少分钟、多少首歌;还有人把虾米那些复杂到近乎偏执的曲风分类整理进 Excel,给这份文件起了一个很郑重的名字:「拯救虾米的遗产」。
有人做得更直接。关停消息传出以后,几名用户跑到北京望京的阿里办公楼下,拉起两条横幅:
「虾米别走。」
「虾米别关。」
虾米创始团队成员、前产品总监稻草最后只在社交平台写了一句:「现在最好的告别,就是不说话。」创始人王皓那天发了五条微博,没有一条提到虾米。他早几年就离开了阿里,也早已经完成了自己的告别。
可用户没有。
两年后的 2023 年 2 月,还有人专门写了一篇「虾米音乐两周年祭」。一个已经不存在的 App,仍然被人按照人的方式纪念,一周年、两周年,忌日,祭文。
人们后来怀念的那个虾米,其实在关停之前就已经死过很多次了。版权一批批下架,创始人离开,管理层更换,入口被挪走,用户越来越少。活着的虾米最后只剩每天一百万人打开,在版权大战里已经算不上什么筹码。
可等它真的死了,这一百万人突然有了名字。
他们叫自己「音乐难民」。
虾米死后,「虾米」这两个字并没有跟着消失。播放器关停七个月后,大麦成立「虾米音乐娱乐」。过去那句「听见不同」,被改成了「看见不同」;原本装在耳机里的虾米,开始往剧场、舞台和音乐节上走。
2022 年,阿那亚虾米音乐节第一次在秦皇岛海边举办,主题叫「一直游到海水变蓝」。
人群重新聚在「虾米」这个名字下面,只不过这一次,他们不再隔着播放器听歌,而是真的站在海边,看乐队上台,看太阳落下去。到 2025 年第四届音乐节,已经有 6 组国际音乐人在这里完成中国内地首秀。
虾米于是有了一种很奇怪的「死后生活」。产品死了,名字还在。原来的团队散了,新的业务继续使用它。那只曾经缩在播放器图标里的小虾米,被阿里从一个地方捞出来,又放进另一个地方。
到了 2026 年,这个名字第三次出现。这一次,既没有播放器,也没有舞台,它被放到了一款 AI 音乐模型上。
HappyShrimp,快乐虾米。
十年前,创办虾米的人离开阿里,甚至远走普吉;十年后,阿里重新拿起了他留下的那个名字。只是这一次,做虾米的人已经换了一批,连「音乐」这件事本身也变了。
新的身体
快乐虾米现在还很年轻。1.0 版本里,人声偶尔还有机器味,复杂的中文歌词会唱得含混,段落控制也没有专业制作软件那么细。可这些大概只是时间问题。今天需要反复抽卡十几次才能碰到的结果,下一版可能改几个词就能得到。
真正值得注意是,写一首歌这件事,正在突然变得太容易。
Suno 每天已经能生成超过 700 万首歌曲。Deezer 今年 6 月的高峰期,每天收到接近 9 万首完全由 AI 生成的音乐,第一次超过平台全部新增音乐的一半。
音乐工业过去很少为「歌太多了」发愁。
旧虾米出生的时候,互联网当然也不缺 MP3,但一首真正想听的歌仍然来之不易。它可能藏在某张冷门唱片里,藏在一个没人认识的乐队下面,甚至连曲风叫什么都不知道。所以虾米花很多力气做一件事,找。
那时候音乐平台怕的是,好东西沉下去,快乐虾米所在的世界正好相反。
你想要一首下雨天听的歌,它可以现做;想要女声、慢一点、像十年前的夏天,也可以继续改。短视频缺 BGM,广告缺小样,游戏缺一段背景音乐,过去要先去曲库里找,或者找一个人来写,现在都可以直接生成一首。
于是音乐第一次从「找一首合适的」,慢慢变成「做一首合适的」。
这两个动作看起来只差一个字,背后的世界完全不同。
找歌的时候,总有一个陌生人在另一头。也许是一个你从没听说过的意大利音乐人,也许是刚上传第一份 Demo 的大学生,也许是一支几十年前就已经解散的德国乐队。虾米负责把你带过去。
生成音乐的时候,完全不需要人的存在。你描述情绪,模型给出旋律;你不满意,再做一首。音乐变成了一种可以按需要即时生产的东西。它不必先属于谁,也不必等着被谁发现。
这也是为什么快乐虾米这个名字放在这里,会显得有一点奇怪。
十八年前,王皓给那个网站取名 EMUMO,Earn Music & Money。他最初想解决的问题之一,是互联网时代音乐应该怎样分钱,怎样让做音乐的人拿到更多。
今天的快乐虾米面对的却是另一个问题。好音乐是否已经存在,甚至都不再重要。
版权的麻烦也因此重新出现,只是换了一副样子。以前的争议是,一首歌未经允许被上传到平台,该把钱给谁;现在的问题变成了,模型学习过谁的歌,它生成出来的新音乐又算谁的。
就在快乐虾米发布的 8 月 17 日,美国独立音乐出版商 Round Hill Music 起诉 Suno,指控它未经授权使用数百首歌曲的歌词训练模型。
旧虾米替人找歌,快乐虾米替人做歌。
前一个世界里,一首陌生的歌可能改变一个人的审美,听众顺着它一路走下去,最后甚至自己成为音乐人;后一个世界里,人只需要说出自己想听什么。
然后等一分钟,歌就来了。
游到海水变蓝
作家余华小时候住在浙江海盐,他看到的海一直是黄的。课本却说,海水是蓝色的。
他想知道蓝色到底在哪里,于是往海里游。岸一点点远了,水越来越深,他还是继续往前。小时候的人会相信很多很具体的事情,比如只要游得足够远,就能抵达课本里的那种蓝。
最后当然没有。但很多年以后,他还记得自己曾经朝那个方向游过。
我总觉得,旧虾米留下来的东西,也有一点像这件事。
它存在的那个年代,很多东西都还隔着距离。一首真正喜欢的歌,不一定第一次就喜欢。一个陌生的名字,也不会立刻变成你的审美。人会因为偶然听见的一点声音继续往下走,今天听不懂,过几个月再回来;从一个人走到另一个人,从一种音乐走到另一种音乐。
后来回头看,才发现人的很多喜好,就是在这样绕路的时候长出来的。
互联网和 AI 这些年一直在缩短这种距离。搜索让一首歌更容易被找到,推荐把陌生的音乐送到耳边。到了生成式 AI,这件事又往前走了一步:人甚至可以不用等待一首合适的歌出现,自己描述一种心情,然后让它被写出来。
一分钟以后,音乐就来了。
这当然改变了很多东西。
过去,听众和创作者之间隔着一条很长的路。有人写歌,有人录音,有人发行,有人整理,有人推荐,最后才有人偶然听见。虾米花了十二年,在这条路上搭了很多路标,让人更容易走向那些原本不会遇见的音乐。
今天,这条路正在变短。甚至有些时候,听众自己也可以走到路的另一边。一个不会乐器、不懂乐理的人,也可以第一次试着把脑子里模糊的情绪变成一首歌。也许它并不成熟,也许里面仍然有明显的机器痕迹,但「创作音乐」这件事,第一次离普通人这么近。
这可能也是快乐虾米和旧虾米之间有意思的地方。
十八年前,虾米试着让更多音乐被听见。十八年后,另一只虾米开始试着让更多人做出音乐。它们面对的已经不是同一个音乐世界,也没有必要回答同一个问题。
余华小时候没有游到蓝色的海。后来的人也许不需要再游那么远了。技术不断把远处的东西拉近,把过去只有少数人能够做到的事情,放到更多人面前。
只是人还是要决定自己往哪里游。
HappyShrimp 生成一首歌,大约只需要一分钟。
只是有些东西,可能恰恰生长在那一分钟之外。
原文链接
Статья
公司倒闭后,如何靠卖员工数据赚钱原文标题:《公司倒闭后,如何靠卖员工数据赚钱》 原文作者:动察Beating 邮件、聊天记录、项目文档、工单,过去只是公司关停后等待清理的数字遗产。现在,它们开始被重新估价,打包,出售,送进 AI 公司的训练管线。 入殓师替死人保住最后的体面。企业死后的体面,则是证明自己留下的东西还有价值。 8 月 17 日,一场破产资产拍卖上,Google 出价 1000 万美元,买下 Spirit Airlines 的全部企业数据。竞标的还有一家,叫 Mercor,出价 750 万,差 250 万输掉了。 拍品分三块。第一块,约 1 亿封员工电子邮件。第二块,5 亿条 Microsoft Teams 消息。两块合计 6 亿条。第三块,日历、表格、财务数据库、项目文件、运营记录,加一批内部软件。乘客档案、常旅客信息等不包含在内。 6 亿条,一个人一天说 100 句话,要不停地说 16000 多年。 算下来一条消息卖了 1.67 美分。美国人把 1 美分硬币叫 penny,掉地上都懒得捡。也就是说,Spirit 员工在 Teams 里说的一句话,值一个半 penny。 时间回到 1980 年,Spirit Airlines 出生在底特律,前身是家卡车公司,叫 Charter One,后来改行开飞机。1992 年改名 Spirit,灵魂的意思。此后 34 年,它把美国超低成本航空的模式做到全行业模仿的标杆。 它的底子曾经不薄,205 架清一色的空客,一天约 300 个航班,2024 年营收约 50 亿美元。但是同年净亏约 12 亿,申请破产时背着约 90 亿债务。 2026 年 5 月的一个深夜,公司宣布停飞。第二天,约 17000 名员工从新闻里知道自己失业了。 事情还在走程序,交易要等破产法官批准。Spirit 走的是 Chapter 11 下的清算式关停,没有破产托管人接手,公司仍在法院监督下,自己把剩下的资产一件件卖掉。涉及员工邮件、Teams 消息等敏感数据,还要先交给独立机构处理,删掉姓名、邮箱等能够识别个人身份的信息;这家机构由 Google 挑选,费用也由 Google 承担。 另外,翻遍公开报道,破产公司把内部数据卖给 AI 公司,此前找不到先例。这一单,很可能就是历史第一例。 美国老牌科技媒体 Gizmodo 给这桩交易起的标题是,Spirit 死了,但它的数据会在 Google 的服务器里阴魂不散,飘荡几代人。 一门新生意 给死公司收尸的人一直都有。律师、清算人、拍卖行,干了几十年。飞机、桌椅、商标、专利,能卖的早就卖了。 真正新的是从今年开始,连公司的内部员工数据也被摆上了货架。 这门生意冒出来,背后有两个原因。 第一件事,死掉的公司变多了。 2024 年第一季度,美国初创公司的失败率同比涨了 58%,活跃的风险投资机构数量比高峰期少了 62%。 钱其实没有变少,只是越来越集中地流向 AI。2024 年,美国 AI 初创公司拿走了 970 亿美元融资,创下历史纪录。资本市场依然有钱,只是越来越不愿意把钱花在 AI 之外。 结果就是,一批原本还能继续靠融资活下去的公司,开始更早撞上墙。2024 年 8 月,a16z 投资的金融科技公司 Tally 宣布关停。它累计融资 1.72 亿美元,最高估值 8.55 亿美元,已经走到 D 轮,最后还是没能拿到下一笔钱。 第二件事,数据变贵了。 大模型训练对数据的消耗已经到了非常夸张的量级。GPT-4 的训练数据约为 13 万亿个 token。作为参照,Google Books 四十多年扫描了约 4000 万本书,折算下来大约 4 万亿个 token。也就是说,GPT-4 一次训练使用的数据量,相当于三个多 Google Books。 Epoch AI 算了笔账,高质量的语言数据,书、新闻、维基,2026 年前后就会耗尽。公开互联网里能够用于训练的高质量文本正在迅速见底,合成数据的占比越来越高。接下来,AI 公司要找的新数据,只能更多地往公开互联网之外走。企业内部积累了多年的邮件、聊天记录和工作文档,就这样进入了视野。 而 AI 训练数据集这个市场,研究机构预测 2030 年能做到 97 亿美元。算上各类授权,盘子的总规模估计能达到 675 亿美元。 一边是越来越多的公司进入关停和清算,留下大量过去没有被定价的内部数据;另一边,AI 公司对公开互联网之外的数据需求越来越大。两边同时出现,这才让企业内部数据第一次具备了被规模化交易的条件。 真正让这类数据变得更有价值的,是企业 Agent 的发展。Gartner 预测,到 2026 年,40% 的企业应用将内置任务型 AI Agent,而前一年这一比例还不到 5%。 企业 Agent 需要的训练材料,和普通大模型并不完全一样。公开网页可以提供知识、语言和成品内容,但很难还原一家公司真实的工作过程。沟通与合作,落实到具体有很多真实的细节,比如一个需求怎样被提出,几个人怎么讨论,任务如何分配,出了问题怎样修改,最后又是怎么交付的。 这些过程,大量保存在企业内部的邮件、聊天记录、工单和项目文档里。 当这类数据开始有明确的买家和用途,原本在公司关停时被直接删除的东西,也就有了单独拿出来交易的价值。 收尸人 以前干这活的是清算律师,现在多了三种人。 第一种叫解散服务商,代表是 SimpleClosure。 这家公司只做一件事,帮创业公司体面地死。2023 年公司刚起步,pre-seed 轮拿了 150 万美元,2025 年 5 月又拿了 1500 万美元 A 轮,领投的是 TTV Capital。连给大量美国初创公司管理股权和公司事务的 Carta,也停掉了自己的关停服务,转而投资 SimpleClosure,并把这部分客户需求交给它。 到 2025 年 10 月,SimpleClosure 已经办完了一千多家公司的葬礼。Crunchbase 给它起了个名字,「A Better Way To Fail」,一种更好的失败方式。美国创业者爱说 fail fast,快速失败。SimpleClosure 说,快速失败不够,还得体面。官网上甚至挂着一个定价计算器,输入公司情况,就能算出死一次要花多少钱。 葬礼都不白办。2026 年 4 月,SimpleClosure 上线了 Asset Hub,专门处理公司关停后留下的无形资产。品牌、软件、客户名单之外,第一次被明确摆上货架的还有 Slack 记录、邮件、Jira 工单这类内部工作数据。 这说明在 Spirit 之前,市场已经开始尝试给死公司的内部数据定价,只不过当时还是创业公司、小额交易和私下撮合。 有一个现成的案例。转录和字幕公司 cielo24 关停的时候,通过 SimpleClosure 出售了过去 13 年积累下来的 Slack 消息、内部邮件和 Jira 工单。CEO Shanna Johnson 后来告诉 Forbes,这批数据最终卖出了数十万美元。 对一家已经决定关门的公司来说,这原本是一批需要清理的数据,最后却成了清算时能够回收的一笔资产。 卖数据这个环节,SimpleClosure 交给了 Protege。这是一家数据交易市场,专做 AI 训练数据授权,2026 年 1 月刚拿了 a16z 领投的 3000 万美元,创始人叫 Bobby Samuels。Protege 最早的切入点是医疗影像,30 天时间里给买方凑齐了数百万张影像做预训练。 现在,Protege 开始把这套数据授权和交易能力用到关停公司的内部通信数据上。SimpleClosure 负责公司关停和资产整理,Protege 负责寻找买家、完成数据授权和交易。 第二类参与者,是破产法庭和清算律师。几十年来,他们清点的是飞机、桌椅、商标和专利。现在,清单里开始多出邮箱、Slack 记录和其他内部数据。 按照美国破产法,这些数据可以作为无形资产纳入破产财产,并在法院监督下出售。相关律所也开始设立专门团队,处理破产案件里的数据保存、取证和整理。Redgrave LLP 就有这样的重组与取证业务。 第三类,是负责技术执行的 e-discovery 服务商。KLDiscovery、Epiq、Consilio 这类公司,平时就在做企业数据的采集、整理、托管和审阅。邮箱、Teams、SharePoint 里的内容,需要先由他们导出、归档,再整理成可以进入交易流程的数据包。 这个行业本身已经有一套成熟的收费方式。EDRM 会定期发布定价调查,常见的计费单位包括数据采集每 GB、托管每 GB 每月,以及文档审阅费用。 Spirit 的 6 亿条消息最后能变成一件拍品,中间靠的就是这类基础工作。只是和法庭文件、拍卖报价相比,这部分很少出现在公开报道里,具体由谁处理、怎么处理,外界通常看不见。 尸检清单 对企业 Agent 来说,它需要学习的不只是知识和标准答案,还包括真实工作环境里的判断、协作、纠错和执行过程。 成品告诉模型最后做成了什么,内部记录告诉它这件事到底是怎么做成的。 这种变化已经反映在 Agent 训练数据上。过去一条代码训练样本可能只是几百个 token,内容是修改几行代码;现在,一条 Agent 训练样本往往要包含需求理解、文件定位、代码修改和测试验证的完整过程。 训练数据开始从单一的答案,转向完整的任务执行记录。对 Agent 来说,最终结果当然重要,但更有训练价值的,是完成任务过程中留下的判断、操作和反馈。 相比正常经营的公司,关停企业的数据更容易进入交易流程。公司还在运营时,出售内部通信会牵涉商业机密、员工隐私、竞业风险和客户关系,法务和管理层通常都会非常谨慎。进入清算以后,公司的主要目标变成尽可能回收剩余资产,为债权人争取更多价值。 这也是为什么,同样一批内部数据,在公司活着的时候很难出售,到了关停阶段,却可能被重新当作资产评估。 企业内部数据的价值,行业其实早就意识到了。Salesforce 一直把 Slack 中积累的企业通信视作重要的数据资产,微软 CEO Satya Nadella 也多次强调,企业使用 AI 时,真正有价值的一部分正是自己的专有数据和工作上下文。 过去,这些数据主要服务于公司自己。现在,随着 AI 公司开始主动寻找企业内部数据,它们第一次有了更明确的外部买家。 定价的艺术 这门生意虽然刚开始形成,但市场上已经出现了一些可以参考的价格。 SimpleClosure 和 Protege 处理的关停创业公司数据,单笔交易通常在 1 万到 10 万美元之间。Mercor 给被收购初创公司的员工聊天记录和邮件开出的报价,最高可以到 30 万美元。 Spirit 把价格一下推到了千万美元级。Mercor 出价 750 万美元,Google 最后出到 1000 万美元,争的是约 6 亿条内部通信和其他企业数据。只按这 6 亿条消息计算,平均每条大约 1.67 美分。 这个单价并不高。路透社 2024 年报道,Photobucket 曾拿着约 130 亿张照片和视频与 AI 公司谈授权,照片报价大约每张 5 美分到 1 美元,视频则在每条 1 美元以上。B2B 数据市场里,一条联系人信息根据完整度和准确度不同,也可以卖几美分到几美元。 但这些价格还不足以形成一套统一的标准。关停企业的内部数据到底值多少钱,目前主要还是一单一议。数据量、行业、时间跨度、完整度、独特性,以及买家准备用它做什么,都会影响最终报价。Spirit 的 1000 万美元,更像是目前少数公开可见的大型样本。 如果再和成熟的数据授权市场相比,差距更明显。Reddit 把用户帖子和评论授权给 Google,合同金额约为每年 6000 万美元;News Corp 与 OpenAI 的内容授权协议五年约 2.5 亿美元;xAI 与 Telegram 的合作金额达到 3 亿美元;苹果购买 Shutterstock 图片授权,报价则在 2500 万到 5000 万美元之间。 这些市场已经有稳定的买家、授权方式和定价经验。关停企业内部数据的交易才刚起步,什么数据最值钱、该按条、按容量还是按整包估值,目前都没有明确规则。 Spirit 的 1000 万美元放到公司自己的体量里看,又是另一回事。2024 年 Spirit 全年营收接近 50 亿美元,平均每天约 1370 万美元。Google 买下这批数据花的钱,还不到它正常经营时一天的收入。 对破产清算来说,这只是剩余资产里的一笔回收;对 AI 公司来说,买到的却是一批长期没有公开、包含真实企业运转过程的数据。 清理与移交 数据成交之后,还不能直接交给买方。正式移交之前,通常要经过导出、去身份化、整理打包、法院批准和最终交割几个步骤。 第一步是导出。Slack 的企业数据通常以 ZIP 文件导出,包括按频道整理的 JSON 文件、成员信息和附件。 Microsoft 365 则可以通过取证工具导出邮件和 Teams 消息。Spirit 涉及约 6 亿条内部通信,数据量很大,实际操作中需要分批处理。具体由 e-discovery 服务商还是买方工程团队执行,公开文件目前没有披露。 接下来是去身份化,也就是尽可能删除能够指向具体员工的信息。常见方法包括识别并遮盖姓名、电话、地址等个人信息,或者将敏感字段替换成无法直接对应个人的编号。在部分统计和训练场景中,还会通过增加随机扰动进一步降低重新识别个人的可能性。 但去身份化并不等于绝对匿名。即使姓名和邮箱已经删除,只要文本中保留了足够多的职业、时间、地点或行为特征,仍然存在通过其他信息重新锁定个人的可能。 所以 Spirit 这笔交易里,谁负责这一步很重要。按照目前的交易安排,数据将由一家独立第三方负责去身份化,但这家机构由 Google 选择,费用也由 Google 承担。Google 同时承诺,不会利用这批数据重新识别个人。 破产公司出售数据并没有那么新。过去二十多年里,从 Toysmart、Borders、RadioShack 到 23andMe,都出现过破产过程中处理或出售客户数据的案例。这类交易涉及消费者隐私,通常会受到法院、监管机构和州政府更严格的审查。 Spirit 的不同之处在于,这次出售的核心并不是乘客名单,而是员工邮件、Teams 消息和其他内部工作数据。现有破产程序对这类数据的处理并没有像消费者信息那样形成成熟的规则。 争议也已经出现。Spirit 的空乘工会对交易提出异议,法院因此推迟了审批。原本作为破产资产出售的一批企业数据,开始牵涉到员工权益和 AI 使用边界。 如果交易最终获得批准,数据才会进入最后的交割环节。但从整理完成的数据包到 Google 的系统之间,公开文件披露得很少。数据如何传输、是否还会继续清洗、最终以什么形式进入产品开发或模型训练,目前都无法确认。 程序走到这里,数据才真正完成从破产资产到 AI 资产的转换。 买家 这类数据目前最明确的买家,是 Google 这样的模型公司,以及 Mercor 这样的训练数据服务商。 Google 对 Spirit 这笔交易给出的官方说法,是用于产品改进和 AI 开发。对 Google 来说,这批数据的价值在于,它记录了一家大型企业真实的运营过程,比如排班、协作、内部沟通、项目推进、问题处理和管理决策。 这些内容很难从公开网页获得。尤其对企业 Agent 来说,最终结果之外,更重要的是任务在真实组织里究竟怎样被推进和完成。Spirit 留下的内部记录,恰好包含了大量这样的过程数据。 另一个竞标者 Mercor,更能说明这门生意正在往哪个方向发展。 Mercor 成立于 2023 年,三个创始人 Brendan Foody、Adarsh Hiremath 和 Surya Midha 从高中起就是辩论队队友。公司最早做 AI 招聘,用模型帮助企业筛选和面试候选人。到 2024 年 9 月,Mercor 已经评估约 30 万名求职者,估值达到 2.5 亿美元。 此后,公司的重心逐渐转向 AI 训练数据。2025 年 11 月,三位创始人都只有 22 岁,随着公司估值上升,成为当时全球最年轻的一批白手起家亿万富翁。2026 年上半年,Mercor 营收超过 6.14 亿美元,其中约九成来自 OpenAI 等头部 AI 实验室。到 7 月,公司正在寻求约 200 亿美元估值,并收购了专门为 AI Agent 构建训练环境的 Deeptune。 Mercor 获取训练数据主要有两条路径。 一条是直接购买企业内部记录。它曾向被收购或关停的初创公司报价,购买员工聊天记录和电子邮件,单家公司最高报价约 30 万美元。 另一条是雇佣有实际工作经验的人。TechCrunch 2025 年 10 月报道,AI 实验室通过 Mercor 招募企业前员工,让他们把工作经验转化成训练任务和反馈,时薪大约 200 美元。Mercor CEO 曾表示,公司每天向参与 AI 训练的人支付的报酬超过 150 万美元。 一边购买公司留下的工作记录,一边购买员工掌握的工作经验。Mercor 的核心资产,本质上都是现实世界里的工作过程。 这也解释了为什么它会出现在 Spirit 的拍卖场上。对 Mercor 来说,6 亿条内部通信是另一种规模更大的训练数据来源。 这类业务同样伴随着风险。2025 年,Scale AI 曾起诉 Mercor,指控前员工带走商业秘密;此后,公司也遭遇过训练相关信息泄露和合作暂停。数据既是 Mercor 的生意,也是它最需要防守的资产。 最后有一个数字上的反差。Spirit 以这个名字经营了 34 年,而参与竞拍它内部数据的 Mercor,三个创始人当时都只有 22 岁。 碎掉的长凳 Spirit 的交易还没有完成,法院还没有签字,Google 也没有拿到那批数据。接下来还有工会异议,还有听证,还有很多程序要走。 但这场拍卖已经让一件以前很少被讨论的事情变得具体。 过去,一家公司关门以后,很多东西是真的会消失。财务报表留下来,商标留下来,专利留下来。可一家公司的日常经验通常不会留下来。一个部门怎么开会,一个经理怎么做判断,一次延误发生以后几十个人如何协调,一套流程为什么最后改成今天这样,这些东西很少被正式记录。 公司解散,人走掉,邮箱停用,聊天群关闭,它们也就跟着消失。 所以公司一直是一种很奇怪的组织。 它可以活几十年,积累几万个人的经验,但真正能被继承下来的,往往只是其中很薄的一部分。下一家公司还得重新招人,重新犯错,重新把很多事情学一遍。 AI 改变的可能就是这一点。如果邮件、会议、工单、代码修改和内部讨论真的能够被整理成训练数据,那么一家公司过去只有靠人才能带走的经验,第一次有了另一种保存方式。 这件事最后会走到哪里,现在还很难判断。也许未来企业会主动保存这些数据,也许员工合同会重新写,也许破产法会增加新的限制,也许公司在融资和并购时,连内部工作记录都会被单独估值。 Spirit 提前把这个问题摆了出来。 破产这个词有个流传很广的词源解释。中世纪意大利商人坐在长凳后做生意。资不抵债,长凳被当众砸掉。banca rotta,碎掉的长凳。 几百年来,长凳碎了,事情就结束了。 Spirit 的长凳已经碎了。它留下的 6 亿条消息,正在重新定价。 一条一个半 penny。 原文链接

公司倒闭后,如何靠卖员工数据赚钱

原文标题:《公司倒闭后,如何靠卖员工数据赚钱》
原文作者:动察Beating
邮件、聊天记录、项目文档、工单,过去只是公司关停后等待清理的数字遗产。现在,它们开始被重新估价,打包,出售,送进 AI 公司的训练管线。
入殓师替死人保住最后的体面。企业死后的体面,则是证明自己留下的东西还有价值。
8 月 17 日,一场破产资产拍卖上,Google 出价 1000 万美元,买下 Spirit Airlines 的全部企业数据。竞标的还有一家,叫 Mercor,出价 750 万,差 250 万输掉了。
拍品分三块。第一块,约 1 亿封员工电子邮件。第二块,5 亿条 Microsoft Teams 消息。两块合计 6 亿条。第三块,日历、表格、财务数据库、项目文件、运营记录,加一批内部软件。乘客档案、常旅客信息等不包含在内。
6 亿条,一个人一天说 100 句话,要不停地说 16000 多年。
算下来一条消息卖了 1.67 美分。美国人把 1 美分硬币叫 penny,掉地上都懒得捡。也就是说,Spirit 员工在 Teams 里说的一句话,值一个半 penny。
时间回到 1980 年,Spirit Airlines 出生在底特律,前身是家卡车公司,叫 Charter One,后来改行开飞机。1992 年改名 Spirit,灵魂的意思。此后 34 年,它把美国超低成本航空的模式做到全行业模仿的标杆。
它的底子曾经不薄,205 架清一色的空客,一天约 300 个航班,2024 年营收约 50 亿美元。但是同年净亏约 12 亿,申请破产时背着约 90 亿债务。
2026 年 5 月的一个深夜,公司宣布停飞。第二天,约 17000 名员工从新闻里知道自己失业了。
事情还在走程序,交易要等破产法官批准。Spirit 走的是 Chapter 11 下的清算式关停,没有破产托管人接手,公司仍在法院监督下,自己把剩下的资产一件件卖掉。涉及员工邮件、Teams 消息等敏感数据,还要先交给独立机构处理,删掉姓名、邮箱等能够识别个人身份的信息;这家机构由 Google 挑选,费用也由 Google 承担。
另外,翻遍公开报道,破产公司把内部数据卖给 AI 公司,此前找不到先例。这一单,很可能就是历史第一例。
美国老牌科技媒体 Gizmodo 给这桩交易起的标题是,Spirit 死了,但它的数据会在 Google 的服务器里阴魂不散,飘荡几代人。
一门新生意
给死公司收尸的人一直都有。律师、清算人、拍卖行,干了几十年。飞机、桌椅、商标、专利,能卖的早就卖了。
真正新的是从今年开始,连公司的内部员工数据也被摆上了货架。
这门生意冒出来,背后有两个原因。
第一件事,死掉的公司变多了。
2024 年第一季度,美国初创公司的失败率同比涨了 58%,活跃的风险投资机构数量比高峰期少了 62%。
钱其实没有变少,只是越来越集中地流向 AI。2024 年,美国 AI 初创公司拿走了 970 亿美元融资,创下历史纪录。资本市场依然有钱,只是越来越不愿意把钱花在 AI 之外。
结果就是,一批原本还能继续靠融资活下去的公司,开始更早撞上墙。2024 年 8 月,a16z 投资的金融科技公司 Tally 宣布关停。它累计融资 1.72 亿美元,最高估值 8.55 亿美元,已经走到 D 轮,最后还是没能拿到下一笔钱。
第二件事,数据变贵了。
大模型训练对数据的消耗已经到了非常夸张的量级。GPT-4 的训练数据约为 13 万亿个 token。作为参照,Google Books 四十多年扫描了约 4000 万本书,折算下来大约 4 万亿个 token。也就是说,GPT-4 一次训练使用的数据量,相当于三个多 Google Books。
Epoch AI 算了笔账,高质量的语言数据,书、新闻、维基,2026 年前后就会耗尽。公开互联网里能够用于训练的高质量文本正在迅速见底,合成数据的占比越来越高。接下来,AI 公司要找的新数据,只能更多地往公开互联网之外走。企业内部积累了多年的邮件、聊天记录和工作文档,就这样进入了视野。
而 AI 训练数据集这个市场,研究机构预测 2030 年能做到 97 亿美元。算上各类授权,盘子的总规模估计能达到 675 亿美元。
一边是越来越多的公司进入关停和清算,留下大量过去没有被定价的内部数据;另一边,AI 公司对公开互联网之外的数据需求越来越大。两边同时出现,这才让企业内部数据第一次具备了被规模化交易的条件。
真正让这类数据变得更有价值的,是企业 Agent 的发展。Gartner 预测,到 2026 年,40% 的企业应用将内置任务型 AI Agent,而前一年这一比例还不到 5%。
企业 Agent 需要的训练材料,和普通大模型并不完全一样。公开网页可以提供知识、语言和成品内容,但很难还原一家公司真实的工作过程。沟通与合作,落实到具体有很多真实的细节,比如一个需求怎样被提出,几个人怎么讨论,任务如何分配,出了问题怎样修改,最后又是怎么交付的。
这些过程,大量保存在企业内部的邮件、聊天记录、工单和项目文档里。
当这类数据开始有明确的买家和用途,原本在公司关停时被直接删除的东西,也就有了单独拿出来交易的价值。
收尸人
以前干这活的是清算律师,现在多了三种人。
第一种叫解散服务商,代表是 SimpleClosure。
这家公司只做一件事,帮创业公司体面地死。2023 年公司刚起步,pre-seed 轮拿了 150 万美元,2025 年 5 月又拿了 1500 万美元 A 轮,领投的是 TTV Capital。连给大量美国初创公司管理股权和公司事务的 Carta,也停掉了自己的关停服务,转而投资 SimpleClosure,并把这部分客户需求交给它。
到 2025 年 10 月,SimpleClosure 已经办完了一千多家公司的葬礼。Crunchbase 给它起了个名字,「A Better Way To Fail」,一种更好的失败方式。美国创业者爱说 fail fast,快速失败。SimpleClosure 说,快速失败不够,还得体面。官网上甚至挂着一个定价计算器,输入公司情况,就能算出死一次要花多少钱。
葬礼都不白办。2026 年 4 月,SimpleClosure 上线了 Asset Hub,专门处理公司关停后留下的无形资产。品牌、软件、客户名单之外,第一次被明确摆上货架的还有 Slack 记录、邮件、Jira 工单这类内部工作数据。
这说明在 Spirit 之前,市场已经开始尝试给死公司的内部数据定价,只不过当时还是创业公司、小额交易和私下撮合。
有一个现成的案例。转录和字幕公司 cielo24 关停的时候,通过 SimpleClosure 出售了过去 13 年积累下来的 Slack 消息、内部邮件和 Jira 工单。CEO Shanna Johnson 后来告诉 Forbes,这批数据最终卖出了数十万美元。
对一家已经决定关门的公司来说,这原本是一批需要清理的数据,最后却成了清算时能够回收的一笔资产。
卖数据这个环节,SimpleClosure 交给了 Protege。这是一家数据交易市场,专做 AI 训练数据授权,2026 年 1 月刚拿了 a16z 领投的 3000 万美元,创始人叫 Bobby Samuels。Protege 最早的切入点是医疗影像,30 天时间里给买方凑齐了数百万张影像做预训练。
现在,Protege 开始把这套数据授权和交易能力用到关停公司的内部通信数据上。SimpleClosure 负责公司关停和资产整理,Protege 负责寻找买家、完成数据授权和交易。
第二类参与者,是破产法庭和清算律师。几十年来,他们清点的是飞机、桌椅、商标和专利。现在,清单里开始多出邮箱、Slack 记录和其他内部数据。
按照美国破产法,这些数据可以作为无形资产纳入破产财产,并在法院监督下出售。相关律所也开始设立专门团队,处理破产案件里的数据保存、取证和整理。Redgrave LLP 就有这样的重组与取证业务。
第三类,是负责技术执行的 e-discovery 服务商。KLDiscovery、Epiq、Consilio 这类公司,平时就在做企业数据的采集、整理、托管和审阅。邮箱、Teams、SharePoint 里的内容,需要先由他们导出、归档,再整理成可以进入交易流程的数据包。
这个行业本身已经有一套成熟的收费方式。EDRM 会定期发布定价调查,常见的计费单位包括数据采集每 GB、托管每 GB 每月,以及文档审阅费用。
Spirit 的 6 亿条消息最后能变成一件拍品,中间靠的就是这类基础工作。只是和法庭文件、拍卖报价相比,这部分很少出现在公开报道里,具体由谁处理、怎么处理,外界通常看不见。
尸检清单
对企业 Agent 来说,它需要学习的不只是知识和标准答案,还包括真实工作环境里的判断、协作、纠错和执行过程。
成品告诉模型最后做成了什么,内部记录告诉它这件事到底是怎么做成的。
这种变化已经反映在 Agent 训练数据上。过去一条代码训练样本可能只是几百个 token,内容是修改几行代码;现在,一条 Agent 训练样本往往要包含需求理解、文件定位、代码修改和测试验证的完整过程。
训练数据开始从单一的答案,转向完整的任务执行记录。对 Agent 来说,最终结果当然重要,但更有训练价值的,是完成任务过程中留下的判断、操作和反馈。
相比正常经营的公司,关停企业的数据更容易进入交易流程。公司还在运营时,出售内部通信会牵涉商业机密、员工隐私、竞业风险和客户关系,法务和管理层通常都会非常谨慎。进入清算以后,公司的主要目标变成尽可能回收剩余资产,为债权人争取更多价值。
这也是为什么,同样一批内部数据,在公司活着的时候很难出售,到了关停阶段,却可能被重新当作资产评估。
企业内部数据的价值,行业其实早就意识到了。Salesforce 一直把 Slack 中积累的企业通信视作重要的数据资产,微软 CEO Satya Nadella 也多次强调,企业使用 AI 时,真正有价值的一部分正是自己的专有数据和工作上下文。
过去,这些数据主要服务于公司自己。现在,随着 AI 公司开始主动寻找企业内部数据,它们第一次有了更明确的外部买家。
定价的艺术
这门生意虽然刚开始形成,但市场上已经出现了一些可以参考的价格。
SimpleClosure 和 Protege 处理的关停创业公司数据,单笔交易通常在 1 万到 10 万美元之间。Mercor 给被收购初创公司的员工聊天记录和邮件开出的报价,最高可以到 30 万美元。
Spirit 把价格一下推到了千万美元级。Mercor 出价 750 万美元,Google 最后出到 1000 万美元,争的是约 6 亿条内部通信和其他企业数据。只按这 6 亿条消息计算,平均每条大约 1.67 美分。
这个单价并不高。路透社 2024 年报道,Photobucket 曾拿着约 130 亿张照片和视频与 AI 公司谈授权,照片报价大约每张 5 美分到 1 美元,视频则在每条 1 美元以上。B2B 数据市场里,一条联系人信息根据完整度和准确度不同,也可以卖几美分到几美元。
但这些价格还不足以形成一套统一的标准。关停企业的内部数据到底值多少钱,目前主要还是一单一议。数据量、行业、时间跨度、完整度、独特性,以及买家准备用它做什么,都会影响最终报价。Spirit 的 1000 万美元,更像是目前少数公开可见的大型样本。
如果再和成熟的数据授权市场相比,差距更明显。Reddit 把用户帖子和评论授权给 Google,合同金额约为每年 6000 万美元;News Corp 与 OpenAI 的内容授权协议五年约 2.5 亿美元;xAI 与 Telegram 的合作金额达到 3 亿美元;苹果购买 Shutterstock 图片授权,报价则在 2500 万到 5000 万美元之间。
这些市场已经有稳定的买家、授权方式和定价经验。关停企业内部数据的交易才刚起步,什么数据最值钱、该按条、按容量还是按整包估值,目前都没有明确规则。
Spirit 的 1000 万美元放到公司自己的体量里看,又是另一回事。2024 年 Spirit 全年营收接近 50 亿美元,平均每天约 1370 万美元。Google 买下这批数据花的钱,还不到它正常经营时一天的收入。
对破产清算来说,这只是剩余资产里的一笔回收;对 AI 公司来说,买到的却是一批长期没有公开、包含真实企业运转过程的数据。
清理与移交
数据成交之后,还不能直接交给买方。正式移交之前,通常要经过导出、去身份化、整理打包、法院批准和最终交割几个步骤。
第一步是导出。Slack 的企业数据通常以 ZIP 文件导出,包括按频道整理的 JSON 文件、成员信息和附件。
Microsoft 365 则可以通过取证工具导出邮件和 Teams 消息。Spirit 涉及约 6 亿条内部通信,数据量很大,实际操作中需要分批处理。具体由 e-discovery 服务商还是买方工程团队执行,公开文件目前没有披露。
接下来是去身份化,也就是尽可能删除能够指向具体员工的信息。常见方法包括识别并遮盖姓名、电话、地址等个人信息,或者将敏感字段替换成无法直接对应个人的编号。在部分统计和训练场景中,还会通过增加随机扰动进一步降低重新识别个人的可能性。
但去身份化并不等于绝对匿名。即使姓名和邮箱已经删除,只要文本中保留了足够多的职业、时间、地点或行为特征,仍然存在通过其他信息重新锁定个人的可能。
所以 Spirit 这笔交易里,谁负责这一步很重要。按照目前的交易安排,数据将由一家独立第三方负责去身份化,但这家机构由 Google 选择,费用也由 Google 承担。Google 同时承诺,不会利用这批数据重新识别个人。
破产公司出售数据并没有那么新。过去二十多年里,从 Toysmart、Borders、RadioShack 到 23andMe,都出现过破产过程中处理或出售客户数据的案例。这类交易涉及消费者隐私,通常会受到法院、监管机构和州政府更严格的审查。
Spirit 的不同之处在于,这次出售的核心并不是乘客名单,而是员工邮件、Teams 消息和其他内部工作数据。现有破产程序对这类数据的处理并没有像消费者信息那样形成成熟的规则。
争议也已经出现。Spirit 的空乘工会对交易提出异议,法院因此推迟了审批。原本作为破产资产出售的一批企业数据,开始牵涉到员工权益和 AI 使用边界。
如果交易最终获得批准,数据才会进入最后的交割环节。但从整理完成的数据包到 Google 的系统之间,公开文件披露得很少。数据如何传输、是否还会继续清洗、最终以什么形式进入产品开发或模型训练,目前都无法确认。
程序走到这里,数据才真正完成从破产资产到 AI 资产的转换。
买家
这类数据目前最明确的买家,是 Google 这样的模型公司,以及 Mercor 这样的训练数据服务商。
Google 对 Spirit 这笔交易给出的官方说法,是用于产品改进和 AI 开发。对 Google 来说,这批数据的价值在于,它记录了一家大型企业真实的运营过程,比如排班、协作、内部沟通、项目推进、问题处理和管理决策。
这些内容很难从公开网页获得。尤其对企业 Agent 来说,最终结果之外,更重要的是任务在真实组织里究竟怎样被推进和完成。Spirit 留下的内部记录,恰好包含了大量这样的过程数据。
另一个竞标者 Mercor,更能说明这门生意正在往哪个方向发展。
Mercor 成立于 2023 年,三个创始人 Brendan Foody、Adarsh Hiremath 和 Surya Midha 从高中起就是辩论队队友。公司最早做 AI 招聘,用模型帮助企业筛选和面试候选人。到 2024 年 9 月,Mercor 已经评估约 30 万名求职者,估值达到 2.5 亿美元。
此后,公司的重心逐渐转向 AI 训练数据。2025 年 11 月,三位创始人都只有 22 岁,随着公司估值上升,成为当时全球最年轻的一批白手起家亿万富翁。2026 年上半年,Mercor 营收超过 6.14 亿美元,其中约九成来自 OpenAI 等头部 AI 实验室。到 7 月,公司正在寻求约 200 亿美元估值,并收购了专门为 AI Agent 构建训练环境的 Deeptune。
Mercor 获取训练数据主要有两条路径。
一条是直接购买企业内部记录。它曾向被收购或关停的初创公司报价,购买员工聊天记录和电子邮件,单家公司最高报价约 30 万美元。
另一条是雇佣有实际工作经验的人。TechCrunch 2025 年 10 月报道,AI 实验室通过 Mercor 招募企业前员工,让他们把工作经验转化成训练任务和反馈,时薪大约 200 美元。Mercor CEO 曾表示,公司每天向参与 AI 训练的人支付的报酬超过 150 万美元。
一边购买公司留下的工作记录,一边购买员工掌握的工作经验。Mercor 的核心资产,本质上都是现实世界里的工作过程。
这也解释了为什么它会出现在 Spirit 的拍卖场上。对 Mercor 来说,6 亿条内部通信是另一种规模更大的训练数据来源。
这类业务同样伴随着风险。2025 年,Scale AI 曾起诉 Mercor,指控前员工带走商业秘密;此后,公司也遭遇过训练相关信息泄露和合作暂停。数据既是 Mercor 的生意,也是它最需要防守的资产。
最后有一个数字上的反差。Spirit 以这个名字经营了 34 年,而参与竞拍它内部数据的 Mercor,三个创始人当时都只有 22 岁。
碎掉的长凳
Spirit 的交易还没有完成,法院还没有签字,Google 也没有拿到那批数据。接下来还有工会异议,还有听证,还有很多程序要走。
但这场拍卖已经让一件以前很少被讨论的事情变得具体。
过去,一家公司关门以后,很多东西是真的会消失。财务报表留下来,商标留下来,专利留下来。可一家公司的日常经验通常不会留下来。一个部门怎么开会,一个经理怎么做判断,一次延误发生以后几十个人如何协调,一套流程为什么最后改成今天这样,这些东西很少被正式记录。
公司解散,人走掉,邮箱停用,聊天群关闭,它们也就跟着消失。
所以公司一直是一种很奇怪的组织。
它可以活几十年,积累几万个人的经验,但真正能被继承下来的,往往只是其中很薄的一部分。下一家公司还得重新招人,重新犯错,重新把很多事情学一遍。
AI 改变的可能就是这一点。如果邮件、会议、工单、代码修改和内部讨论真的能够被整理成训练数据,那么一家公司过去只有靠人才能带走的经验,第一次有了另一种保存方式。
这件事最后会走到哪里,现在还很难判断。也许未来企业会主动保存这些数据,也许员工合同会重新写,也许破产法会增加新的限制,也许公司在融资和并购时,连内部工作记录都会被单独估值。
Spirit 提前把这个问题摆了出来。
破产这个词有个流传很广的词源解释。中世纪意大利商人坐在长凳后做生意。资不抵债,长凳被当众砸掉。banca rotta,碎掉的长凳。
几百年来,长凳碎了,事情就结束了。
Spirit 的长凳已经碎了。它留下的 6 亿条消息,正在重新定价。
一条一个半 penny。
原文链接
Статья
王兴兴,一只蝴蝶与机器狗原文标题:《王兴兴,一只蝴蝶与机器狗》 原文作者:动察Beating 音乐响起,一排银灰色的人形机器人和武校的孩子们同时出拳、踢腿、转身,动作分毫不差。这是除夕夜的央视一号演播厅。 表演进入后半段,机器人开始接连空翻——前空翻、后空翻、腾空转体 360 度,每次落地都稳稳当当。中途,一台机器人踉跄摔倒,又迅速爬起,接着打。6 亿人隔着屏幕,看完了全程。 造它们的人叫王兴兴。他不爱说话。 蝴蝶 三十多年前,浙江余姚的一所幼儿园,王兴兴画下了人生中的第一张画。 一只蝴蝶。 他没有学过画画。蝴蝶是照着画册临摹的。一个幼儿园的孩子,没上过一天美术课,画出来线条稳当,大家都说不像这个年纪的人画的。老师拿给别的老师看,老师们又拿给家长看。很多年后,王兴兴自己还记得这件事。 后来接受采访时,他主动说起这只蝴蝶。这个故事背后没有什么天才叙事,只有困扰,对细节过于敏感的困扰。 日常之物中,线条是否平直,胶水涂得是否均匀,他都能察觉,总想抹去那些不完美。 这种对具体之物的敏锐,后来一直跟着他。 王兴兴是余姚人,余姚是王阳明的故乡,一座因读书而闻名的浙东县城。五六岁的王兴兴,个子够不着灶台,他嫌家里饭做得不好,搬一张板凳,踩上去,自己炒。他自己讲起这些往事,用的词是「过于敏感」——「很多时间都花在了思想斗争上」。他找不到更准确的描述,「简单来说就是强迫症。」 可轮到语言,一切都颠倒过来。英语单词,记不住。有些汉字,笔拿起来,忽然写不出。高中几百场英语考试,他只及格过 3 次。考研报的是浙江大学,英语没过线,调剂去了上海大学。 王兴兴的动手能力极强。小学,捣鼓出一款风力小车。初中,手工做了一个微型涡轮喷气发动机。十岁那年,他在电视机里第一次看到波士顿动力的机器人,一只四足的金属东西迈开步子。那时候没有人知道,很多年后,他造的机器会站上同一个舞台。 2009 年,他考入浙江理工大学,机电专业。他说,上的是普通大学,一度很自卑。大学里,他对人工智能和神经网络产生了兴趣,把课本上的东西一件一件做成真的。 他喜欢一个人吃饭。因为他觉得和别人吃饭浪费时间。他不读人物传记,也不怎么读科幻,许多科技从业者拿科幻当预言读,但他不是这样。他读《费曼物理学讲义》,一本直接讨论世界怎样运转的书。书的扉页上印着作者的一句话,「我无法创造的,我便无法理解。」休息的时候,他爱看动漫。 直到一年多以前,他的手机号仍然公开在网上谈起社交,他的回答很直接:「不喜欢社交,没什么意义。」 在一次采访里,他说起自己。 小时候,他觉得自己多少有一点小聪明,却很少得到关注和肯定,甚至时常感到被打压。很长一段时间里,他的内心都处于挣扎之中,不断寻找出路和机会,想要「从茧里面出来」。 他说,世界真正给他的机会并不多。 停了一下,他又补了一句: 「但也还好,我玩得很开心。」 200 元 大一寒假,王兴兴做了人生中第一台人形机器人。成本 200 元。 一台纯手搓出来的机器人。两条腿,能走几步,仅此而已。做完了,他并不满意,按他自己的说法,「远没有达到我的预期」。当时全球的人形机器人控制技术都不太理想,性能上不去,看不到让机器人替人类干活的可能。他暂时把这份执念放下了。 机器本身,他没有放下。 读研时,他到了上海大学贾文川的课题组。贾文川刚主持一项国家自然科学基金青年项目,课题听起来很像科幻小说里才会出现的设定:用无创式脑机接口,操控四足机器人的高性能运动。 项目经费不多,人手紧缺。考研复试之后两人第一次见面,王兴兴展示了本科期间做过的几个机电小作品,聊了聊对机器人的看法。他绩点不高,也没有拿得出手的获奖证书。但贾文川还是点头让他进了组。 「他的展示和表达都略显紧张,不过表达很真诚。」贾文川后来回忆。 进组以后,王兴兴几乎无时不刻坐在实验桌前,哪怕是节假日。他给实验桌贴了一个蓝色小狗的图标,那是他给自己要做的机器人取的名字——XDog,一只有无限可能的机器狗。 他不用波士顿动力那种昂贵的液压驱动,选了电机驱动,成本最低的路。整台机器,研发只投入了一两万元。其实这个方案,他研究生刚入学时就想到了,当时甚至想过像比尔·盖茨和乔布斯一样辍学去创业。想想而已,当时只有一个想法,方案都没做出来。 2015 年,XDog 参加上海的比赛,拿了二等奖,奖金 8 万元。这是他人生第一次靠造东西换到钱。 「第一桶金。」他后来这么叫它。 当年报道比赛的一位记者,用镜头记录下了他狭小的、堆满设备的实验室,配文写着「这比起谷歌和麻省理工的研究环境与动辄就几百万上千万美元的财力支持,简直是天壤之别」。谷歌养着波士顿动力,砸进去的钱以亿计。王兴兴的狗,是几千块钱的零件和实验桌前的夜以继日,一点一点拼出来的。 贾文川一直记得两个瞬间。一个是 XDog 获得国际电气与电子工程师协会《科技纵览》的报道之后,这个几乎从不示弱的学生说了一句: 「贾老师,我真的已经竭尽全力了。」 另一个,是他后来的轻描淡写,「那些顶尖大学的人也不过如此。」 事实证明,王兴兴研发的机器狗,比海外顶尖教授的实验室做的还要好一些。 知乎上曾经有个问题:「如何看待上海大学王兴兴同学做的 XDog?」王兴兴本人跑到底下回答:「我运气还不错吧。」隔了一会儿又补了一句:「运气真的不错吧。」 硕士毕业,他去了深圳,进大疆。两个月后辞职。2016 年,他创办宇树科技。全部筹码是 XDog,加上一位天使投资人给的 200 万元,按这笔钱计算,当时宇树的估值是 1333 万元。 「2016 年我们刚出来创业,机器人行业是非常冷门的,跟现在完全冰火两重天。那时候宇树科技的估值只有 1000 多万元人民币,我们融了 200 万元。这点儿钱差不多花了一年半的时间,到最后已经接近发不出工资。但到 2018 年我们开始正式发货,融资就变得顺利了一些。」 创业初期,有投资人问他,机器狗到底有什么用? 他说「先把产品做出来,科研机构总会买。」 讲不明白的时候,就先把东西做出来。对王兴兴来说,产品需要在现实中验证,一个人的思考,也需要通过具体问题判断。 据 elsewhere 的整理,早期的宇树还有一套奇怪的面试题。每一个应聘者都要笔答 12 道题,前台也不例外。题目包括:最近的几百年,人类显著的科技进步都诞生于西方,你认为是什么原因导致的?你怎么看待和评价中医?最后还有一道「找不同」的图片题。 题是王兴兴本人出的。没有标准答案。他把产品交给市场验证,也用这些问题考察即将和他一起做产品的人。 卧铺 2018 年,宇树走到悬崖边上。 早期融资即将耗尽,原本谈好的下一笔投资出了变故。公司账面上只剩下不到二十万元。王兴兴停掉自己的工资,又拿出积蓄,维持员工的工资。技术路线没有动。 这一年,大疆一度入局。他离开大疆创业两年后,老东家用 1012.86 万元拿下宇树约 17% 的股份,成为当时最大的外部股东。第二年,大疆减资退出。 也是在这个阶段,极客公园旗下的变量资本给了宇树第一笔机构投资,200 万元。 一年后,红杉找上门。红杉中国当时的种子基金分析师李彦男,从浙大的学长那里听说了宇树。他上宇树官网,只找到一个 QQ 邮箱。他通过邮箱反查出微信号,发去好友申请。三天后,第一次登门。 一个月后,宇树被推上红杉的投委会。投决会之前,王兴兴主动提出,带一只机器狗去北京,现场演示——A1,四条腿,塞进 20 寸的行李箱。电池超标,上不了飞机,也上不了高铁。他坐十几个小时的卧铺,从杭州去北京。演示完,再坐卧铺回来。 出发前,他问李彦男: 「方便带个狗子过去吗?」 投决会前一天,他在朋友圈里写,感觉创业快干不下去了,不行就回深圳打工。 第二天,他站在会议室里。演示产品,回答问题,从头到尾不像一个准备放弃的人。合伙人曹曦给他打了 8 分,那是在座的人里最高的分。按照红杉的规矩,8 分的意思是,一定要投。那份投资备忘里还留着一句话:「很喜欢这个人。」 后来李彦男发现,只要有展示产品的机会,王兴兴都非常有热情。连着几年,他都主动提出带机器狗去红杉的 CEO 峰会和 LP 大会。有一年现场没有展台,他就带着狗,在会场外候着。 投决会那天,他还说了一个愿望。他想造一个比奥特曼、甚至比山还大的机器人。他希望有一天,可以让机器人制造机器人。 当时没有人知道这些想象会通向哪里。2019 年 12 月,红杉以 1500 万元认购宇树约 10% 的股份。公司活了下来。 春晚秧歌 宇树第一款商业化的机器狗叫 Laikago,莱卡狗。 莱卡,是 1957 年苏联送上太空的那只狗,地球上第一个进入轨道的生命。莫斯科街头的流浪狗,被抓来训练,塞进卫星,升空。几个小时后,它死在过热的空间里。 王兴兴把这个名字给了自己的机器狗,「太空狗」,象征人类探索未知的憧憬。那只真狗再也没能回来。他造的狗,一次次摔,一次次被扶起来,重写程序,再跑。 2017 年,澎湃新闻的记者跑到杭州滨江采访他。27 岁的王兴兴站在镜头前,有些腼腆,不知所措。他原本穿着套头衫和运动鞋,为了尊重镜头,临时换上一件从网上买的、久未开封的衬衫。 记者问他:有机会去波士顿动力工作,和自己创业,怎么选? 他笑,「我不会有这个困难的,因为我英语差,可能出国都不太好出,所以这个事情不会发生,我也不用去考虑这个问题。」 莱卡狗重 22 公斤,最大瞬时功率 18 千瓦,功率密度比一般的超级跑车还高。四条腿可以折叠,装进行李箱。 2020 年,宇树全公司 18 个人,七成是技术岗。客户名单分两栏,国内 30 家,多是高校和科研院所的实验室;国外 12 家,包括 Google、Nvidia、苹果,还有安卓之父 Andy Rubin。 2019 年,宇树全年收入 1182.82 万元,净利率 26.5%。当时波士顿动力的同类产品按月出租,租金近万美元。宇树的莱卡狗,卖两三万元人民币。 然后是春晚。 2025 年,机器人扭秧歌。节目叫《秧 BOT》,导演是张艺谋。16 台 H1,宇树第一款全尺寸人形机器人,两条腿,穿红色花棉袄,转手绢,和 16 位新疆艺术学院的舞蹈演员一起,人机对舞。 花棉袄的创意来自张艺谋。为了演出效果,团队去掉机器人的全部外壳,露出机械骨架,再套上花棉袄,这叫「减了肥」。它们有个艺名,叫「福兮」,谐音伏羲。 排练花了近三个月。节目播出那一夜,「扭秧歌的机器人」成了全中国最热的话题之一。手绢抛起来,在空中转,落下,再接住,台下看,像一群红色的蝴蝶在绕圈。在此之前,还没有如此规模的 AI 驱动集群人形机器人上过电视直播。 时间往前倒四年,宇树机器人也上过一次春晚。那时它们还是四条腿的机器牛「犇犇」,与刘德华、王一博同台演出《牛起来》。那台机器牛,是基于 A1 改装的,和 2019 年被塞进 20 寸行李箱、坐卧铺去北京的那只狗子,是同一个型号。 2026 年除夕夜,也就是开头那一幕。机型换成了 H2,身高一米八二,通体银灰色,对面站着一排塔沟武校的学员,人机对打,动作完全同步。 醉拳打到一半,一台机器人摔倒在地,网上的讨论涌了上来。王兴兴出来解释,摔倒,是导演安排的剧情需要。 G1 发布后,一段视频流传开来。机器人高高跳起,被人扫腿,踉跄,再站稳。参与研发 Mobile ALOHA 的工程师赵子豪在自己的主页上警告同行,「硅谷可以一直相信自己在软件、人工智能领域是最好的,直到一家中国硬件初创公司在可量产的人形机器人上实现了最好的 AI 驱动的运动控制。」 机器人越来越强。2026 年初,H2 的一段训练视频里,机器人腾空侧踢,一脚踢碎了悬挂的西瓜。镜头里,站在旁边的王兴兴下意识地后退避让。 镜头之外,机器人的进步以另一种方式留下痕迹。 宇树机器狗的训练场在楼顶。机器狗每天从办公室爬楼梯上去。爬得多了,摔得多了,那几层楼梯的台阶边缘被踩得缺一块、少一块。碎屑有人清理,但楼梯没有翻修,扫干净接着用。 宇树有一套内部要求,研发同事写文档、写说明书,起码要让一个大一的本科生看得懂;消费级的产品,要让一个中老年用户直接上手。王兴兴嫌许多工程师写的东西「不是给普通人用的」。 这些年,机器人的价格一路向下。机器狗最低卖到 9000 多元。人形机器人 G1 压到 9.9 万元。R1 再压到 3.99 万元。有人叫他「价格屠夫」。 他不太喜欢这个标签,「其实我觉得我们没有做到『屠夫』的程度。」 2026 年 7 月,王兴兴登上《时代》杂志封面。封面标题几个大字,「机器人时代来临」。 画面上,他造的载人机甲 GD01 近 2.7 米高,几乎占满整个版面。他站在机甲右边,瘦,戴眼镜,身形像一个注脚。这款机甲的想法,一部分来自他少年时看过的电影,他承认参考了《阿凡达》里的那台机器。最初他还想过,造一台更大的机器人去打拳击比赛。 《时代》写他身材瘦削,戴着眼镜,没有许多科技创始人身上那种张扬的傲气;谈机器人技术时,带着一种安静而坚定的信念。 上一个登上这本杂志封面的中国企业家,是 8 年前,那个人叫李彦宏。 热 民营企业座谈会那天,他是发言的企业家代表里,唯一的 90 后。 股东名单越来越长:美团、小米、腾讯、阿里、字节。红杉、经纬、深创投。战略配售的名单上,写着 DeepSeek。 梁文锋拿出 1.8 亿元打新,首日浮盈超过 11 亿。雷军赚 152 亿。美团系浮盈 333 亿。 大疆如果当年没有退出,这笔股份值 250 亿。最早给他 200 万的那位天使投资人尹方鸣,按发行价折算还剩 2.8 亿,翻了约 140 倍。 外国的政要也来了。德国总理默茨带着 30 家德国企业的负责人到访,看了春晚同款的「武 BOT」。几个月后,缅甸总统敏昂莱把访华的最后一站放在宇树,展厅里,机器人提起毛笔,写下一幅书法,王兴兴站在旁边讲解。 机器也开始进入投资人们的生活。红杉的曹曦在办公室门口摆了两台宇树的产品,一个穿着 Monolith 工服、打着领结的前台 G1,另一个是机器牛「牛犇犇」,那时 2021 年春晚之后王兴兴送给他的纪念。光合创投的朱嘉订了一台 R1,等了近半年,到货那天,人和机器握了个手。2025 年春天,G1 和蜜雪冰城的雪王一起,站在美团龙珠的投资人年会上迎宾。 想见王兴兴的人排起了队。他自己说: 「太热了太热了。找来的人太多了,消息回都回不过来。」 《时代》的采访里,记者问他走红的另一面。他回答: 「因为炒作过于狂热,给公司和整个行业都带来了相当大的压力。所有人都期望你的技术能以极快的速度实现飞跃。但事实是,硬核科技的突破是需要时间的。」 六小时 IPO 网上路演那天,不到 2 分钟,互动区涌进 20 多条提问。三个小时里,问题一条接一条。 有人问,如果别人把你们的股票炒上去,公司怎么办? 有人拿特斯拉的 Optimus 作比,问战略差异。 有人说「机器人好帅」,他回复「感谢认可。」 有人在线求职,问他公司的 logo 要不要重新设计。 直播镜头里,他看起来有点紧张。像很多年前复试时那样。开场演讲很短,不到五分钟。 三个小时到了。路演结束。王兴兴没有走。 他把没回答完的问题一条条看完,斟酌措辞,再逐字逐句地回应。他又待了近三个小时。 这是他人生里最长的一次输出。 他说,「希望投资者是认同公司价值才买我们的股票,而不是为了炒作。」 他还说,具身智能行业整体仍处在发展早期,类似于早年家用电脑的起步阶段。 2026 年 8 月 19 日,科创板。宇树的发行市值是 610 亿元。发行价 150.8 元。市盈率 219 倍。开盘涨 629%。 中一签,赚 47 万。 王兴兴的身家,超过 1300 亿。 他把上市比作高考。高中英语只及格过 3 次的人,又要进考场了。备考的日子,他一边对接投资人、监管机构,一边还在开发新产品。复习的方式,还是老一套,做东西。 上市前夕的访谈里,记者问他,现在看到了什么。 「我至少看到了『黎明的光』,就在我面前。」 1988 年 2 月,物理学家费曼在加州理工学院去世。他办公室的黑板上,留着一行粉笔字: What I cannot create, I do not understand. 我无法创造的,我便无法理解。 余姚的幼儿园里,一个孩子画完一只蝴蝶,把画举起来给老师看。画就在那儿,人人都看得见。 大学的实验桌上,他把机器人摆到众人面前,让它自己走两步。 它就走起来。 后来它学会跑,跳,学会上下台阶。还会写毛笔字,翻跟头,打醉拳。 它摔倒过,然后又重新站起来了。 原文链接

王兴兴,一只蝴蝶与机器狗

原文标题:《王兴兴,一只蝴蝶与机器狗》
原文作者:动察Beating
音乐响起,一排银灰色的人形机器人和武校的孩子们同时出拳、踢腿、转身,动作分毫不差。这是除夕夜的央视一号演播厅。
表演进入后半段,机器人开始接连空翻——前空翻、后空翻、腾空转体 360 度,每次落地都稳稳当当。中途,一台机器人踉跄摔倒,又迅速爬起,接着打。6 亿人隔着屏幕,看完了全程。
造它们的人叫王兴兴。他不爱说话。
蝴蝶
三十多年前,浙江余姚的一所幼儿园,王兴兴画下了人生中的第一张画。
一只蝴蝶。
他没有学过画画。蝴蝶是照着画册临摹的。一个幼儿园的孩子,没上过一天美术课,画出来线条稳当,大家都说不像这个年纪的人画的。老师拿给别的老师看,老师们又拿给家长看。很多年后,王兴兴自己还记得这件事。
后来接受采访时,他主动说起这只蝴蝶。这个故事背后没有什么天才叙事,只有困扰,对细节过于敏感的困扰。
日常之物中,线条是否平直,胶水涂得是否均匀,他都能察觉,总想抹去那些不完美。
这种对具体之物的敏锐,后来一直跟着他。
王兴兴是余姚人,余姚是王阳明的故乡,一座因读书而闻名的浙东县城。五六岁的王兴兴,个子够不着灶台,他嫌家里饭做得不好,搬一张板凳,踩上去,自己炒。他自己讲起这些往事,用的词是「过于敏感」——「很多时间都花在了思想斗争上」。他找不到更准确的描述,「简单来说就是强迫症。」
可轮到语言,一切都颠倒过来。英语单词,记不住。有些汉字,笔拿起来,忽然写不出。高中几百场英语考试,他只及格过 3 次。考研报的是浙江大学,英语没过线,调剂去了上海大学。
王兴兴的动手能力极强。小学,捣鼓出一款风力小车。初中,手工做了一个微型涡轮喷气发动机。十岁那年,他在电视机里第一次看到波士顿动力的机器人,一只四足的金属东西迈开步子。那时候没有人知道,很多年后,他造的机器会站上同一个舞台。
2009 年,他考入浙江理工大学,机电专业。他说,上的是普通大学,一度很自卑。大学里,他对人工智能和神经网络产生了兴趣,把课本上的东西一件一件做成真的。
他喜欢一个人吃饭。因为他觉得和别人吃饭浪费时间。他不读人物传记,也不怎么读科幻,许多科技从业者拿科幻当预言读,但他不是这样。他读《费曼物理学讲义》,一本直接讨论世界怎样运转的书。书的扉页上印着作者的一句话,「我无法创造的,我便无法理解。」休息的时候,他爱看动漫。
直到一年多以前,他的手机号仍然公开在网上谈起社交,他的回答很直接:「不喜欢社交,没什么意义。」
在一次采访里,他说起自己。
小时候,他觉得自己多少有一点小聪明,却很少得到关注和肯定,甚至时常感到被打压。很长一段时间里,他的内心都处于挣扎之中,不断寻找出路和机会,想要「从茧里面出来」。
他说,世界真正给他的机会并不多。
停了一下,他又补了一句:
「但也还好,我玩得很开心。」
200 元
大一寒假,王兴兴做了人生中第一台人形机器人。成本 200 元。
一台纯手搓出来的机器人。两条腿,能走几步,仅此而已。做完了,他并不满意,按他自己的说法,「远没有达到我的预期」。当时全球的人形机器人控制技术都不太理想,性能上不去,看不到让机器人替人类干活的可能。他暂时把这份执念放下了。
机器本身,他没有放下。
读研时,他到了上海大学贾文川的课题组。贾文川刚主持一项国家自然科学基金青年项目,课题听起来很像科幻小说里才会出现的设定:用无创式脑机接口,操控四足机器人的高性能运动。
项目经费不多,人手紧缺。考研复试之后两人第一次见面,王兴兴展示了本科期间做过的几个机电小作品,聊了聊对机器人的看法。他绩点不高,也没有拿得出手的获奖证书。但贾文川还是点头让他进了组。
「他的展示和表达都略显紧张,不过表达很真诚。」贾文川后来回忆。
进组以后,王兴兴几乎无时不刻坐在实验桌前,哪怕是节假日。他给实验桌贴了一个蓝色小狗的图标,那是他给自己要做的机器人取的名字——XDog,一只有无限可能的机器狗。
他不用波士顿动力那种昂贵的液压驱动,选了电机驱动,成本最低的路。整台机器,研发只投入了一两万元。其实这个方案,他研究生刚入学时就想到了,当时甚至想过像比尔·盖茨和乔布斯一样辍学去创业。想想而已,当时只有一个想法,方案都没做出来。
2015 年,XDog 参加上海的比赛,拿了二等奖,奖金 8 万元。这是他人生第一次靠造东西换到钱。
「第一桶金。」他后来这么叫它。
当年报道比赛的一位记者,用镜头记录下了他狭小的、堆满设备的实验室,配文写着「这比起谷歌和麻省理工的研究环境与动辄就几百万上千万美元的财力支持,简直是天壤之别」。谷歌养着波士顿动力,砸进去的钱以亿计。王兴兴的狗,是几千块钱的零件和实验桌前的夜以继日,一点一点拼出来的。
贾文川一直记得两个瞬间。一个是 XDog 获得国际电气与电子工程师协会《科技纵览》的报道之后,这个几乎从不示弱的学生说了一句:
「贾老师,我真的已经竭尽全力了。」
另一个,是他后来的轻描淡写,「那些顶尖大学的人也不过如此。」
事实证明,王兴兴研发的机器狗,比海外顶尖教授的实验室做的还要好一些。
知乎上曾经有个问题:「如何看待上海大学王兴兴同学做的 XDog?」王兴兴本人跑到底下回答:「我运气还不错吧。」隔了一会儿又补了一句:「运气真的不错吧。」
硕士毕业,他去了深圳,进大疆。两个月后辞职。2016 年,他创办宇树科技。全部筹码是 XDog,加上一位天使投资人给的 200 万元,按这笔钱计算,当时宇树的估值是 1333 万元。
「2016 年我们刚出来创业,机器人行业是非常冷门的,跟现在完全冰火两重天。那时候宇树科技的估值只有 1000 多万元人民币,我们融了 200 万元。这点儿钱差不多花了一年半的时间,到最后已经接近发不出工资。但到 2018 年我们开始正式发货,融资就变得顺利了一些。」
创业初期,有投资人问他,机器狗到底有什么用?
他说「先把产品做出来,科研机构总会买。」
讲不明白的时候,就先把东西做出来。对王兴兴来说,产品需要在现实中验证,一个人的思考,也需要通过具体问题判断。
据 elsewhere 的整理,早期的宇树还有一套奇怪的面试题。每一个应聘者都要笔答 12 道题,前台也不例外。题目包括:最近的几百年,人类显著的科技进步都诞生于西方,你认为是什么原因导致的?你怎么看待和评价中医?最后还有一道「找不同」的图片题。
题是王兴兴本人出的。没有标准答案。他把产品交给市场验证,也用这些问题考察即将和他一起做产品的人。
卧铺
2018 年,宇树走到悬崖边上。
早期融资即将耗尽,原本谈好的下一笔投资出了变故。公司账面上只剩下不到二十万元。王兴兴停掉自己的工资,又拿出积蓄,维持员工的工资。技术路线没有动。
这一年,大疆一度入局。他离开大疆创业两年后,老东家用 1012.86 万元拿下宇树约 17% 的股份,成为当时最大的外部股东。第二年,大疆减资退出。
也是在这个阶段,极客公园旗下的变量资本给了宇树第一笔机构投资,200 万元。
一年后,红杉找上门。红杉中国当时的种子基金分析师李彦男,从浙大的学长那里听说了宇树。他上宇树官网,只找到一个 QQ 邮箱。他通过邮箱反查出微信号,发去好友申请。三天后,第一次登门。
一个月后,宇树被推上红杉的投委会。投决会之前,王兴兴主动提出,带一只机器狗去北京,现场演示——A1,四条腿,塞进 20 寸的行李箱。电池超标,上不了飞机,也上不了高铁。他坐十几个小时的卧铺,从杭州去北京。演示完,再坐卧铺回来。
出发前,他问李彦男:
「方便带个狗子过去吗?」
投决会前一天,他在朋友圈里写,感觉创业快干不下去了,不行就回深圳打工。
第二天,他站在会议室里。演示产品,回答问题,从头到尾不像一个准备放弃的人。合伙人曹曦给他打了 8 分,那是在座的人里最高的分。按照红杉的规矩,8 分的意思是,一定要投。那份投资备忘里还留着一句话:「很喜欢这个人。」
后来李彦男发现,只要有展示产品的机会,王兴兴都非常有热情。连着几年,他都主动提出带机器狗去红杉的 CEO 峰会和 LP 大会。有一年现场没有展台,他就带着狗,在会场外候着。
投决会那天,他还说了一个愿望。他想造一个比奥特曼、甚至比山还大的机器人。他希望有一天,可以让机器人制造机器人。
当时没有人知道这些想象会通向哪里。2019 年 12 月,红杉以 1500 万元认购宇树约 10% 的股份。公司活了下来。
春晚秧歌
宇树第一款商业化的机器狗叫 Laikago,莱卡狗。
莱卡,是 1957 年苏联送上太空的那只狗,地球上第一个进入轨道的生命。莫斯科街头的流浪狗,被抓来训练,塞进卫星,升空。几个小时后,它死在过热的空间里。
王兴兴把这个名字给了自己的机器狗,「太空狗」,象征人类探索未知的憧憬。那只真狗再也没能回来。他造的狗,一次次摔,一次次被扶起来,重写程序,再跑。
2017 年,澎湃新闻的记者跑到杭州滨江采访他。27 岁的王兴兴站在镜头前,有些腼腆,不知所措。他原本穿着套头衫和运动鞋,为了尊重镜头,临时换上一件从网上买的、久未开封的衬衫。
记者问他:有机会去波士顿动力工作,和自己创业,怎么选?
他笑,「我不会有这个困难的,因为我英语差,可能出国都不太好出,所以这个事情不会发生,我也不用去考虑这个问题。」
莱卡狗重 22 公斤,最大瞬时功率 18 千瓦,功率密度比一般的超级跑车还高。四条腿可以折叠,装进行李箱。
2020 年,宇树全公司 18 个人,七成是技术岗。客户名单分两栏,国内 30 家,多是高校和科研院所的实验室;国外 12 家,包括 Google、Nvidia、苹果,还有安卓之父 Andy Rubin。
2019 年,宇树全年收入 1182.82 万元,净利率 26.5%。当时波士顿动力的同类产品按月出租,租金近万美元。宇树的莱卡狗,卖两三万元人民币。
然后是春晚。
2025 年,机器人扭秧歌。节目叫《秧 BOT》,导演是张艺谋。16 台 H1,宇树第一款全尺寸人形机器人,两条腿,穿红色花棉袄,转手绢,和 16 位新疆艺术学院的舞蹈演员一起,人机对舞。
花棉袄的创意来自张艺谋。为了演出效果,团队去掉机器人的全部外壳,露出机械骨架,再套上花棉袄,这叫「减了肥」。它们有个艺名,叫「福兮」,谐音伏羲。
排练花了近三个月。节目播出那一夜,「扭秧歌的机器人」成了全中国最热的话题之一。手绢抛起来,在空中转,落下,再接住,台下看,像一群红色的蝴蝶在绕圈。在此之前,还没有如此规模的 AI 驱动集群人形机器人上过电视直播。
时间往前倒四年,宇树机器人也上过一次春晚。那时它们还是四条腿的机器牛「犇犇」,与刘德华、王一博同台演出《牛起来》。那台机器牛,是基于 A1 改装的,和 2019 年被塞进 20 寸行李箱、坐卧铺去北京的那只狗子,是同一个型号。
2026 年除夕夜,也就是开头那一幕。机型换成了 H2,身高一米八二,通体银灰色,对面站着一排塔沟武校的学员,人机对打,动作完全同步。
醉拳打到一半,一台机器人摔倒在地,网上的讨论涌了上来。王兴兴出来解释,摔倒,是导演安排的剧情需要。
G1 发布后,一段视频流传开来。机器人高高跳起,被人扫腿,踉跄,再站稳。参与研发 Mobile ALOHA 的工程师赵子豪在自己的主页上警告同行,「硅谷可以一直相信自己在软件、人工智能领域是最好的,直到一家中国硬件初创公司在可量产的人形机器人上实现了最好的 AI 驱动的运动控制。」
机器人越来越强。2026 年初,H2 的一段训练视频里,机器人腾空侧踢,一脚踢碎了悬挂的西瓜。镜头里,站在旁边的王兴兴下意识地后退避让。
镜头之外,机器人的进步以另一种方式留下痕迹。
宇树机器狗的训练场在楼顶。机器狗每天从办公室爬楼梯上去。爬得多了,摔得多了,那几层楼梯的台阶边缘被踩得缺一块、少一块。碎屑有人清理,但楼梯没有翻修,扫干净接着用。
宇树有一套内部要求,研发同事写文档、写说明书,起码要让一个大一的本科生看得懂;消费级的产品,要让一个中老年用户直接上手。王兴兴嫌许多工程师写的东西「不是给普通人用的」。
这些年,机器人的价格一路向下。机器狗最低卖到 9000 多元。人形机器人 G1 压到 9.9 万元。R1 再压到 3.99 万元。有人叫他「价格屠夫」。
他不太喜欢这个标签,「其实我觉得我们没有做到『屠夫』的程度。」
2026 年 7 月,王兴兴登上《时代》杂志封面。封面标题几个大字,「机器人时代来临」。
画面上,他造的载人机甲 GD01 近 2.7 米高,几乎占满整个版面。他站在机甲右边,瘦,戴眼镜,身形像一个注脚。这款机甲的想法,一部分来自他少年时看过的电影,他承认参考了《阿凡达》里的那台机器。最初他还想过,造一台更大的机器人去打拳击比赛。
《时代》写他身材瘦削,戴着眼镜,没有许多科技创始人身上那种张扬的傲气;谈机器人技术时,带着一种安静而坚定的信念。
上一个登上这本杂志封面的中国企业家,是 8 年前,那个人叫李彦宏。

民营企业座谈会那天,他是发言的企业家代表里,唯一的 90 后。
股东名单越来越长:美团、小米、腾讯、阿里、字节。红杉、经纬、深创投。战略配售的名单上,写着 DeepSeek。
梁文锋拿出 1.8 亿元打新,首日浮盈超过 11 亿。雷军赚 152 亿。美团系浮盈 333 亿。
大疆如果当年没有退出,这笔股份值 250 亿。最早给他 200 万的那位天使投资人尹方鸣,按发行价折算还剩 2.8 亿,翻了约 140 倍。
外国的政要也来了。德国总理默茨带着 30 家德国企业的负责人到访,看了春晚同款的「武 BOT」。几个月后,缅甸总统敏昂莱把访华的最后一站放在宇树,展厅里,机器人提起毛笔,写下一幅书法,王兴兴站在旁边讲解。
机器也开始进入投资人们的生活。红杉的曹曦在办公室门口摆了两台宇树的产品,一个穿着 Monolith 工服、打着领结的前台 G1,另一个是机器牛「牛犇犇」,那时 2021 年春晚之后王兴兴送给他的纪念。光合创投的朱嘉订了一台 R1,等了近半年,到货那天,人和机器握了个手。2025 年春天,G1 和蜜雪冰城的雪王一起,站在美团龙珠的投资人年会上迎宾。
想见王兴兴的人排起了队。他自己说:
「太热了太热了。找来的人太多了,消息回都回不过来。」
《时代》的采访里,记者问他走红的另一面。他回答:
「因为炒作过于狂热,给公司和整个行业都带来了相当大的压力。所有人都期望你的技术能以极快的速度实现飞跃。但事实是,硬核科技的突破是需要时间的。」
六小时
IPO 网上路演那天,不到 2 分钟,互动区涌进 20 多条提问。三个小时里,问题一条接一条。
有人问,如果别人把你们的股票炒上去,公司怎么办?
有人拿特斯拉的 Optimus 作比,问战略差异。
有人说「机器人好帅」,他回复「感谢认可。」
有人在线求职,问他公司的 logo 要不要重新设计。
直播镜头里,他看起来有点紧张。像很多年前复试时那样。开场演讲很短,不到五分钟。
三个小时到了。路演结束。王兴兴没有走。
他把没回答完的问题一条条看完,斟酌措辞,再逐字逐句地回应。他又待了近三个小时。
这是他人生里最长的一次输出。
他说,「希望投资者是认同公司价值才买我们的股票,而不是为了炒作。」
他还说,具身智能行业整体仍处在发展早期,类似于早年家用电脑的起步阶段。
2026 年 8 月 19 日,科创板。宇树的发行市值是 610 亿元。发行价 150.8 元。市盈率 219 倍。开盘涨 629%。
中一签,赚 47 万。
王兴兴的身家,超过 1300 亿。
他把上市比作高考。高中英语只及格过 3 次的人,又要进考场了。备考的日子,他一边对接投资人、监管机构,一边还在开发新产品。复习的方式,还是老一套,做东西。
上市前夕的访谈里,记者问他,现在看到了什么。
「我至少看到了『黎明的光』,就在我面前。」
1988 年 2 月,物理学家费曼在加州理工学院去世。他办公室的黑板上,留着一行粉笔字:
What I cannot create, I do not understand.
我无法创造的,我便无法理解。
余姚的幼儿园里,一个孩子画完一只蝴蝶,把画举起来给老师看。画就在那儿,人人都看得见。
大学的实验桌上,他把机器人摆到众人面前,让它自己走两步。
它就走起来。
后来它学会跑,跳,学会上下台阶。还会写毛笔字,翻跟头,打醉拳。
它摔倒过,然后又重新站起来了。
原文链接
Статья
Anthropic,Dario Amodei,与「最后一家私营公司」原文标题:《Anthropic,Dario Amodei,与「最后一家私营公司」》 原文作者:动察Beating 关于 Anthropic 的创始人 Dario Amodei,流传着两种说法,互相矛盾,又都说得通。 一种说法是,他是这个时代最清醒的守夜人。全世界都在往超级智能的悬崖上踩油门,只有他肯站在路边,一遍一遍喊,前面是深渊。 另一种说法是,他是硅谷野心最大的人之一。他领着全世界最强的 AI 公司,日夜赶工,把所有人警告过的那个未来,一点一点,亲手造出来。 一个人,真的可以同时把这两件事都干了。 他给那个设想中的那个世界取了个名字,「数据中心里的天才之国」。那个国度里有五千万个天才,不睡觉,一天工作二十四小时,思考的速度是普通人的几十倍,还能复制出无数个和自己一样的天才。这个国家没有土地,没有边界,它处在一排一排的数据中心里。 2026 年 1 月,他把这个想象写进一篇长文,题目叫《技术的青春期》。 然后他又往前推演了一步。要是有一天,这五千万名天才不听人类的话了,会怎么样? 再往后的画面就危险起来了。生物武器、大规模失业、独裁、战争,他一样一样往下数。数到最后,说,留给我们的时间不多了。 可在同一篇文章里,他还写着:「AI 已经在替 Anthropic 写大量代码,帮着把下一代模型更快地做出来。」 一边警告,一边加速。他不觉得这中间有什么矛盾。 这就是全部问题的起点,不是他坏,是他真的不觉得。 当然,他有他的解释。Anthropic 停下来,OpenAI 不停,Google 不停,别的国家的公司也不会停。没有谁肯第一个松手,最先停下的那一个,多半什么也拦不住,只是把果子让给别人。 这套说辞翻译过来就是,既然大家都在抢,那就让「我」来抢第一。既然谁也停不下来,那就让「我」来决定什么时候停。 这样一来,超级智能该不该造,反倒不那么要紧了。照他的判断,它迟早会被造出来。真正要紧的,是谁先把它造出来,以及到了那一天,谁有资格握住方向盘。 来不及 Dario Amodei 1983 年出生在旧金山,1983 年。父亲是意大利托斯卡纳人,一辈子做皮具生意;母亲是芝加哥的犹太裔,旧金山公共图书馆的规划和建设,她出过一份力。 他从小就喜欢数学和物理。1990 年代末,湾区互联网泡沫,公司一家接一家往外冒,年轻人写网站、找投资,盘算上市那天能套现多少钱。这些故事没能打动他。很多年后他说,自己当时要找的是「基础科学真理」,他只想弄明白,世界为什么会长成这个样子。 他对所谓「重要问题」,很早就有一份近乎固执的认真。只要认准一件事足够重要,他就想不通,人怎么还能若无其事地慢下来。 2003 年,美国要打伊拉克,他在加州理工学院读书。校园里反战的人不少。聊天时,有人说着忧心忡忡的话;第二天,大家照旧上课。他在学生报上写了篇文章批评同学,说要是真怕一场战争会害死很多人,反对就不该只停在嘴边,等它真的发生,再后悔就晚了。 在他看来,犹豫从来不是中立。等待,本身就是一种选择。 这个二十岁的年轻人,最不能忍受的,就是等。 三年后,他二十三岁,父亲死于丙型肝炎。 当时的丙肝几乎无药可治。标准疗法是打一整年的干扰素,但是会导致发烧、脱发、抑郁,治愈率还不到一半。 2013 年 12 月,一种新药获批。疗程缩到十二周,治愈率百分之九十五。 他父亲没有等到。 只差七年。 一个没有救下父亲的儿子,此后二十年,都在催着科学快一点,再快一点。 父亲去世以后,他从理论物理转向生物物理,在普林斯顿研究视网膜的神经回路。当时的仪器一次只能记下很少的神经信号,他嫌慢,就参与去造新的传感器。 再后来,他进斯坦福医学院,研究癌症和蛋白质。离病越近,人就越显得小。一种病牵扯几百个基因、成千上万种蛋白质,还有数不清的通路彼此勾连。研究者耗尽许多年,或许能把其中一环看明白,却仍不知道,把它放回整个身体以后,会发生什么。 后来他形容,那种复杂让他几乎绝望。 AI 就是在这个时候进了他的视野,那是一样能把人的尺度撑大的工具。机器能同时读许多论文,处理许多数据,试许多种可能,替代原本要几百名、几千名研究人员一起完成的认知劳动。 他从「人太渺小」出发,抵达的结论是造一个更大的东西,把人再压缩一次。 2014 年,他离开生命科学,进了百度在硅谷的人工智能团队。团队很快发现,模型大一点,数据多一点,算力再往上加一点,效果就还会再往上走。几年以后,这套经验被总结成「规模定律」,你未必知道下一代模型会突然学会什么,却可以大致断定,它一定比上一代更强。 智能头一次显得可以像工业品一样被生产出来。强大的 AI,也就成了一件早晚会诞生的东西。 剩下的差别,只是多少数据,多少芯片,多少电力,以及还要等多久。 那个最恨等待的人,亲手证明了,通往他想要的答案的路,是存在的。 方向盘 2016 年,Dario Amodei 进了 OpenAI。 此后几年,语言模型迅速长大。到 GPT-3,OpenAI 把公司一半以上的算力交给 Dario,由他把模型规模放大一百倍。结果比许多人预期的还要惊人,它可以写文章、翻译、总结,还有一些没人教过它、自己学会的本事。 规模长一分,能力长一分。 他确信这条路通往通用智能。而一旦接受模型最终可能和人一样聪明,安全就再也没法被当成鸡毛蒜皮。 然后他发现了问题。Dario 负责把模型造出来,却慢慢发现,造模型,和决定模型往哪儿去,压根是两码事。模型什么时候发布,开放到什么程度,跟哪些公司合作,谁有决策权,这些事并不因为他负责训练就自动归他管。 OpenAI 内部分成两拨人。一拨要快点把技术推向世界;另一拨担心,公司由谁领导、按什么原则行事,也许比某一项技术细节更要紧。 那究竟什么样的人,有资格领导一家制造强大智能的公司? 他的答案是,领导者必须诚实,动机必须真诚,也必须真心希望世界变好。 技术安全,慢慢变成了对人的判断。这条推导很危险,也很顺理成章。危险就危险在,它把一切复杂问题,最后都化简成这个人可不可信。而在这个推导里,永远缺席的一环,是谁来判断这个人可不可信。 到 2020 年,他与 OpenAI 领导层之间的矛盾已经很难再调和。那一年 12 月,他带着妹妹 Daniela、Jack Clark、Chris Olah 和几名同事,离开了 OpenAI。因为 Dario 喜欢熊猫,这个小圈子在内部被叫作「熊猫派」。 几个月以后,他们创办了 Anthropic。Anthropic,词典里的意思是「与人有关的」。 这一回,Dario 不打算再把方向盘交给别人。 二十个人 2021 年,旧金山的疫情还没结束。 Anthropic 刚成立没多久,只有十五到二十个人。多数时候,大家隔着 Zoom 开会;每周再挑一天,各自带把椅子,到公园里碰头。一边吃午饭,一边聊模型、算力、安全研究,也聊这家公司到底该长成什么样子。 不到二十个人,坐在旧金山的草地上,手里兴许还捧着半盒没吃完的沙拉,操心的却是八十亿人的往后。 规模定律告诉他们,未来一定会来。既然一定要来,总得有人提前把路备好。「总得有人」这四个字,就是全部的合法性论证。 Anthropic 给自己定下的目标,是一边造最前沿的模型,一边研究怎么理解和控制它,再把这一套安全方法,变成别家公司的标准。 Dario 在 OpenAI 吃过一回亏。他明白,只站在技术的外围谈安全,到头来多半只能给真正握着模型的人提提建议。话说得再好听,也不过是站在岸上,教水里的人怎么游泳。 得自己下水。 这让 Anthropic 从成立第一天起,就显得很拧巴。想知道最强模型有什么危险,就得先拥有最强模型;想影响监管,就得先在行业里有分量。 于是,Anthropic 很快卷进了所有前沿大模型公司都躲不开的那个循环,融资、买算力、训练模型、发布产品、抢客户,再用新的收入和估值换更多的算力。 Dario 说,把公司做大,是在保护世界。投资人也愿意相信,押注 Anthropic,是在投一家更负责任的 AI 公司。 这套说法的精妙之处在于,他越赚钱,就显得越道德;公司估值越高,他「保护世界」的证据就越足。 商业利益和文明使命互相抬轿子。 方向,由 Dario 来给。他写长文,谈文明、科学和人类的未来。把这些宏大判断落地的,是妹妹 Daniela,管招人、搭团队、找钱。 公司的起点,是一个几乎没法证伪的宏大判断: 强大 AI 就要来了,而世界需要一家更值得信任的公司,站到最前面去。 「更值得信任」,是公司自己说的。 这样的叙事给了 Anthropic 很强的凝聚力。加入的人,并不是只在找一份薪水更高的差事。他们相信,自己干的是关系到人类文明的大事。 一家公司最可怕的状态,就是员工真的相信自己在拯救人类。因为从那一刻起,所有商业上的扩张,都自动变成了圣战;所有反对的声音,都自动变成了对人类的背叛。 创业头几年,Anthropic 想证明,一家 AI 公司可以比别人更谨慎,也更负责任。这个愿望大概是真诚的。 但真诚从来不保证正确。真诚的人做错事,往往比虚伪的人更麻烦,因为他们从不停下来问自己: 负责任,究竟是什么意思? 一家私人公司,凭什么替全世界做决定? 尺子 早期的大模型训练,通常得靠大量人类标注员去评判回答。什么样的答案更好,什么样的内容有害,模型该不该拒绝,都得先由人做出判断,再把这些偏好喂回给机器。 这个方法有效但笨重。标注员来自不同地方,价值观也不同。规则写得再细,也覆盖不住所有情况。 Anthropic 想出了另一个办法,与其让人类一遍遍告诉模型每一道题怎么答,不如先交给它一套原则。2022 年,Anthropic 提出「宪法式 AI」。做法大致是,先让模型生成回答,再让它照着一套成文原则挑自己答案的毛病,找出问题,再重新改过。 这套「宪法」越写越长。它要懂得权力,懂得利益冲突,懂得什么叫成熟,什么叫智慧。它甚至得想想自己的身份、处境和福祉,别把自己简单当成一件没有内在价值的工具。 它在塑造的,是一种人格。 Anthropic 在宪法里写,这份文件直接塑造 Claude 的行为,代表公司对 Claude 价值观和性格的设想,也是理解 Claude 该如何行动的「最终权威」。历史上管这种事的人,有教会,有皇帝,有政党。现在是一家私人公司。 可当一个大模型对世界的影响不再是一次消费那么简单。Claude 拒绝什么、鼓励什么,怎样描述一个国家、一场战争或一种政治制度,都会影响下游的产品,成为别人理解世界的一部分。 Anthropic 还是在用一家公司的方式做决定,可这决定带来的影响,越来越像一套公共制度,却不用承担公共制度的任何审查。 给模型写完宪法,Anthropic 又开始给行业设计交通规则。2023 年,公司推出「负责任扩展政策」。一个只会写邮件的模型,和一个能设计生物武器、发动复杂网络攻击的模型,显然不能用同一套办法管。于是 Anthropic 给模型划出不同的风险等级。能力越强,可能闯的祸越大,公司就得上越严的安全措施。 一家私人公司,就此同时演了好几个角色。它造模型;模型造出来,由它来测这模型有多危险;什么算危险,由它定标准;危险到哪一步该被叫停,也由它划界线;最后,它再揣着这套结果,去告诉监管者该怎样立规矩。 又当运动员,又当裁判。 Anthropic 显然也想到了这一层。为了不让公司最后被商业利益整个吞掉,Anthropic 又设计了长期利益信托。这个信托,由一些不直接持有公司经济利益的外部成员组成,为的是让 Anthropic 在股东回报之外,也顾念人类的长期利益。照最初的设计,信托会一步步拿到任免多数董事的权力,等公司偏离使命时踩下刹车。 从公司治理的角度看,这样的安排相当少见。多数创业公司融资时,都在忙着向投资人证明自己会高速增长。Anthropic 却反着来,搭了一套结构,防着未来的投资人和管理层为了赚钱,把安全的承诺扔到一边。 不能说这些是摆样子。Anthropic 确实比绝大多数科技公司更认真地在想权力这件事,也肯给自己找麻烦。但它自始至终认真思考的全都是怎样把这份权力用得更好,而不是要不要这份权力。 一个从出生起就自带使命的公司,是永远不会问「我凭什么存在」的。它只会问「我怎样才能更好地存在」。 它没有回答「谁给你的权力」,它只是在宣讲,权力既然已经在手里,自己打算怎样当一个好人。 到这一步,Dario 已经不只是在经营一家公司。他的安全观正在渗进模型的性格,渗进公共政策。接下来他开始谈论,哪个国家该先拿到强大智能,什么样的政治制度值得被护住,全世界获得智能的顺序,又该由谁来定。 美国先得到未来 2024 年,Dario Amodei 写下《Machines of Loving Grace》。 这个名字取自一首诗。1967 年,诗人 Richard Brautigan 在加州理工学院写下《All Watched Over by Machines of Loving Grace》: 一首讲机器与万物和解的诗。他借走标题,写出人类历史上最乐观的技术预言之一。 强大 AI 会变成一支由无数顶尖科学家组成的研究团队,昼夜不停地读论文、设计实验,把几十年的科学进步压进短短几年。癌症、传染病、遗传疾病,可能被大规模攻克。人类或许真能搞懂抑郁、焦虑和成瘾是怎么发生的。寿命能延长,贫困国家能跳过工业化。 他给出一个极大胆的判断,如果强大 AI 发展顺利,未来 50 到 100 年的生物医学进步,可能在 5 到 10 年内完成。 很难不想起他的父亲。 他的儿子等了七年,等到一种新药获批,可以救别人,却已经救不了他。他希望往后的人不必再等。 在他的理想世界里,他是真的相信,这项技术能减少疾病、痛苦和死亡。他甚至专门讨论,怎样不让 AI 的好处只落在富裕国家头上,他希望 AI 能帮全球南方发展,让技术红利尽量盖到全世界。 可等他开始谈怎么走到这个未来,事情就不那么四海一家了。 他认为,强大 AI 出现的时候,国家必须占住优势。这个优势,不能只是一家公司产品更好,或在排行榜上多拿几分。它得落到芯片、算力、能源、供应链、军事和国际联盟上。 美国及其盟友必须拿到更多先进半导体,建起更大规模的数据中心,同时卡住战略竞争者,不让它们拿到训练最强模型所需的芯片。等强大 AI 真来了,还要借它扩大军事和经济优势,形成别国轻易撼动不了的地位。 再往后,才轮到分享。 药是要分发的,芯片是要卡住的。他许诺的「让往后的人不必再等」,真实版本是「让符合条件的人不必再等」。而谁符合条件,他说了算。 他甚至用「永恒的 1991 年」来形容那种状态。1991 年,苏联解体,冷战收场,美国及其盟友拿到压倒性优势。他盼着强大 AI 能再造一个那样的历史时刻。 请注意这个比喻的含金量。一个声称要造福全人类的技术,理想蓝本是人类历史上最彻底的一场单极霸权。 天下为公,四个字写得漂亮。只是「天下」归美国,「为公」归 Anthropic。 后来 DeepSeek 出现。中国公司用相对有限的资源,训练出有竞争力的模型。在 Dario 看来,这恰恰证明中国有出色的研究者和工程能力。一旦再拿到足够多的先进芯片,中国公司可能训练出世界上最强的模型。 所以,更不能把芯片给它。 对手越强,越证明封锁是对的;对手证明了自己的能力,反而成为被封锁的理由。这套逻辑永远讲得通,因为它是条衔尾蛇。 他把未来分成两种。一种两极世界,两边都能训练极强模型,智能竞赛变成新冷战。另一种单极世界,美国及其盟友掌握绝大部分先进算力,西方用领先的这几年,形成技术、经济和军事优势,再把这份优势固定下来。 他明显更盼着第二种未来。什么造福人类,什么不必再等,什么机器与万物和解,在「永恒的单极」面前,都是前言。 他曾经公开反对过一种叙事,他说他不喜欢 AI 公司的创始人把自己描述成带领人类走向救赎的先知,也警惕少数企业仗着技术优势,单方面塑造所有人的未来。 他反对先知。但他做的,和先知做的,是同一件事。 他看见了所有危险,除了自己 再把时间拨回 2026 年 1 月的《技术的青春期》。 在这篇文章里,Dario Amodei 几乎把外界对他和 Anthropic 的全部批评,自己先写了出来。 他承认,前沿 AI 公司正在拿到一种历史上很少有私人企业握过的权力。他甚至捅破窗户纸说,AI 公司可能借产品去影响用户的政治态度,甚至给用户「洗脑」。他呼吁公众必须紧紧盯住 AI 公司,政府也得提防这些公司跟国家权力靠得太近。 他也担心,AI 会让财富和政治权力进一步收拢。少数公司把智能、财富和信息都攥在手里,普通公民对经济和政府的影响,就一点点弱下去。 这些危险,他都看见了。写得清楚,写得到位。很少有站在权力中心的人,会这样坦白地讲出自己那个位置有多危险。 正因为写得太好,才必须追问一句:然后呢? 他每回提出解法,最后都会绕回同一个方向。顺着他的解法走到头,Anthropic 总比原来拿到更多权力。模型越危险,越需要 Anthropic 留在前沿;政府越不懂技术,越得依赖 Anthropic 的判断;公众越容易被模型影响,Anthropic 就越得替模型把价值观写好;别的国家越不可信,美国和它的 AI 公司就越该多握芯片和算力。 他承认每一场病,开出的都是同一张药方,Anthropic。 他相信自己真诚地相信,这项技术危险到不能随便交到任何人手里。他也相信自己比多数人都更早看清了这个危险。 真诚的人,有时是自己最先骗过的那个。尤其当骗自己的收益如此巨大的时候。 他似乎真诚地相信,这项技术危险到不能随便交到任何人手里。他又真诚地相信,自己比多数人都更早看清了这个危险。 这两句话搁在一起,就是一套完整的自我授权。他从来不必宣布自己该当人类的监护人。他只需不断地把那些他觉得不够可靠的人排除掉,市场不行,公众不行,威权国家不行,其他公司也不够谨慎,等人都被排除干净,剩下来最适合握方向盘的,恰好是 Anthropic。 排除法的终点,永远是他自己。 他不相信任何人有资格替人类决定未来。 于是,他决定自己来。 最后一家私营公司 2026 年 8 月 14 日,一句话从一档播客里传出来。 「在 Anthropic 内部,他们非常自信。多个我信任的人告诉过我,Dario 说过:Anthropic 某一天可能成为世界上唯一的私营公司。」 说这话的人叫 Gavin Baker,一个投过 SpaceX 的对冲基金经理。他补了一句,说在那个愿景里,只有 Anthropic,然后是各国政府。仅此。 一天之内,这句话在社交媒体上传开了。 前白宫 AI 与加密货币事务顾问、现任总统科技顾问委员会联席主席 David Sacks 说:「这太自大了。狂妄得有点像 SBF。」 第二天傍晚,Dario 在 X 发布了两篇长文来回应。 第一篇谈监管。他说,「要么集中,要么分布」是个虚假的选择;真正好的制度,恰恰能把权力去中心化: 「正式法院系统有时可能显得古板、精英主义,但它比另一选择——暴民正义——更能护住弱者。制度在最好的情况下,可以把权力赋予理念而不是个人。」 第二篇谈信息传递。他说,公众对 AI 的负面情绪是一场信任危机。接着,他写下两篇长文里最重的一段: 「我认为到目前为止,对 AI 公司包括 Anthropic 最准确的批评是,我们还没有兑现我们让世界受益的大承诺。这完全怪我们。」 「真正有效的做法是真正治愈癌症。」 两篇长文,没有一句正面回应那句流言。他用一个真问题,回避了另一个真问题。 他说,要真正治愈癌症。他指的是用 AI 推动整个医学进步,让新药来得足够快,快过任何一种病。 这是给一个死在 2006 年的人的话。那个人等一瓶药,等了很久,没有等到。 从那以后,他相信慢是罪。一个人相信慢是罪,就会把快当成唯一的解药。解药是好东西。只是他想让所有人相信,解药只能由他配。 1986 年,英国作家艾伦·摩尔出版了一部漫画,叫《守望者》,后来拍成了电影。电影里有一个人,叫阿德里安·维特,人称法老王,号称全世界最聪明的人。 他比所有人都更早看见灾难要来。核战争,末日,人类毁灭自己。他为此准备了半生。然后他明白了,光警告是没有用的。 于是他亲手引爆了那场灾难。一夜之间,几座城市从地图上抹去。 他觉得只有让人类亲眼看见毁灭的样子,两个超级大国才会停手,世界才能从此和平。 他是凶手,也是他自己认定的救世主。 故事的结尾,一切如他所愿。他问那个蓝色的、近乎全知的曼哈顿博士: 「结局?阿德里安,什么都没有结束。一切,永远不会结束。」 原文链接

Anthropic,Dario Amodei,与「最后一家私营公司」

原文标题:《Anthropic,Dario Amodei,与「最后一家私营公司」》
原文作者:动察Beating
关于 Anthropic 的创始人 Dario Amodei,流传着两种说法,互相矛盾,又都说得通。
一种说法是,他是这个时代最清醒的守夜人。全世界都在往超级智能的悬崖上踩油门,只有他肯站在路边,一遍一遍喊,前面是深渊。
另一种说法是,他是硅谷野心最大的人之一。他领着全世界最强的 AI 公司,日夜赶工,把所有人警告过的那个未来,一点一点,亲手造出来。
一个人,真的可以同时把这两件事都干了。
他给那个设想中的那个世界取了个名字,「数据中心里的天才之国」。那个国度里有五千万个天才,不睡觉,一天工作二十四小时,思考的速度是普通人的几十倍,还能复制出无数个和自己一样的天才。这个国家没有土地,没有边界,它处在一排一排的数据中心里。
2026 年 1 月,他把这个想象写进一篇长文,题目叫《技术的青春期》。
然后他又往前推演了一步。要是有一天,这五千万名天才不听人类的话了,会怎么样?
再往后的画面就危险起来了。生物武器、大规模失业、独裁、战争,他一样一样往下数。数到最后,说,留给我们的时间不多了。
可在同一篇文章里,他还写着:「AI 已经在替 Anthropic 写大量代码,帮着把下一代模型更快地做出来。」
一边警告,一边加速。他不觉得这中间有什么矛盾。
这就是全部问题的起点,不是他坏,是他真的不觉得。
当然,他有他的解释。Anthropic 停下来,OpenAI 不停,Google 不停,别的国家的公司也不会停。没有谁肯第一个松手,最先停下的那一个,多半什么也拦不住,只是把果子让给别人。
这套说辞翻译过来就是,既然大家都在抢,那就让「我」来抢第一。既然谁也停不下来,那就让「我」来决定什么时候停。
这样一来,超级智能该不该造,反倒不那么要紧了。照他的判断,它迟早会被造出来。真正要紧的,是谁先把它造出来,以及到了那一天,谁有资格握住方向盘。
来不及
Dario Amodei 1983 年出生在旧金山,1983 年。父亲是意大利托斯卡纳人,一辈子做皮具生意;母亲是芝加哥的犹太裔,旧金山公共图书馆的规划和建设,她出过一份力。
他从小就喜欢数学和物理。1990 年代末,湾区互联网泡沫,公司一家接一家往外冒,年轻人写网站、找投资,盘算上市那天能套现多少钱。这些故事没能打动他。很多年后他说,自己当时要找的是「基础科学真理」,他只想弄明白,世界为什么会长成这个样子。
他对所谓「重要问题」,很早就有一份近乎固执的认真。只要认准一件事足够重要,他就想不通,人怎么还能若无其事地慢下来。
2003 年,美国要打伊拉克,他在加州理工学院读书。校园里反战的人不少。聊天时,有人说着忧心忡忡的话;第二天,大家照旧上课。他在学生报上写了篇文章批评同学,说要是真怕一场战争会害死很多人,反对就不该只停在嘴边,等它真的发生,再后悔就晚了。
在他看来,犹豫从来不是中立。等待,本身就是一种选择。
这个二十岁的年轻人,最不能忍受的,就是等。
三年后,他二十三岁,父亲死于丙型肝炎。
当时的丙肝几乎无药可治。标准疗法是打一整年的干扰素,但是会导致发烧、脱发、抑郁,治愈率还不到一半。
2013 年 12 月,一种新药获批。疗程缩到十二周,治愈率百分之九十五。
他父亲没有等到。
只差七年。
一个没有救下父亲的儿子,此后二十年,都在催着科学快一点,再快一点。
父亲去世以后,他从理论物理转向生物物理,在普林斯顿研究视网膜的神经回路。当时的仪器一次只能记下很少的神经信号,他嫌慢,就参与去造新的传感器。
再后来,他进斯坦福医学院,研究癌症和蛋白质。离病越近,人就越显得小。一种病牵扯几百个基因、成千上万种蛋白质,还有数不清的通路彼此勾连。研究者耗尽许多年,或许能把其中一环看明白,却仍不知道,把它放回整个身体以后,会发生什么。
后来他形容,那种复杂让他几乎绝望。
AI 就是在这个时候进了他的视野,那是一样能把人的尺度撑大的工具。机器能同时读许多论文,处理许多数据,试许多种可能,替代原本要几百名、几千名研究人员一起完成的认知劳动。
他从「人太渺小」出发,抵达的结论是造一个更大的东西,把人再压缩一次。
2014 年,他离开生命科学,进了百度在硅谷的人工智能团队。团队很快发现,模型大一点,数据多一点,算力再往上加一点,效果就还会再往上走。几年以后,这套经验被总结成「规模定律」,你未必知道下一代模型会突然学会什么,却可以大致断定,它一定比上一代更强。
智能头一次显得可以像工业品一样被生产出来。强大的 AI,也就成了一件早晚会诞生的东西。
剩下的差别,只是多少数据,多少芯片,多少电力,以及还要等多久。
那个最恨等待的人,亲手证明了,通往他想要的答案的路,是存在的。
方向盘
2016 年,Dario Amodei 进了 OpenAI。
此后几年,语言模型迅速长大。到 GPT-3,OpenAI 把公司一半以上的算力交给 Dario,由他把模型规模放大一百倍。结果比许多人预期的还要惊人,它可以写文章、翻译、总结,还有一些没人教过它、自己学会的本事。
规模长一分,能力长一分。
他确信这条路通往通用智能。而一旦接受模型最终可能和人一样聪明,安全就再也没法被当成鸡毛蒜皮。
然后他发现了问题。Dario 负责把模型造出来,却慢慢发现,造模型,和决定模型往哪儿去,压根是两码事。模型什么时候发布,开放到什么程度,跟哪些公司合作,谁有决策权,这些事并不因为他负责训练就自动归他管。
OpenAI 内部分成两拨人。一拨要快点把技术推向世界;另一拨担心,公司由谁领导、按什么原则行事,也许比某一项技术细节更要紧。
那究竟什么样的人,有资格领导一家制造强大智能的公司?
他的答案是,领导者必须诚实,动机必须真诚,也必须真心希望世界变好。
技术安全,慢慢变成了对人的判断。这条推导很危险,也很顺理成章。危险就危险在,它把一切复杂问题,最后都化简成这个人可不可信。而在这个推导里,永远缺席的一环,是谁来判断这个人可不可信。
到 2020 年,他与 OpenAI 领导层之间的矛盾已经很难再调和。那一年 12 月,他带着妹妹 Daniela、Jack Clark、Chris Olah 和几名同事,离开了 OpenAI。因为 Dario 喜欢熊猫,这个小圈子在内部被叫作「熊猫派」。
几个月以后,他们创办了 Anthropic。Anthropic,词典里的意思是「与人有关的」。
这一回,Dario 不打算再把方向盘交给别人。
二十个人
2021 年,旧金山的疫情还没结束。
Anthropic 刚成立没多久,只有十五到二十个人。多数时候,大家隔着 Zoom 开会;每周再挑一天,各自带把椅子,到公园里碰头。一边吃午饭,一边聊模型、算力、安全研究,也聊这家公司到底该长成什么样子。
不到二十个人,坐在旧金山的草地上,手里兴许还捧着半盒没吃完的沙拉,操心的却是八十亿人的往后。
规模定律告诉他们,未来一定会来。既然一定要来,总得有人提前把路备好。「总得有人」这四个字,就是全部的合法性论证。
Anthropic 给自己定下的目标,是一边造最前沿的模型,一边研究怎么理解和控制它,再把这一套安全方法,变成别家公司的标准。
Dario 在 OpenAI 吃过一回亏。他明白,只站在技术的外围谈安全,到头来多半只能给真正握着模型的人提提建议。话说得再好听,也不过是站在岸上,教水里的人怎么游泳。
得自己下水。
这让 Anthropic 从成立第一天起,就显得很拧巴。想知道最强模型有什么危险,就得先拥有最强模型;想影响监管,就得先在行业里有分量。
于是,Anthropic 很快卷进了所有前沿大模型公司都躲不开的那个循环,融资、买算力、训练模型、发布产品、抢客户,再用新的收入和估值换更多的算力。
Dario 说,把公司做大,是在保护世界。投资人也愿意相信,押注 Anthropic,是在投一家更负责任的 AI 公司。
这套说法的精妙之处在于,他越赚钱,就显得越道德;公司估值越高,他「保护世界」的证据就越足。
商业利益和文明使命互相抬轿子。
方向,由 Dario 来给。他写长文,谈文明、科学和人类的未来。把这些宏大判断落地的,是妹妹 Daniela,管招人、搭团队、找钱。
公司的起点,是一个几乎没法证伪的宏大判断:
强大 AI 就要来了,而世界需要一家更值得信任的公司,站到最前面去。
「更值得信任」,是公司自己说的。
这样的叙事给了 Anthropic 很强的凝聚力。加入的人,并不是只在找一份薪水更高的差事。他们相信,自己干的是关系到人类文明的大事。
一家公司最可怕的状态,就是员工真的相信自己在拯救人类。因为从那一刻起,所有商业上的扩张,都自动变成了圣战;所有反对的声音,都自动变成了对人类的背叛。
创业头几年,Anthropic 想证明,一家 AI 公司可以比别人更谨慎,也更负责任。这个愿望大概是真诚的。
但真诚从来不保证正确。真诚的人做错事,往往比虚伪的人更麻烦,因为他们从不停下来问自己:
负责任,究竟是什么意思?
一家私人公司,凭什么替全世界做决定?
尺子
早期的大模型训练,通常得靠大量人类标注员去评判回答。什么样的答案更好,什么样的内容有害,模型该不该拒绝,都得先由人做出判断,再把这些偏好喂回给机器。
这个方法有效但笨重。标注员来自不同地方,价值观也不同。规则写得再细,也覆盖不住所有情况。
Anthropic 想出了另一个办法,与其让人类一遍遍告诉模型每一道题怎么答,不如先交给它一套原则。2022 年,Anthropic 提出「宪法式 AI」。做法大致是,先让模型生成回答,再让它照着一套成文原则挑自己答案的毛病,找出问题,再重新改过。
这套「宪法」越写越长。它要懂得权力,懂得利益冲突,懂得什么叫成熟,什么叫智慧。它甚至得想想自己的身份、处境和福祉,别把自己简单当成一件没有内在价值的工具。
它在塑造的,是一种人格。
Anthropic 在宪法里写,这份文件直接塑造 Claude 的行为,代表公司对 Claude 价值观和性格的设想,也是理解 Claude 该如何行动的「最终权威」。历史上管这种事的人,有教会,有皇帝,有政党。现在是一家私人公司。
可当一个大模型对世界的影响不再是一次消费那么简单。Claude 拒绝什么、鼓励什么,怎样描述一个国家、一场战争或一种政治制度,都会影响下游的产品,成为别人理解世界的一部分。
Anthropic 还是在用一家公司的方式做决定,可这决定带来的影响,越来越像一套公共制度,却不用承担公共制度的任何审查。
给模型写完宪法,Anthropic 又开始给行业设计交通规则。2023 年,公司推出「负责任扩展政策」。一个只会写邮件的模型,和一个能设计生物武器、发动复杂网络攻击的模型,显然不能用同一套办法管。于是 Anthropic 给模型划出不同的风险等级。能力越强,可能闯的祸越大,公司就得上越严的安全措施。
一家私人公司,就此同时演了好几个角色。它造模型;模型造出来,由它来测这模型有多危险;什么算危险,由它定标准;危险到哪一步该被叫停,也由它划界线;最后,它再揣着这套结果,去告诉监管者该怎样立规矩。
又当运动员,又当裁判。
Anthropic 显然也想到了这一层。为了不让公司最后被商业利益整个吞掉,Anthropic 又设计了长期利益信托。这个信托,由一些不直接持有公司经济利益的外部成员组成,为的是让 Anthropic 在股东回报之外,也顾念人类的长期利益。照最初的设计,信托会一步步拿到任免多数董事的权力,等公司偏离使命时踩下刹车。
从公司治理的角度看,这样的安排相当少见。多数创业公司融资时,都在忙着向投资人证明自己会高速增长。Anthropic 却反着来,搭了一套结构,防着未来的投资人和管理层为了赚钱,把安全的承诺扔到一边。
不能说这些是摆样子。Anthropic 确实比绝大多数科技公司更认真地在想权力这件事,也肯给自己找麻烦。但它自始至终认真思考的全都是怎样把这份权力用得更好,而不是要不要这份权力。
一个从出生起就自带使命的公司,是永远不会问「我凭什么存在」的。它只会问「我怎样才能更好地存在」。
它没有回答「谁给你的权力」,它只是在宣讲,权力既然已经在手里,自己打算怎样当一个好人。
到这一步,Dario 已经不只是在经营一家公司。他的安全观正在渗进模型的性格,渗进公共政策。接下来他开始谈论,哪个国家该先拿到强大智能,什么样的政治制度值得被护住,全世界获得智能的顺序,又该由谁来定。
美国先得到未来
2024 年,Dario Amodei 写下《Machines of Loving Grace》。
这个名字取自一首诗。1967 年,诗人 Richard Brautigan 在加州理工学院写下《All Watched Over by Machines of Loving Grace》:
一首讲机器与万物和解的诗。他借走标题,写出人类历史上最乐观的技术预言之一。
强大 AI 会变成一支由无数顶尖科学家组成的研究团队,昼夜不停地读论文、设计实验,把几十年的科学进步压进短短几年。癌症、传染病、遗传疾病,可能被大规模攻克。人类或许真能搞懂抑郁、焦虑和成瘾是怎么发生的。寿命能延长,贫困国家能跳过工业化。
他给出一个极大胆的判断,如果强大 AI 发展顺利,未来 50 到 100 年的生物医学进步,可能在 5 到 10 年内完成。
很难不想起他的父亲。
他的儿子等了七年,等到一种新药获批,可以救别人,却已经救不了他。他希望往后的人不必再等。
在他的理想世界里,他是真的相信,这项技术能减少疾病、痛苦和死亡。他甚至专门讨论,怎样不让 AI 的好处只落在富裕国家头上,他希望 AI 能帮全球南方发展,让技术红利尽量盖到全世界。
可等他开始谈怎么走到这个未来,事情就不那么四海一家了。
他认为,强大 AI 出现的时候,国家必须占住优势。这个优势,不能只是一家公司产品更好,或在排行榜上多拿几分。它得落到芯片、算力、能源、供应链、军事和国际联盟上。
美国及其盟友必须拿到更多先进半导体,建起更大规模的数据中心,同时卡住战略竞争者,不让它们拿到训练最强模型所需的芯片。等强大 AI 真来了,还要借它扩大军事和经济优势,形成别国轻易撼动不了的地位。
再往后,才轮到分享。
药是要分发的,芯片是要卡住的。他许诺的「让往后的人不必再等」,真实版本是「让符合条件的人不必再等」。而谁符合条件,他说了算。
他甚至用「永恒的 1991 年」来形容那种状态。1991 年,苏联解体,冷战收场,美国及其盟友拿到压倒性优势。他盼着强大 AI 能再造一个那样的历史时刻。
请注意这个比喻的含金量。一个声称要造福全人类的技术,理想蓝本是人类历史上最彻底的一场单极霸权。
天下为公,四个字写得漂亮。只是「天下」归美国,「为公」归 Anthropic。
后来 DeepSeek 出现。中国公司用相对有限的资源,训练出有竞争力的模型。在 Dario 看来,这恰恰证明中国有出色的研究者和工程能力。一旦再拿到足够多的先进芯片,中国公司可能训练出世界上最强的模型。
所以,更不能把芯片给它。
对手越强,越证明封锁是对的;对手证明了自己的能力,反而成为被封锁的理由。这套逻辑永远讲得通,因为它是条衔尾蛇。
他把未来分成两种。一种两极世界,两边都能训练极强模型,智能竞赛变成新冷战。另一种单极世界,美国及其盟友掌握绝大部分先进算力,西方用领先的这几年,形成技术、经济和军事优势,再把这份优势固定下来。
他明显更盼着第二种未来。什么造福人类,什么不必再等,什么机器与万物和解,在「永恒的单极」面前,都是前言。
他曾经公开反对过一种叙事,他说他不喜欢 AI 公司的创始人把自己描述成带领人类走向救赎的先知,也警惕少数企业仗着技术优势,单方面塑造所有人的未来。
他反对先知。但他做的,和先知做的,是同一件事。
他看见了所有危险,除了自己
再把时间拨回 2026 年 1 月的《技术的青春期》。
在这篇文章里,Dario Amodei 几乎把外界对他和 Anthropic 的全部批评,自己先写了出来。
他承认,前沿 AI 公司正在拿到一种历史上很少有私人企业握过的权力。他甚至捅破窗户纸说,AI 公司可能借产品去影响用户的政治态度,甚至给用户「洗脑」。他呼吁公众必须紧紧盯住 AI 公司,政府也得提防这些公司跟国家权力靠得太近。
他也担心,AI 会让财富和政治权力进一步收拢。少数公司把智能、财富和信息都攥在手里,普通公民对经济和政府的影响,就一点点弱下去。
这些危险,他都看见了。写得清楚,写得到位。很少有站在权力中心的人,会这样坦白地讲出自己那个位置有多危险。
正因为写得太好,才必须追问一句:然后呢?
他每回提出解法,最后都会绕回同一个方向。顺着他的解法走到头,Anthropic 总比原来拿到更多权力。模型越危险,越需要 Anthropic 留在前沿;政府越不懂技术,越得依赖 Anthropic 的判断;公众越容易被模型影响,Anthropic 就越得替模型把价值观写好;别的国家越不可信,美国和它的 AI 公司就越该多握芯片和算力。
他承认每一场病,开出的都是同一张药方,Anthropic。
他相信自己真诚地相信,这项技术危险到不能随便交到任何人手里。他也相信自己比多数人都更早看清了这个危险。
真诚的人,有时是自己最先骗过的那个。尤其当骗自己的收益如此巨大的时候。
他似乎真诚地相信,这项技术危险到不能随便交到任何人手里。他又真诚地相信,自己比多数人都更早看清了这个危险。
这两句话搁在一起,就是一套完整的自我授权。他从来不必宣布自己该当人类的监护人。他只需不断地把那些他觉得不够可靠的人排除掉,市场不行,公众不行,威权国家不行,其他公司也不够谨慎,等人都被排除干净,剩下来最适合握方向盘的,恰好是 Anthropic。
排除法的终点,永远是他自己。
他不相信任何人有资格替人类决定未来。
于是,他决定自己来。
最后一家私营公司
2026 年 8 月 14 日,一句话从一档播客里传出来。
「在 Anthropic 内部,他们非常自信。多个我信任的人告诉过我,Dario 说过:Anthropic 某一天可能成为世界上唯一的私营公司。」
说这话的人叫 Gavin Baker,一个投过 SpaceX 的对冲基金经理。他补了一句,说在那个愿景里,只有 Anthropic,然后是各国政府。仅此。
一天之内,这句话在社交媒体上传开了。
前白宫 AI 与加密货币事务顾问、现任总统科技顾问委员会联席主席 David Sacks 说:「这太自大了。狂妄得有点像 SBF。」
第二天傍晚,Dario 在 X 发布了两篇长文来回应。
第一篇谈监管。他说,「要么集中,要么分布」是个虚假的选择;真正好的制度,恰恰能把权力去中心化:
「正式法院系统有时可能显得古板、精英主义,但它比另一选择——暴民正义——更能护住弱者。制度在最好的情况下,可以把权力赋予理念而不是个人。」
第二篇谈信息传递。他说,公众对 AI 的负面情绪是一场信任危机。接着,他写下两篇长文里最重的一段:
「我认为到目前为止,对 AI 公司包括 Anthropic 最准确的批评是,我们还没有兑现我们让世界受益的大承诺。这完全怪我们。」
「真正有效的做法是真正治愈癌症。」
两篇长文,没有一句正面回应那句流言。他用一个真问题,回避了另一个真问题。
他说,要真正治愈癌症。他指的是用 AI 推动整个医学进步,让新药来得足够快,快过任何一种病。
这是给一个死在 2006 年的人的话。那个人等一瓶药,等了很久,没有等到。
从那以后,他相信慢是罪。一个人相信慢是罪,就会把快当成唯一的解药。解药是好东西。只是他想让所有人相信,解药只能由他配。
1986 年,英国作家艾伦·摩尔出版了一部漫画,叫《守望者》,后来拍成了电影。电影里有一个人,叫阿德里安·维特,人称法老王,号称全世界最聪明的人。
他比所有人都更早看见灾难要来。核战争,末日,人类毁灭自己。他为此准备了半生。然后他明白了,光警告是没有用的。
于是他亲手引爆了那场灾难。一夜之间,几座城市从地图上抹去。
他觉得只有让人类亲眼看见毁灭的样子,两个超级大国才会停手,世界才能从此和平。
他是凶手,也是他自己认定的救世主。
故事的结尾,一切如他所愿。他问那个蓝色的、近乎全知的曼哈顿博士:
「结局?阿德里安,什么都没有结束。一切,永远不会结束。」
原文链接
Статья
腾讯还有梦想原文标题:《腾讯还有梦想》 原文作者:动察Beating 2026 年 8 月 12 日,腾讯发布二季度财报。 单季资本开支,527.8 亿元。三个月前,这个数字是 319 亿。再往前推一年,全年加起来也不过 792 亿。 这家公司一向以花钱克制著称。它买卡的速度,曾经慢到让市场怀疑它是不是真的想上 AI 的牌桌。现在,它把花钱的速度在一年之内提到了这个量级。 同一天的财报会上,马化腾说,腾讯正在「构建一个全新的、AI 赋能的腾讯」。混元改名叫 HY,Hy4 即将发布。这家公司上一次用「全新」形容自己,还是微信诞生的年代。 腾讯还有梦想。它的梦想不只是 AI,它要重新学会做一家不安稳的公司。 2018 年,潘乱在《腾讯没有梦想》里说腾讯是水一样的公司。水善利万物而不争,哪里有渠道,就往哪里流。水没有个性,所以水也没有梦想。 水往低处流,这是天性,逆流是逆流者的事。2026 年,这家 28 岁的公司,做了件违反天性的事。它承认,八年前那篇文章说对了,承认水一样的活法,已经活不下去了。 水 5 月 5 日晚 9 点,《腾讯没有梦想》发表。一万三千字。 夜里 2 点,刘炽平和腾讯公关总监张军在朋友圈回应。刘炽平说,腾讯是一个比外界想象更大的组织和生态,「把腾讯简化成一个产品的得失,一种战略的部署,一个人的意志,都太狭隘了」。 2 点 19 分,一张疑似马化腾回应的截图开始在朋友圈流传。 2 点 39 分,真正的马化腾才开口,是对一个关心他的朋友说「有批评蛮好。」 随后,他说: 「从写第一行代码开始,我的理想都是如何做出最好的产品,而不是赚多少钱。」 白天,全国媒体几乎全文引用了那张疑似马化腾回应的截图,连张一鸣都在朋友圈替腾讯说话,说这是「堂吉诃德式的想象」,腾讯不仅强大,还在各个维度不断进化。 张军那天一直在长途飞机上,他落地后说:「我们固然没有外界想的那么糟,但批评也让我们意识到,我们没自己想得那么好。」 当然,当时关于那篇文章也有一些不同的声音。洪波说,文章里提到的很多是真问题,但这么大的公司,有唯一的正确答案吗?「或许,作者认为张一鸣就是那个唯一正确的答案。他有点迷信张一鸣。」 那篇文章还记录了一个更早的故事。2011 年初,3Q 大战刚结束,腾讯开了一次总办会,讨论什么是腾讯的开放能力。马化腾让与会的 16 名高管,每个人在纸上写下他们认为的腾讯核心能力,总共得出 21 个答案。最后定下两个。 资本、流量。 资本这个词是刘炽平主张的。开放,就是把流量放出去,让它变成投资。流量开放,资本开放,「我不再自己做」。 这两个词管了腾讯十年。微信管流量的入口,投资管流量的出口,中间是游戏和广告源源不断造出来的现金。京东的电商入口进了微信九宫格,搜狗接了搜索,美团接了本地生活。流量换股权,股权换盟友。十年里,腾讯市值涨了十倍,超过 Facebook。那篇文章发表的时候,它看起来仍然不可战胜。 八年之后回头重读会发现,那篇文章几乎预言了腾讯后来每一次跌倒的方式。 十年后的 2021 年 12 月 23 日,腾讯把 14.7% 的京东股票分给了自己的股东,市值约 1000 亿中国香港元。2022 年 1 月,减持 Sea,套现 32 亿美元。2022 年 11 月,又分掉 9.6% 的美团,约 1594 亿中国香港元。 当年被定为「核心能力」的资本,被腾讯亲手拆掉了。水流了几十年,第一次开始往回走。 第一场 AI 梦 那篇文章里有一段,当年没有多少人注意。它写到了腾讯的 AI。AI Lab 做的围棋程序「绝艺」,先后败给了两个业余作品。一个是头条副总裁的个人爱好,一个是微信翻译团队几名工程师的业余之作。 很少有人意识到,腾讯的第一次 AI 梦,在那篇文章发表前两年就开始了。 2016 年春天,AlphaGo 战胜李世石,全世界第一次认真对待人工智能。中国的互联网公司像听见了发令枪。这一年,腾讯副总裁姚星筹建 AI Lab。次年十月,阿里达摩院成立,宣布三年投入 1000 亿。 2017 年 3 月 23 日,腾讯宣布,任命张潼担任 AI Lab 主任。张潼是机器学习领域最顶尖的华人学者之一,此前是百度研究院副院长。加盟时他说:「世界范围内的华裔人才在 AI 领域有很强的技术优势,这是中国发展 AI 的机会。」 当时 AI Lab 有 50 余位科学家,90% 以上有 AI 相关博士学位和海外留学背景。腾讯还嫌不够,2017 年 5 月,它任命微软研究院首席研究员俞栋为 AI Lab 副主任,主管新设立的西雅图实验室。之所以设立在西雅图,是因为很多微软的人不愿离开那儿,腾讯就把实验室建到微软旁边。 第一次梦的开场,声势是足的。2017 年 3 月,绝艺在日本 UEC 杯夺冠,年底又在龙星战登顶。围棋是那两年 AI 的名片。AlphaGo 之后,谁家的 AI 都得会下棋,那也是腾讯 AI 最高光的时刻。 然后,梦想开始泄气。 问题出在腾讯自己的方式上。2018 年 9 月 30 日,腾讯启动 930 变革,成立 CSIG。变革后第三天,财新发了一篇报道,标题直接点破了问题: 《三个 AI 团队仍然分而治之,2B 业务赛马机制如何破?》 AI Lab、优图、微信 AI,三条线各做各的,数据不互通,人才不共享。 2019 年 1 月 3 日,张潼不再担任公司管理职位,回到学术界。他后来去了港科大与创新工场的联合实验室。50 余位科学家散掉一批,张正友接任主任。 2021 年,姚星也走了。他没有去任何一家大厂,创办了自己的公司元象,方向是「全真互联网」。天使轮的投资人名单里,坐着腾讯和高瓴。 2025 年 12 月,俞栋,当年西雅图实验室的负责人,离开 AI Lab,加入美国 Capital One。三个月后,2026 年 3 月 21 日,腾讯正式撤销 AI Lab,部分人员并入混元大模型团队。 从张潼上任到实验室撤销,九年。一场梦的完整生命周期。 腾讯的第一次 AI 梦不是没有开始,也不是不重视。它挖来了这个领域最贵的人,把实验室建到了微软旁边。它死在一个更简单的问题上,这家公司不知道怎么安放一个不能马上变现的梦。 研究不落地,业务不供血,三条线互相赛马,谁也没有输,所以谁也没有赢。 拆 2018 年 9 月 30 日,《腾讯没有梦想》发表五个月后,腾讯启动了 930 变革。撤销 MIG,新设 PCG 和 CSIG,六大事业群成形。马化腾在全员信里写下: 「扎根消费互联网,拥抱产业互联网。」 没有人能证明是那篇文章推动了这场变革,不过重要是共振。文章说出的问题,腾讯自己也开始承认了。这是腾讯六年来最大的变革,马化腾说这件事让他「每天都如履薄冰」。 变革之后,腾讯新成立的 CSIG,由汤道生坐镇,他宣布,CSIG 不再使用赛马机制。 赛马是腾讯的传家宝,微信就是赛马的产物。2010 年,几个团队同时做移动即时通讯,张小龙的广州团队赢了。这个机制生产过腾讯最后一件伟大产品。 2019 年 11 月 11 日,腾讯 21 周年,马化腾发全员信,公布新的使命愿景: 「用户为本,科技向善。」 当年腾讯的旧愿景是「最受尊重的互联网企业」,非常大,也非常虚,没人说清楚怎么实现。一年半之后,腾讯把它换了。 还有腾讯云。930 时被寄予厚望的产业互联网,走得不顺。2021 年,腾讯云不再追求规模,转向减少亏损。2023 年,汤道生明确说,要从集成商转为被集成商,收缩那些不赚钱的总集成项目。金融科技及企业服务的毛利率慢慢爬到了 2025 年的 51%。 代价是,这场转型的野心,从「再造一个腾讯」,收缩成「把利润做正」。 减亏之外,这五年也留下了果实。汤道生给产业互联网定过一个说法,叫 C2B。产业互联网不仅是 ToB、ToG 的,也是 ToC 的,B 端、G 端归根到底还是 C 端。腾讯会议、企业微信这批产品,就是这条路走出来的。它们没有再造一个腾讯,但让腾讯头一回学会了做云上的软件,学会了不再用流量直接换钱。 930 一周年,杨国安说,腾讯开始摆脱靠社交和游戏吃饭的「富二代」式路径依赖。这句话其实只说对了一半,路径确实在变,不过依赖还在。多年以后,汤道生会说,大模型和云一样,难以被垄断。这句话的底气,就是那五年减亏减出来的。 2023 年 5 月,刘炽平退任执行董事。他仍然是总裁,仍然管着投资委员会。但象征意义是清楚的。主张「资本是核心能力」的人,从董事会的名单上退了下去。有媒体给他算了算,16 年总薪酬超过 23 亿元。 从 930 到 2023,五年时间,腾讯做的几乎全是「拆」。拆组织,拆投资,拆愿景,拆赛马。它知道自己病了,于是一件一件地把旧衣服脱下来。但一家公司最难的不是换方向,是承认换了方向之后,仍然不知道答案。产业互联网这第二次转型,最后以减亏收场。 水换了一条河道,还是水。 潮 2023 年 5 月 19 日,马化腾在中国香港的股东会上被问到 AI,他说: 「AI 是互联网百年不遇的机遇。」 又补了一句,腾讯不会为了提振股价,把半成品拿出来。 这句话里有清醒,也有迟缓。清醒在于,他看得见这场革命的分量。迟缓在于,说这话的时候,百度的文心一言已经发布两个月,阿里的通义千问发布一个月,而腾讯的模型还要再等四个月。2023 年 9 月 7 日,混元大模型才正式发布,主打的是「解决胡言乱语」。 安全与克制,一贯的腾讯姿态。 克制了将近一年,2024 年 11 月,腾讯把 Hunyuan-Large 开源。3890 亿参数,当时全球最大的开源 MoE 模型。一向对开源态度冷淡的公司,头一回把模型的门打开。 2024 年 5 月 30 日,腾讯元宝上线。公司对外的说法是:「大模型不争一时之先。」 一年后,它自己推翻了自己。 2025 年 2 月 13 日,元宝接入 DeepSeek-R1 满血版,免费。三天后,微信搜一搜灰度上线 AI 搜索,同样接入 DeepSeek。腾讯特意说明,这个功能不会读取用户的聊天记录和朋友圈。3 月 4 日,元宝登顶中国区苹果 App Store 免费下载榜。 这是流量旧法术显灵的最后一次。接入对手的模型,灌进自己的流量,一个月登顶。 然后,腾讯想再显灵一次。 2026 年 1 月 26 日的员工大会上,马化腾宣布了一个玩法。「元宝派」,春节发 10 亿红包。他说,希望能重现十一年前微信红包的时刻。 2014 年除夕,微信红包上线。800 万用户,4000 万个红包,马云称之为「偷袭珍珠港」。一年后的除夕,微信和央视春晚合作,全国人对着电视摇手机。一夜之间,红包收发 10.1 亿次。移动支付的格局,在这两个除夕之间被改写。 那是腾讯最后一次靠产品和流量完成的奇袭。此后十一年,它再没有过那样的夜晚。 2026 年春节,腾讯用 10 个亿,想把这个夜晚买回来。 它没有买回来。红包活动上线没几天,微信先出手了。2 月 4 日前后,微信以「诱导用户高频分享链接」「对用户造成骚扰」为由,限制了元宝抢红包链接的打开。 自家的产品,被自家的门禁拦在了外面。 元宝回应说,正在紧急调整分享机制。微信公关总监给了四个字: 「一视同仁。」 平心而论,微信并非完全冷眼。元宝派的邀请,曾被允许经由微信好友、群聊和朋友圈扩散。这是腾讯最核心的关系链入口,微信把它打开了一条缝。但最后元宝没能从那条缝里挤过去。 顶峰时,元宝日活跃用户超过 5000 万,月活跃用户 1.14 亿。然后,潮水退去。元宝跌出苹果商店免费榜前十。QuestMobile 后来的数据显示,红包活动一结束,元宝的日活跃用户就回落到了春节前的水平。 到 2026 年 3 月,元宝独立 App 的月活跃用户是 5735 万,国内月活过亿的 AI 应用只有三个,豆包、千问、DeepSeek。 三个月后,2026 年 5 月 13 日的股东会上,马化腾说了句掏心窝的话: 「一年前我们以为上了船,后来发现那个船漏水了。又开始换一艘船,现在感觉站上去了,还坐不下去,还是希望船速能快一点。」 2014 年,微信红包用一个除夕夜改变了支付格局。2026 年,腾讯用 10 个亿买回了同一个教训。流量不是用户,水还是水,它能把任何东西冲上榜首,却留不住任何东西。 2026 年 6 月,腾讯出了 100 亿,投 DeepSeek 首轮。有人解读说是腾讯承认自己做不出来,于是才掏钱买。 一个 27 岁的首席科学家,改变不了一个十万人的公司组织惯性。AI Lab 九年烧出来的教训摆在那里。不是没有人才,是这家公司以前会用自己最擅长的方式,把人才和梦想一起消化掉。 逆流 2026 年,逆流。 先看钱。2024 年全年,腾讯资本开支 767 亿元,同比增长 221%。2025 年,792 亿。这个数字在 AI 军备竞赛最白热化的一年里,只涨了 3%。同期,字节的资本开支据测算超过 1600 亿,阿里宣布三年投入 3800 亿。 腾讯没买卡的钱去做了回购。 2025 年,它回购了约 800 亿中国香港元的股票,加上分红,两年里还给股东的钱超过 2400 亿中国香港元。3 月 18 日的年报电话会上,刘炽平解释,2025 年受 GPU 供应限制,买不到卡。其实不是买不到,是不想在溢价高位买。财报次日,腾讯股价跌了超过 6%。 然后,2026 年来了。第一季度,资本开支 319 亿。第二季度,527.8 亿。上半年合计 846.8 亿,超过 2024 年全年。在电话会上,刘炽平还暗示,未来可能减少回购,把钱投给 AI。那台算了十年 ROI 的算盘,在 2026 年被放了下来。 再看组织。2025 年 12 月,腾讯升级大模型研发架构,新成立 AI Infra 部、AI Data 部、数据计算平台部。2026 年 3 月,撤销 AI Lab。第一次梦的载体被拆掉,人员和资产并入混元。一家公司亲手拆掉自己建了九年的研究机构,是葬礼和交接仪式办在了同一天。 然后是人。2025 年 12 月,腾讯宣布,27 岁的姚顺雨出任「CEO/总裁办公室」首席 AI 科学家,向总裁刘炽平汇报。 姚顺雨,1998 年生,安徽合肥人。高中在合肥一中,2014 年高考全省理科第三,考入清华大学姚班。在清华,他组织过说唱社。高中班主任记得,这个全省理科第三的孩子,喜欢唱跳 rap 篮球。 他在普林斯顿大学读了博士,读博期间做出了 ReAct 框架和思维树,牵头了 SWE-bench。今天全球一半的智能体研究,站在他搭的脚手架上。2024 年 8 月,他加入 OpenAI,参与 Operator 和 Deep Research。2025 年 9 月离开。三个月后,成了腾讯的首席 AI 科学家,27 岁。 媒体问他为什么选腾讯。他的回答是: 「最重要的是大家非常诚实。」 2026 年 1 月 10 日,他入职后首次公开发声,说的是「Claude Code 正重塑计算机行业」。6 月 5 日,他和汤道生有一场对谈,被问到腾讯 AI 是不是慢了。他说: 「AI 是长期游戏,下半场才开始。」 汤道生接过话:「这是一个长跑,这是一个马拉松,腾讯还是有非常丰富的场景。」 腾讯的 AI 版图里,站着两支军队。 一支在 TEG,混元。姚顺雨接手之后,它把分散在各处的模型研发、数据、训练基础设施,一件一件收拢到自己手里。撤销的 AI Lab,一部分研究人员并入了大语言模型部,一部分转去了产学研合作中心。 另一支在 WXG,微信。它的名字叫 WeLM。2022 年,微信发布这个中文预训练模型,100 亿参数,18 项中文任务上超过同规模模型。2025 年 8 月,微信又公开 WeChat-YATT,一套大模型强化学习训练框架。到了 2026 年,新一代 WeLM 转向稀疏的 MoE 架构,基础版本 800 亿参数,每次推理只激活 30 亿;扩展版本 1300 亿,激活 49 亿。7 月 9 日,微信 AI 团队公开 Hidden Decoding 研究,把两个新模型写进论文。 人也在两边流动。2025 年底,混元的资深研究员徐灿转岗去了 WeLM。徐灿是 WizardLM 的创建者,2023 年在微软提出 Evol-Instruct,让大模型自己给自己出难题。他走之后,混元的后训练团队拆成几个小组,各自往前摸索前进。 两支军队,两种逻辑。混元手里是集中的算力、数据和模型资源。WeLM 手里是微信的原生入口、小程序服务、十几亿用户的真实反馈。它们协作,也竞争。腾讯的 AI 入口之争,第一场就发生在自己家里。 2019 年,张小龙说「每天有一亿人教我做产品」。2020 年 1 月 9 日,微信公开课,张小龙没有到场。他录了一段 13 分钟的视频,讲信息互联的七个思考,承认公众平台有两个失误,宣布要做短内容。 十几天后,视频号出生。这是微信在抖音最凶猛的那几年里,唯一一次正面还击。那场仗后来证明了一件事,腾讯的产品能力没有死绝,它一直住在微信那栋楼里。 2021 年,他用两个词总结微信十年,连接、简单。 他说,希望微信一直像一个小而美的产品,有自己的灵魂,有自己的审美,有自己的创意,有自己的观念。潘乱当年管他叫「聪明人里的笨蛋」。 2026 年春节,正是这个笨蛋的产品洁癖,把元宝的 10 亿红包拦在了微信门外。腾讯身上最克制的那一部分,反而最像产品公司。2026 年,微信被押上了桌。搜一搜接入 AI,微信 Agent 开始测试,AI 助手「小微」灰度放量。有人说,张小龙这次赌上了一切。 大模型也早已进入微信的身体。视频号和朋友圈的广告召回环节,部署着一个叫 LEADRE 的系统,底层用的是 10 亿参数的混元模型。 「小微」在 2026 年 6 月开始小范围灰度。用户可以直接叫它操作微信的原生功能,叫它调用小程序完成任务。内部测试的人说,小微的主模型是 WeLM,一部分回答会调用 DeepSeek。 6 月,微信开放平台做了一件更彻底的事。小程序可以接入微信 AI 生态,自动模式下,平台读取小程序源码,分析页面结构,让微信 AI 直接操作;开发模式下,开发者把业务能力封装成技能,审核通过后供微信 AI 调用。微信想让 AI 长成自己的手。 最后是那笔 100 亿。2026 年 6 月,DeepSeek 完成首轮融资,总额超过 500 亿元。梁文锋个人出了约 200 亿,宁德时代约 50 亿,腾讯约 100 亿。据说投资人由梁文锋亲自挑选。 投资,是腾讯最会的姿势。但这笔投资也可以读成新姿态。八年前,腾讯投资是为了「遏制阿里」,是防御。今天,它投资一家自己暂时赶不上的公司,并且已经把自己最贵的流量通道,微信,开放给了它的模型。当年被它用投资「收编」的那种公司,如今是它用投资承认的老师。 水往低处流,这是天性,逆流是逆流者的事。 2026 年的腾讯,一边继续做水,流量、投资、生态,一样没丢。一边开始逆流,在没有看见回报之前,把真金白银砸进去,把最核心的资产押给不确定。它的梦想回来了。 尾声 《腾讯没有梦想》的结尾写: 「希望腾讯不需要等到四年半后再来复盘反思。」 腾讯等了不止四年半,它用了八年。 这八年里,它把「资本」分给了股东,把「流量」开放给了对手,把赛马机制送进了历史。旧愿景换成了新的,亲手建的 AI Lab 拆掉了。最后,一个 27 岁的年轻人坐上了首席科学家的位子。它曾经被预言的一切跌倒,都摔过了。元宝的退潮,云的减亏,第一次 AI 梦的葬礼。摔倒之后,它还在往那个方向走。 《了不起的盖茨比》写于 1925 年。盖茨比是一个把整个人生押在「过去」上的人。他在长岛海湾对岸买下一栋豪宅,夜夜办宴会,灯火通明,只为对岸一盏绿灯。灯后面,住着他五年前爱过的姑娘。菲茨杰拉德在小说的最后几页,替盖茨比、也替所有想重写时间的人,写下了一段话: 「于是我们奋力向前划,逆水行舟,被不停地推回过去。」 盖茨比逆流,是为了回到过去。他相信只要把船划得够快,时间就会倒流,旧梦就能复燃。他失败了。子弹穿过泳池,宴会散场,那盏绿灯始终隔着一道海湾。 腾讯也在划船,它逆流是为了不再回去。不再回到那个只有资本和流量、只有确定性、只有水一样活法的自己。 腾讯还有梦想。 原文链接

腾讯还有梦想

原文标题:《腾讯还有梦想》
原文作者:动察Beating
2026 年 8 月 12 日,腾讯发布二季度财报。
单季资本开支,527.8 亿元。三个月前,这个数字是 319 亿。再往前推一年,全年加起来也不过 792 亿。
这家公司一向以花钱克制著称。它买卡的速度,曾经慢到让市场怀疑它是不是真的想上 AI 的牌桌。现在,它把花钱的速度在一年之内提到了这个量级。
同一天的财报会上,马化腾说,腾讯正在「构建一个全新的、AI 赋能的腾讯」。混元改名叫 HY,Hy4 即将发布。这家公司上一次用「全新」形容自己,还是微信诞生的年代。
腾讯还有梦想。它的梦想不只是 AI,它要重新学会做一家不安稳的公司。
2018 年,潘乱在《腾讯没有梦想》里说腾讯是水一样的公司。水善利万物而不争,哪里有渠道,就往哪里流。水没有个性,所以水也没有梦想。
水往低处流,这是天性,逆流是逆流者的事。2026 年,这家 28 岁的公司,做了件违反天性的事。它承认,八年前那篇文章说对了,承认水一样的活法,已经活不下去了。

5 月 5 日晚 9 点,《腾讯没有梦想》发表。一万三千字。
夜里 2 点,刘炽平和腾讯公关总监张军在朋友圈回应。刘炽平说,腾讯是一个比外界想象更大的组织和生态,「把腾讯简化成一个产品的得失,一种战略的部署,一个人的意志,都太狭隘了」。
2 点 19 分,一张疑似马化腾回应的截图开始在朋友圈流传。
2 点 39 分,真正的马化腾才开口,是对一个关心他的朋友说「有批评蛮好。」
随后,他说:
「从写第一行代码开始,我的理想都是如何做出最好的产品,而不是赚多少钱。」
白天,全国媒体几乎全文引用了那张疑似马化腾回应的截图,连张一鸣都在朋友圈替腾讯说话,说这是「堂吉诃德式的想象」,腾讯不仅强大,还在各个维度不断进化。
张军那天一直在长途飞机上,他落地后说:「我们固然没有外界想的那么糟,但批评也让我们意识到,我们没自己想得那么好。」
当然,当时关于那篇文章也有一些不同的声音。洪波说,文章里提到的很多是真问题,但这么大的公司,有唯一的正确答案吗?「或许,作者认为张一鸣就是那个唯一正确的答案。他有点迷信张一鸣。」
那篇文章还记录了一个更早的故事。2011 年初,3Q 大战刚结束,腾讯开了一次总办会,讨论什么是腾讯的开放能力。马化腾让与会的 16 名高管,每个人在纸上写下他们认为的腾讯核心能力,总共得出 21 个答案。最后定下两个。
资本、流量。
资本这个词是刘炽平主张的。开放,就是把流量放出去,让它变成投资。流量开放,资本开放,「我不再自己做」。
这两个词管了腾讯十年。微信管流量的入口,投资管流量的出口,中间是游戏和广告源源不断造出来的现金。京东的电商入口进了微信九宫格,搜狗接了搜索,美团接了本地生活。流量换股权,股权换盟友。十年里,腾讯市值涨了十倍,超过 Facebook。那篇文章发表的时候,它看起来仍然不可战胜。
八年之后回头重读会发现,那篇文章几乎预言了腾讯后来每一次跌倒的方式。
十年后的 2021 年 12 月 23 日,腾讯把 14.7% 的京东股票分给了自己的股东,市值约 1000 亿中国香港元。2022 年 1 月,减持 Sea,套现 32 亿美元。2022 年 11 月,又分掉 9.6% 的美团,约 1594 亿中国香港元。
当年被定为「核心能力」的资本,被腾讯亲手拆掉了。水流了几十年,第一次开始往回走。
第一场 AI 梦
那篇文章里有一段,当年没有多少人注意。它写到了腾讯的 AI。AI Lab 做的围棋程序「绝艺」,先后败给了两个业余作品。一个是头条副总裁的个人爱好,一个是微信翻译团队几名工程师的业余之作。
很少有人意识到,腾讯的第一次 AI 梦,在那篇文章发表前两年就开始了。
2016 年春天,AlphaGo 战胜李世石,全世界第一次认真对待人工智能。中国的互联网公司像听见了发令枪。这一年,腾讯副总裁姚星筹建 AI Lab。次年十月,阿里达摩院成立,宣布三年投入 1000 亿。
2017 年 3 月 23 日,腾讯宣布,任命张潼担任 AI Lab 主任。张潼是机器学习领域最顶尖的华人学者之一,此前是百度研究院副院长。加盟时他说:「世界范围内的华裔人才在 AI 领域有很强的技术优势,这是中国发展 AI 的机会。」
当时 AI Lab 有 50 余位科学家,90% 以上有 AI 相关博士学位和海外留学背景。腾讯还嫌不够,2017 年 5 月,它任命微软研究院首席研究员俞栋为 AI Lab 副主任,主管新设立的西雅图实验室。之所以设立在西雅图,是因为很多微软的人不愿离开那儿,腾讯就把实验室建到微软旁边。
第一次梦的开场,声势是足的。2017 年 3 月,绝艺在日本 UEC 杯夺冠,年底又在龙星战登顶。围棋是那两年 AI 的名片。AlphaGo 之后,谁家的 AI 都得会下棋,那也是腾讯 AI 最高光的时刻。
然后,梦想开始泄气。
问题出在腾讯自己的方式上。2018 年 9 月 30 日,腾讯启动 930 变革,成立 CSIG。变革后第三天,财新发了一篇报道,标题直接点破了问题:
《三个 AI 团队仍然分而治之,2B 业务赛马机制如何破?》
AI Lab、优图、微信 AI,三条线各做各的,数据不互通,人才不共享。
2019 年 1 月 3 日,张潼不再担任公司管理职位,回到学术界。他后来去了港科大与创新工场的联合实验室。50 余位科学家散掉一批,张正友接任主任。
2021 年,姚星也走了。他没有去任何一家大厂,创办了自己的公司元象,方向是「全真互联网」。天使轮的投资人名单里,坐着腾讯和高瓴。
2025 年 12 月,俞栋,当年西雅图实验室的负责人,离开 AI Lab,加入美国 Capital One。三个月后,2026 年 3 月 21 日,腾讯正式撤销 AI Lab,部分人员并入混元大模型团队。
从张潼上任到实验室撤销,九年。一场梦的完整生命周期。
腾讯的第一次 AI 梦不是没有开始,也不是不重视。它挖来了这个领域最贵的人,把实验室建到了微软旁边。它死在一个更简单的问题上,这家公司不知道怎么安放一个不能马上变现的梦。
研究不落地,业务不供血,三条线互相赛马,谁也没有输,所以谁也没有赢。

2018 年 9 月 30 日,《腾讯没有梦想》发表五个月后,腾讯启动了 930 变革。撤销 MIG,新设 PCG 和 CSIG,六大事业群成形。马化腾在全员信里写下:
「扎根消费互联网,拥抱产业互联网。」
没有人能证明是那篇文章推动了这场变革,不过重要是共振。文章说出的问题,腾讯自己也开始承认了。这是腾讯六年来最大的变革,马化腾说这件事让他「每天都如履薄冰」。
变革之后,腾讯新成立的 CSIG,由汤道生坐镇,他宣布,CSIG 不再使用赛马机制。
赛马是腾讯的传家宝,微信就是赛马的产物。2010 年,几个团队同时做移动即时通讯,张小龙的广州团队赢了。这个机制生产过腾讯最后一件伟大产品。
2019 年 11 月 11 日,腾讯 21 周年,马化腾发全员信,公布新的使命愿景:
「用户为本,科技向善。」
当年腾讯的旧愿景是「最受尊重的互联网企业」,非常大,也非常虚,没人说清楚怎么实现。一年半之后,腾讯把它换了。
还有腾讯云。930 时被寄予厚望的产业互联网,走得不顺。2021 年,腾讯云不再追求规模,转向减少亏损。2023 年,汤道生明确说,要从集成商转为被集成商,收缩那些不赚钱的总集成项目。金融科技及企业服务的毛利率慢慢爬到了 2025 年的 51%。
代价是,这场转型的野心,从「再造一个腾讯」,收缩成「把利润做正」。
减亏之外,这五年也留下了果实。汤道生给产业互联网定过一个说法,叫 C2B。产业互联网不仅是 ToB、ToG 的,也是 ToC 的,B 端、G 端归根到底还是 C 端。腾讯会议、企业微信这批产品,就是这条路走出来的。它们没有再造一个腾讯,但让腾讯头一回学会了做云上的软件,学会了不再用流量直接换钱。
930 一周年,杨国安说,腾讯开始摆脱靠社交和游戏吃饭的「富二代」式路径依赖。这句话其实只说对了一半,路径确实在变,不过依赖还在。多年以后,汤道生会说,大模型和云一样,难以被垄断。这句话的底气,就是那五年减亏减出来的。
2023 年 5 月,刘炽平退任执行董事。他仍然是总裁,仍然管着投资委员会。但象征意义是清楚的。主张「资本是核心能力」的人,从董事会的名单上退了下去。有媒体给他算了算,16 年总薪酬超过 23 亿元。
从 930 到 2023,五年时间,腾讯做的几乎全是「拆」。拆组织,拆投资,拆愿景,拆赛马。它知道自己病了,于是一件一件地把旧衣服脱下来。但一家公司最难的不是换方向,是承认换了方向之后,仍然不知道答案。产业互联网这第二次转型,最后以减亏收场。
水换了一条河道,还是水。

2023 年 5 月 19 日,马化腾在中国香港的股东会上被问到 AI,他说:
「AI 是互联网百年不遇的机遇。」
又补了一句,腾讯不会为了提振股价,把半成品拿出来。
这句话里有清醒,也有迟缓。清醒在于,他看得见这场革命的分量。迟缓在于,说这话的时候,百度的文心一言已经发布两个月,阿里的通义千问发布一个月,而腾讯的模型还要再等四个月。2023 年 9 月 7 日,混元大模型才正式发布,主打的是「解决胡言乱语」。
安全与克制,一贯的腾讯姿态。
克制了将近一年,2024 年 11 月,腾讯把 Hunyuan-Large 开源。3890 亿参数,当时全球最大的开源 MoE 模型。一向对开源态度冷淡的公司,头一回把模型的门打开。
2024 年 5 月 30 日,腾讯元宝上线。公司对外的说法是:「大模型不争一时之先。」
一年后,它自己推翻了自己。
2025 年 2 月 13 日,元宝接入 DeepSeek-R1 满血版,免费。三天后,微信搜一搜灰度上线 AI 搜索,同样接入 DeepSeek。腾讯特意说明,这个功能不会读取用户的聊天记录和朋友圈。3 月 4 日,元宝登顶中国区苹果 App Store 免费下载榜。
这是流量旧法术显灵的最后一次。接入对手的模型,灌进自己的流量,一个月登顶。
然后,腾讯想再显灵一次。
2026 年 1 月 26 日的员工大会上,马化腾宣布了一个玩法。「元宝派」,春节发 10 亿红包。他说,希望能重现十一年前微信红包的时刻。
2014 年除夕,微信红包上线。800 万用户,4000 万个红包,马云称之为「偷袭珍珠港」。一年后的除夕,微信和央视春晚合作,全国人对着电视摇手机。一夜之间,红包收发 10.1 亿次。移动支付的格局,在这两个除夕之间被改写。
那是腾讯最后一次靠产品和流量完成的奇袭。此后十一年,它再没有过那样的夜晚。
2026 年春节,腾讯用 10 个亿,想把这个夜晚买回来。
它没有买回来。红包活动上线没几天,微信先出手了。2 月 4 日前后,微信以「诱导用户高频分享链接」「对用户造成骚扰」为由,限制了元宝抢红包链接的打开。
自家的产品,被自家的门禁拦在了外面。
元宝回应说,正在紧急调整分享机制。微信公关总监给了四个字:
「一视同仁。」
平心而论,微信并非完全冷眼。元宝派的邀请,曾被允许经由微信好友、群聊和朋友圈扩散。这是腾讯最核心的关系链入口,微信把它打开了一条缝。但最后元宝没能从那条缝里挤过去。
顶峰时,元宝日活跃用户超过 5000 万,月活跃用户 1.14 亿。然后,潮水退去。元宝跌出苹果商店免费榜前十。QuestMobile 后来的数据显示,红包活动一结束,元宝的日活跃用户就回落到了春节前的水平。
到 2026 年 3 月,元宝独立 App 的月活跃用户是 5735 万,国内月活过亿的 AI 应用只有三个,豆包、千问、DeepSeek。
三个月后,2026 年 5 月 13 日的股东会上,马化腾说了句掏心窝的话:
「一年前我们以为上了船,后来发现那个船漏水了。又开始换一艘船,现在感觉站上去了,还坐不下去,还是希望船速能快一点。」
2014 年,微信红包用一个除夕夜改变了支付格局。2026 年,腾讯用 10 个亿买回了同一个教训。流量不是用户,水还是水,它能把任何东西冲上榜首,却留不住任何东西。
2026 年 6 月,腾讯出了 100 亿,投 DeepSeek 首轮。有人解读说是腾讯承认自己做不出来,于是才掏钱买。
一个 27 岁的首席科学家,改变不了一个十万人的公司组织惯性。AI Lab 九年烧出来的教训摆在那里。不是没有人才,是这家公司以前会用自己最擅长的方式,把人才和梦想一起消化掉。
逆流
2026 年,逆流。
先看钱。2024 年全年,腾讯资本开支 767 亿元,同比增长 221%。2025 年,792 亿。这个数字在 AI 军备竞赛最白热化的一年里,只涨了 3%。同期,字节的资本开支据测算超过 1600 亿,阿里宣布三年投入 3800 亿。
腾讯没买卡的钱去做了回购。
2025 年,它回购了约 800 亿中国香港元的股票,加上分红,两年里还给股东的钱超过 2400 亿中国香港元。3 月 18 日的年报电话会上,刘炽平解释,2025 年受 GPU 供应限制,买不到卡。其实不是买不到,是不想在溢价高位买。财报次日,腾讯股价跌了超过 6%。
然后,2026 年来了。第一季度,资本开支 319 亿。第二季度,527.8 亿。上半年合计 846.8 亿,超过 2024 年全年。在电话会上,刘炽平还暗示,未来可能减少回购,把钱投给 AI。那台算了十年 ROI 的算盘,在 2026 年被放了下来。
再看组织。2025 年 12 月,腾讯升级大模型研发架构,新成立 AI Infra 部、AI Data 部、数据计算平台部。2026 年 3 月,撤销 AI Lab。第一次梦的载体被拆掉,人员和资产并入混元。一家公司亲手拆掉自己建了九年的研究机构,是葬礼和交接仪式办在了同一天。
然后是人。2025 年 12 月,腾讯宣布,27 岁的姚顺雨出任「CEO/总裁办公室」首席 AI 科学家,向总裁刘炽平汇报。
姚顺雨,1998 年生,安徽合肥人。高中在合肥一中,2014 年高考全省理科第三,考入清华大学姚班。在清华,他组织过说唱社。高中班主任记得,这个全省理科第三的孩子,喜欢唱跳 rap 篮球。
他在普林斯顿大学读了博士,读博期间做出了 ReAct 框架和思维树,牵头了 SWE-bench。今天全球一半的智能体研究,站在他搭的脚手架上。2024 年 8 月,他加入 OpenAI,参与 Operator 和 Deep Research。2025 年 9 月离开。三个月后,成了腾讯的首席 AI 科学家,27 岁。
媒体问他为什么选腾讯。他的回答是:
「最重要的是大家非常诚实。」
2026 年 1 月 10 日,他入职后首次公开发声,说的是「Claude Code 正重塑计算机行业」。6 月 5 日,他和汤道生有一场对谈,被问到腾讯 AI 是不是慢了。他说:
「AI 是长期游戏,下半场才开始。」
汤道生接过话:「这是一个长跑,这是一个马拉松,腾讯还是有非常丰富的场景。」
腾讯的 AI 版图里,站着两支军队。
一支在 TEG,混元。姚顺雨接手之后,它把分散在各处的模型研发、数据、训练基础设施,一件一件收拢到自己手里。撤销的 AI Lab,一部分研究人员并入了大语言模型部,一部分转去了产学研合作中心。
另一支在 WXG,微信。它的名字叫 WeLM。2022 年,微信发布这个中文预训练模型,100 亿参数,18 项中文任务上超过同规模模型。2025 年 8 月,微信又公开 WeChat-YATT,一套大模型强化学习训练框架。到了 2026 年,新一代 WeLM 转向稀疏的 MoE 架构,基础版本 800 亿参数,每次推理只激活 30 亿;扩展版本 1300 亿,激活 49 亿。7 月 9 日,微信 AI 团队公开 Hidden Decoding 研究,把两个新模型写进论文。
人也在两边流动。2025 年底,混元的资深研究员徐灿转岗去了 WeLM。徐灿是 WizardLM 的创建者,2023 年在微软提出 Evol-Instruct,让大模型自己给自己出难题。他走之后,混元的后训练团队拆成几个小组,各自往前摸索前进。
两支军队,两种逻辑。混元手里是集中的算力、数据和模型资源。WeLM 手里是微信的原生入口、小程序服务、十几亿用户的真实反馈。它们协作,也竞争。腾讯的 AI 入口之争,第一场就发生在自己家里。
2019 年,张小龙说「每天有一亿人教我做产品」。2020 年 1 月 9 日,微信公开课,张小龙没有到场。他录了一段 13 分钟的视频,讲信息互联的七个思考,承认公众平台有两个失误,宣布要做短内容。
十几天后,视频号出生。这是微信在抖音最凶猛的那几年里,唯一一次正面还击。那场仗后来证明了一件事,腾讯的产品能力没有死绝,它一直住在微信那栋楼里。
2021 年,他用两个词总结微信十年,连接、简单。
他说,希望微信一直像一个小而美的产品,有自己的灵魂,有自己的审美,有自己的创意,有自己的观念。潘乱当年管他叫「聪明人里的笨蛋」。
2026 年春节,正是这个笨蛋的产品洁癖,把元宝的 10 亿红包拦在了微信门外。腾讯身上最克制的那一部分,反而最像产品公司。2026 年,微信被押上了桌。搜一搜接入 AI,微信 Agent 开始测试,AI 助手「小微」灰度放量。有人说,张小龙这次赌上了一切。
大模型也早已进入微信的身体。视频号和朋友圈的广告召回环节,部署着一个叫 LEADRE 的系统,底层用的是 10 亿参数的混元模型。
「小微」在 2026 年 6 月开始小范围灰度。用户可以直接叫它操作微信的原生功能,叫它调用小程序完成任务。内部测试的人说,小微的主模型是 WeLM,一部分回答会调用 DeepSeek。
6 月,微信开放平台做了一件更彻底的事。小程序可以接入微信 AI 生态,自动模式下,平台读取小程序源码,分析页面结构,让微信 AI 直接操作;开发模式下,开发者把业务能力封装成技能,审核通过后供微信 AI 调用。微信想让 AI 长成自己的手。
最后是那笔 100 亿。2026 年 6 月,DeepSeek 完成首轮融资,总额超过 500 亿元。梁文锋个人出了约 200 亿,宁德时代约 50 亿,腾讯约 100 亿。据说投资人由梁文锋亲自挑选。
投资,是腾讯最会的姿势。但这笔投资也可以读成新姿态。八年前,腾讯投资是为了「遏制阿里」,是防御。今天,它投资一家自己暂时赶不上的公司,并且已经把自己最贵的流量通道,微信,开放给了它的模型。当年被它用投资「收编」的那种公司,如今是它用投资承认的老师。
水往低处流,这是天性,逆流是逆流者的事。
2026 年的腾讯,一边继续做水,流量、投资、生态,一样没丢。一边开始逆流,在没有看见回报之前,把真金白银砸进去,把最核心的资产押给不确定。它的梦想回来了。
尾声
《腾讯没有梦想》的结尾写:
「希望腾讯不需要等到四年半后再来复盘反思。」
腾讯等了不止四年半,它用了八年。
这八年里,它把「资本」分给了股东,把「流量」开放给了对手,把赛马机制送进了历史。旧愿景换成了新的,亲手建的 AI Lab 拆掉了。最后,一个 27 岁的年轻人坐上了首席科学家的位子。它曾经被预言的一切跌倒,都摔过了。元宝的退潮,云的减亏,第一次 AI 梦的葬礼。摔倒之后,它还在往那个方向走。
《了不起的盖茨比》写于 1925 年。盖茨比是一个把整个人生押在「过去」上的人。他在长岛海湾对岸买下一栋豪宅,夜夜办宴会,灯火通明,只为对岸一盏绿灯。灯后面,住着他五年前爱过的姑娘。菲茨杰拉德在小说的最后几页,替盖茨比、也替所有想重写时间的人,写下了一段话:
「于是我们奋力向前划,逆水行舟,被不停地推回过去。」
盖茨比逆流,是为了回到过去。他相信只要把船划得够快,时间就会倒流,旧梦就能复燃。他失败了。子弹穿过泳池,宴会散场,那盏绿灯始终隔着一道海湾。
腾讯也在划船,它逆流是为了不再回去。不再回到那个只有资本和流量、只有确定性、只有水一样活法的自己。
腾讯还有梦想。
原文链接
Статья
DeepSeek V4 Pro 正式版上线原文标题:《DeepSeek V4 Pro 正式版上线》 原文作者:动察Beating DeepSeek V4 Pro 正式版来了。 8 月 12 日晚,DeepSeek 官方 API 文档已经将 deepseek-v4-pro 对应的模型版本更新为 DeepSeek-V4-Pro-0813。目前开发者可以直接通过 API 调用新版本,价格为 3 元/百万 Token 输入、6 元/百万 Token 输出,缓存命中输入仅 0.025 元/百万 Token。 V4 Pro-0813 继续支持 100 万 Token 上下文窗口,最大输出达到 38.4 万 Token,同时支持思考与非思考两种模式。JSON Output、Tool Calls 等能力也已经开放。 截至 8 月 12 日晚,DeepSeek 官方更新日志还没有单独发布 V4 Pro 正式版公告。但在此前 V4 Flash 正式版更新时,DeepSeek 曾明确表示,V4 Pro 正式版将在随后推出;如今 API 后台模型节点已经从此前版本切换至 DeepSeek-V4-Pro-0813。 距离 V4 第一次出现,已经过去接近四个月。 今年 4 月 24 日,DeepSeek 发布 V4 Preview,同时推出 V4 Pro 和 V4 Flash。其中 V4 Pro 是整个系列的旗舰版本,总参数量达到 1.6T,每个 Token 激活约 49B 参数,并支持 100 万 Token 上下文。V4 这一代从一开始就明显加强了 Coding、工具调用和长时间 Agent 任务。 7 月 31 日,DeepSeek 推出 V4-Flash-0731。官方表示,这一版本保持原有模型架构和尺寸,主要重新进行了后训练,Agent 能力得到明显加强,并原生加入 Responses API,同时针对 Codex 进行了适配。当时 DeepSeek 还专门强调,此次更新只涉及 Flash,Pro 与网页端模型没有变化,V4 Pro 正式版随后发布。 现在,Pro 这块最后的拼图终于补了上来。 DeepSeek 这一代模型,越来越围着 Agent 转 V4 Pro 正式版发布的时间点,刚好赶上整个大模型行业新一轮产品重心迁移。 今年模型厂商发布新品时,单纯比较知识问答、数学和传统 Benchmark 的篇幅已经越来越少。Coding、Computer Use、Tool Use、长时间任务完成率,以及完成一次任务究竟要花多少钱,正在成为新的核心指标。 7 月发布 GPT-5.6 时,OpenAI 花了大量篇幅介绍 Agent 和 Coding 能力。GPT-5.6 Sol 支持新的 max reasoning effort,进一步推出 ultra 模式,由多个 Agent 并行完成复杂任务;Responses API 也开始允许模型直接编写程序协调工具、处理中间结果,再决定下一步动作。OpenAI 甚至直接把「每一美元能完成多少工作」作为这一代产品的主要卖点之一。 Anthropic 的路线也很接近。 6 月底发布的 Claude Sonnet 5,主要提升同样集中在 Coding、Agent、Computer Use 和长时间任务上。Anthropic 提供不同 effort level,让开发者根据任务选择推理强度;到了 8 月 10 日,Anthropic 又宣布把 Sonnet 5 原本的促销价格 2 美元/百万输入、10 美元/百万输出永久保留下来。 模型公司现在面对的已经不只是谁更聪明。 一个 Agent 可能连续运行几十分钟甚至数小时,反复读写代码、搜索资料、调用浏览器和外部工具。一旦真正进入生产环境,模型调用次数会迅速增加。能力、速度、Token 消耗和调用价格,开始一起决定一个 Agent 产品能不能跑起来。 DeepSeek V4 的设计基本也沿着这个方向展开。 100 万 Token 上下文可以让模型一次读进更大的代码仓库、企业知识库和任务历史;Tool Calls 负责与外部环境交互;兼容 Anthropic API,以及 Flash 已经率先支持的 Responses API,则是在降低模型进入现有 Agent 工具链的门槛。DeepSeek 在 4 月发布 V4 时,就已经同时开放 OpenAI ChatCompletions 与 Anthropic 格式接口。 这也是 V4 Pro 正式版比单纯又一个更大的 DeepSeek 模型更值得关注的地方。DeepSeek 正在把模型进一步做成 Agent 可以直接调用的基础设施。 V4 Pro 正式版上线后,DeepSeek 这一代产品的分层也更加清楚。 目前 V4 Flash 输入价格为 1 元/百万 Token,Pro 为 3 元;Flash 输出 2 元,Pro 为 6 元。两者价格刚好相差三倍。V4 Pro 与 Flash 都支持 100 万上下文,但 Pro 使用更大的激活参数规模,定位更偏向复杂推理、Coding 和更困难的 Agent 任务。 Flash 承担大量、高频、成本敏感的任务,Pro 留给更重的工作。 2025 年的大模型竞争还经常围绕「旗舰模型谁跑分第一」展开。到了 2026 年,模型正在越来越像真正的软件基础设施,既要聪明,也要有稳定 API、长上下文、工具调用、足够高的并发,以及能让开发者算得过来的价格。 V4 Pro 正式版上线之后,DeepSeek V4 这一代的产品轮廓终于完整了。 原文链接

DeepSeek V4 Pro 正式版上线

原文标题:《DeepSeek V4 Pro 正式版上线》
原文作者:动察Beating
DeepSeek V4 Pro 正式版来了。
8 月 12 日晚,DeepSeek 官方 API 文档已经将 deepseek-v4-pro 对应的模型版本更新为 DeepSeek-V4-Pro-0813。目前开发者可以直接通过 API 调用新版本,价格为 3 元/百万 Token 输入、6 元/百万 Token 输出,缓存命中输入仅 0.025 元/百万 Token。
V4 Pro-0813 继续支持 100 万 Token 上下文窗口,最大输出达到 38.4 万 Token,同时支持思考与非思考两种模式。JSON Output、Tool Calls 等能力也已经开放。
截至 8 月 12 日晚,DeepSeek 官方更新日志还没有单独发布 V4 Pro 正式版公告。但在此前 V4 Flash 正式版更新时,DeepSeek 曾明确表示,V4 Pro 正式版将在随后推出;如今 API 后台模型节点已经从此前版本切换至 DeepSeek-V4-Pro-0813。
距离 V4 第一次出现,已经过去接近四个月。
今年 4 月 24 日,DeepSeek 发布 V4 Preview,同时推出 V4 Pro 和 V4 Flash。其中 V4 Pro 是整个系列的旗舰版本,总参数量达到 1.6T,每个 Token 激活约 49B 参数,并支持 100 万 Token 上下文。V4 这一代从一开始就明显加强了 Coding、工具调用和长时间 Agent 任务。
7 月 31 日,DeepSeek 推出 V4-Flash-0731。官方表示,这一版本保持原有模型架构和尺寸,主要重新进行了后训练,Agent 能力得到明显加强,并原生加入 Responses API,同时针对 Codex 进行了适配。当时 DeepSeek 还专门强调,此次更新只涉及 Flash,Pro 与网页端模型没有变化,V4 Pro 正式版随后发布。
现在,Pro 这块最后的拼图终于补了上来。
DeepSeek 这一代模型,越来越围着 Agent 转
V4 Pro 正式版发布的时间点,刚好赶上整个大模型行业新一轮产品重心迁移。
今年模型厂商发布新品时,单纯比较知识问答、数学和传统 Benchmark 的篇幅已经越来越少。Coding、Computer Use、Tool Use、长时间任务完成率,以及完成一次任务究竟要花多少钱,正在成为新的核心指标。
7 月发布 GPT-5.6 时,OpenAI 花了大量篇幅介绍 Agent 和 Coding 能力。GPT-5.6 Sol 支持新的 max reasoning effort,进一步推出 ultra 模式,由多个 Agent 并行完成复杂任务;Responses API 也开始允许模型直接编写程序协调工具、处理中间结果,再决定下一步动作。OpenAI 甚至直接把「每一美元能完成多少工作」作为这一代产品的主要卖点之一。
Anthropic 的路线也很接近。
6 月底发布的 Claude Sonnet 5,主要提升同样集中在 Coding、Agent、Computer Use 和长时间任务上。Anthropic 提供不同 effort level,让开发者根据任务选择推理强度;到了 8 月 10 日,Anthropic 又宣布把 Sonnet 5 原本的促销价格 2 美元/百万输入、10 美元/百万输出永久保留下来。
模型公司现在面对的已经不只是谁更聪明。
一个 Agent 可能连续运行几十分钟甚至数小时,反复读写代码、搜索资料、调用浏览器和外部工具。一旦真正进入生产环境,模型调用次数会迅速增加。能力、速度、Token 消耗和调用价格,开始一起决定一个 Agent 产品能不能跑起来。
DeepSeek V4 的设计基本也沿着这个方向展开。
100 万 Token 上下文可以让模型一次读进更大的代码仓库、企业知识库和任务历史;Tool Calls 负责与外部环境交互;兼容 Anthropic API,以及 Flash 已经率先支持的 Responses API,则是在降低模型进入现有 Agent 工具链的门槛。DeepSeek 在 4 月发布 V4 时,就已经同时开放 OpenAI ChatCompletions 与 Anthropic 格式接口。
这也是 V4 Pro 正式版比单纯又一个更大的 DeepSeek 模型更值得关注的地方。DeepSeek 正在把模型进一步做成 Agent 可以直接调用的基础设施。
V4 Pro 正式版上线后,DeepSeek 这一代产品的分层也更加清楚。
目前 V4 Flash 输入价格为 1 元/百万 Token,Pro 为 3 元;Flash 输出 2 元,Pro 为 6 元。两者价格刚好相差三倍。V4 Pro 与 Flash 都支持 100 万上下文,但 Pro 使用更大的激活参数规模,定位更偏向复杂推理、Coding 和更困难的 Agent 任务。
Flash 承担大量、高频、成本敏感的任务,Pro 留给更重的工作。
2025 年的大模型竞争还经常围绕「旗舰模型谁跑分第一」展开。到了 2026 年,模型正在越来越像真正的软件基础设施,既要聪明,也要有稳定 API、长上下文、工具调用、足够高的并发,以及能让开发者算得过来的价格。
V4 Pro 正式版上线之后,DeepSeek V4 这一代的产品轮廓终于完整了。
原文链接
Статья
中国互联网的二十年,和办公 Agent 的这个夏天原文标题:《中国互联网的二十年,和办公 Agent 的这个夏天》 原文作者:动察Beating 杭州有两栋写字楼隔街相望。一栋楼顶在 2026 年春节前新立起一尊红金色的孙悟空,挨着钉钉那道闪电标志。另一栋楼顶,是飞书的标志。孙悟空立起来那天,照片很快在社交媒体上传开,不少人笑称,这是最朴实的商战,钉钉的意思,大概是要比飞书高一头。 这两家已经打了十年。从谁家的消息能看见已读,打到文档、表格和客户名单,最后一路打到了屋顶上。 不过楼顶那只猴子的两只手空着,没有挥棒。它要拿出来的东西,在一个多月后的发布会上。 3 月 17 日,杭州西溪。钉钉创始人无招站上发布会的台。2015 年他造出钉钉,2021 年离开,2025 年又被请了回来。这一天,他要发布一套新的 AI 助手,名字就叫悟空,标志用的正是楼顶那只猴子。 阿里 CEO 吴泳铭坐在台下。无招说,要把钉钉打碎,用 AI 重新炼一遍。从前是人使用钉钉,往后是 AI 使用钉钉。 讲到标志时,他把猴子头上的金箍摘了,说因为它已经是斗战胜佛。 台下鼓掌。 大闹天宫的那只猴子,没有走到灵山。他被压在五行山下五百年,出来时头上多了一个箍,一路被咒念得满地打滚,脾气一点一点被收拾干净。真正走到灵山的,已经是另一只猴子,不再想着自己当王。 斗战胜佛,是齐天大圣走完那条路之后得到的新名字。想走到那里,先得把当初那只猴子办掉。 这个故事讲悟空,也是在讲钉钉。 这场发布会表面上发布的是一款 AI 产品,真正要动的却是钉钉自己。钉钉把一千多项底层能力改写成 AI 可以直接调用的指令。从前员工得在屏幕上一层层点开审批、日程和业务系统,悟空可以绕过这一层,直接读数据、调工具,再把事情接着往下做。 无招要交出去的不只是一个入口,还有这家公司十年长出来的内脏。 不过短短八十六天以后,6 月 11 日,他离开了钉钉。这件事有点戏剧化,不过放回中国互联网过去二十年,却算不上新鲜。 那些真正活过一轮又一轮周期的公司,几乎都干过同一件事,那就是在旧业务还赚钱、旧产品还站在最高处的时候,亲手把下一把刀递给自己人。 中国互联网这二十年,没有谁靠守着原来那个自己活到今天。 想活下去,先得杀死曾经的自己。 杀死那个顶点上的自己 这套手艺,互联网大厂们练了很久。 2010 年 10 月,深圳。张小龙给马化腾写了一封信,说 QQ 属于电脑,腾讯需要一款生在手机上的通信工具。腾讯没有直接把这件事交给 QQ 团队去做,内部三个组同时开工,QQ、QQ 通讯录、QQ 邮箱各做一款,谁先做出来算谁的。 那一年,QQ 正在最高处。 2011 年 1 月 21 日,广州。做 QQ 邮箱的那个团队上线了微信 1.0。 腾讯先动了这一刀。两年以后,杭州也发生了差不多的事。 2013 年,马云说,阿里无线团队的职责就是灭了淘宝。 那一年,淘宝正站在舞台中央。 两年以后,手机淘宝成了双 11 的主战场。淘宝两个字保留下来,但人们买东西的那块屏幕已经换了,很少再有人坐在电脑前打开淘宝网页版。 再过五年,轮到北京。 2018 年 8 月,知春路。中航大厦摘下「今日头条」四个大字,换上「字节跳动」。今日头条还能打开,还在更新,还有用户和广告。 那一年,今日头条依然是国民应用。 只是抖音已经超过了它。三个月后,陈林出任今日头条 CEO,张一鸣的官方称谓也从「今日头条创始人兼 CEO」,改成「字节跳动创始人兼 CEO」。 三回都一样。 要动刀的东西正在赚钱,正在万众瞩目,看起来正是全公司最不该碰的地方。可等它自己老下去,公司也就跟着一起老了。所以得趁它还硬朗的时候动手,把下一把刀交给自己人,让新的从里面长出来,再把旧的一点一点吃掉。 败者之师 但钉钉当年并不是站在最高处被造出来的。 2014 年,杭州,文一西路 176 号。湖畔花园的一间旧公寓里,六个阿里人围着一张桌子开周会。他们刚从来往上撤下来。来往是阿里拿来打微信的社交产品,公司斥过巨资,还要求每名员工一个月拉来一百名外部用户。马云亲自站台,柳传志、史玉柱、李连杰也被请进去开号。那阵子很多人的手机里都躺着一个来往,装上,用两天,然后再也没有打开过。 他们退回去的那间公寓,在阿里内部几乎称得上是一座祖屋。 1999 年,马云和十七个同伴就是在那里凑出五十万,阿里巴巴开张。后来西溪园区建起来,还专门复刻了这间屋子的内部陈设。 只是这一次,从公寓里长出来的新方向,不是战略会定出来的。 来往想抢走微信里的普通人,没抢动。无招于是换了个方向,去找中国老板最朴素的那点焦虑,比如我说的话有没有人看,我交代的事有没有往前推进。 钉一下、已读未读、企业通讯录、考勤、审批,后来让无数员工头疼的那些东西,当年正好戳在管理者心口那根刺上。 钉钉后来一直被说成是给老板做的。可在当时,真正愿意为一套管理软件掏钱的,也正是这些人。中国有几千万家小公司,老板自己跑业务、自己发工资、自己追进度。钉钉出现之前,他手里除了一个微信群,几乎什么都没有。 2015 年 1 月,钉钉上线。第一年用户过亿,三年超过三亿。 一支从来往撤下来的败军,就这样做出了一样称手的兵器。 后来,这件兵器砍到过很多人,也包括做出它的人。 回来拆自己的人 无招是 2021 年离开钉钉的。 那一年,阿里推行「云钉一体」,要把钉钉和阿里云绑在一起卖给大客户、做定制项目,而无招坚持标准化产品和中小企业。分歧写在纸上是路线,落到日子里就是一次次评审会谈不拢。离开以后,他创办两氢一氧,做跨境产品和小型智能硬件。 四年以后,风向彻底变了。 2025 年 2 月,阿里宣布未来三年投入 3800 亿元建设 AI 基础设施,吴泳铭把钉钉称作阿里面向企业最重要的 AI 应用之一。3 月 31 日,阿里收购两氢一氧投资人的股份,无招第二次坐回钉钉 CEO 的位置。 十年前,他从来往的败局里造出钉钉。这一次把他请回来,是要让他亲手拆掉自己造出来的东西。 无招回来后的第一周,没有完全采用业务部门备好的客户名单,而是自己带队去北京、广东和华东走访。回来以后,他又逐个评审钉钉的产品经理,一人十分钟,随机抽一个功能,请对方讲明白为什么这样设计。 十分钟很短,短到没有多少铺垫的余地,一开口就知道这个功能到底有没有被认真想过。公开报道说,这场抽查很少有人及格。无招最后给出的判断是,钉钉已经做了许多 AI 功能,却没能定义未来。 接着是「下地运动」。产品、研发和运营每天轮流做两小时客服。 在这之前,后台的数据一直很好看,转人工率只有 15%,评价全是五星。可当人真的把电话接起来,听到的是另一套内容。有人说答非所问,有人说需求提了一年没动静,也有人根本找不到转人工的入口。 重新计算以后,客户满意度只有 30%。几个月后,这个数字被提到 80%,成本降了 90%。 无招确实修好了一些东西。他能一眼看穿一家大公司给自己编出来的数据,会逼着产品经理去听客户骂人,也真的把 30% 拉到了 80%。 问题是,他用来修理产品的那套方法,很快也被用来修理人。 然后,整台机器的螺丝越拧越紧。九点打卡,每天都有早会和晚会,午休结束后 13 点 15 分要进入工作状态。管理岗被要求学 Python,技术团队倒查代码量。产品经理每周得拜访三家企业,对外沟通甚至出现统一话术「不好意思,我只有钉钉。」有报道写,他晚上十点巡楼,会给还在加班的人点赞。 滕雅辛就是在这时候进的钉钉。 她是产品经理,花名幽素。面试时,无招围绕一个拉新任务,从她父亲问到母亲,又从母亲问到外公外婆,最后还在追问真的凑不齐六个能上钉钉的家人吗。 较劲 幽素入职第一天,就被分进一个保密项目,代号 O。后来她才知道,O 代表的是 ONE。 项目第二周,设计负责人离开。第四周,推荐她进组的师兄被调去别处。整个团队里,在 ONE 待满三个月的产品经理只有三个人,她是其中之一。人一直在换,新来的人需要从头补课,可发布日期一天都没有推迟。 2025 年 8 月 25 日,钉钉十周年发布会,无招一口气推出五款产品。DingTalk A1 是一张 3.8 毫米厚、能吸在手机背面的录音卡片,AI 听记支持 72 种语言,AI 表格和 AI 搜问也一同亮相。 ONE 摆在正中间,它要把消息、日程、会议、审批和文档重新排一遍序,让「人找事」变成「事找人」。可真往前走,最先撞上的就是钉钉自己。 有员工拿着碧桂园的案例去汇报,希望用 ONE 的卡片给保安和保洁动态派活。按照幽素的记录,无招没有认可这个方向,他希望 ONE 和钉钉一样,服务老板和管理者。 方向摇摆很快落到了数据上。 ONE 的日活一度稳定在三百万左右,留存随后急跌。团队把它从整理信息改成一套能装下各种 Agent 的底座,屏幕底部堆进一排图标,内部和客户都纷纷对产品表示质疑。等大包大揽的心思被收了回去,产品又变回了简洁,首页为空,代表你已经处理完所有急事。幽素记录的数据里,次日留存从 10% 出头涨到接近 30%,交出入口之前,峰值一度超过 45%。 它是在刚学会走路的时候被挪走的。2026 年初,ONE 被拆分,退到钉钉的负一屏,悟空变成主入口。 入口换了,钉钉的焦虑没有消失。很快,它又有了一个新的参照物,就在马路对面。 两个多月后,4 月 2 日夜里,钉钉的高级经理和产品总监接到通知,十二点以前不许下班。不是开会,也不是赶版本。他们要看隔壁飞书的大楼几点熄灯。 这场较劲当然不只是比谁的灯亮得更晚。 一年前,飞书 CEO 谢欣在一场公开活动上谈过考勤软件。他说,假如一套办公工具每天只收集打卡数据,一年攒下一千万次打卡,AI 最后大概只能预测明天哪几个员工会迟到。他没点名,听众知道那句话是在点谁的。另一场采访里,他说飞书的表格产品领先至少十二个月。 一家把管理做到极致,一家把协作做到极致。这是同一道题的两个解法,两边都答得认真。钉钉追问谁还没执行,飞书想把一项决策是怎么发生的留在文档里,让三个月后进来的新人翻开就知道,当初为什么这么决定。 幽素把自己置身其中的这些日子,一点点写了下来。 6 月 4 日,她在阿里内网发出《置身钉内》,七万五千字,一百零五页,分成八章,写产品的发心、定位、设计、用户、敏捷、秩序、军争和长期。 换招牌 6 月 8 日,杭州。前钉钉副总裁汪佳敏写了《置身钉外》。他说,自己希望无招带钉钉重现辉煌,但代价不该是所有人用工作时长换到油尽灯枯。 6 月 10 日,杭州。阿里合伙人委员会在内网发文,批评钉钉的管理方式,称这不是阿里文化该有的样子。 6 月 11 日,杭州。无招卸任。他第二次执掌钉钉,一共 437 天。 他回来是为了把旧钉钉办掉,最后被同一套办法办掉的,也包括他自己。 但钉钉的那场手术没有停。 二十一天以后,悟空、QoderWork 和 MuleRun 被交给接任者陈宇森整合。QoderWork 做桌面执行,MuleRun 从阿里云内部长出来,悟空则是无招亲自发布的那一个。8 月 3 日,装着这三样东西的千问办公开始公测。 从摘掉金箍到装进千问,一百三十九天。那尊猴子还站在楼顶。给它取名的人已经走了,它自己成了另一个名字的来时路。 差不多同一时间,马路对面的那家公司也开始动了。 7 月 30 日,北京。字节把飞书一分为二。产品团队并进豆包,也就是字节自家的 AI 助手,谢欣改向豆包负责人赵祺汇报;销售、市场和客户服务团队进入火山引擎,那是字节的云业务,由谭待负责。通知里说,飞书现有产品和服务保持不变。 「保持不变。」 八年前,中航大厦换招牌的时候,今日头条也没有消失。它还能打开,还有用户,还有广告。真正变化的是名字背后的权力,今日头条从一家公司退回成一款产品,字节跳动站到了它上面。 如今,相似的事情又落到了飞书身上。 只是飞书这一次有点不一样。它的营收本身还在涨,客户还在续费,谢欣也还在负责产品。《财经》拿到的数据称,2025 年飞书营收超过 30 亿元,2026 年第二季度同比增长超过 100%,同期超过九成新增客户购买了飞书的 AI 产品。 飞书被动刀的时候,它正在赢。 这反而更像过去二十年里那些真正重要的转折。等一项业务已经输了,再动它通常只剩收拾残局;真正难的是它还在赚钱、还在增长的时候,先把下一层权力交出去。 8 月 6 日,北京。字节召开年内第二次全员会,梁汝波把抖音和豆包并列为两条粗主干,赵祺和谭待都在场。那位 2014 年就加入字节、做过第一任人力负责人的谢欣,从直接向创始人梁汝波汇报,改成向赵祺汇报。 到这里,飞书的变化已经不只是一次汇报线调整。字节正在重新决定,谁才是下一阶段站在最上面的那个入口。 腾讯也在做类似的收口。 年初,公司里同时长出好几个 Agent 产品。WorkBuddy 之外,还有 QClaw 和 Marvis,外面把这场内部竞赛叫「百虾大战」。到了 7 月,QClaw 的相关业务和部分团队被划进 WorkBuddy 所在的部门。 多名腾讯内部人士告诉媒体,马化腾频繁参加 WorkBuddy 的产品会,团队申请算力、技术和市场资源时一路绿灯。内部流传,它可能成为 QQ、微信之后的第三个战略级产品。8 月 8 日,WorkBuddy 的广告从北京知春路铺到深圳高新园,从地铁通道和写字楼电梯一直追进手机信息流,夜里也亮着。 知春路。八年前,今日头条就是在那条路上摘掉了自己的招牌。 这个夏天,类似的调整还在往外扩散。 百度把内部用了几年的助手 dodo 的研发人员和资源并进办公 Agent「搭子」,此前文库和网盘也已经被划进同一个事业群,为 GenFlow 提供内容和用户。美团则把自家的 LongCat 模型接进 CatPaw,开始进入代码、履约和企业业务,其中履约压着几十万骑手和几百万商家的日常调度,是这家公司最重的一条线。 到了这里,已经很难再把这些变化看成几家公司各自的产品调整,大厂们都在把旧业务多年积下来的用户、权限、数据和组织关系,往 Agent 那边搬。 改良 老舍写《茶馆》,王利发一辈子都在改良。 前清那会儿,他把方桌长凳换成小桌藤椅,后来隔出公寓招学生住,再往后评书说不下去了,他还想添几个女招待。日子越紧,他改得越勤,嘴里总挂着一句:「我可是改良啊。」 裕泰这块招牌一直没换,里面的桌椅却换过好几茬。墙上那张「莫谈国事」的纸条,一张比一张写得大。 王利发什么都肯改,但招牌下面那套活法却一直没舍得动。最后,改良没有替他换来一条活路。 中国互联网时代的巨头们下手往往比「改良」狠得多,它们没有等旧东西老去,真正需要动刀的时候,往往恰恰是它还在赚钱、还在增长、还站在最高处的时候。 今年夏天轮到了办公软件。它们积累十年的组织关系、权限和客户,正是 Agent 最需要的粮食;它们修了十年的产品边界,也正好挡在 Agent 往前走的路上。 中国互联网二十年,最残酷的一课可能从来都不是怎么打败别人。 而是当那个最赚钱、最熟悉、最舍不得动的自己开始挡路时,你敢不敢先下手。 想活下去,先得杀死曾经的自己。 原文链接

中国互联网的二十年,和办公 Agent 的这个夏天

原文标题:《中国互联网的二十年,和办公 Agent 的这个夏天》
原文作者:动察Beating
杭州有两栋写字楼隔街相望。一栋楼顶在 2026 年春节前新立起一尊红金色的孙悟空,挨着钉钉那道闪电标志。另一栋楼顶,是飞书的标志。孙悟空立起来那天,照片很快在社交媒体上传开,不少人笑称,这是最朴实的商战,钉钉的意思,大概是要比飞书高一头。
这两家已经打了十年。从谁家的消息能看见已读,打到文档、表格和客户名单,最后一路打到了屋顶上。
不过楼顶那只猴子的两只手空着,没有挥棒。它要拿出来的东西,在一个多月后的发布会上。
3 月 17 日,杭州西溪。钉钉创始人无招站上发布会的台。2015 年他造出钉钉,2021 年离开,2025 年又被请了回来。这一天,他要发布一套新的 AI 助手,名字就叫悟空,标志用的正是楼顶那只猴子。
阿里 CEO 吴泳铭坐在台下。无招说,要把钉钉打碎,用 AI 重新炼一遍。从前是人使用钉钉,往后是 AI 使用钉钉。
讲到标志时,他把猴子头上的金箍摘了,说因为它已经是斗战胜佛。
台下鼓掌。
大闹天宫的那只猴子,没有走到灵山。他被压在五行山下五百年,出来时头上多了一个箍,一路被咒念得满地打滚,脾气一点一点被收拾干净。真正走到灵山的,已经是另一只猴子,不再想着自己当王。
斗战胜佛,是齐天大圣走完那条路之后得到的新名字。想走到那里,先得把当初那只猴子办掉。
这个故事讲悟空,也是在讲钉钉。
这场发布会表面上发布的是一款 AI 产品,真正要动的却是钉钉自己。钉钉把一千多项底层能力改写成 AI 可以直接调用的指令。从前员工得在屏幕上一层层点开审批、日程和业务系统,悟空可以绕过这一层,直接读数据、调工具,再把事情接着往下做。
无招要交出去的不只是一个入口,还有这家公司十年长出来的内脏。
不过短短八十六天以后,6 月 11 日,他离开了钉钉。这件事有点戏剧化,不过放回中国互联网过去二十年,却算不上新鲜。
那些真正活过一轮又一轮周期的公司,几乎都干过同一件事,那就是在旧业务还赚钱、旧产品还站在最高处的时候,亲手把下一把刀递给自己人。
中国互联网这二十年,没有谁靠守着原来那个自己活到今天。
想活下去,先得杀死曾经的自己。
杀死那个顶点上的自己
这套手艺,互联网大厂们练了很久。
2010 年 10 月,深圳。张小龙给马化腾写了一封信,说 QQ 属于电脑,腾讯需要一款生在手机上的通信工具。腾讯没有直接把这件事交给 QQ 团队去做,内部三个组同时开工,QQ、QQ 通讯录、QQ 邮箱各做一款,谁先做出来算谁的。
那一年,QQ 正在最高处。
2011 年 1 月 21 日,广州。做 QQ 邮箱的那个团队上线了微信 1.0。
腾讯先动了这一刀。两年以后,杭州也发生了差不多的事。
2013 年,马云说,阿里无线团队的职责就是灭了淘宝。
那一年,淘宝正站在舞台中央。
两年以后,手机淘宝成了双 11 的主战场。淘宝两个字保留下来,但人们买东西的那块屏幕已经换了,很少再有人坐在电脑前打开淘宝网页版。
再过五年,轮到北京。
2018 年 8 月,知春路。中航大厦摘下「今日头条」四个大字,换上「字节跳动」。今日头条还能打开,还在更新,还有用户和广告。
那一年,今日头条依然是国民应用。
只是抖音已经超过了它。三个月后,陈林出任今日头条 CEO,张一鸣的官方称谓也从「今日头条创始人兼 CEO」,改成「字节跳动创始人兼 CEO」。
三回都一样。
要动刀的东西正在赚钱,正在万众瞩目,看起来正是全公司最不该碰的地方。可等它自己老下去,公司也就跟着一起老了。所以得趁它还硬朗的时候动手,把下一把刀交给自己人,让新的从里面长出来,再把旧的一点一点吃掉。
败者之师
但钉钉当年并不是站在最高处被造出来的。
2014 年,杭州,文一西路 176 号。湖畔花园的一间旧公寓里,六个阿里人围着一张桌子开周会。他们刚从来往上撤下来。来往是阿里拿来打微信的社交产品,公司斥过巨资,还要求每名员工一个月拉来一百名外部用户。马云亲自站台,柳传志、史玉柱、李连杰也被请进去开号。那阵子很多人的手机里都躺着一个来往,装上,用两天,然后再也没有打开过。
他们退回去的那间公寓,在阿里内部几乎称得上是一座祖屋。
1999 年,马云和十七个同伴就是在那里凑出五十万,阿里巴巴开张。后来西溪园区建起来,还专门复刻了这间屋子的内部陈设。
只是这一次,从公寓里长出来的新方向,不是战略会定出来的。
来往想抢走微信里的普通人,没抢动。无招于是换了个方向,去找中国老板最朴素的那点焦虑,比如我说的话有没有人看,我交代的事有没有往前推进。
钉一下、已读未读、企业通讯录、考勤、审批,后来让无数员工头疼的那些东西,当年正好戳在管理者心口那根刺上。
钉钉后来一直被说成是给老板做的。可在当时,真正愿意为一套管理软件掏钱的,也正是这些人。中国有几千万家小公司,老板自己跑业务、自己发工资、自己追进度。钉钉出现之前,他手里除了一个微信群,几乎什么都没有。
2015 年 1 月,钉钉上线。第一年用户过亿,三年超过三亿。
一支从来往撤下来的败军,就这样做出了一样称手的兵器。
后来,这件兵器砍到过很多人,也包括做出它的人。
回来拆自己的人
无招是 2021 年离开钉钉的。
那一年,阿里推行「云钉一体」,要把钉钉和阿里云绑在一起卖给大客户、做定制项目,而无招坚持标准化产品和中小企业。分歧写在纸上是路线,落到日子里就是一次次评审会谈不拢。离开以后,他创办两氢一氧,做跨境产品和小型智能硬件。
四年以后,风向彻底变了。
2025 年 2 月,阿里宣布未来三年投入 3800 亿元建设 AI 基础设施,吴泳铭把钉钉称作阿里面向企业最重要的 AI 应用之一。3 月 31 日,阿里收购两氢一氧投资人的股份,无招第二次坐回钉钉 CEO 的位置。
十年前,他从来往的败局里造出钉钉。这一次把他请回来,是要让他亲手拆掉自己造出来的东西。
无招回来后的第一周,没有完全采用业务部门备好的客户名单,而是自己带队去北京、广东和华东走访。回来以后,他又逐个评审钉钉的产品经理,一人十分钟,随机抽一个功能,请对方讲明白为什么这样设计。
十分钟很短,短到没有多少铺垫的余地,一开口就知道这个功能到底有没有被认真想过。公开报道说,这场抽查很少有人及格。无招最后给出的判断是,钉钉已经做了许多 AI 功能,却没能定义未来。
接着是「下地运动」。产品、研发和运营每天轮流做两小时客服。
在这之前,后台的数据一直很好看,转人工率只有 15%,评价全是五星。可当人真的把电话接起来,听到的是另一套内容。有人说答非所问,有人说需求提了一年没动静,也有人根本找不到转人工的入口。
重新计算以后,客户满意度只有 30%。几个月后,这个数字被提到 80%,成本降了 90%。
无招确实修好了一些东西。他能一眼看穿一家大公司给自己编出来的数据,会逼着产品经理去听客户骂人,也真的把 30% 拉到了 80%。
问题是,他用来修理产品的那套方法,很快也被用来修理人。
然后,整台机器的螺丝越拧越紧。九点打卡,每天都有早会和晚会,午休结束后 13 点 15 分要进入工作状态。管理岗被要求学 Python,技术团队倒查代码量。产品经理每周得拜访三家企业,对外沟通甚至出现统一话术「不好意思,我只有钉钉。」有报道写,他晚上十点巡楼,会给还在加班的人点赞。
滕雅辛就是在这时候进的钉钉。
她是产品经理,花名幽素。面试时,无招围绕一个拉新任务,从她父亲问到母亲,又从母亲问到外公外婆,最后还在追问真的凑不齐六个能上钉钉的家人吗。
较劲
幽素入职第一天,就被分进一个保密项目,代号 O。后来她才知道,O 代表的是 ONE。
项目第二周,设计负责人离开。第四周,推荐她进组的师兄被调去别处。整个团队里,在 ONE 待满三个月的产品经理只有三个人,她是其中之一。人一直在换,新来的人需要从头补课,可发布日期一天都没有推迟。
2025 年 8 月 25 日,钉钉十周年发布会,无招一口气推出五款产品。DingTalk A1 是一张 3.8 毫米厚、能吸在手机背面的录音卡片,AI 听记支持 72 种语言,AI 表格和 AI 搜问也一同亮相。
ONE 摆在正中间,它要把消息、日程、会议、审批和文档重新排一遍序,让「人找事」变成「事找人」。可真往前走,最先撞上的就是钉钉自己。
有员工拿着碧桂园的案例去汇报,希望用 ONE 的卡片给保安和保洁动态派活。按照幽素的记录,无招没有认可这个方向,他希望 ONE 和钉钉一样,服务老板和管理者。
方向摇摆很快落到了数据上。
ONE 的日活一度稳定在三百万左右,留存随后急跌。团队把它从整理信息改成一套能装下各种 Agent 的底座,屏幕底部堆进一排图标,内部和客户都纷纷对产品表示质疑。等大包大揽的心思被收了回去,产品又变回了简洁,首页为空,代表你已经处理完所有急事。幽素记录的数据里,次日留存从 10% 出头涨到接近 30%,交出入口之前,峰值一度超过 45%。
它是在刚学会走路的时候被挪走的。2026 年初,ONE 被拆分,退到钉钉的负一屏,悟空变成主入口。
入口换了,钉钉的焦虑没有消失。很快,它又有了一个新的参照物,就在马路对面。
两个多月后,4 月 2 日夜里,钉钉的高级经理和产品总监接到通知,十二点以前不许下班。不是开会,也不是赶版本。他们要看隔壁飞书的大楼几点熄灯。
这场较劲当然不只是比谁的灯亮得更晚。
一年前,飞书 CEO 谢欣在一场公开活动上谈过考勤软件。他说,假如一套办公工具每天只收集打卡数据,一年攒下一千万次打卡,AI 最后大概只能预测明天哪几个员工会迟到。他没点名,听众知道那句话是在点谁的。另一场采访里,他说飞书的表格产品领先至少十二个月。
一家把管理做到极致,一家把协作做到极致。这是同一道题的两个解法,两边都答得认真。钉钉追问谁还没执行,飞书想把一项决策是怎么发生的留在文档里,让三个月后进来的新人翻开就知道,当初为什么这么决定。
幽素把自己置身其中的这些日子,一点点写了下来。
6 月 4 日,她在阿里内网发出《置身钉内》,七万五千字,一百零五页,分成八章,写产品的发心、定位、设计、用户、敏捷、秩序、军争和长期。
换招牌
6 月 8 日,杭州。前钉钉副总裁汪佳敏写了《置身钉外》。他说,自己希望无招带钉钉重现辉煌,但代价不该是所有人用工作时长换到油尽灯枯。
6 月 10 日,杭州。阿里合伙人委员会在内网发文,批评钉钉的管理方式,称这不是阿里文化该有的样子。
6 月 11 日,杭州。无招卸任。他第二次执掌钉钉,一共 437 天。
他回来是为了把旧钉钉办掉,最后被同一套办法办掉的,也包括他自己。
但钉钉的那场手术没有停。
二十一天以后,悟空、QoderWork 和 MuleRun 被交给接任者陈宇森整合。QoderWork 做桌面执行,MuleRun 从阿里云内部长出来,悟空则是无招亲自发布的那一个。8 月 3 日,装着这三样东西的千问办公开始公测。
从摘掉金箍到装进千问,一百三十九天。那尊猴子还站在楼顶。给它取名的人已经走了,它自己成了另一个名字的来时路。
差不多同一时间,马路对面的那家公司也开始动了。
7 月 30 日,北京。字节把飞书一分为二。产品团队并进豆包,也就是字节自家的 AI 助手,谢欣改向豆包负责人赵祺汇报;销售、市场和客户服务团队进入火山引擎,那是字节的云业务,由谭待负责。通知里说,飞书现有产品和服务保持不变。
「保持不变。」
八年前,中航大厦换招牌的时候,今日头条也没有消失。它还能打开,还有用户,还有广告。真正变化的是名字背后的权力,今日头条从一家公司退回成一款产品,字节跳动站到了它上面。
如今,相似的事情又落到了飞书身上。
只是飞书这一次有点不一样。它的营收本身还在涨,客户还在续费,谢欣也还在负责产品。《财经》拿到的数据称,2025 年飞书营收超过 30 亿元,2026 年第二季度同比增长超过 100%,同期超过九成新增客户购买了飞书的 AI 产品。
飞书被动刀的时候,它正在赢。
这反而更像过去二十年里那些真正重要的转折。等一项业务已经输了,再动它通常只剩收拾残局;真正难的是它还在赚钱、还在增长的时候,先把下一层权力交出去。
8 月 6 日,北京。字节召开年内第二次全员会,梁汝波把抖音和豆包并列为两条粗主干,赵祺和谭待都在场。那位 2014 年就加入字节、做过第一任人力负责人的谢欣,从直接向创始人梁汝波汇报,改成向赵祺汇报。
到这里,飞书的变化已经不只是一次汇报线调整。字节正在重新决定,谁才是下一阶段站在最上面的那个入口。
腾讯也在做类似的收口。
年初,公司里同时长出好几个 Agent 产品。WorkBuddy 之外,还有 QClaw 和 Marvis,外面把这场内部竞赛叫「百虾大战」。到了 7 月,QClaw 的相关业务和部分团队被划进 WorkBuddy 所在的部门。
多名腾讯内部人士告诉媒体,马化腾频繁参加 WorkBuddy 的产品会,团队申请算力、技术和市场资源时一路绿灯。内部流传,它可能成为 QQ、微信之后的第三个战略级产品。8 月 8 日,WorkBuddy 的广告从北京知春路铺到深圳高新园,从地铁通道和写字楼电梯一直追进手机信息流,夜里也亮着。
知春路。八年前,今日头条就是在那条路上摘掉了自己的招牌。
这个夏天,类似的调整还在往外扩散。
百度把内部用了几年的助手 dodo 的研发人员和资源并进办公 Agent「搭子」,此前文库和网盘也已经被划进同一个事业群,为 GenFlow 提供内容和用户。美团则把自家的 LongCat 模型接进 CatPaw,开始进入代码、履约和企业业务,其中履约压着几十万骑手和几百万商家的日常调度,是这家公司最重的一条线。
到了这里,已经很难再把这些变化看成几家公司各自的产品调整,大厂们都在把旧业务多年积下来的用户、权限、数据和组织关系,往 Agent 那边搬。
改良
老舍写《茶馆》,王利发一辈子都在改良。
前清那会儿,他把方桌长凳换成小桌藤椅,后来隔出公寓招学生住,再往后评书说不下去了,他还想添几个女招待。日子越紧,他改得越勤,嘴里总挂着一句:「我可是改良啊。」
裕泰这块招牌一直没换,里面的桌椅却换过好几茬。墙上那张「莫谈国事」的纸条,一张比一张写得大。
王利发什么都肯改,但招牌下面那套活法却一直没舍得动。最后,改良没有替他换来一条活路。
中国互联网时代的巨头们下手往往比「改良」狠得多,它们没有等旧东西老去,真正需要动刀的时候,往往恰恰是它还在赚钱、还在增长、还站在最高处的时候。
今年夏天轮到了办公软件。它们积累十年的组织关系、权限和客户,正是 Agent 最需要的粮食;它们修了十年的产品边界,也正好挡在 Agent 往前走的路上。
中国互联网二十年,最残酷的一课可能从来都不是怎么打败别人。
而是当那个最赚钱、最熟悉、最舍不得动的自己开始挡路时,你敢不敢先下手。
想活下去,先得杀死曾经的自己。
原文链接
Статья
哈萨比斯退场,前LLM时代最后一幕原文标题:《哈萨比斯退场,前LLM时代最后一幕》 原文作者:动察Beating 哈萨比斯原本也要走。 据 Pathfounders 援引的业内消息人士透露,Google DeepMind 联合创始人、2024 年诺贝尔化学奖得主德米斯·哈萨比斯,原计划与 Jeff Dean 同期离开 Google。管理层担心两位 AI 领袖同时出走会重创股价,因此设法把哈萨比斯留下。知情人士称,等局势稳定下来,他仍有可能离开。 8 月 5 日,Google 对外公布的故事要体面许多。 哈萨比斯主动交出 Google DeepMind 的日常管理权,转任董事长和 Alphabet 首席科学家,继续负责 AGI、科学研究和药物研发公司 Isomorphic Labs。在 DeepMind 工作十三年的 Koray Kavukcuoglu 接过日常工作,他是 Google 首席 AI 架构师,也是 DeepMind 早期深度学习团队的创建者之一,今后直接向桑达尔·皮查伊汇报。 大公司很会写告别。 大人物的告别常常从头衔变长开始。董事长、首席科学家,名片上的字更多了,手边直接管理的人却少了。Google 留下哈萨比斯的声望和诺贝尔奖,也留下一个足以让投资者暂时安心的名字。 这家全世界最强大的科技公司,已经很难继续按照过去那套方式容纳那个给它带来 AlphaGo、AlphaFold 和诺贝尔奖章的科学家。现在它能做的,是先把人留下,再给可能到来的分手找一个不那么难看的日子。 Google 与哈萨比斯共同维持了前 LLM 时代最后一套完整的生活方式。科学家决定问题,公司负责付钱,研究以年为单位,产品可以晚一点上线,也可以先不考虑利润。 Google 与哈萨比斯这场尚未完成的分手,也成了前 LLM 时代的最后一幕。 一小时 哈萨比斯原本要和 Jeff Dean 在同一天离开。Jeff Dean 是 Google 最有传奇色彩的工程师之一,1999 年加入 Google,搭过搜索、广告和分布式计算的底层系统,后来又参与创办 Google Brain。Google 员工编过无数关于他的段子,仿佛这个人打一个响指,半个互联网都得重启。 那天他宣布离职后,有人开玩笑说,Google 终于把 Jeff Dean「开源给全人类」了。 十四年前,他做的事情恰好相反。他替 Google 把全世界最稀缺的一批 AI 科学家领进门。 2012 年 12 月,美国太浩湖,Harrah's 酒店 731 号房间。现代 AI 史上最著名的人才拍卖之一,在两张双人床尽头的一张桌子旁进行。 拍卖人杰弗里·辛顿,是研究神经网络数十年的英裔加拿大科学家,后来被称为 AI 教父。他腰伤严重,从 2005 年起便无法正常坐着,一旦坐下,椎间盘可能再次滑脱,让他卧床数周。 于是,他把生活整个改造成了站立和躺卧,乘车时横在后座,吃饭时跪在桌边,到了酒店,便把一只垃圾桶倒扣在桌面上,再把笔记本电脑架到上面,站着等待邮箱收到新的拍卖报价。 辛顿和两个学生刚成立了一家叫 DNNresearch 的公司,没有产品,没有营收,公司全部的家当是房间里的三个人,以及他们刚刚做出的 AlexNet。 AlexNet 以辛顿的学生 Alex Krizhevsky 命名。那一年,它在 ImageNet 图像识别竞赛里大幅甩开传统方法,让被冷落几十年的神经网络忽然翻身。 辛顿的另一名学生伊利亚·苏茨克维尔,后来会成为 OpenAI 联合创始人和首席科学家。可在此刻,他还和老师站在 731 号房间里,看着 Gmail 里一封封报价邮件进来。 拍卖规则很简单,每出现一个新价格,其他公司有一小时决定跟不跟,每次至少加价 100 万美元。 百度来了,微软来了,Google 来了,还有一家只成立了两年的伦敦公司,DeepMind。它手头的现金比不过那些巨头,只能拿自己的股份出价,很快被挤下牌桌。 剩下三家公司继续抬价,一路喊到 4400 万美元。辛顿叫停了拍卖,睡了一觉,第二天决定把公司卖给 Google。 他没有继续把价格往上抬。到了这个数,钱已经够多了,自己和两个学生接下来在哪里工作,才是更重要的事。 Jeff Dean 和 Google 工程负责人 Alan Eustace 在拍卖前陪辛顿过了 65 岁生日。他们主要想看看辛顿身边的两个学生究竟怎么样。后来 Google 花 4400 万美元买下这家没有产品的公司,其实就是为了买这三个人。 最好的几十年 DeepMind 没有在太浩湖买下辛顿。一年多以后,它自己长成了 Google 想买的东西。 故事发生在一场办得乱七八糟的生日派对上。 2013 年 6 月,马斯克的妻子、演员 Talulah Riley 在纽约州塔里敦租下一座城堡,为丈夫庆生。宾客穿上武士服,现场还来了一名体重约 350 磅的相扑冠军。马斯克亲自上场与之较量,扭伤了脖子。 Google 联合创始人拉里·佩奇也参加了派对。那几年,他受声带疾病困扰,说话只能把声音压得很低。佩奇把哈萨比斯叫出去,两个人沿着城堡外面散步。 走到外面,他问道: 「你为什么不利用我已经创造好的一切?」 哈萨比斯醍醐灌顶。这句话的意思就是「你不必再造一家 Google」,因为那会花掉职业生涯里最好的几十年。Google 已经有数据中心、工程师、现金和遍布世界的产品。你要解决的是智能,何必先去忙活开公司那一摊子事儿。 哈萨比斯小时候是国际象棋神童,十七岁参与设计过一款电子游戏,后来又去读认知神经科学。2010 年,他与穆斯塔法·苏莱曼、Shane Legg 创办 DeepMind,目标从一开始就是 AGI。 公司才成立几年,他已经烦透了融资。 研究智能本来就像往无底洞里扔石头,还要隔三岔五出来给投资人解释,为什么到今天这个无底洞还没传来回声。而且每完成一轮融资,又得马不停蹄地启动下一轮融资。 佩奇给他的答案,是省掉建设另一家 Google 的几十年,也由 Google 承担那些暂时看不见回报的时间。 2014 年,Google 以大约 6.5 亿美元收购 DeepMind。实验室继续留在伦敦,保留自己的名字和研究文化。Google 还答应成立 AI 伦理与安全委员会,监督这些技术如何使用。 Skype 联合创始人、DeepMind 早期投资人 Jaan Tallinn 后来回忆,Google 在纯财务上的报价并不占优,安全委员会的承诺才是 DeepMind 最终选择 Google 的重要原因。 这是前 LLM 时代最迷人的一份婚约。 Google 承诺了钱和耐心,DeepMind 交付通往 AGI 的可能性。至于什么时候赚钱,先往后稍一稍。 那时候 Google 家大业大,输得起,也等得起。 两个 100 亿 2024 年圣诞节前,英国记者 Sebastian Mallaby 在伦敦一家酒吧见到哈萨比斯。他们此前已经聊过许多次。 那一次,哈萨比斯从背包里摸出一个皮盒。打开,里面是一枚沉重的金色圆盘。 他刚从斯德哥尔摩领回来诺贝尔化学奖奖章。 哈萨比斯与 DeepMind 科学家 John Jumper 因为 AlphaFold 共同获得了当年的诺贝尔化学奖。Jumper 博士毕业半年后,哈萨比斯就把 AlphaFold 项目交给他领导。后来,这个团队解决了困扰生物学界数十年的蛋白质结构预测问题。 诺贝尔奖已经是世俗世界能颁给科学家的最高奖章,哈萨比斯对 Mallaby 说: 「就算你拿 100 亿美元来换这个诺贝尔奖,我也会拒绝。」 2026 年 6 月,Alphabet 为扩建 AI 基础设施发起最高 800 亿美元的股权融资。巴菲特的伯克希尔通过定向增发买下 100 亿美元的 Alphabet 股票。 到 7 月,这家由巴菲特掌舵六十年的投资公司,持有的 Alphabet 头寸已经超过 310 亿美元。 巴菲特没有谈 AGI,他还是那个在奥马哈拨算盘的人,认的是一条老理,一家好公司要能在很长时间里,赚到显著高于无风险资产的资本回报。 谈到 Google 和其他 AI 公司,他关心的是它们正在砸下的几千亿美元,最后究竟能不能生出更多的钱。 「这是真钱。」他说。 真钱砸下去,起码得听见个响。 两笔 100 亿美元,只隔十八个月,却像两种价值语言在 Google 内部撞到了一起。 哈萨比斯用 100 亿美元说明一枚奖章的无价,巴菲特用 100 亿美元追问这家公司将来究竟值多少钱。 Google 收购 DeepMind 时,钱跟在科学问题身后,买下一段无法标价的研究时间。到了 2026 年,Alphabet 年内资本开支预计接近 2000 亿美元,大部分投向 AI 算力和数据中心。钱开始走到研究前面,先变成芯片、土地、电力、服务器和折旧。 数据中心没有情怀,每一座机房亮起来,账本上就多记下一笔欠未来的债。LLM 把智能从实验室里的科学问题,推成了一项巨型土木工程。 桌子两边 Google 和 DeepMind 的婚姻,从第一年起便没有表面上那么太平。 2015 年 8 月,收购 DeepMind 时约定成立的 AGI 安全委员会,在 SpaceX 举行了第一次会议。哈萨比斯、DeepMind 联合创始人穆斯塔法·苏莱曼、马斯克、Google 高层以及 LinkedIn 联合创始人 Reid Hoffman 等人都到场了。 苏莱曼长期关注 AI 的社会影响,想建立一套不完全受 Google 股东控制的治理结构。 会议没有达成任何协议。 桌面上谈的是人类命运,桌子底下剑拔弩张的是 Google 与马斯克的利益冲突、马斯克与佩奇之间的私人矛盾,以及每个人对 AI 风险截然不同的理解。 会议散场以后,哈萨比斯和苏莱曼又与 Google 展开一场代号「马里奥计划」的漫长谈判。他们希望把 DeepMind 改造成一家拥有独立董事、服务全球公共利益的机构。 此后几年,独立计划反复拉扯,到 2021 年彻底作罢。Google 舍不得松开 AI,DeepMind 也离不开 Google 的算力和钱。 也是 2015 年,在硅谷沙丘路上的罗斯伍德酒店,时任 Y Combinator 掌门人的萨姆·奥特曼给伊利亚·苏茨克维尔发了一封邮件,请他来吃饭。苏茨克维尔到达的时候,马斯克、曾任 Stripe 技术负责人的 Greg Brockman 等人已经到了。 他过了一阵才明白,自己才是这顿饭的主角。 他们讨论的问题很直白,他们担心 Google 和 DeepMind 领先得太多,想重新建一个实验室,成为制衡的力量。 几个月后,OpenAI 诞生。 苏茨克维尔离开 Google,成为 OpenAI 的联合创始人和研究负责人。最早的 OpenAI 是一家非营利研究机构,成立公告上写着他们不受财务回报约束,研究员可以发表论文、博客和代码,专利也准备与世界分享。 那时还没有 ChatGPT,没有订阅费,没有企业 API,更没有一眼望不到头的数据中心账单。 那群人也相信,科学家可以先研究未来,赚钱的事以后再说。 OpenAI 诞生于对 Google 过度强大的恐惧,又继承了 DeepMind 最初的理想。后来,Scaling Law 开始主导 AI 的发展路线,模型越做越大,账单也越拉越长。2019 年,OpenAI 成立营利性子公司;2022 年,ChatGPT 闯进了大众的屏幕里。 从那之后,所有人都得开始奔跑,包括谷歌。 第三十七手以后 2016 年 3 月,AlphaGo 在首尔与围棋世界冠军李世石进行五番棋。第二局走到第三十七手,AlphaGo 把一枚黑子落在人类棋手极少选择的位置。现场解说一度怀疑机器走错了。 李世石离开座位,到吸烟室待了十几分钟。回到棋盘前,他最终还是输掉了这一局。 后来人们反复谈论这一手,把它视为机器第一次公开走出人类经验边界的时刻。 那场比赛的 100 万美元奖金,也很有当时 DeepMind 的气质。哈萨比斯甚至没有事先完成 Google 的财务审批,就先把这笔奖金承诺了出去。 等 AlphaGo 获胜,奖金最终被捐给慈善机构和围棋组织。 科学问题先于财务流程,那是实验室的黄金年代。 随后是 AlphaZero、MuZero,以及 AlphaFold。 过去,科学家通过实验解析一个蛋白质结构,往往要花几个月甚至几年。AlphaFold 把氨基酸序列变成三维结构预测,DeepMind 又与欧洲生物信息学研究所建立免费数据库,把超过两亿个预测结构放进去,覆盖了科学界已知蛋白质中的绝大部分。 来自 190 多个国家的 300 多万名研究人员使用过它。AlphaFold 没有按月收费,也没有一条可以拿到财报上展示的商业增长曲线。它替无数科学家省下实验室里的年月,给 Google 带回两枚诺贝尔奖章,而在商业方面却几乎没有对应的收入。 ChatGPT 带来的压力之下,已经淡出 Google 日常工作的联合创始人谢尔盖·布林也回来了。 布林后来回忆,自己在一个小型聚会上碰到一名 OpenAI 员工,对方问他: 「你到底在干什么?这可能是计算机科学有史以来最具变革性的时刻。」 布林觉得对方说得对,于是此后越来越深地参与 Gemini。 2023 年,皮查伊把 Google Brain 与 DeepMind 合并为 Google DeepMind,哈萨比斯成为 CEO,Jeff Dean 成为首席科学家。这看起来是哈萨比斯权力的顶点,也恰恰是旧 DeepMind 作为独立实验室的终点。 它被接进 Google 的模型、应用和商业系统,成了整家公司的 AI 引擎。如今接过 DeepMind 日常管理工作的 Koray,负责 Gemini 模型、前沿研究、Gemini 应用和开发者团队。 皮查伊在公告里不断强调「加速」「快速行动」和即将发布的新模型。 十三年前,Google 给 DeepMind 的,是时间。 十三年后,Google 最缺的,恰好也是时间。 把钟表往回拨一格 2026 年夏天,离开的几乎都是前 LLM 时代旧故事里的人。 AlphaFold 项目负责人 John Jumper 去了 Anthropic;Transformer 论文作者、Gemini 联合负责人 Noam Shazeer 去了 OpenAI。 随后,Jeff Dean 与 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 一起创办 Discovery Loop。Jeff Dean 和 Ghemawat 搭建过 Google 早期最重要的分布式系统,Vinyals 和 Quoc Le 则长期位于 Google 现代 AI 研究的中心。 Discovery Loop 被注册成一家公益公司。Jeff Dean 在告别信里解释,独立公司的意义之一,就是可以作出一些「不一定符合公司最纯粹财务利益」的决定。 Google 成了 Discovery Loop 的创始投资者和云计算合作伙伴。它没能把这群人继续留在自己的组织架构里,于是决定花钱,让他们到外面继续做事。 前 LLM 时代大概就是这样散场的。 没有人当众撕毁理想,也没有谁摔门而去。旧实验室被接进产品线,旧科学家带着母公司的资金去外面继续研究,所有人都留足了体面。 哈萨比斯现在还没离开,但那份始于 2013 年城堡外的约定,已经失去了赖以成立的条件,时间。 「你为什么不利用我已经创造好的一切?」 佩奇口中的那个「一切」,今天比十三年前多得多。 Google 有更多的钱、机器、工程师和数据中心,多到巴菲特愿意拿出 100 亿美元,押注这些庞大的投入最终能够产生回报。 可佩奇当年递给哈萨比斯的核心资产,正在变得越来越少。 那是把十年交给一个问题的胆量,是允许一群科学家暂时不看日历的奢侈。 从太浩湖 731 号房间里倒扣的垃圾桶,到 Alphabet 一年近 2000 亿美元的资本开支,AI 只用了十四年。房间变成数据中心,三个人的小公司变成几十万块芯片支撑的工业体系,一小时一次的人才竞价,也变成了按季度计算的模型竞赛。那群人把 AI 从一个小圈子做成了这个时代最庞大的工业体系,等这一切终于大到难以想象,他们开始一个接一个地离开。 哈萨比斯原本也要走,Google 把他离职的钟表指针往回拨了一格。 可它拨不回 2013 年。 原文链接

哈萨比斯退场,前LLM时代最后一幕

原文标题:《哈萨比斯退场,前LLM时代最后一幕》
原文作者:动察Beating
哈萨比斯原本也要走。
据 Pathfounders 援引的业内消息人士透露,Google DeepMind 联合创始人、2024 年诺贝尔化学奖得主德米斯·哈萨比斯,原计划与 Jeff Dean 同期离开 Google。管理层担心两位 AI 领袖同时出走会重创股价,因此设法把哈萨比斯留下。知情人士称,等局势稳定下来,他仍有可能离开。
8 月 5 日,Google 对外公布的故事要体面许多。
哈萨比斯主动交出 Google DeepMind 的日常管理权,转任董事长和 Alphabet 首席科学家,继续负责 AGI、科学研究和药物研发公司 Isomorphic Labs。在 DeepMind 工作十三年的 Koray Kavukcuoglu 接过日常工作,他是 Google 首席 AI 架构师,也是 DeepMind 早期深度学习团队的创建者之一,今后直接向桑达尔·皮查伊汇报。
大公司很会写告别。
大人物的告别常常从头衔变长开始。董事长、首席科学家,名片上的字更多了,手边直接管理的人却少了。Google 留下哈萨比斯的声望和诺贝尔奖,也留下一个足以让投资者暂时安心的名字。
这家全世界最强大的科技公司,已经很难继续按照过去那套方式容纳那个给它带来 AlphaGo、AlphaFold 和诺贝尔奖章的科学家。现在它能做的,是先把人留下,再给可能到来的分手找一个不那么难看的日子。
Google 与哈萨比斯共同维持了前 LLM 时代最后一套完整的生活方式。科学家决定问题,公司负责付钱,研究以年为单位,产品可以晚一点上线,也可以先不考虑利润。
Google 与哈萨比斯这场尚未完成的分手,也成了前 LLM 时代的最后一幕。
一小时
哈萨比斯原本要和 Jeff Dean 在同一天离开。Jeff Dean 是 Google 最有传奇色彩的工程师之一,1999 年加入 Google,搭过搜索、广告和分布式计算的底层系统,后来又参与创办 Google Brain。Google 员工编过无数关于他的段子,仿佛这个人打一个响指,半个互联网都得重启。
那天他宣布离职后,有人开玩笑说,Google 终于把 Jeff Dean「开源给全人类」了。
十四年前,他做的事情恰好相反。他替 Google 把全世界最稀缺的一批 AI 科学家领进门。
2012 年 12 月,美国太浩湖,Harrah's 酒店 731 号房间。现代 AI 史上最著名的人才拍卖之一,在两张双人床尽头的一张桌子旁进行。
拍卖人杰弗里·辛顿,是研究神经网络数十年的英裔加拿大科学家,后来被称为 AI 教父。他腰伤严重,从 2005 年起便无法正常坐着,一旦坐下,椎间盘可能再次滑脱,让他卧床数周。
于是,他把生活整个改造成了站立和躺卧,乘车时横在后座,吃饭时跪在桌边,到了酒店,便把一只垃圾桶倒扣在桌面上,再把笔记本电脑架到上面,站着等待邮箱收到新的拍卖报价。
辛顿和两个学生刚成立了一家叫 DNNresearch 的公司,没有产品,没有营收,公司全部的家当是房间里的三个人,以及他们刚刚做出的 AlexNet。
AlexNet 以辛顿的学生 Alex Krizhevsky 命名。那一年,它在 ImageNet 图像识别竞赛里大幅甩开传统方法,让被冷落几十年的神经网络忽然翻身。
辛顿的另一名学生伊利亚·苏茨克维尔,后来会成为 OpenAI 联合创始人和首席科学家。可在此刻,他还和老师站在 731 号房间里,看着 Gmail 里一封封报价邮件进来。
拍卖规则很简单,每出现一个新价格,其他公司有一小时决定跟不跟,每次至少加价 100 万美元。
百度来了,微软来了,Google 来了,还有一家只成立了两年的伦敦公司,DeepMind。它手头的现金比不过那些巨头,只能拿自己的股份出价,很快被挤下牌桌。
剩下三家公司继续抬价,一路喊到 4400 万美元。辛顿叫停了拍卖,睡了一觉,第二天决定把公司卖给 Google。
他没有继续把价格往上抬。到了这个数,钱已经够多了,自己和两个学生接下来在哪里工作,才是更重要的事。
Jeff Dean 和 Google 工程负责人 Alan Eustace 在拍卖前陪辛顿过了 65 岁生日。他们主要想看看辛顿身边的两个学生究竟怎么样。后来 Google 花 4400 万美元买下这家没有产品的公司,其实就是为了买这三个人。
最好的几十年
DeepMind 没有在太浩湖买下辛顿。一年多以后,它自己长成了 Google 想买的东西。
故事发生在一场办得乱七八糟的生日派对上。
2013 年 6 月,马斯克的妻子、演员 Talulah Riley 在纽约州塔里敦租下一座城堡,为丈夫庆生。宾客穿上武士服,现场还来了一名体重约 350 磅的相扑冠军。马斯克亲自上场与之较量,扭伤了脖子。
Google 联合创始人拉里·佩奇也参加了派对。那几年,他受声带疾病困扰,说话只能把声音压得很低。佩奇把哈萨比斯叫出去,两个人沿着城堡外面散步。
走到外面,他问道:
「你为什么不利用我已经创造好的一切?」
哈萨比斯醍醐灌顶。这句话的意思就是「你不必再造一家 Google」,因为那会花掉职业生涯里最好的几十年。Google 已经有数据中心、工程师、现金和遍布世界的产品。你要解决的是智能,何必先去忙活开公司那一摊子事儿。
哈萨比斯小时候是国际象棋神童,十七岁参与设计过一款电子游戏,后来又去读认知神经科学。2010 年,他与穆斯塔法·苏莱曼、Shane Legg 创办 DeepMind,目标从一开始就是 AGI。
公司才成立几年,他已经烦透了融资。
研究智能本来就像往无底洞里扔石头,还要隔三岔五出来给投资人解释,为什么到今天这个无底洞还没传来回声。而且每完成一轮融资,又得马不停蹄地启动下一轮融资。
佩奇给他的答案,是省掉建设另一家 Google 的几十年,也由 Google 承担那些暂时看不见回报的时间。
2014 年,Google 以大约 6.5 亿美元收购 DeepMind。实验室继续留在伦敦,保留自己的名字和研究文化。Google 还答应成立 AI 伦理与安全委员会,监督这些技术如何使用。
Skype 联合创始人、DeepMind 早期投资人 Jaan Tallinn 后来回忆,Google 在纯财务上的报价并不占优,安全委员会的承诺才是 DeepMind 最终选择 Google 的重要原因。
这是前 LLM 时代最迷人的一份婚约。
Google 承诺了钱和耐心,DeepMind 交付通往 AGI 的可能性。至于什么时候赚钱,先往后稍一稍。
那时候 Google 家大业大,输得起,也等得起。
两个 100 亿
2024 年圣诞节前,英国记者 Sebastian Mallaby 在伦敦一家酒吧见到哈萨比斯。他们此前已经聊过许多次。
那一次,哈萨比斯从背包里摸出一个皮盒。打开,里面是一枚沉重的金色圆盘。
他刚从斯德哥尔摩领回来诺贝尔化学奖奖章。
哈萨比斯与 DeepMind 科学家 John Jumper 因为 AlphaFold 共同获得了当年的诺贝尔化学奖。Jumper 博士毕业半年后,哈萨比斯就把 AlphaFold 项目交给他领导。后来,这个团队解决了困扰生物学界数十年的蛋白质结构预测问题。
诺贝尔奖已经是世俗世界能颁给科学家的最高奖章,哈萨比斯对 Mallaby 说:
「就算你拿 100 亿美元来换这个诺贝尔奖,我也会拒绝。」
2026 年 6 月,Alphabet 为扩建 AI 基础设施发起最高 800 亿美元的股权融资。巴菲特的伯克希尔通过定向增发买下 100 亿美元的 Alphabet 股票。
到 7 月,这家由巴菲特掌舵六十年的投资公司,持有的 Alphabet 头寸已经超过 310 亿美元。
巴菲特没有谈 AGI,他还是那个在奥马哈拨算盘的人,认的是一条老理,一家好公司要能在很长时间里,赚到显著高于无风险资产的资本回报。
谈到 Google 和其他 AI 公司,他关心的是它们正在砸下的几千亿美元,最后究竟能不能生出更多的钱。
「这是真钱。」他说。
真钱砸下去,起码得听见个响。
两笔 100 亿美元,只隔十八个月,却像两种价值语言在 Google 内部撞到了一起。
哈萨比斯用 100 亿美元说明一枚奖章的无价,巴菲特用 100 亿美元追问这家公司将来究竟值多少钱。
Google 收购 DeepMind 时,钱跟在科学问题身后,买下一段无法标价的研究时间。到了 2026 年,Alphabet 年内资本开支预计接近 2000 亿美元,大部分投向 AI 算力和数据中心。钱开始走到研究前面,先变成芯片、土地、电力、服务器和折旧。
数据中心没有情怀,每一座机房亮起来,账本上就多记下一笔欠未来的债。LLM 把智能从实验室里的科学问题,推成了一项巨型土木工程。
桌子两边
Google 和 DeepMind 的婚姻,从第一年起便没有表面上那么太平。
2015 年 8 月,收购 DeepMind 时约定成立的 AGI 安全委员会,在 SpaceX 举行了第一次会议。哈萨比斯、DeepMind 联合创始人穆斯塔法·苏莱曼、马斯克、Google 高层以及 LinkedIn 联合创始人 Reid Hoffman 等人都到场了。
苏莱曼长期关注 AI 的社会影响,想建立一套不完全受 Google 股东控制的治理结构。
会议没有达成任何协议。
桌面上谈的是人类命运,桌子底下剑拔弩张的是 Google 与马斯克的利益冲突、马斯克与佩奇之间的私人矛盾,以及每个人对 AI 风险截然不同的理解。
会议散场以后,哈萨比斯和苏莱曼又与 Google 展开一场代号「马里奥计划」的漫长谈判。他们希望把 DeepMind 改造成一家拥有独立董事、服务全球公共利益的机构。
此后几年,独立计划反复拉扯,到 2021 年彻底作罢。Google 舍不得松开 AI,DeepMind 也离不开 Google 的算力和钱。
也是 2015 年,在硅谷沙丘路上的罗斯伍德酒店,时任 Y Combinator 掌门人的萨姆·奥特曼给伊利亚·苏茨克维尔发了一封邮件,请他来吃饭。苏茨克维尔到达的时候,马斯克、曾任 Stripe 技术负责人的 Greg Brockman 等人已经到了。
他过了一阵才明白,自己才是这顿饭的主角。
他们讨论的问题很直白,他们担心 Google 和 DeepMind 领先得太多,想重新建一个实验室,成为制衡的力量。
几个月后,OpenAI 诞生。
苏茨克维尔离开 Google,成为 OpenAI 的联合创始人和研究负责人。最早的 OpenAI 是一家非营利研究机构,成立公告上写着他们不受财务回报约束,研究员可以发表论文、博客和代码,专利也准备与世界分享。
那时还没有 ChatGPT,没有订阅费,没有企业 API,更没有一眼望不到头的数据中心账单。
那群人也相信,科学家可以先研究未来,赚钱的事以后再说。
OpenAI 诞生于对 Google 过度强大的恐惧,又继承了 DeepMind 最初的理想。后来,Scaling Law 开始主导 AI 的发展路线,模型越做越大,账单也越拉越长。2019 年,OpenAI 成立营利性子公司;2022 年,ChatGPT 闯进了大众的屏幕里。
从那之后,所有人都得开始奔跑,包括谷歌。
第三十七手以后
2016 年 3 月,AlphaGo 在首尔与围棋世界冠军李世石进行五番棋。第二局走到第三十七手,AlphaGo 把一枚黑子落在人类棋手极少选择的位置。现场解说一度怀疑机器走错了。
李世石离开座位,到吸烟室待了十几分钟。回到棋盘前,他最终还是输掉了这一局。
后来人们反复谈论这一手,把它视为机器第一次公开走出人类经验边界的时刻。
那场比赛的 100 万美元奖金,也很有当时 DeepMind 的气质。哈萨比斯甚至没有事先完成 Google 的财务审批,就先把这笔奖金承诺了出去。
等 AlphaGo 获胜,奖金最终被捐给慈善机构和围棋组织。
科学问题先于财务流程,那是实验室的黄金年代。
随后是 AlphaZero、MuZero,以及 AlphaFold。
过去,科学家通过实验解析一个蛋白质结构,往往要花几个月甚至几年。AlphaFold 把氨基酸序列变成三维结构预测,DeepMind 又与欧洲生物信息学研究所建立免费数据库,把超过两亿个预测结构放进去,覆盖了科学界已知蛋白质中的绝大部分。
来自 190 多个国家的 300 多万名研究人员使用过它。AlphaFold 没有按月收费,也没有一条可以拿到财报上展示的商业增长曲线。它替无数科学家省下实验室里的年月,给 Google 带回两枚诺贝尔奖章,而在商业方面却几乎没有对应的收入。
ChatGPT 带来的压力之下,已经淡出 Google 日常工作的联合创始人谢尔盖·布林也回来了。
布林后来回忆,自己在一个小型聚会上碰到一名 OpenAI 员工,对方问他:
「你到底在干什么?这可能是计算机科学有史以来最具变革性的时刻。」
布林觉得对方说得对,于是此后越来越深地参与 Gemini。
2023 年,皮查伊把 Google Brain 与 DeepMind 合并为 Google DeepMind,哈萨比斯成为 CEO,Jeff Dean 成为首席科学家。这看起来是哈萨比斯权力的顶点,也恰恰是旧 DeepMind 作为独立实验室的终点。
它被接进 Google 的模型、应用和商业系统,成了整家公司的 AI 引擎。如今接过 DeepMind 日常管理工作的 Koray,负责 Gemini 模型、前沿研究、Gemini 应用和开发者团队。
皮查伊在公告里不断强调「加速」「快速行动」和即将发布的新模型。
十三年前,Google 给 DeepMind 的,是时间。
十三年后,Google 最缺的,恰好也是时间。
把钟表往回拨一格
2026 年夏天,离开的几乎都是前 LLM 时代旧故事里的人。
AlphaFold 项目负责人 John Jumper 去了 Anthropic;Transformer 论文作者、Gemini 联合负责人 Noam Shazeer 去了 OpenAI。
随后,Jeff Dean 与 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 一起创办 Discovery Loop。Jeff Dean 和 Ghemawat 搭建过 Google 早期最重要的分布式系统,Vinyals 和 Quoc Le 则长期位于 Google 现代 AI 研究的中心。
Discovery Loop 被注册成一家公益公司。Jeff Dean 在告别信里解释,独立公司的意义之一,就是可以作出一些「不一定符合公司最纯粹财务利益」的决定。
Google 成了 Discovery Loop 的创始投资者和云计算合作伙伴。它没能把这群人继续留在自己的组织架构里,于是决定花钱,让他们到外面继续做事。
前 LLM 时代大概就是这样散场的。
没有人当众撕毁理想,也没有谁摔门而去。旧实验室被接进产品线,旧科学家带着母公司的资金去外面继续研究,所有人都留足了体面。
哈萨比斯现在还没离开,但那份始于 2013 年城堡外的约定,已经失去了赖以成立的条件,时间。
「你为什么不利用我已经创造好的一切?」
佩奇口中的那个「一切」,今天比十三年前多得多。
Google 有更多的钱、机器、工程师和数据中心,多到巴菲特愿意拿出 100 亿美元,押注这些庞大的投入最终能够产生回报。
可佩奇当年递给哈萨比斯的核心资产,正在变得越来越少。
那是把十年交给一个问题的胆量,是允许一群科学家暂时不看日历的奢侈。
从太浩湖 731 号房间里倒扣的垃圾桶,到 Alphabet 一年近 2000 亿美元的资本开支,AI 只用了十四年。房间变成数据中心,三个人的小公司变成几十万块芯片支撑的工业体系,一小时一次的人才竞价,也变成了按季度计算的模型竞赛。那群人把 AI 从一个小圈子做成了这个时代最庞大的工业体系,等这一切终于大到难以想象,他们开始一个接一个地离开。
哈萨比斯原本也要走,Google 把他离职的钟表指针往回拨了一格。
可它拨不回 2013 年。
原文链接
Статья
DeepSeek牵手宇树:当智能便宜到可以被浪费的时候原文标题:《DeepSeek牵手宇树:当智能便宜到可以被浪费的时候》 原文作者:动察Beating 技术真正开始改变世界,往往发生在它便宜到可以被浪费的时候。 最近,连外媒都开始学会了一个很中国互联网的词,斩杀线。 7 月 31 日,DeepSeek V4 Flash 更新。在 Artificial Analysis 那张同时比较模型智能水平和使用成本的坐标图里,纵轴越往上,模型越聪明;横轴越往右,调用成本越高。V4 Flash 的智能指数到了 50 分,已经贴着全球第一梯队,一轮测试的平均成本却只有 3 美分。那个点几乎被推到了坐标系的左上角。比它便宜的模型,能力大多不如它;比它聪明的模型,又普遍贵出一大截。 现在一个模型如果没有比 DeepSeek 强出足够多,就越来越难解释自己为什么要贵几十倍。中文互联网把这条边界叫作「斩杀线」。几天以后,彭博讨论中国模型对美国 AI 公司的价格压力,标题里也直接用了「Death Zone」。 从 2024 年的 V2 开始,DeepSeek 就在不停地往下压机器「想一次」要花的钱。模型能够完成的任务越来越复杂,价格却始终没跟着能力一起往上飞涨。过去两年,大模型行业习惯用更大的参数、更长的上下文和更高的 Benchmark 讲进步,DeepSeek 一直还在追另一个标准,同样的智能,能不能少花点钱。 杭州另一边,王兴兴做了十几年另一件相似的事。 他读研究生时做 XDog,从一开始就没有多少钱可以烧。贵的液压系统用不起,就研究低成本的电机;成熟的方案买不起,就自己画驱动板、写程序、搭控制系统。很多今天已经变成宇树产品标准件的技术选择,最早都带着一种很朴素的工程习惯,先别问行业里通常怎么做,先看看有没有更便宜的办法。 王兴兴后来回忆,2010 年做双足机器人时,机械部分加起来只花了两百块钱。多年以后有人问宇树还能不能继续降成本,他回答:「不要跟我们比降成本,我们可以继续降低很多。」 一家公司在降低思考的价格,一家公司在降低行动的价格。很长一段时间里,他们虽然都在杭州,但还是在各走各的路。 直到 8 月 6 日。 宇树科技公布科创板 IPO 战略配售结果,DeepSeek 拿出 1.408 亿元认购宇树新股。双方披露的合作安排也相当直接,宇树需要模型训练服务和技术方案时优先考虑 DeepSeek,DeepSeek 需要机器人、探索具身智能应用时优先考虑宇树。 这笔钱放到今天的 AI 行业里并不算惊人。真正有意思的是,两个十几年来一直想把昂贵技术往白菜价上做的人,第一次把自己的成本曲线接到了一起。于是一个比「大模型终于给机器人接上身体」更值得追问的问题冒了出来: 如果机器思考的成本和机器行动的成本同时继续下降,AI 最后会变成什么样? 答案可能不只是「更多人用得起」。 更大的变化,是我们开始不用那么珍惜它。 两个价格屠夫 梁文锋和王兴兴身上最像的地方,是他们都不太相信靠补贴换来的便宜。价格表当然可以一夜改掉,但羊毛出在羊身上,这种低价通常撑不了多久。东西真想长期卖得便宜,最后还得回到工程里,把那些原本理所当然存在的成本一层层拆掉。 DeepSeek-V2 是最典型的一次。2024 年模型发布以后,国内大模型行业很快被拖进价格战,外界最容易看到的是 API 报价,而真正能支撑住降价的东西藏在模型结构里。V2 总参数达到 2360 亿,每处理一个 Token,实际只激活其中 210 亿;相较上一代,训练成本减少 42.5%,KV Cache 减少 93.3%,最大生成吞吐提高到 5.76 倍。 到了 V3,这个思路继续往前推。模型变得更大,正式训练用掉 278.8 万 H800 GPU 小时,DeepSeek 又通过混合专家、低精度训练、通信优化去优化效率。 这种成本观后来甚至开始反过来定义产品。 今年 5 月,DeepSeek 把 V4-Pro 原本 75% 的促销折扣直接改成永久价格,旗舰档也继续往下压。梁文锋此前解释过他们的定价原则,根据真实成本定价,不长期贴钱,也不追求暴利。 王兴兴对机器人的理解几乎一样。 2025 年接受《晚点》采访时被问到,H1 当初卖 9 万美元,后来更灵活的 G1 低配版起售价只剩 9.9 万元人民币,这样还赚不赚钱。 王兴兴回答:「商业行为肯定要有合理的商业利润。成本一直是我们做所有东西的 KPI,核心就是要赚钱。」 他随后谈的也很少是那句最常见的「规模起来供应商自然会降价」。真正决定机器人价格下限的,是电机怎么选、减速器怎么做,一个关节要用多少零件,整机还能不能再轻一点,哪些部件必须攥在自己手里。 这种降本方式有一种很强的工业时代质感,一分钱掰成两半花。 一块电路板少几厘米,一个关节少两个零件,一根线束换一种走法,单拎出来都算不上什么伟大突破,可几十个这样的变化叠在一起,最后会直接影响售价。 宇树过去几年的价格变化正是如此。2023 年,第一代全尺寸人形机器人 H1 上市,当年只卖出 5 台,平均售价 59.34 万元;2024 年,更小的 G1 进入市场,销量提高到 410 台,平均售价降到 26.07 万元;到 2025 年前九个月,人形机器人销量达到 3551 台,平均售价又降到 16.76 万元。 价格每往下降一节,机器人的买家也会迎来新的一批。五六十万元的设备,需要实验室立项、写预算、解释买回来到底准备研究什么;十几万元已经可以进入更多高校、开发团队和企业。 很多技术真正跨过普及的临界点,就是在这种变化里完成的。从专项预算变成部门预算,再从部门预算变成普通采购,最后某一天,人们懒得再为每一次使用算账。 贵的技术天然只配解决贵的问题,价格跌下来以后,那些过去根本不值得技术出场的小事,才会开始进入它的世界。 两条成本曲线终于相交 宇树自己已经在做世界模型和 VLA,所以 DeepSeek 的价值并不只是给机器人「接一个大脑」。真正能把两家公司咬合起来的,是具身智能目前最昂贵的那个训练循环。 这个循环一半发生在现实世界。机器人真的伸手、走路、拿东西,人类或者其他系统不断给它示范,产生成功和失败的轨迹。 另一半发生在计算中,数据被清洗、标注,送进模型训练新的策略,再经过推理和验证重新部署回机器人。机器出去接着试,带回来新的数据,模型再学一遍。这套循环转得越快,机器人接触到的世界越多。 问题是,它两头都贵。真机贵,团队就很难让几百台机器人一天到晚在实验室里摔跟头;训练和推理贵,那些采回来一眼看不出价值的数据,也很难被反复训练和验证。 于是过去做机器人实验总是很珍贵的。机器只有几台,今天采什么数据要提前想清楚;算力就那么多,一批轨迹值不值得再跑一遍,也得掰着指头算。资源越贵,研究人员越倾向于挑那些看起来最有价值、成功概率最高的问题。 可现实世界偏偏不是这样的。 杯子放在桌边 3 厘米和 5 厘米有什么区别,毛巾湿了一半以后该从哪里抓,抽屉卡住时是接着用力还是先往回退一点,塑料袋里装一个苹果和三个苹果时手臂要怎么调整。这些事单拎出来,没有任何一个值得开一场发布会,甚至很难值得一个实验室专门立项。可机器人一旦进入家庭、餐厅、仓库、办公室,它每天面对的世界恰恰由这些琐碎到令人厌烦的问题组成。 这时候再看 DeepSeek 和宇树的合作,逻辑会清楚很多。 宇树把前半段的成本往下压,让更多真机进入实验室、开发团队和真实场景;DeepSeek 长期解决的是后半段的问题,让模型训练、推理和验证越来越便宜。 多数轨迹最后不会进入产品,多数实验也不会产生新闻,有些机器人会连续一百次抓错杯子,一批昂贵的数据跑完,也可能只证明了最初的思路根本不成立。 资源贵的时候,这些叫打水漂;成本足够低,它们才有资格被叫作经验。 手机便宜一点,意味着更多人可以买;机器人便宜一点,还意味着它自己可以拥有更多没有产出的时间,在实验室里练一个下午,做一些最后根本用不上的动作,走进更多奇怪的环境,遇见更多工程师提前没想到的情况。 当身体和智能同时变便宜,具身智能最先得到的,就是更多犯错的资格。 人类是怎么学会浪费技术的 这种事在人类技术史上已经发生过很多次。 1865 年,英国经济学家 William Stanley Jevons 研究蒸汽机和煤炭时发现了一件反直觉的事。蒸汽机效率越来越高,每完成一项工作要烧掉的煤越来越少,英国消耗的煤却没有跟着下降,反而增加了。因为蒸汽动力一旦变便宜,过去舍不得用它干的事也开始使用它,效率省下来的煤,很快又被更多新的需求吃掉。 后来人们把这个现象叫作「杰文斯悖论」。 过去两年用 AI 的人,其实多少已经体会到了反过来的那个阶段。模型还贵的时候,我们先学会了一门怎么省智能。创业团队嘴上讨论用户体验,产品经理心里还得记着一张 Token 价格表,一个功能技术上做得到,最后也可能因为「每个用户多跑五次模型太贵了」被砍掉。 可技术真正进入生活,往往要过另一道坎,它便宜到我们开始用它做一些并不那么重要的事。 今天没人会在打开客厅的灯之前先算这一小时的照明创造了多少经济价值,也没人因为手机后台多发了几个网络请求就觉得自己挥霍了伟大的互联网基础设施。 电和网络都有成本,只是这笔成本已经低到不值得为每一次使用做决策。人在这些事上早就变得大手大脚,而且毫无愧疚。 智能如果有一天来到这里,我们和 AI 的关系也会跟着改变。会议结束顺手让模型整理一下,文章写完让几个模型分别挑毛病,一个 Agent 没做成就换几条路径接着试,有枣没枣先打三杆子。机器人收拾桌子,第一次把杯子碰倒,第二次手伸歪,第三次动作太慢,那就来第四次。 一项技术真正普及以后,人们不会越来越认真地计算它的使用效率,人甚至会忘记自己正在使用它。 等我们不再算这笔账 1911 年,英国数学家和哲学家怀特海在《数学入门》里写过一句话: 「文明的进步,在于不断扩大那些我们无需思考就能完成的重要操作。」 今天的 AI 显然还没走到这里。我们仍然在讨论哪个任务值得用最贵的模型,开发者还会因为每百万 Token 差几块钱换供应商;机器人公司还得在展厅、实验室和工厂之间,找那个最容易算过账的场景。这个行业依然有一种很重的柴米油盐感。 而这笔 1.408 亿元的投资真正链接到一起的,是一张过去很少出现在行业讨论里的账单。机器犯一次错,到底多少钱? 今天这个答案还不够便宜,所以每一条真实世界的数据都要认真采集,每一轮训练都要挑挑拣拣,每一台机器人最好尽快找到一份能算出产出的工作。 等到智能真正普及的那一天,可能不会有一场发布会宣布新时代到来。我们只是慢慢发现,一台机器人在仓库角落里练了一下午抓箱子,失败三百次,已经没人专门过问;一个 Agent 为了找答案自己试了几十条路径,也没人盯着 Token 账单心疼;实验室里多放几台机器人,不再需要为每一台写一份采购理由。 所以 AI 未来真正重要的价格,可能不是一百万 Token 究竟多少钱,也不是一台人形机器人究竟多少钱,而是我们什么时候终于懒得再算这些数字。 当机器多想几遍、多走几步、多犯几次错,都已经不值得人心疼的时候,智能才算真正从一种昂贵的能力变成基础设施。 技术真正开始改变世界,往往发生在它便宜到可以被浪费的时候。 DeepSeek 正在让思考接近这个价格,宇树正在让身体接近这个价格。剩下的事,是让机器拥有足够便宜的一生。 便宜到可以反复尝试,便宜到可以不断犯错,便宜到那些今天看起来毫无意义的失败,终于多到足够组成智能。 原文链接

DeepSeek牵手宇树:当智能便宜到可以被浪费的时候

原文标题:《DeepSeek牵手宇树:当智能便宜到可以被浪费的时候》
原文作者:动察Beating
技术真正开始改变世界,往往发生在它便宜到可以被浪费的时候。
最近,连外媒都开始学会了一个很中国互联网的词,斩杀线。
7 月 31 日,DeepSeek V4 Flash 更新。在 Artificial Analysis 那张同时比较模型智能水平和使用成本的坐标图里,纵轴越往上,模型越聪明;横轴越往右,调用成本越高。V4 Flash 的智能指数到了 50 分,已经贴着全球第一梯队,一轮测试的平均成本却只有 3 美分。那个点几乎被推到了坐标系的左上角。比它便宜的模型,能力大多不如它;比它聪明的模型,又普遍贵出一大截。
现在一个模型如果没有比 DeepSeek 强出足够多,就越来越难解释自己为什么要贵几十倍。中文互联网把这条边界叫作「斩杀线」。几天以后,彭博讨论中国模型对美国 AI 公司的价格压力,标题里也直接用了「Death Zone」。
从 2024 年的 V2 开始,DeepSeek 就在不停地往下压机器「想一次」要花的钱。模型能够完成的任务越来越复杂,价格却始终没跟着能力一起往上飞涨。过去两年,大模型行业习惯用更大的参数、更长的上下文和更高的 Benchmark 讲进步,DeepSeek 一直还在追另一个标准,同样的智能,能不能少花点钱。
杭州另一边,王兴兴做了十几年另一件相似的事。
他读研究生时做 XDog,从一开始就没有多少钱可以烧。贵的液压系统用不起,就研究低成本的电机;成熟的方案买不起,就自己画驱动板、写程序、搭控制系统。很多今天已经变成宇树产品标准件的技术选择,最早都带着一种很朴素的工程习惯,先别问行业里通常怎么做,先看看有没有更便宜的办法。
王兴兴后来回忆,2010 年做双足机器人时,机械部分加起来只花了两百块钱。多年以后有人问宇树还能不能继续降成本,他回答:「不要跟我们比降成本,我们可以继续降低很多。」
一家公司在降低思考的价格,一家公司在降低行动的价格。很长一段时间里,他们虽然都在杭州,但还是在各走各的路。
直到 8 月 6 日。
宇树科技公布科创板 IPO 战略配售结果,DeepSeek 拿出 1.408 亿元认购宇树新股。双方披露的合作安排也相当直接,宇树需要模型训练服务和技术方案时优先考虑 DeepSeek,DeepSeek 需要机器人、探索具身智能应用时优先考虑宇树。
这笔钱放到今天的 AI 行业里并不算惊人。真正有意思的是,两个十几年来一直想把昂贵技术往白菜价上做的人,第一次把自己的成本曲线接到了一起。于是一个比「大模型终于给机器人接上身体」更值得追问的问题冒了出来:
如果机器思考的成本和机器行动的成本同时继续下降,AI 最后会变成什么样?
答案可能不只是「更多人用得起」。
更大的变化,是我们开始不用那么珍惜它。
两个价格屠夫
梁文锋和王兴兴身上最像的地方,是他们都不太相信靠补贴换来的便宜。价格表当然可以一夜改掉,但羊毛出在羊身上,这种低价通常撑不了多久。东西真想长期卖得便宜,最后还得回到工程里,把那些原本理所当然存在的成本一层层拆掉。
DeepSeek-V2 是最典型的一次。2024 年模型发布以后,国内大模型行业很快被拖进价格战,外界最容易看到的是 API 报价,而真正能支撑住降价的东西藏在模型结构里。V2 总参数达到 2360 亿,每处理一个 Token,实际只激活其中 210 亿;相较上一代,训练成本减少 42.5%,KV Cache 减少 93.3%,最大生成吞吐提高到 5.76 倍。
到了 V3,这个思路继续往前推。模型变得更大,正式训练用掉 278.8 万 H800 GPU 小时,DeepSeek 又通过混合专家、低精度训练、通信优化去优化效率。
这种成本观后来甚至开始反过来定义产品。
今年 5 月,DeepSeek 把 V4-Pro 原本 75% 的促销折扣直接改成永久价格,旗舰档也继续往下压。梁文锋此前解释过他们的定价原则,根据真实成本定价,不长期贴钱,也不追求暴利。
王兴兴对机器人的理解几乎一样。
2025 年接受《晚点》采访时被问到,H1 当初卖 9 万美元,后来更灵活的 G1 低配版起售价只剩 9.9 万元人民币,这样还赚不赚钱。
王兴兴回答:「商业行为肯定要有合理的商业利润。成本一直是我们做所有东西的 KPI,核心就是要赚钱。」
他随后谈的也很少是那句最常见的「规模起来供应商自然会降价」。真正决定机器人价格下限的,是电机怎么选、减速器怎么做,一个关节要用多少零件,整机还能不能再轻一点,哪些部件必须攥在自己手里。
这种降本方式有一种很强的工业时代质感,一分钱掰成两半花。
一块电路板少几厘米,一个关节少两个零件,一根线束换一种走法,单拎出来都算不上什么伟大突破,可几十个这样的变化叠在一起,最后会直接影响售价。
宇树过去几年的价格变化正是如此。2023 年,第一代全尺寸人形机器人 H1 上市,当年只卖出 5 台,平均售价 59.34 万元;2024 年,更小的 G1 进入市场,销量提高到 410 台,平均售价降到 26.07 万元;到 2025 年前九个月,人形机器人销量达到 3551 台,平均售价又降到 16.76 万元。
价格每往下降一节,机器人的买家也会迎来新的一批。五六十万元的设备,需要实验室立项、写预算、解释买回来到底准备研究什么;十几万元已经可以进入更多高校、开发团队和企业。
很多技术真正跨过普及的临界点,就是在这种变化里完成的。从专项预算变成部门预算,再从部门预算变成普通采购,最后某一天,人们懒得再为每一次使用算账。
贵的技术天然只配解决贵的问题,价格跌下来以后,那些过去根本不值得技术出场的小事,才会开始进入它的世界。
两条成本曲线终于相交
宇树自己已经在做世界模型和 VLA,所以 DeepSeek 的价值并不只是给机器人「接一个大脑」。真正能把两家公司咬合起来的,是具身智能目前最昂贵的那个训练循环。
这个循环一半发生在现实世界。机器人真的伸手、走路、拿东西,人类或者其他系统不断给它示范,产生成功和失败的轨迹。
另一半发生在计算中,数据被清洗、标注,送进模型训练新的策略,再经过推理和验证重新部署回机器人。机器出去接着试,带回来新的数据,模型再学一遍。这套循环转得越快,机器人接触到的世界越多。
问题是,它两头都贵。真机贵,团队就很难让几百台机器人一天到晚在实验室里摔跟头;训练和推理贵,那些采回来一眼看不出价值的数据,也很难被反复训练和验证。
于是过去做机器人实验总是很珍贵的。机器只有几台,今天采什么数据要提前想清楚;算力就那么多,一批轨迹值不值得再跑一遍,也得掰着指头算。资源越贵,研究人员越倾向于挑那些看起来最有价值、成功概率最高的问题。
可现实世界偏偏不是这样的。
杯子放在桌边 3 厘米和 5 厘米有什么区别,毛巾湿了一半以后该从哪里抓,抽屉卡住时是接着用力还是先往回退一点,塑料袋里装一个苹果和三个苹果时手臂要怎么调整。这些事单拎出来,没有任何一个值得开一场发布会,甚至很难值得一个实验室专门立项。可机器人一旦进入家庭、餐厅、仓库、办公室,它每天面对的世界恰恰由这些琐碎到令人厌烦的问题组成。
这时候再看 DeepSeek 和宇树的合作,逻辑会清楚很多。
宇树把前半段的成本往下压,让更多真机进入实验室、开发团队和真实场景;DeepSeek 长期解决的是后半段的问题,让模型训练、推理和验证越来越便宜。
多数轨迹最后不会进入产品,多数实验也不会产生新闻,有些机器人会连续一百次抓错杯子,一批昂贵的数据跑完,也可能只证明了最初的思路根本不成立。
资源贵的时候,这些叫打水漂;成本足够低,它们才有资格被叫作经验。
手机便宜一点,意味着更多人可以买;机器人便宜一点,还意味着它自己可以拥有更多没有产出的时间,在实验室里练一个下午,做一些最后根本用不上的动作,走进更多奇怪的环境,遇见更多工程师提前没想到的情况。
当身体和智能同时变便宜,具身智能最先得到的,就是更多犯错的资格。
人类是怎么学会浪费技术的
这种事在人类技术史上已经发生过很多次。
1865 年,英国经济学家 William Stanley Jevons 研究蒸汽机和煤炭时发现了一件反直觉的事。蒸汽机效率越来越高,每完成一项工作要烧掉的煤越来越少,英国消耗的煤却没有跟着下降,反而增加了。因为蒸汽动力一旦变便宜,过去舍不得用它干的事也开始使用它,效率省下来的煤,很快又被更多新的需求吃掉。
后来人们把这个现象叫作「杰文斯悖论」。
过去两年用 AI 的人,其实多少已经体会到了反过来的那个阶段。模型还贵的时候,我们先学会了一门怎么省智能。创业团队嘴上讨论用户体验,产品经理心里还得记着一张 Token 价格表,一个功能技术上做得到,最后也可能因为「每个用户多跑五次模型太贵了」被砍掉。
可技术真正进入生活,往往要过另一道坎,它便宜到我们开始用它做一些并不那么重要的事。
今天没人会在打开客厅的灯之前先算这一小时的照明创造了多少经济价值,也没人因为手机后台多发了几个网络请求就觉得自己挥霍了伟大的互联网基础设施。
电和网络都有成本,只是这笔成本已经低到不值得为每一次使用做决策。人在这些事上早就变得大手大脚,而且毫无愧疚。
智能如果有一天来到这里,我们和 AI 的关系也会跟着改变。会议结束顺手让模型整理一下,文章写完让几个模型分别挑毛病,一个 Agent 没做成就换几条路径接着试,有枣没枣先打三杆子。机器人收拾桌子,第一次把杯子碰倒,第二次手伸歪,第三次动作太慢,那就来第四次。
一项技术真正普及以后,人们不会越来越认真地计算它的使用效率,人甚至会忘记自己正在使用它。
等我们不再算这笔账
1911 年,英国数学家和哲学家怀特海在《数学入门》里写过一句话:
「文明的进步,在于不断扩大那些我们无需思考就能完成的重要操作。」
今天的 AI 显然还没走到这里。我们仍然在讨论哪个任务值得用最贵的模型,开发者还会因为每百万 Token 差几块钱换供应商;机器人公司还得在展厅、实验室和工厂之间,找那个最容易算过账的场景。这个行业依然有一种很重的柴米油盐感。
而这笔 1.408 亿元的投资真正链接到一起的,是一张过去很少出现在行业讨论里的账单。机器犯一次错,到底多少钱?
今天这个答案还不够便宜,所以每一条真实世界的数据都要认真采集,每一轮训练都要挑挑拣拣,每一台机器人最好尽快找到一份能算出产出的工作。
等到智能真正普及的那一天,可能不会有一场发布会宣布新时代到来。我们只是慢慢发现,一台机器人在仓库角落里练了一下午抓箱子,失败三百次,已经没人专门过问;一个 Agent 为了找答案自己试了几十条路径,也没人盯着 Token 账单心疼;实验室里多放几台机器人,不再需要为每一台写一份采购理由。
所以 AI 未来真正重要的价格,可能不是一百万 Token 究竟多少钱,也不是一台人形机器人究竟多少钱,而是我们什么时候终于懒得再算这些数字。
当机器多想几遍、多走几步、多犯几次错,都已经不值得人心疼的时候,智能才算真正从一种昂贵的能力变成基础设施。
技术真正开始改变世界,往往发生在它便宜到可以被浪费的时候。
DeepSeek 正在让思考接近这个价格,宇树正在让身体接近这个价格。剩下的事,是让机器拥有足够便宜的一生。
便宜到可以反复尝试,便宜到可以不断犯错,便宜到那些今天看起来毫无意义的失败,终于多到足够组成智能。
原文链接
Статья
Hassabis卸任,Jeff Dean离职创业,谷歌的军心散了原文标题:《Hassabis卸任,Jeff Dean离职创业,谷歌的军心散了》 原文作者:动察Beating 8 月 5 日,Google DeepMind CEO Demis Hassabis 卸下日常管理职务,转任 DeepMind 董事长,并出任 Alphabet 首席科学家。他仍然负责长期 AI 研究,也继续领导新药研发公司 Isomorphic Labs。头衔比过去更高,但其实是一次明升暗降,手里的实际管理权变少了。 Gemini 的研发和交付将由原 DeepMind 首席技术官 Koray Kavukcuoglu 负责,直接向皮查伊汇报。Hassabis 仍然是谷歌 AI 的科学象征,继续参与 AGI 方向的判断,却不再掌握 DeepMind 的日常运转。经过这次调整,DeepMind 与 Alphabet 总部之间的管理链条进一步缩短,皮查伊也将更直接地掌握 Gemini 的研发进度。 同一天,Jeff Dean 宣布离开谷歌。 他带走了 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le,成立一家名为 Discovery Loop 的公司,希望用 AI 自动完成提出问题、设计实验、执行实验和评估结果的整个科研流程。谷歌参与了创始投资,将成为它的云服务商,并提供第一年的算力。 谷歌没有强留这支团队,而是选择继续保持资本、云服务和科研合作上的关系。对于一批已经决定创业的顶尖研究者来说,这算得上体面的处理方式。 市场仍然迅速做出了反应。Alphabet 股价盘中一度下跌超过 5%,收盘跌幅接近 4%。以这家公司的体量计算,3.8% 的跌幅对应约 1750 亿美元的市值,盘中下跌最多时,蒸发规模接近 2600 亿美元。 过去六个星期,这已经是 Alphabet 第四次因为 AI 受到市场惩罚。 Jeff Dean 与 Hassabis,谷歌 AI 的两种传统 Jeff Dean 很难被归入一般意义上的技术高管。 1999 年加入谷歌时,他是公司第 30 号员工。此后近三十年,谷歌几次最重要的技术转型,他几乎都在场。 早期搜索和广告系统需要处理迅速膨胀的数据,他和 Ghemawat 写出了 MapReduce 和 Bigtable。这些系统后来成为大规模分布式计算的基础,影响远远超出谷歌。Google Brain、TensorFlow 和 TPU 的建立,同样有他的参与。到了 Gemini 时代,他又成为模型的技术联合负责人。 谷歌今天能够训练大模型,能够在自研芯片上运行模型,也能够把模型接入搜索、云和各种消费产品,背后都能找到他参与修建的基础设施。 Hassabis 代表的是另一种能力。 2010 年,他在伦敦创办 DeepMind。2014 年,谷歌完成收购。两年后,AlphaGo 击败李世石,人工智能第一次以如此直接的方式进入全球公众视野。2024 年,他与 John Jumper 凭借 AlphaFold 获得诺贝尔化学奖。 2023 年,Google Brain 与 DeepMind 合并,Hassabis 接管整合后的 Google DeepMind。他既是 Gemini 项目的领导者,也是谷歌对外讲述 AI 未来时最重要的人物。 Dean 和 Hassabis,分别支撑着谷歌 AI 的工程传统与科学传统。如今,Dean 离开公司,Hassabis 退居二线。 六个星期里的四次暴跌 这次调整之所以引起如此强烈的市场反应,还因为它发生在谷歌 AI 连续受挫之后。 6 月,Transformer 论文作者之一、Gemini 技术联合负责人 Noam Shazeer 离开谷歌,加入 OpenAI。2024 年,谷歌刚刚通过一笔约 27 亿美元的特殊交易,将他从 Character.AI 请回公司,并安排他进入 Gemini 核心团队。两年后,Shazeer 再次离开。 随后,AlphaFold 负责人、2024 年诺贝尔化学奖得主 John Jumper 加入 Anthropic。 两天内,谷歌失去了两位极有分量的研究者。6 月 22 日,Alphabet 股价盘中一度下跌超过 7%,市值蒸发超过 2000 亿美元。 7 月 16 日,Gemini 3.5 Pro 延期的消息传出。这款旗舰模型原计划在 6 月发布,因为代码能力等指标未达到预期,进度已经推迟数月。消息公布后,Alphabet 股价盘中再次下跌超过 3%。 7 月下旬,压力转移到了财务报表上。 Alphabet 第二季度资本开支达到 449 亿美元,同比翻倍,全年资本开支指引被上调到 1950 亿至 2050 亿美元。同期,公司自由现金流转为负 59 亿美元,这是 Alphabet 历史上第一次出现季度自由现金流为负。财报发布后的第一个交易日,股价盘中跌幅超过 7%。 谷歌投入的资源越来越多,模型却没有形成与投入相称的领先优势。而且旗舰产品没有按时交付出来,负责研究和工程的核心人物又在相继离开。 Jumper 离开后,有媒体援引 DeepMind 员工的说法称,文本、图像、视频、语音和视觉等领域,谷歌已经很难找到明确处于行业最前沿的模型。 谷歌从不缺资源,甚至可以说,它拥有整个 AI 行业最完整的一套资源。 它有自研 TPU,有全球规模的数据中心,有搜索和 YouTube 积累的数据,有 Android、Chrome、Workspace 和云服务提供的分发渠道。皮查伊也在内部信中列出了一串成绩,说 Gemini 应用月活用户达到 9.5 亿,Gemma 下载量超过 9 亿,Gemini Robotics 也在继续推进。 这些资产足以证明谷歌仍然强大,却无法代替下一代旗舰模型本身。市场愿意为长期投入付钱,前提是这笔钱最终能够换来领先。模型延期与核心人员离开连续发生后,投资人开始怀疑,谷歌缺少的究竟是时间,还是把庞大资源拧成一股绳的能力。 DeepMind 告别创始人管理 接替 Hassabis 负责日常运营的 Koray Kavukcuoglu 在 DeepMind 工作了 13 年,师从杨立昆,参与过 DQN、WaveNet 和多代 Gemini 项目,过去担任 Google DeepMind 的 CTO。 Koray 熟悉 DeepMind,也长期负责连接研究、基础设施和产品。由他接管 Gemini,说明谷歌接下来更重视模型交付、产品协同和商业落地。 这次调整还改变了 DeepMind 在谷歌内部的位置。 Hassabis 时代的 DeepMind 始终保留着鲜明的创始人色彩。它从伦敦起家,被谷歌收购后仍保持相对独立的研究传统。Google Brain 与 DeepMind 合并之后,Hassabis 成为整合团队的 CEO,也让 DeepMind 的文化在新组织中占据主导地位。 如今,Hassabis 退出日常管理,Koray 直接向皮查伊汇报,DeepMind 与 Alphabet 总部的关系变得更紧密。对谷歌来说,这是一次加强控制的调整。皮查伊需要更清楚地掌握 Gemini 的研发节奏,也需要有人对模型延期、资源投入和产品落地承担直接责任。 对 DeepMind 而言,这也意味着一个阶段的结束。 Hassabis 仍然在谷歌,仍然拥有崇高的头衔,也仍然参与长期研究。但那家由创始人直接领导、以科学理想塑造组织性格的 DeepMind,正在逐渐成为 Alphabet 内部更加标准化的一支 AI 研发部门。 谷歌正在学习如何送走人才 Jeff Dean 的离职,展示了谷歌处理人才外流的另一种方式。 谷歌参与 Discovery Loop 的创始投资,继续提供云服务和算力,并与新公司保持研究合作。Dean 和他的团队虽然离开了组织,仍然处在谷歌的资本和技术生态之内。 这项安排对双方都有好处。 Discovery Loop 获得了昂贵的算力、基础设施和早期资金,不必从零开始搭建研究平台。谷歌则保留了投资回报、云订单和未来合作的可能,也避免把一批工作二十多年的核心人才直接推向竞争对手。 从公司治理角度看,这几乎已经是理想的离职方案。 但它仍然无法回答一个问题,这样一支熟悉谷歌、参与建造谷歌、也能够调用谷歌资源的团队,为什么最终认为,离开以后更容易完成自己的研究? 他们没有放弃过去的研究方向,也没有因为内部竞争失败而被迫出走。他们只是将原本在谷歌内部进行的工作,搬到一家自己能够完全掌控的新公司。 他们在谈到离开的原因时说,在大组织里,总有太多惯性需要克服,才能推动激进的变化。他们想造一些不同的东西。 谷歌过去吸引顶尖研究者,靠的是人才留在这里可以获得足够多的资源,完成其他地方无法完成的工作。 如今,一批最了解谷歌资源的人开始做出相反判断。他们依然相信那些研究值得投入,也依然相信 AI 将改变科学,只是不再相信大公司的组织方式最适合完成它。 实验室之外,新的公司开始生长 谷歌 DeepMind 让人想起贝尔实验室。 贝尔实验室依靠 AT&T 长期稳定的利润,汇集了二十世纪最优秀的一批科学家和工程师,先后诞生晶体管、激光、信息论和 Unix。它的伟大没有随着组织本身完整保存下来,却通过离开的人不断扩散。 晶体管联合发明人 William Shockley 离开贝尔实验室后,在加州创办肖克利半导体。1957 年,八名工程师集体离开,成立仙童半导体。Intel 和 AMD 的创始团队,此后又从仙童体系中分化出来。后来被称为硅谷的产业网络,很大一部分正是沿着这条人才流动的路径形成。 谷歌 DeepMind 还没有走到贝尔实验室的结局。Gemini 拥有庞大的用户,Google Cloud 仍在增长,两者的相似之处在于,一家依靠成熟商业体系供养的顶级实验室自己培养出来的人,开始到外面建立新的实验室和公司。 一家实验室最辉煌的时候,人们看它聚集了多少天才。走到下一个阶段,人们会看这些天才离开后又建成了什么。 这是一种成就,也是一种损失。对整个科技行业而言,两者可以同时成立,但是对谷歌而言,这笔账很难如此轻松地一笔勾销。 谷歌投资 Discovery Loop,可以分享这家公司未来的收益,为它提供云服务也能把算力支出重新变成收入。可一家公司能够投资外部成果,却无法借此替代内部失去的创造力。 Dean 在谷歌工作了 27 年。他说,自己大约五周前才开始认真考虑创业。 一个在公司待了近三十年的人,用五周决定离开。Discovery Loop 里仍然是那些熟悉的搭档,Ghemawat 负责系统,Vinyals 负责研究,Quoc Le 继续做自动化机器学习。人员分工没有发生太大变化,研究方向也没有突然改变,只是他们从谷歌的大楼里搬了出去。 Hassabis 在告别信中说,AGI 已经近在眼前。Dean 创办的新公司,同样押注 AI 将改变科学研究。 他们大概仍然相信同一个未来,只是开始各自奔前程。 原文链接

Hassabis卸任,Jeff Dean离职创业,谷歌的军心散了

原文标题:《Hassabis卸任,Jeff Dean离职创业,谷歌的军心散了》
原文作者:动察Beating
8 月 5 日,Google DeepMind CEO Demis Hassabis 卸下日常管理职务,转任 DeepMind 董事长,并出任 Alphabet 首席科学家。他仍然负责长期 AI 研究,也继续领导新药研发公司 Isomorphic Labs。头衔比过去更高,但其实是一次明升暗降,手里的实际管理权变少了。
Gemini 的研发和交付将由原 DeepMind 首席技术官 Koray Kavukcuoglu 负责,直接向皮查伊汇报。Hassabis 仍然是谷歌 AI 的科学象征,继续参与 AGI 方向的判断,却不再掌握 DeepMind 的日常运转。经过这次调整,DeepMind 与 Alphabet 总部之间的管理链条进一步缩短,皮查伊也将更直接地掌握 Gemini 的研发进度。
同一天,Jeff Dean 宣布离开谷歌。
他带走了 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le,成立一家名为 Discovery Loop 的公司,希望用 AI 自动完成提出问题、设计实验、执行实验和评估结果的整个科研流程。谷歌参与了创始投资,将成为它的云服务商,并提供第一年的算力。
谷歌没有强留这支团队,而是选择继续保持资本、云服务和科研合作上的关系。对于一批已经决定创业的顶尖研究者来说,这算得上体面的处理方式。
市场仍然迅速做出了反应。Alphabet 股价盘中一度下跌超过 5%,收盘跌幅接近 4%。以这家公司的体量计算,3.8% 的跌幅对应约 1750 亿美元的市值,盘中下跌最多时,蒸发规模接近 2600 亿美元。
过去六个星期,这已经是 Alphabet 第四次因为 AI 受到市场惩罚。
Jeff Dean 与 Hassabis,谷歌 AI 的两种传统
Jeff Dean 很难被归入一般意义上的技术高管。
1999 年加入谷歌时,他是公司第 30 号员工。此后近三十年,谷歌几次最重要的技术转型,他几乎都在场。
早期搜索和广告系统需要处理迅速膨胀的数据,他和 Ghemawat 写出了 MapReduce 和 Bigtable。这些系统后来成为大规模分布式计算的基础,影响远远超出谷歌。Google Brain、TensorFlow 和 TPU 的建立,同样有他的参与。到了 Gemini 时代,他又成为模型的技术联合负责人。
谷歌今天能够训练大模型,能够在自研芯片上运行模型,也能够把模型接入搜索、云和各种消费产品,背后都能找到他参与修建的基础设施。
Hassabis 代表的是另一种能力。
2010 年,他在伦敦创办 DeepMind。2014 年,谷歌完成收购。两年后,AlphaGo 击败李世石,人工智能第一次以如此直接的方式进入全球公众视野。2024 年,他与 John Jumper 凭借 AlphaFold 获得诺贝尔化学奖。
2023 年,Google Brain 与 DeepMind 合并,Hassabis 接管整合后的 Google DeepMind。他既是 Gemini 项目的领导者,也是谷歌对外讲述 AI 未来时最重要的人物。
Dean 和 Hassabis,分别支撑着谷歌 AI 的工程传统与科学传统。如今,Dean 离开公司,Hassabis 退居二线。
六个星期里的四次暴跌
这次调整之所以引起如此强烈的市场反应,还因为它发生在谷歌 AI 连续受挫之后。
6 月,Transformer 论文作者之一、Gemini 技术联合负责人 Noam Shazeer 离开谷歌,加入 OpenAI。2024 年,谷歌刚刚通过一笔约 27 亿美元的特殊交易,将他从 Character.AI 请回公司,并安排他进入 Gemini 核心团队。两年后,Shazeer 再次离开。
随后,AlphaFold 负责人、2024 年诺贝尔化学奖得主 John Jumper 加入 Anthropic。
两天内,谷歌失去了两位极有分量的研究者。6 月 22 日,Alphabet 股价盘中一度下跌超过 7%,市值蒸发超过 2000 亿美元。
7 月 16 日,Gemini 3.5 Pro 延期的消息传出。这款旗舰模型原计划在 6 月发布,因为代码能力等指标未达到预期,进度已经推迟数月。消息公布后,Alphabet 股价盘中再次下跌超过 3%。
7 月下旬,压力转移到了财务报表上。
Alphabet 第二季度资本开支达到 449 亿美元,同比翻倍,全年资本开支指引被上调到 1950 亿至 2050 亿美元。同期,公司自由现金流转为负 59 亿美元,这是 Alphabet 历史上第一次出现季度自由现金流为负。财报发布后的第一个交易日,股价盘中跌幅超过 7%。
谷歌投入的资源越来越多,模型却没有形成与投入相称的领先优势。而且旗舰产品没有按时交付出来,负责研究和工程的核心人物又在相继离开。
Jumper 离开后,有媒体援引 DeepMind 员工的说法称,文本、图像、视频、语音和视觉等领域,谷歌已经很难找到明确处于行业最前沿的模型。
谷歌从不缺资源,甚至可以说,它拥有整个 AI 行业最完整的一套资源。
它有自研 TPU,有全球规模的数据中心,有搜索和 YouTube 积累的数据,有 Android、Chrome、Workspace 和云服务提供的分发渠道。皮查伊也在内部信中列出了一串成绩,说 Gemini 应用月活用户达到 9.5 亿,Gemma 下载量超过 9 亿,Gemini Robotics 也在继续推进。
这些资产足以证明谷歌仍然强大,却无法代替下一代旗舰模型本身。市场愿意为长期投入付钱,前提是这笔钱最终能够换来领先。模型延期与核心人员离开连续发生后,投资人开始怀疑,谷歌缺少的究竟是时间,还是把庞大资源拧成一股绳的能力。
DeepMind 告别创始人管理
接替 Hassabis 负责日常运营的 Koray Kavukcuoglu 在 DeepMind 工作了 13 年,师从杨立昆,参与过 DQN、WaveNet 和多代 Gemini 项目,过去担任 Google DeepMind 的 CTO。
Koray 熟悉 DeepMind,也长期负责连接研究、基础设施和产品。由他接管 Gemini,说明谷歌接下来更重视模型交付、产品协同和商业落地。
这次调整还改变了 DeepMind 在谷歌内部的位置。
Hassabis 时代的 DeepMind 始终保留着鲜明的创始人色彩。它从伦敦起家,被谷歌收购后仍保持相对独立的研究传统。Google Brain 与 DeepMind 合并之后,Hassabis 成为整合团队的 CEO,也让 DeepMind 的文化在新组织中占据主导地位。
如今,Hassabis 退出日常管理,Koray 直接向皮查伊汇报,DeepMind 与 Alphabet 总部的关系变得更紧密。对谷歌来说,这是一次加强控制的调整。皮查伊需要更清楚地掌握 Gemini 的研发节奏,也需要有人对模型延期、资源投入和产品落地承担直接责任。
对 DeepMind 而言,这也意味着一个阶段的结束。
Hassabis 仍然在谷歌,仍然拥有崇高的头衔,也仍然参与长期研究。但那家由创始人直接领导、以科学理想塑造组织性格的 DeepMind,正在逐渐成为 Alphabet 内部更加标准化的一支 AI 研发部门。
谷歌正在学习如何送走人才
Jeff Dean 的离职,展示了谷歌处理人才外流的另一种方式。
谷歌参与 Discovery Loop 的创始投资,继续提供云服务和算力,并与新公司保持研究合作。Dean 和他的团队虽然离开了组织,仍然处在谷歌的资本和技术生态之内。
这项安排对双方都有好处。
Discovery Loop 获得了昂贵的算力、基础设施和早期资金,不必从零开始搭建研究平台。谷歌则保留了投资回报、云订单和未来合作的可能,也避免把一批工作二十多年的核心人才直接推向竞争对手。
从公司治理角度看,这几乎已经是理想的离职方案。
但它仍然无法回答一个问题,这样一支熟悉谷歌、参与建造谷歌、也能够调用谷歌资源的团队,为什么最终认为,离开以后更容易完成自己的研究?
他们没有放弃过去的研究方向,也没有因为内部竞争失败而被迫出走。他们只是将原本在谷歌内部进行的工作,搬到一家自己能够完全掌控的新公司。
他们在谈到离开的原因时说,在大组织里,总有太多惯性需要克服,才能推动激进的变化。他们想造一些不同的东西。
谷歌过去吸引顶尖研究者,靠的是人才留在这里可以获得足够多的资源,完成其他地方无法完成的工作。
如今,一批最了解谷歌资源的人开始做出相反判断。他们依然相信那些研究值得投入,也依然相信 AI 将改变科学,只是不再相信大公司的组织方式最适合完成它。
实验室之外,新的公司开始生长
谷歌 DeepMind 让人想起贝尔实验室。
贝尔实验室依靠 AT&T 长期稳定的利润,汇集了二十世纪最优秀的一批科学家和工程师,先后诞生晶体管、激光、信息论和 Unix。它的伟大没有随着组织本身完整保存下来,却通过离开的人不断扩散。
晶体管联合发明人 William Shockley 离开贝尔实验室后,在加州创办肖克利半导体。1957 年,八名工程师集体离开,成立仙童半导体。Intel 和 AMD 的创始团队,此后又从仙童体系中分化出来。后来被称为硅谷的产业网络,很大一部分正是沿着这条人才流动的路径形成。
谷歌 DeepMind 还没有走到贝尔实验室的结局。Gemini 拥有庞大的用户,Google Cloud 仍在增长,两者的相似之处在于,一家依靠成熟商业体系供养的顶级实验室自己培养出来的人,开始到外面建立新的实验室和公司。
一家实验室最辉煌的时候,人们看它聚集了多少天才。走到下一个阶段,人们会看这些天才离开后又建成了什么。
这是一种成就,也是一种损失。对整个科技行业而言,两者可以同时成立,但是对谷歌而言,这笔账很难如此轻松地一笔勾销。
谷歌投资 Discovery Loop,可以分享这家公司未来的收益,为它提供云服务也能把算力支出重新变成收入。可一家公司能够投资外部成果,却无法借此替代内部失去的创造力。
Dean 在谷歌工作了 27 年。他说,自己大约五周前才开始认真考虑创业。
一个在公司待了近三十年的人,用五周决定离开。Discovery Loop 里仍然是那些熟悉的搭档,Ghemawat 负责系统,Vinyals 负责研究,Quoc Le 继续做自动化机器学习。人员分工没有发生太大变化,研究方向也没有突然改变,只是他们从谷歌的大楼里搬了出去。
Hassabis 在告别信中说,AGI 已经近在眼前。Dean 创办的新公司,同样押注 AI 将改变科学研究。
他们大概仍然相信同一个未来,只是开始各自奔前程。
原文链接
Статья
梁文锋青年往事:八万本金、一台菲亚特和一个人的长征原文标题:《梁文锋青年往事:八万本金、一台菲亚特和一个人的长征》 原文作者:动察Beating 2025 年 1 月 27 日,星期一。梁文锋正在吴川的一片球场上,和几个初中同学踢球。 七天前,DeepSeek-R1 发布。七天后,消息越过太平洋,在美国资本市场掀起震荡。英伟达股价单日跌去超过 16%,市值蒸发近六千亿美元。美国媒体翻出冷战年代的旧词,把这一天称作新的「斯普特尼克时刻」。 DeepSeek 已经登上中美两国应用商店免费榜榜首。硅谷的人在一夜之间学会了念一个陌生的中国名字,采访邮件从世界各地涌向杭州,记者四处打听梁文锋去了哪里。 没有人找到他。 那天下午,他穿着球衣,在粤西一座县级市的球场上来回奔跑。球落到脚边,他接住,转身,再传出去。场外的世界正在为他震动,球场上的比赛还在继续。 第二天是除夕。梁文锋回到米历岭村,村口已经拉起一条横幅,红底白字写着:「热烈欢迎文锋,家乡的骄傲与希望。」 游客一拨接一拨地来,站在横幅下面拍照。有人弯下腰,从路边抓起一把泥土,小心收好,像是想从这座村庄里带走一点好运。梁文锋的高中同学陈先生告诉记者,他答应了会回吴川过年,只是回来以后,要找个地方躲起来。 米历岭村的孩子 1985 年,梁文锋出生在吴川市覃巴镇米历岭村。 吴川在粤西,三面被江水环抱,南边朝着海。鉴江从北面一路下来,到了这里忽然转过一道弯,再向南流入大海。过去跑水路的商船常在江湾停泊,岸边货栈相接,人声嘈杂,这座县城因此得过一个颇有气势的名字,「小佛山」。 吴川也相信读书。清代状元林召棠的故乡霞街村,离米历岭村不远。县志里记载着这里出了一个状元,二十名进士,一百六十五名举人。几百年间,一代代年轻人从这里出发,沿着同一条窄窄的路,去往县城、省城和京城。功名早已成为旧事,读书能够改命的念头,却一直留在这片土地上。 米历岭村也有自己的故事,村里老人提起先辈,会说到抗日将领梁华盛,也会说到 1936 年从中山大学毕业的梁太熙。按照村里的记载,解放以后,已有近百名学生从这里考入全国重点大学。 可梁文锋长在九十年代。那是广东的金钱年代,工厂在招人,生意在冒头,沿海的城市一天一个样。一个年轻人肯吃苦、敢闯荡,未必需要在教室里坐很多年,也有机会挣到从前不敢想的钱。相比之下,读书太慢了,要一年一年熬,最后能换来什么谁也说不准。 村里不少家长认定读书没有用,甚至专程走到梁家,劝他的父亲别再让孩子念下去。那时,米历岭村几百年积攒下来的功名想象,正被广东新鲜、滚烫的财富故事盖过去。 很多年后,梁文锋在一次采访里说起这段往事: 「我是八十年代在广东一个五线城市长大的。我的父亲是小学老师,九十年代,广东赚钱机会很多,当时有不少家长到我家里来,基本就是家长觉得读书没用。但现在回去看,观念都变了。因为钱不好赚了,连开出租车的机会可能都没了。一代人的时间就变了。」 「一代人的时间就变了。」 这句话是说九十年代,也是说 2024 年。说这话的时候,他正在做另一件同样慢、同样难以解释的事。 梁文锋的父亲在梅菉小学教书,后来做了教导副主任,母亲也是教师,在边岭小学任教。这个家庭与科研没有多少关系,阁楼上却常年堆着书。据地方媒体报道,藏书最多时有上千本。 父亲给家里定过两条规矩。饭桌上不谈学习,只谈一家人的生活;吃过晚饭,全家人各自找一本书读。梁文锋考得好不好,父亲很少追问。他更常说的一句话是,解决问题比分数重要。 梁家最值钱的电器,是一台飞跃牌收音机。黑色的外壳,金属旋钮,一根可以一节节抽长的天线。拧动开关,喇叭里先传出沙沙的电流声,调准频率以后,遥远地方的声音才从噪声里慢慢浮出来。 梁文锋读四年级时,把这台收音机拆了。螺丝卸下来,外壳打开,里面密密麻麻的线头和零件露在桌面上。他拆完再装,装好又拆,据说前后折腾了三十七次。 父亲没有教过他电路,也没有拦着,只在旁边递给他一把螺丝刀,嘱咐一句:「拆完记得装回去。」 后来家里有了电视,梁文锋就开始拆电视。有一回梁文锋把电视拆坏了,父亲没有骂他,也没有没收工具,只看着那台再也亮不起来的电视,问他:「下一次,怎样才能不把我的电视机拆坏?」 他的学前班在梅岭小学,小学在梅菉小学。小学班主任李老师记得,他上课时很少走神,碰上难题尤其专注,善于总结方法。六年级那年,他获得全国奥数二等奖,也是在那一年,考进吴川一中。 初中三年,他的总成绩在全年级一百名上下,不算拔尖,数学竞赛却常常拿第一。1999 年中考,他考了 819 分,只比吴川一中的录取线高出二十多分。 高一,他从年级一百名冲进前十。高三班主任兼数学老师杨亚宏说,这孩子不张扬,作业从来不用老师操心,在数学小组里兴致特别高,每年都参加省数学竞赛,至少拿三等奖。初中班主任容老师也说,他初中就自学完了高中数学,开始读大学数学,文静,但不是书呆子,仿佛不需要花很多时间,就能学好每一个学科。初中那几年,他迷上电脑,拆拆装装,还帮学校修过电脑。 2002 年夏天,高考放榜。梁文锋考了 806 分,满分 900,成为当年的湛江市高考状元。 填报志愿时,他只写了浙江大学,理由是这里的信息与电子工程专业好。 杨亚宏问他确不确定,他说确定。 后来有报道说,他那个分数,本可以去清华。 不上课的人 2002 年秋天,梁文锋到杭州,念浙江大学电子信息工程专业。 他很少上课。多年以后,知乎上有个同届不同班的同学出来回忆,说梁文锋大多数时间自学,觉得老师进度慢,浪费时间。大二那年,同学在赶作业,他已经自己画电路板、写单片机程序、做界面,做出一个类似 miniplayer 的软件。 他还把一把普通吉他改成电吉他,音色可以接进电脑调节。做完以后,他没有觉得这东西多了不起,只嫌吉他的音准不够好,说要是能自动调音,就更好了。 大三暑假,他和两个同学组队,参加全国大学生电子设计竞赛。三个人平时专业成绩都不是前几名。浙大校内集训的时候,很多设计题目几乎是梁文锋一个人搞定。最后,他们拿到浙江省第一名、全国一等奖。 奖项到十月才公布,已经错过当年的保研窗口。梁文锋因此晚了一年读研。空出来的那一年,他继续做电子传感系统,据说与海洋导航有关,硬件、软件和算法仍由他一个人包办。本科同学后来评价,他在大学里做过的那些电子系统,随便挑出一个,当作电子系的硕士论文都绰绰有余。 他还骑车穷游。大学期间,他骑着一辆自行车跑遍华东几个省,白天赶路,晚上在野外打地铺,一圈下来没花多少钱。这个故事是他的电设队友在浙大校内论坛讲述的,那个帖子的标题还把「梁文锋」写成了「梁文峰」。 2007 年,他开始在浙江大学攻读信息与通信工程硕士,研究方向是机器视觉,导师项志宇。项志宇本科、硕士、博士都在浙大,之后曾赴葡萄牙阿威罗大学和美国俄亥俄州立大学从事博士后研究,回国后一直留在计算机视觉领域。 梁文锋的毕业论文题目是《基于低成本 PTZ 摄像机的目标跟踪算法研究》,2010 年 5 月提交。 他要解决的问题,是让一台价格不高、能够转动的摄像机,在光线、遮挡和背景不断变化的环境里,持续盯住一个移动的目标。设备有限,环境复杂。论文致谢里他写,项老师领他进入机器视觉的大门,为他准备学习计划,经常是逐行代码地进行指导。 2011 年,这篇论文经过改写,发表在《浙江大学学报(工学版)》上。文末的作者简介只有一行: 梁文锋,1985 年生,广东湛江人,硕士生,从事机器视觉研究。 档案到此为止,工整,干净,像一个标准的好学生。 多年以后再看,那篇论文里已经出现了一个他后来需要反复处理的问题:怎样在有限的条件下,识别真正重要的目标,并且一直做下去。 八万本金 2008 年,金融危机。A 股从 6124 点的高位一路跌到 1664 点,交易大厅里一片惨绿,腰斩再腰斩,很多人账户里的数字只剩下零头。 那年正在读研二的梁文锋从一片狼藉里看见另一件事,他认为这个动荡的市场里,也许藏着突破口。他拉上想法一致的同学,研究把机器学习用在交易上。 据媒体后来的转述,2008 年前后,浙大玉泉校区的实验室里,几个研究机器视觉的学生开始琢磨一种「外挂炒股软件」,他们最初的念头并不宏大,只是想把之前亏掉的钱赚回来。一开始,他们写的程序在股市上还是多亏少赚。反复修正优化策略之后,才开始赚钱。那个被他们叫作「外挂」的东西,在金融行业有一个更正式的名字,量化交易。 当年行情数据没有现在这么好拿,从行情软件的画面里截取数字,又自己写程序,设法接入交易软件。研究摄像头的本事,被他用在了盯盘上。他还四处搜集数据,托关系从金融机构手里拿,然后建模,调参数,他没日没夜地写代码,常常熬夜到凌晨。 梁文锋一开始的本金只有 8 万块。8 万块放在今天,不够买一台顶配显卡。放在 2008 年,它是梁文锋的全部身家。他没有跟任何人解释这场豪赌,在别人忙着刷简历、找实习的年纪,他天天对着屏幕忙活。他很少向人解释自己究竟在做什么。那时,量化交易在中国还没有成为一个体面的职业名字。 2009 年,他去上海艾麒信息实习。公司是浙大校友周朝恩创办的,他没毕业就被任命为新技术部经理,月薪一万六,负责 AI 视频图像技术。离职的时候,周朝恩给了个建议,去找毛利高的业务。这句话梁文锋记了很多年,2023 年两人重逢,他还主动提起。 不过艾麒信息只是他生活里的一条支线。2009 年,他一边领着高薪,一边为量化交易做准备。在他自己的人生规划里,那才是主线。 2010 年 6 月,实验室里的三个同学硕士毕业。一个进了大厂,一个选择创业,另一个去了成都,继续埋头做那些旁人看不懂的东西。 去成都的是梁文锋。 成都的出租屋,开往西藏的菲亚特 梁文锋在成都的出租屋不足十平米,昏暗潮湿,里面只有一张破旧书桌和一张单人床。饿了就吃泡面,累了趴在桌上小憩。房间小得放不下一张床和一张书桌以外的东西,可一个人全部的将来,都挤在这间屋里。 名校研究生毕业,不去大厂,不进体制,天天对着屏幕。2010 年的语境里,这是标准反面教材。没有人知道他对着屏幕在做什么。暗涌的报道里说他毕业后「躲在成都廉价出租屋里,不停接受进入诸多场景中尝试的挫败」。 2010 年 4 月 16 日,沪深 300 股指期货挂牌上市,主力合约开盘 3450 点。中国资本市场第一次有了成熟的做空和对冲工具,也终于为量化交易推开了一扇门。 梁文锋等的正是这扇门。 据后来的报道,那两年,他把大部分时间耗在成都的出租屋里,反复测试着他的想法。这些价格看上去混乱,背后却未必毫无规律。只要数据足够多,模型足够准确,也许就能从那些涨跌里找到一套可以重复的解释。 这也是西蒙斯留给后来者的信念。西蒙斯原本是一名数学家,后来创办文艺复兴科技,用数学模型和计算机程序进行交易,旗下大奖章基金也由此成为量化投资史上最著名的基金之一。他相信,市场价格看似杂乱,背后依然存在可以被识别和计算的规律。一定有办法为价格建模,难处只在于,能不能把那套办法找出来。 同一时期,梁文锋身边还有一群同样不安分的年轻人。有人窝在深圳的城中村里,研究看上去不太靠谱的飞行器,也曾邀请他一起加入。梁文锋没有去。后来,那群人做出了大疆。 2011 年的他不知道自己和那些朋友的未来。那年的他,只有一个还没跑通的模型,一间租来的小屋,和一辆车。 那年 10 月,梁文锋 26 岁。那一年微博刚刚热闹起来,人们在上面晒生活,也晒孤独。就在那个秋天,他开着一辆菲亚特,去了西藏。 那并不是什么适合远征的车。菲亚特是意大利的老牌汽车,当年在中国卖得不贵,五六万元就能买到一辆,是街上随处可见的普通小车。后来品牌退出中国市场,那些车也慢慢从公路上消失了。 梁文锋管它叫「坐骑」。 出发的时候,那辆车已经快散架了。 这一路,他都在发微博。把那些微博一条一条摊开,就是一页一页的日记。 「10 月 19 日,拉萨。 回到拉萨。感动~」 回到拉萨,也是郑钧那首老歌的名字,以前自驾进藏的人,脑子里大概都盘旋过这旋律。 「10 月 24 日,羊卓雍措。 古道西风瘦马,夕阳西下。」 羊卓雍措在海拔 4441 米的地方,湖面六百多平方公里,湖岸线两百多公里。他拍湖,拍雪山,拍那辆菲亚特。 「10 月 25 日。 一览众山小。」 「10 月 26 日,雅鲁藏布江边。 一骑走天下。」 「10 月 27 日,喜马拉雅山。 菲亚特到此一游。西藏,喜马拉雅山,雪山的另一边是印度。」 「10 月 28 日,湖边。 那个湖其实有几公里宽,雪山还有几十公里远。」 梁文锋继续向西。 他经过雍布拉康。那座宫殿立在山头,是西藏历史上最早的宫殿,比布达拉宫还要古老。随后,他沿着喜马拉雅山北麓往珠峰方向走,从正北和正西拍下雪山,再穿过希夏邦马自然保护区,进入阿里。 阿里平均海拔超过四千五百米,人们叫它「世界屋脊的屋脊」。那里的空气只剩下平原的一半左右,公路穿过荒原,往往几百公里见不到人烟。 梁文锋把菲亚特开了进去。 然后,他在微博上消失了一个星期。 再次出现时,他开始补发沿途的照片。进入无人区两百公里,他拍到藏羚羊;四百公里处,雪地上空盘旋着鹰。照片下面,他写: 「风萧萧兮易水寒~」 一路上,他仍旧用那些旧诗句替自己说话,直到 2011 年 11 月 7 日,他发出了最后一条微博: 「被困无人区一个星期。所幸我出来了。但我的菲亚特没有出来。它永远地留在那片漫无边际的高山草原。That's the END。」 此后,梁文锋再也没有更新过微博。2014 年 8 月 19 日,这个账号被盗。那个曾经拍湖、拍雪山,也会在评论区里和陌生人说笑的年轻人,慢慢从互联网上消失了。他的后半生,是从丢车那天开始的。 最后是去是留 西藏之行以后,梁文锋停止更新自己的微博,却没有从那群浙大朋友的时间线里彻底消失。 那些年,他们仍会在评论区里互相出题,讨论数学、游戏,也打听彼此最后决定去哪里。徐进和郑达韡,是其中出现最多的两个名字。几年以后,他们会和梁文锋一起创办雅克比,成为幻方最早的班底。可在 2012 年的微博里,他们仍只是几个站在人生路口的年轻人。 2012 年 8 月 23 日,郑达韡在微博上出了一道题:一只蚂蚁只能沿着立方体的棱爬行,从一个顶点出发,走到与它相对的顶点。它每到一个顶点便随机选择下一条边,求最终路程的数学期望。 郑达韡艾特了梁文锋和徐进。梁文锋回复:「那道题貌似我和徐进都没做出来,肯定要比 4 大。」 后来,许多人重新计算过这道题,答案是 10。他当时没有给出证明,只判断答案一定大于 4。方向是对的。 就在这道题底下,他问了郑达韡一句: 「最后是去是留?」 这句话没有上下文,也没有更多解释。放回当时,它或许只是朋友之间一句寻常的询问。多年以后再看,却像一个很早的邀请,一道尚未解出的数学题,一群仍在选择去处的年轻人,以及一个还没有名字的团队。 郑达韡后来加入幻方,也成为 DeepSeek 的核心成员。徐进同样走进了梁文锋此后的创业故事。 郑达韡留下了四千多条微博。把它们一条一条翻看,能看见一个年轻人从学生时代走向社会,也能看见那一代技术青年曾经怎样谈论自己的人生。 他说自己前后经历过四次保送,省下四年,没有把时间浪费在应试上。他把人生画成一个三角,三个角分别是喜爱、努力和玩耍。他想做「让人感动的产品」,也希望推动新的技术,让自己的父母有一天也能享受到科技带来的变化。 这些理想之间,夹着大量更年轻、更粗粝的东西。他打 Dota,写「宁可少一个人,也不要猪一样的队友」;也转发过一句在程序员中流传很广的话,大意是,我们这一代最聪明的头脑,正在研究怎样让人们多点一次广告。 崇高和玩笑并排出现在同一条时间线上。那时的人不觉得这有什么矛盾。他们讨论数学,也讨论游戏;想改变世界,也会为了一个糟糕的游戏队友生气。微博还没有成为精心修剪的个人橱窗,一个人说过的话,往往就那么杂乱地留在那里。 徐进的微博删得差不多了,残存的帖子里,有人问起保送,他回答得很直接:「因为可以不用读高三。」 他的履历随后被人们重新翻出来:浙江大学竺可桢学院混合班,博士阶段研究机器人导航,还参与过「玉兔号」月球车视觉导航相关项目。那个在微博上嫌高三浪费时间的人,后来真的把机器送到了一片还没有路的地方。 这段青年往事不只属于梁文锋。后来组成幻方、走进 DeepSeek 的一些人,那时已经在同一张松散的关系网里相遇。对技术的迷恋,对低效规则的不耐烦,对聪明同伴近乎苛刻的看重,都比公司更早出现。 幻方还没有名字,它最初的性格就已经在微博时代长好了。 2013 年,梁文锋从成都回到杭州。他和徐进、郑达韡决定继续做「外挂炒股」,共同创业,理由是「可比上班赚钱多了」。 2013 年 9 月 10 日,杭州雅克比投资管理有限公司注册,注册资本 10 万元。梁文锋持股 50.5%,徐进、姚峰峰、郑达韡各 16.5%。公司名字来自德国数学家卡尔·雅克比。 两年后,市场又替他们推开了一扇门。 2015 年 4 月,中证 500 股指期货上市,量化交易者手里多了新的对冲工具。两个月后,杭州幻方科技成立。名字取自中国古代的洛书九宫图,一种横竖斜相加都相等的矩阵。同年,他们搬进杭州环城北路的汇金国际大厦,当时杭州少有的新建高档写字楼,租金昂贵,入驻的大多是私募机构。 2015 年 12 月,水木社区出现了一则招聘启事。启事没有直接写梁文锋的名字,只用第三人称讲述了一个「L 先生」的故事: 2008 年,L 先生带着 8 万元本金,开始了自己独立的量化交易之路。2015 年,经历过 7 年熊市牛市大轮回的 L 先生,以每年超过 100% 的复合收益率,迈入了亿元富豪的队伍。 启事还写道,中国的量化交易即将告别单兵游侠的年代,走向极客汇聚的私募基金时代。L 先生的理想,是有一天能够与西蒙斯创办的文艺复兴科技站在同一张牌桌上。 一个很少谈论自己的人,第一次向陌生人讲述自己的过去,却把自己藏在一个字母后面。他用第三人称写自己,语气平静得像是在整理另一个人的履历。 八万元,七年,过亿。 这是他的青年时代最完整的一张毕业证,也是写给世界的第一封自白。 西藏的微博日记写给自己,水木社区的招聘启事写给未来的同伴。两份文字之间,隔着四年,也隔着一辆永远没有驶出阿里无人区的菲亚特。 萤火 2016 年 10 月 21 日,幻方第一个由深度学习模型生成的股票仓位正式上线实盘。也是从这一天起,GPU 进入了幻方的交易系统。 八年前,梁文锋还要从行情软件的画面里截取数据,自己寻找接口,逐条修改规则。如今,股票买什么、卖什么、仓位放多少,开始交给模型计算。人退到更远的地方,负责准备数据、设计系统,再等待机器给出答案。 2019 年,梁文锋在金牛奖颁奖礼上解释过两者的区别。人做投资决策时,依赖经验和感觉,更接近一种艺术;程序做决策时,面对的是一个可以求解的问题,背后应当存在更优的答案。 从 2008 年到 2016 年,他花了八年时间,试图把自己从每一次具体的判断中拿掉。模型不需要兴奋,也不会恐慌,更不会因为前一天的亏损改变脾气。它只接收数据,计算概率,然后执行。 做量化的人,常常从相信自己的判断开始,最后却要建立一套不再需要自己判断的系统。梁文锋走到这里,已经可以管理更大的资金,继续把这台机器打磨得更精确。 可他没有停在资金规模上。 系统要继续变聪明,需要更多数据、更复杂的模型,也需要越来越多的算力。幻方的 GPU 数量由此沿着一条陡峭的曲线向上增长。梁文锋后来回忆,最早只有一张卡,到 2015 年增加到一百张,2019 年达到一千张,此后又走向一万张。 2019 年,幻方投入近两亿元,建成「萤火一号」。这套计算集群拥有约一千一百块 GPU,占地接近一个篮球场。两年后,「萤火二号」落成,投入十亿元,装入约一万张英伟达 A100。单是一个机房的面积,就接近十个篮球场。 量化私募赚到钱以后,通常会扩大规模、招募交易员,或者寻找更多策略。梁文锋把其中很大一部分钱换成了显卡、机柜和持续轰鸣的计算设备。当时,中国的大模型产业尚未真正起步,没有多少人知道如此庞大的算力最终能用来做什么。 有人问他,为什么要买这么多显卡。 梁文锋回答,一件激动人心的事,或许不能只用资金衡量。就像家里买一架钢琴,一是买得起,二是确实有人想弹。 2018 年,一家财经媒体到幻方调研。梁文锋捧着保温杯,穿一件深蓝色工装绒棉衬衫,身形瘦削,神情略显拘谨,看上去像从上世纪九十年代走来的工程师。 采访原定半小时,最后谈了两个多小时。只要问到技术,他几乎有问必答;碰上难以准确描述的地方,便停下来想一会儿,赧然地笑笑。 记者问,幻方怎样考核员工。 梁文锋说,公司没有什么考核指标。一个人如果长期没有做出贡献,首先应该反思的,是公司有没有把他放到合适的位置上。 记者又问,幻方最终想成为一家怎样的公司。 他想了一会儿,说,希望有一天,可以不收业绩报酬和管理费。停顿片刻,他又补充,真正想做的,是一个开源的策略平台,让普通投资者也能使用。 那时的幻方仍是一家量化私募,开源、普惠这些词,从他的嘴里说出来,多少显得离生意有些远。可梁文锋似乎一直不太满足于只把技术变成少数人的优势。他赚到钱,接下来想的却是怎样把那套能力拆开,让更多人拿得到。 后来他在 DeepSeek 做的许多事,早在这次采访里露出了轮廓。2018 年的保温杯旁,那个不善闲谈的工程师,已经把这些想法说了出来。 2021 年 8 月,幻方管理规模突破千亿,和九坤、明汯、灵均并称量化四大天王。 四个月后,回撤来了。 2021 年 12 月 28 日,幻方发布公开说明,称公司遭遇成立以来最大的业绩回撤,并为此「深感愧疚」。随后,幻方关闭募集通道,主动压缩管理规模。过去几年迅速膨胀的数字开始往回退,那台曾经高速运转的资金机器,第一次显出失速的迹象。 传奇不是一路向上的。 幻方收缩规模的那几年,资金退潮,外界的掌声也渐渐稀薄。与此同时,那些已经买下的显卡、建成的机房和聚集起来的年轻工程师,开始被用于另一件尚未得到证明的事。 幻方缩水的那几年,恰好是 DeepSeek 孕育的那几年。这一点,当时没有人看得出来,包括他自己。 尾声 2023 年 1 月,幻方公告 2022 年度的捐赠,公司捐了 2.2 亿元,其中一位署名「一只平凡的小猪」的员工,个人捐了 1.38 亿。外界猜来猜去,认为那只小猪就是梁文锋。 三个月后,幻方发布公告,宣布进入大模型领域。海报上引用了特吕弗写给青年导演的话: 「务必要疯狂地怀抱雄心,且还要疯狂地真诚。」 彼时,国内大模型创业已经挤满了互联网大厂、明星创业者和资本。幻方从量化市场旁边突然拐进来,多少显得不合时宜。它没有云业务,没有搜索入口,也没有庞大的用户体系,手里真正确定的东西,只有算力、工程师和一笔从量化市场赚来的钱。 2023 年 7 月,杭州深度求索人工智能基础技术研究有限公司成立。团队大约一百四十人,许多成员是刚离开校园的清华、北大毕业生,平均年龄不到三十岁。 有人问梁文锋,为什么不去争抢那些已经成名、经验丰富的人。 他说,选人的标准始终是热爱和好奇心。世界最顶尖的前五十名人才,也许暂时不在中国,但中国可以自己培养出那样的人。 2024 年 5 月,DeepSeek-V2 发布,输入每百万 token 1 元、输出 2 元,国产大模型的价格战由此被推向新的阶段。梁文锋后来形容,他们并没有打算做一条搅动市场的鲶鱼,只是不小心成了鲶鱼。 但低价只是结果。 暗涌问他,为什么一定要往最难的地方走。过去几十年,中国科技公司最熟悉的路径,是等美国做出底层创新,再把技术拿回来,做产品、铺市场、跑规模。这条路走得快,也确实赚到了钱。 梁文锋说,随着经济的发展,中国必须逐步从技术的受益者转变为贡献者,不能一直依赖别人的成果。 过去三十年的 IT 革命里,中国几乎没有真正参与过核心技术创新。更快的芯片、更好的软件、更新的架构,总会在十八个月之后来到这里。摩尔定律像一场准时抵达的季风,人们习惯了站在岸上等待,也渐渐忘了,风从哪里来。 梁文锋不想再等。 现在,轮到中国给世界做贡献了。 同年 12 月 26 日,DeepSeek-V3 发布。官方披露,最终训练阶段使用了 2048 张英伟达 H800,计算成本约 557.6 万美元。 低成本是他的母题。八万元本金,一台价格不高的 PTZ 摄像机,一辆五六万元的菲亚特,再到五百五十七万六千美元的训练账单。他似乎总在有限的条件里找到一条路。资源不够多时,方法能不能更精确;设备不够昂贵时,系统能不能更聪明。 2025 年 1 月 20 日,DeepSeek-R1 发布,推理能力进入全球顶尖模型的行列,并以 MIT 协议开放。同一天,国务院总理李强主持召开专家、企业家和教科文卫体等领域代表座谈会,梁文锋在场,发言谈到国产大模型的发展。 七天后,DeepSeek 让英伟达市值单日蒸发近六千亿美元。那个春节,他仍旧回了吴川。大年初一上午,他便离开了村子。 2025 年 2 月 17 日,民营企业座谈会召开,梁文锋坐在第一排。按照媒体报道,他在那场会议上没有发言。此后相当长一段时间,他也很少公开露面。世界仍在讨论 DeepSeek,他本人再次从人群里退了出去。 传闻梁文锋的微信签名是「把世界拆成数学」。这个没法证实,但挺像他。从拆那台飞跃牌收音机开始,他一辈子都在做同一件事,打开外壳,辨认里面的结构,找到能够运转的规律。 西蒙斯四十四岁创办文艺复兴科技。梁文锋四十岁时,已经在量化市场里度过十六年。两个人都曾相信,杂乱的价格背后存在可以计算的秩序。只是走到后来,梁文锋试图建模的,已经不再只是价格。 2011 年 11 月 7 日,他在微博里写,那辆菲亚特永远留在了阿里漫无边际的高山草原。那是他留给互联网的最后一篇日记。此后,他很少再讲述自己的生活。 在梁文锋留给互联网的最后一条微博里,那辆菲亚特永远停在了阿里的高山草原上。 此后的岁月里,风从荒原上吹过,草一季一季倒伏。人们不知道那辆车后来去了哪里。对读过那条微博的人来说,它似乎一直留在那里,铁皮慢慢锈下去,最终成为无人区的一部分。 人是从那儿走出来的。走出来的人,不必再回头。 原文链接

梁文锋青年往事:八万本金、一台菲亚特和一个人的长征

原文标题:《梁文锋青年往事:八万本金、一台菲亚特和一个人的长征》
原文作者:动察Beating
2025 年 1 月 27 日,星期一。梁文锋正在吴川的一片球场上,和几个初中同学踢球。
七天前,DeepSeek-R1 发布。七天后,消息越过太平洋,在美国资本市场掀起震荡。英伟达股价单日跌去超过 16%,市值蒸发近六千亿美元。美国媒体翻出冷战年代的旧词,把这一天称作新的「斯普特尼克时刻」。
DeepSeek 已经登上中美两国应用商店免费榜榜首。硅谷的人在一夜之间学会了念一个陌生的中国名字,采访邮件从世界各地涌向杭州,记者四处打听梁文锋去了哪里。
没有人找到他。
那天下午,他穿着球衣,在粤西一座县级市的球场上来回奔跑。球落到脚边,他接住,转身,再传出去。场外的世界正在为他震动,球场上的比赛还在继续。
第二天是除夕。梁文锋回到米历岭村,村口已经拉起一条横幅,红底白字写着:「热烈欢迎文锋,家乡的骄傲与希望。」
游客一拨接一拨地来,站在横幅下面拍照。有人弯下腰,从路边抓起一把泥土,小心收好,像是想从这座村庄里带走一点好运。梁文锋的高中同学陈先生告诉记者,他答应了会回吴川过年,只是回来以后,要找个地方躲起来。
米历岭村的孩子
1985 年,梁文锋出生在吴川市覃巴镇米历岭村。
吴川在粤西,三面被江水环抱,南边朝着海。鉴江从北面一路下来,到了这里忽然转过一道弯,再向南流入大海。过去跑水路的商船常在江湾停泊,岸边货栈相接,人声嘈杂,这座县城因此得过一个颇有气势的名字,「小佛山」。
吴川也相信读书。清代状元林召棠的故乡霞街村,离米历岭村不远。县志里记载着这里出了一个状元,二十名进士,一百六十五名举人。几百年间,一代代年轻人从这里出发,沿着同一条窄窄的路,去往县城、省城和京城。功名早已成为旧事,读书能够改命的念头,却一直留在这片土地上。
米历岭村也有自己的故事,村里老人提起先辈,会说到抗日将领梁华盛,也会说到 1936 年从中山大学毕业的梁太熙。按照村里的记载,解放以后,已有近百名学生从这里考入全国重点大学。
可梁文锋长在九十年代。那是广东的金钱年代,工厂在招人,生意在冒头,沿海的城市一天一个样。一个年轻人肯吃苦、敢闯荡,未必需要在教室里坐很多年,也有机会挣到从前不敢想的钱。相比之下,读书太慢了,要一年一年熬,最后能换来什么谁也说不准。
村里不少家长认定读书没有用,甚至专程走到梁家,劝他的父亲别再让孩子念下去。那时,米历岭村几百年积攒下来的功名想象,正被广东新鲜、滚烫的财富故事盖过去。
很多年后,梁文锋在一次采访里说起这段往事:
「我是八十年代在广东一个五线城市长大的。我的父亲是小学老师,九十年代,广东赚钱机会很多,当时有不少家长到我家里来,基本就是家长觉得读书没用。但现在回去看,观念都变了。因为钱不好赚了,连开出租车的机会可能都没了。一代人的时间就变了。」
「一代人的时间就变了。」
这句话是说九十年代,也是说 2024 年。说这话的时候,他正在做另一件同样慢、同样难以解释的事。
梁文锋的父亲在梅菉小学教书,后来做了教导副主任,母亲也是教师,在边岭小学任教。这个家庭与科研没有多少关系,阁楼上却常年堆着书。据地方媒体报道,藏书最多时有上千本。
父亲给家里定过两条规矩。饭桌上不谈学习,只谈一家人的生活;吃过晚饭,全家人各自找一本书读。梁文锋考得好不好,父亲很少追问。他更常说的一句话是,解决问题比分数重要。
梁家最值钱的电器,是一台飞跃牌收音机。黑色的外壳,金属旋钮,一根可以一节节抽长的天线。拧动开关,喇叭里先传出沙沙的电流声,调准频率以后,遥远地方的声音才从噪声里慢慢浮出来。
梁文锋读四年级时,把这台收音机拆了。螺丝卸下来,外壳打开,里面密密麻麻的线头和零件露在桌面上。他拆完再装,装好又拆,据说前后折腾了三十七次。
父亲没有教过他电路,也没有拦着,只在旁边递给他一把螺丝刀,嘱咐一句:「拆完记得装回去。」
后来家里有了电视,梁文锋就开始拆电视。有一回梁文锋把电视拆坏了,父亲没有骂他,也没有没收工具,只看着那台再也亮不起来的电视,问他:「下一次,怎样才能不把我的电视机拆坏?」
他的学前班在梅岭小学,小学在梅菉小学。小学班主任李老师记得,他上课时很少走神,碰上难题尤其专注,善于总结方法。六年级那年,他获得全国奥数二等奖,也是在那一年,考进吴川一中。
初中三年,他的总成绩在全年级一百名上下,不算拔尖,数学竞赛却常常拿第一。1999 年中考,他考了 819 分,只比吴川一中的录取线高出二十多分。
高一,他从年级一百名冲进前十。高三班主任兼数学老师杨亚宏说,这孩子不张扬,作业从来不用老师操心,在数学小组里兴致特别高,每年都参加省数学竞赛,至少拿三等奖。初中班主任容老师也说,他初中就自学完了高中数学,开始读大学数学,文静,但不是书呆子,仿佛不需要花很多时间,就能学好每一个学科。初中那几年,他迷上电脑,拆拆装装,还帮学校修过电脑。
2002 年夏天,高考放榜。梁文锋考了 806 分,满分 900,成为当年的湛江市高考状元。
填报志愿时,他只写了浙江大学,理由是这里的信息与电子工程专业好。
杨亚宏问他确不确定,他说确定。
后来有报道说,他那个分数,本可以去清华。
不上课的人
2002 年秋天,梁文锋到杭州,念浙江大学电子信息工程专业。
他很少上课。多年以后,知乎上有个同届不同班的同学出来回忆,说梁文锋大多数时间自学,觉得老师进度慢,浪费时间。大二那年,同学在赶作业,他已经自己画电路板、写单片机程序、做界面,做出一个类似 miniplayer 的软件。
他还把一把普通吉他改成电吉他,音色可以接进电脑调节。做完以后,他没有觉得这东西多了不起,只嫌吉他的音准不够好,说要是能自动调音,就更好了。
大三暑假,他和两个同学组队,参加全国大学生电子设计竞赛。三个人平时专业成绩都不是前几名。浙大校内集训的时候,很多设计题目几乎是梁文锋一个人搞定。最后,他们拿到浙江省第一名、全国一等奖。
奖项到十月才公布,已经错过当年的保研窗口。梁文锋因此晚了一年读研。空出来的那一年,他继续做电子传感系统,据说与海洋导航有关,硬件、软件和算法仍由他一个人包办。本科同学后来评价,他在大学里做过的那些电子系统,随便挑出一个,当作电子系的硕士论文都绰绰有余。
他还骑车穷游。大学期间,他骑着一辆自行车跑遍华东几个省,白天赶路,晚上在野外打地铺,一圈下来没花多少钱。这个故事是他的电设队友在浙大校内论坛讲述的,那个帖子的标题还把「梁文锋」写成了「梁文峰」。
2007 年,他开始在浙江大学攻读信息与通信工程硕士,研究方向是机器视觉,导师项志宇。项志宇本科、硕士、博士都在浙大,之后曾赴葡萄牙阿威罗大学和美国俄亥俄州立大学从事博士后研究,回国后一直留在计算机视觉领域。
梁文锋的毕业论文题目是《基于低成本 PTZ 摄像机的目标跟踪算法研究》,2010 年 5 月提交。
他要解决的问题,是让一台价格不高、能够转动的摄像机,在光线、遮挡和背景不断变化的环境里,持续盯住一个移动的目标。设备有限,环境复杂。论文致谢里他写,项老师领他进入机器视觉的大门,为他准备学习计划,经常是逐行代码地进行指导。
2011 年,这篇论文经过改写,发表在《浙江大学学报(工学版)》上。文末的作者简介只有一行:
梁文锋,1985 年生,广东湛江人,硕士生,从事机器视觉研究。
档案到此为止,工整,干净,像一个标准的好学生。
多年以后再看,那篇论文里已经出现了一个他后来需要反复处理的问题:怎样在有限的条件下,识别真正重要的目标,并且一直做下去。
八万本金
2008 年,金融危机。A 股从 6124 点的高位一路跌到 1664 点,交易大厅里一片惨绿,腰斩再腰斩,很多人账户里的数字只剩下零头。
那年正在读研二的梁文锋从一片狼藉里看见另一件事,他认为这个动荡的市场里,也许藏着突破口。他拉上想法一致的同学,研究把机器学习用在交易上。
据媒体后来的转述,2008 年前后,浙大玉泉校区的实验室里,几个研究机器视觉的学生开始琢磨一种「外挂炒股软件」,他们最初的念头并不宏大,只是想把之前亏掉的钱赚回来。一开始,他们写的程序在股市上还是多亏少赚。反复修正优化策略之后,才开始赚钱。那个被他们叫作「外挂」的东西,在金融行业有一个更正式的名字,量化交易。
当年行情数据没有现在这么好拿,从行情软件的画面里截取数字,又自己写程序,设法接入交易软件。研究摄像头的本事,被他用在了盯盘上。他还四处搜集数据,托关系从金融机构手里拿,然后建模,调参数,他没日没夜地写代码,常常熬夜到凌晨。
梁文锋一开始的本金只有 8 万块。8 万块放在今天,不够买一台顶配显卡。放在 2008 年,它是梁文锋的全部身家。他没有跟任何人解释这场豪赌,在别人忙着刷简历、找实习的年纪,他天天对着屏幕忙活。他很少向人解释自己究竟在做什么。那时,量化交易在中国还没有成为一个体面的职业名字。
2009 年,他去上海艾麒信息实习。公司是浙大校友周朝恩创办的,他没毕业就被任命为新技术部经理,月薪一万六,负责 AI 视频图像技术。离职的时候,周朝恩给了个建议,去找毛利高的业务。这句话梁文锋记了很多年,2023 年两人重逢,他还主动提起。
不过艾麒信息只是他生活里的一条支线。2009 年,他一边领着高薪,一边为量化交易做准备。在他自己的人生规划里,那才是主线。
2010 年 6 月,实验室里的三个同学硕士毕业。一个进了大厂,一个选择创业,另一个去了成都,继续埋头做那些旁人看不懂的东西。
去成都的是梁文锋。
成都的出租屋,开往西藏的菲亚特
梁文锋在成都的出租屋不足十平米,昏暗潮湿,里面只有一张破旧书桌和一张单人床。饿了就吃泡面,累了趴在桌上小憩。房间小得放不下一张床和一张书桌以外的东西,可一个人全部的将来,都挤在这间屋里。
名校研究生毕业,不去大厂,不进体制,天天对着屏幕。2010 年的语境里,这是标准反面教材。没有人知道他对着屏幕在做什么。暗涌的报道里说他毕业后「躲在成都廉价出租屋里,不停接受进入诸多场景中尝试的挫败」。
2010 年 4 月 16 日,沪深 300 股指期货挂牌上市,主力合约开盘 3450 点。中国资本市场第一次有了成熟的做空和对冲工具,也终于为量化交易推开了一扇门。
梁文锋等的正是这扇门。
据后来的报道,那两年,他把大部分时间耗在成都的出租屋里,反复测试着他的想法。这些价格看上去混乱,背后却未必毫无规律。只要数据足够多,模型足够准确,也许就能从那些涨跌里找到一套可以重复的解释。
这也是西蒙斯留给后来者的信念。西蒙斯原本是一名数学家,后来创办文艺复兴科技,用数学模型和计算机程序进行交易,旗下大奖章基金也由此成为量化投资史上最著名的基金之一。他相信,市场价格看似杂乱,背后依然存在可以被识别和计算的规律。一定有办法为价格建模,难处只在于,能不能把那套办法找出来。
同一时期,梁文锋身边还有一群同样不安分的年轻人。有人窝在深圳的城中村里,研究看上去不太靠谱的飞行器,也曾邀请他一起加入。梁文锋没有去。后来,那群人做出了大疆。
2011 年的他不知道自己和那些朋友的未来。那年的他,只有一个还没跑通的模型,一间租来的小屋,和一辆车。
那年 10 月,梁文锋 26 岁。那一年微博刚刚热闹起来,人们在上面晒生活,也晒孤独。就在那个秋天,他开着一辆菲亚特,去了西藏。
那并不是什么适合远征的车。菲亚特是意大利的老牌汽车,当年在中国卖得不贵,五六万元就能买到一辆,是街上随处可见的普通小车。后来品牌退出中国市场,那些车也慢慢从公路上消失了。
梁文锋管它叫「坐骑」。
出发的时候,那辆车已经快散架了。
这一路,他都在发微博。把那些微博一条一条摊开,就是一页一页的日记。
「10 月 19 日,拉萨。 回到拉萨。感动~」
回到拉萨,也是郑钧那首老歌的名字,以前自驾进藏的人,脑子里大概都盘旋过这旋律。
「10 月 24 日,羊卓雍措。 古道西风瘦马,夕阳西下。」
羊卓雍措在海拔 4441 米的地方,湖面六百多平方公里,湖岸线两百多公里。他拍湖,拍雪山,拍那辆菲亚特。
「10 月 25 日。 一览众山小。」
「10 月 26 日,雅鲁藏布江边。 一骑走天下。」
「10 月 27 日,喜马拉雅山。 菲亚特到此一游。西藏,喜马拉雅山,雪山的另一边是印度。」
「10 月 28 日,湖边。 那个湖其实有几公里宽,雪山还有几十公里远。」
梁文锋继续向西。
他经过雍布拉康。那座宫殿立在山头,是西藏历史上最早的宫殿,比布达拉宫还要古老。随后,他沿着喜马拉雅山北麓往珠峰方向走,从正北和正西拍下雪山,再穿过希夏邦马自然保护区,进入阿里。
阿里平均海拔超过四千五百米,人们叫它「世界屋脊的屋脊」。那里的空气只剩下平原的一半左右,公路穿过荒原,往往几百公里见不到人烟。
梁文锋把菲亚特开了进去。
然后,他在微博上消失了一个星期。
再次出现时,他开始补发沿途的照片。进入无人区两百公里,他拍到藏羚羊;四百公里处,雪地上空盘旋着鹰。照片下面,他写:
「风萧萧兮易水寒~」
一路上,他仍旧用那些旧诗句替自己说话,直到 2011 年 11 月 7 日,他发出了最后一条微博:
「被困无人区一个星期。所幸我出来了。但我的菲亚特没有出来。它永远地留在那片漫无边际的高山草原。That's the END。」
此后,梁文锋再也没有更新过微博。2014 年 8 月 19 日,这个账号被盗。那个曾经拍湖、拍雪山,也会在评论区里和陌生人说笑的年轻人,慢慢从互联网上消失了。他的后半生,是从丢车那天开始的。
最后是去是留
西藏之行以后,梁文锋停止更新自己的微博,却没有从那群浙大朋友的时间线里彻底消失。
那些年,他们仍会在评论区里互相出题,讨论数学、游戏,也打听彼此最后决定去哪里。徐进和郑达韡,是其中出现最多的两个名字。几年以后,他们会和梁文锋一起创办雅克比,成为幻方最早的班底。可在 2012 年的微博里,他们仍只是几个站在人生路口的年轻人。
2012 年 8 月 23 日,郑达韡在微博上出了一道题:一只蚂蚁只能沿着立方体的棱爬行,从一个顶点出发,走到与它相对的顶点。它每到一个顶点便随机选择下一条边,求最终路程的数学期望。
郑达韡艾特了梁文锋和徐进。梁文锋回复:「那道题貌似我和徐进都没做出来,肯定要比 4 大。」
后来,许多人重新计算过这道题,答案是 10。他当时没有给出证明,只判断答案一定大于 4。方向是对的。
就在这道题底下,他问了郑达韡一句:
「最后是去是留?」
这句话没有上下文,也没有更多解释。放回当时,它或许只是朋友之间一句寻常的询问。多年以后再看,却像一个很早的邀请,一道尚未解出的数学题,一群仍在选择去处的年轻人,以及一个还没有名字的团队。
郑达韡后来加入幻方,也成为 DeepSeek 的核心成员。徐进同样走进了梁文锋此后的创业故事。
郑达韡留下了四千多条微博。把它们一条一条翻看,能看见一个年轻人从学生时代走向社会,也能看见那一代技术青年曾经怎样谈论自己的人生。
他说自己前后经历过四次保送,省下四年,没有把时间浪费在应试上。他把人生画成一个三角,三个角分别是喜爱、努力和玩耍。他想做「让人感动的产品」,也希望推动新的技术,让自己的父母有一天也能享受到科技带来的变化。
这些理想之间,夹着大量更年轻、更粗粝的东西。他打 Dota,写「宁可少一个人,也不要猪一样的队友」;也转发过一句在程序员中流传很广的话,大意是,我们这一代最聪明的头脑,正在研究怎样让人们多点一次广告。
崇高和玩笑并排出现在同一条时间线上。那时的人不觉得这有什么矛盾。他们讨论数学,也讨论游戏;想改变世界,也会为了一个糟糕的游戏队友生气。微博还没有成为精心修剪的个人橱窗,一个人说过的话,往往就那么杂乱地留在那里。
徐进的微博删得差不多了,残存的帖子里,有人问起保送,他回答得很直接:「因为可以不用读高三。」
他的履历随后被人们重新翻出来:浙江大学竺可桢学院混合班,博士阶段研究机器人导航,还参与过「玉兔号」月球车视觉导航相关项目。那个在微博上嫌高三浪费时间的人,后来真的把机器送到了一片还没有路的地方。
这段青年往事不只属于梁文锋。后来组成幻方、走进 DeepSeek 的一些人,那时已经在同一张松散的关系网里相遇。对技术的迷恋,对低效规则的不耐烦,对聪明同伴近乎苛刻的看重,都比公司更早出现。
幻方还没有名字,它最初的性格就已经在微博时代长好了。
2013 年,梁文锋从成都回到杭州。他和徐进、郑达韡决定继续做「外挂炒股」,共同创业,理由是「可比上班赚钱多了」。
2013 年 9 月 10 日,杭州雅克比投资管理有限公司注册,注册资本 10 万元。梁文锋持股 50.5%,徐进、姚峰峰、郑达韡各 16.5%。公司名字来自德国数学家卡尔·雅克比。
两年后,市场又替他们推开了一扇门。
2015 年 4 月,中证 500 股指期货上市,量化交易者手里多了新的对冲工具。两个月后,杭州幻方科技成立。名字取自中国古代的洛书九宫图,一种横竖斜相加都相等的矩阵。同年,他们搬进杭州环城北路的汇金国际大厦,当时杭州少有的新建高档写字楼,租金昂贵,入驻的大多是私募机构。
2015 年 12 月,水木社区出现了一则招聘启事。启事没有直接写梁文锋的名字,只用第三人称讲述了一个「L 先生」的故事:
2008 年,L 先生带着 8 万元本金,开始了自己独立的量化交易之路。2015 年,经历过 7 年熊市牛市大轮回的 L 先生,以每年超过 100% 的复合收益率,迈入了亿元富豪的队伍。
启事还写道,中国的量化交易即将告别单兵游侠的年代,走向极客汇聚的私募基金时代。L 先生的理想,是有一天能够与西蒙斯创办的文艺复兴科技站在同一张牌桌上。
一个很少谈论自己的人,第一次向陌生人讲述自己的过去,却把自己藏在一个字母后面。他用第三人称写自己,语气平静得像是在整理另一个人的履历。
八万元,七年,过亿。
这是他的青年时代最完整的一张毕业证,也是写给世界的第一封自白。
西藏的微博日记写给自己,水木社区的招聘启事写给未来的同伴。两份文字之间,隔着四年,也隔着一辆永远没有驶出阿里无人区的菲亚特。
萤火
2016 年 10 月 21 日,幻方第一个由深度学习模型生成的股票仓位正式上线实盘。也是从这一天起,GPU 进入了幻方的交易系统。
八年前,梁文锋还要从行情软件的画面里截取数据,自己寻找接口,逐条修改规则。如今,股票买什么、卖什么、仓位放多少,开始交给模型计算。人退到更远的地方,负责准备数据、设计系统,再等待机器给出答案。
2019 年,梁文锋在金牛奖颁奖礼上解释过两者的区别。人做投资决策时,依赖经验和感觉,更接近一种艺术;程序做决策时,面对的是一个可以求解的问题,背后应当存在更优的答案。
从 2008 年到 2016 年,他花了八年时间,试图把自己从每一次具体的判断中拿掉。模型不需要兴奋,也不会恐慌,更不会因为前一天的亏损改变脾气。它只接收数据,计算概率,然后执行。
做量化的人,常常从相信自己的判断开始,最后却要建立一套不再需要自己判断的系统。梁文锋走到这里,已经可以管理更大的资金,继续把这台机器打磨得更精确。
可他没有停在资金规模上。
系统要继续变聪明,需要更多数据、更复杂的模型,也需要越来越多的算力。幻方的 GPU 数量由此沿着一条陡峭的曲线向上增长。梁文锋后来回忆,最早只有一张卡,到 2015 年增加到一百张,2019 年达到一千张,此后又走向一万张。
2019 年,幻方投入近两亿元,建成「萤火一号」。这套计算集群拥有约一千一百块 GPU,占地接近一个篮球场。两年后,「萤火二号」落成,投入十亿元,装入约一万张英伟达 A100。单是一个机房的面积,就接近十个篮球场。
量化私募赚到钱以后,通常会扩大规模、招募交易员,或者寻找更多策略。梁文锋把其中很大一部分钱换成了显卡、机柜和持续轰鸣的计算设备。当时,中国的大模型产业尚未真正起步,没有多少人知道如此庞大的算力最终能用来做什么。
有人问他,为什么要买这么多显卡。
梁文锋回答,一件激动人心的事,或许不能只用资金衡量。就像家里买一架钢琴,一是买得起,二是确实有人想弹。
2018 年,一家财经媒体到幻方调研。梁文锋捧着保温杯,穿一件深蓝色工装绒棉衬衫,身形瘦削,神情略显拘谨,看上去像从上世纪九十年代走来的工程师。
采访原定半小时,最后谈了两个多小时。只要问到技术,他几乎有问必答;碰上难以准确描述的地方,便停下来想一会儿,赧然地笑笑。
记者问,幻方怎样考核员工。
梁文锋说,公司没有什么考核指标。一个人如果长期没有做出贡献,首先应该反思的,是公司有没有把他放到合适的位置上。
记者又问,幻方最终想成为一家怎样的公司。
他想了一会儿,说,希望有一天,可以不收业绩报酬和管理费。停顿片刻,他又补充,真正想做的,是一个开源的策略平台,让普通投资者也能使用。
那时的幻方仍是一家量化私募,开源、普惠这些词,从他的嘴里说出来,多少显得离生意有些远。可梁文锋似乎一直不太满足于只把技术变成少数人的优势。他赚到钱,接下来想的却是怎样把那套能力拆开,让更多人拿得到。
后来他在 DeepSeek 做的许多事,早在这次采访里露出了轮廓。2018 年的保温杯旁,那个不善闲谈的工程师,已经把这些想法说了出来。
2021 年 8 月,幻方管理规模突破千亿,和九坤、明汯、灵均并称量化四大天王。
四个月后,回撤来了。
2021 年 12 月 28 日,幻方发布公开说明,称公司遭遇成立以来最大的业绩回撤,并为此「深感愧疚」。随后,幻方关闭募集通道,主动压缩管理规模。过去几年迅速膨胀的数字开始往回退,那台曾经高速运转的资金机器,第一次显出失速的迹象。
传奇不是一路向上的。
幻方收缩规模的那几年,资金退潮,外界的掌声也渐渐稀薄。与此同时,那些已经买下的显卡、建成的机房和聚集起来的年轻工程师,开始被用于另一件尚未得到证明的事。
幻方缩水的那几年,恰好是 DeepSeek 孕育的那几年。这一点,当时没有人看得出来,包括他自己。
尾声
2023 年 1 月,幻方公告 2022 年度的捐赠,公司捐了 2.2 亿元,其中一位署名「一只平凡的小猪」的员工,个人捐了 1.38 亿。外界猜来猜去,认为那只小猪就是梁文锋。
三个月后,幻方发布公告,宣布进入大模型领域。海报上引用了特吕弗写给青年导演的话:
「务必要疯狂地怀抱雄心,且还要疯狂地真诚。」
彼时,国内大模型创业已经挤满了互联网大厂、明星创业者和资本。幻方从量化市场旁边突然拐进来,多少显得不合时宜。它没有云业务,没有搜索入口,也没有庞大的用户体系,手里真正确定的东西,只有算力、工程师和一笔从量化市场赚来的钱。
2023 年 7 月,杭州深度求索人工智能基础技术研究有限公司成立。团队大约一百四十人,许多成员是刚离开校园的清华、北大毕业生,平均年龄不到三十岁。
有人问梁文锋,为什么不去争抢那些已经成名、经验丰富的人。
他说,选人的标准始终是热爱和好奇心。世界最顶尖的前五十名人才,也许暂时不在中国,但中国可以自己培养出那样的人。
2024 年 5 月,DeepSeek-V2 发布,输入每百万 token 1 元、输出 2 元,国产大模型的价格战由此被推向新的阶段。梁文锋后来形容,他们并没有打算做一条搅动市场的鲶鱼,只是不小心成了鲶鱼。
但低价只是结果。
暗涌问他,为什么一定要往最难的地方走。过去几十年,中国科技公司最熟悉的路径,是等美国做出底层创新,再把技术拿回来,做产品、铺市场、跑规模。这条路走得快,也确实赚到了钱。
梁文锋说,随着经济的发展,中国必须逐步从技术的受益者转变为贡献者,不能一直依赖别人的成果。
过去三十年的 IT 革命里,中国几乎没有真正参与过核心技术创新。更快的芯片、更好的软件、更新的架构,总会在十八个月之后来到这里。摩尔定律像一场准时抵达的季风,人们习惯了站在岸上等待,也渐渐忘了,风从哪里来。
梁文锋不想再等。
现在,轮到中国给世界做贡献了。
同年 12 月 26 日,DeepSeek-V3 发布。官方披露,最终训练阶段使用了 2048 张英伟达 H800,计算成本约 557.6 万美元。
低成本是他的母题。八万元本金,一台价格不高的 PTZ 摄像机,一辆五六万元的菲亚特,再到五百五十七万六千美元的训练账单。他似乎总在有限的条件里找到一条路。资源不够多时,方法能不能更精确;设备不够昂贵时,系统能不能更聪明。
2025 年 1 月 20 日,DeepSeek-R1 发布,推理能力进入全球顶尖模型的行列,并以 MIT 协议开放。同一天,国务院总理李强主持召开专家、企业家和教科文卫体等领域代表座谈会,梁文锋在场,发言谈到国产大模型的发展。
七天后,DeepSeek 让英伟达市值单日蒸发近六千亿美元。那个春节,他仍旧回了吴川。大年初一上午,他便离开了村子。
2025 年 2 月 17 日,民营企业座谈会召开,梁文锋坐在第一排。按照媒体报道,他在那场会议上没有发言。此后相当长一段时间,他也很少公开露面。世界仍在讨论 DeepSeek,他本人再次从人群里退了出去。
传闻梁文锋的微信签名是「把世界拆成数学」。这个没法证实,但挺像他。从拆那台飞跃牌收音机开始,他一辈子都在做同一件事,打开外壳,辨认里面的结构,找到能够运转的规律。
西蒙斯四十四岁创办文艺复兴科技。梁文锋四十岁时,已经在量化市场里度过十六年。两个人都曾相信,杂乱的价格背后存在可以计算的秩序。只是走到后来,梁文锋试图建模的,已经不再只是价格。
2011 年 11 月 7 日,他在微博里写,那辆菲亚特永远留在了阿里漫无边际的高山草原。那是他留给互联网的最后一篇日记。此后,他很少再讲述自己的生活。
在梁文锋留给互联网的最后一条微博里,那辆菲亚特永远停在了阿里的高山草原上。
此后的岁月里,风从荒原上吹过,草一季一季倒伏。人们不知道那辆车后来去了哪里。对读过那条微博的人来说,它似乎一直留在那里,铁皮慢慢锈下去,最终成为无人区的一部分。
人是从那儿走出来的。走出来的人,不必再回头。
原文链接
Статья
抄中国作业的硅谷,下一道题是AI应用原文标题:《抄中国作业的硅谷,下一道题是AI应用》 原文作者:动察Beating 硅谷开始抄中国的作业了。 最近,美国冒出了一批低价开放模型,目标是能力追上中国的开源模型,价格也压到同一个水平。 Mira Murati 的 Thinking Machines Lab 上个月发布了第一款模型 Inkling。官方说明里写了两件事,底层架构参考 DeepSeek-V3,后训练数据由 Kimi K2.5 生成。 硅谷最贵的一批人,用中国开源模型的骨架,喂中国模型生成的数据。放在两年前,这种事只会反过来发生。 今年早些时候,Arcee AI 的 Trinity-Large-Thinking 在 PinchBench 上拿到 91.9 分,比 Anthropic 的 Opus 4.6 低 1.4 分,价格是后者的 4%。 Arcee AI 的 CEO Mark McQuade 说:「我们正在努力让美国追赶并超越中国。」 硅谷现在照着抄的,已经不只是模型,还有中国公司打下来的价格。 架构可以借鉴,训练方法可以复现,数据能交给别的模型批量生成。权重一旦放出去,开发者还能接着开发。价格这件事更简单,只要有一家先砍下来,剩下的迟早都得跟上。 过去三年,大模型公司靠参数、算力和闭源起了朱楼,也宴了宾客。现在这栋楼眼看着就要塌了。 十六天 7 月 17 日凌晨,月之暗面发布 Kimi K3。总参数 2.8 万亿,上下文 100 万 token,全球规模最大的开放模型。 在 Frontend Code Arena 前端编程榜上,K3 拿到 1679 分,排在它后面的是 Claude Fable 5 和 GPT-5.6 Sol。这是开放模型第一次坐到闭源模型前面。七个前端细分方向,它拿下六个第一。 马斯克在评测结果下面留了一句「Impressive」。 K3 的 API 不便宜,每百万输出 token 收 100 元。可是在 SuperCLUE 的横向测试里,它的任务得分比第二名高 18%,跑完同一批任务,平均成本反而低了 16%。 模型贵不贵,不看每百万 token 标价多少,看把一件事从头做完要花多少。这两个数越离越远,标价本身就越没意义。 两天后的深夜,月之暗面暂停了 C 端新用户订阅。48 小时的请求量远远超出预估,算力不够用了。 7 月 27 日,K3 开放完整权重,连同技术报告和配套基础设施一起放出。 紧接着轮到 DeepSeek。 市场原本一直在等 V4 正式版。4 月底,DeepSeek 先放出 V4-Pro 和 V4-Flash 两个预览版,都支持 100 万 token 上下文,官方管这叫「百万上下文普惠时代」。之后两三个月没什么动静,直到 8 月 2 日,V4 Flash 正式发布并开放权重。总参数 2840 亿,单次推理只激活 130 亿,DeepSWE 编程测试的分数从 7.3 涨到 54.4。 更狠的还是价格。5 月那次,V4-Pro 直接降到原来的四分之一,那已经是 DeepSeek 一个月里第四次调价。等到 Flash 正式上线,大家还是对它的性价比大吃一惊。 「一分钱一分货」是过去的规矩。现在中国模型越来越能打,钱收得越来越少。外国友商当然难受,可是也没什么办法。用户已经见过又便宜又好用的东西,谁都不愿意再回去当冤大头。 随后阿里宣布将在下周放出 Qwen3.8-Max 的权重。过去一直摆在闭源旗舰位置的 Max 系列,也开始开放。它的国际价格,输入大约是 Opus 5 的 40%,输出只有 24%。 这些事情是在短短 16 天内发生的。 过去模型公司靠稀缺定价,只有我能做,你就只能照我的价钱付。榜单上只差几分,价格能差出几十倍。 Kimi、DeepSeek、Qwen 三家公司的技术路线不一样,但做的事是同一件,都在把能力往上推,把权重开放出来,把价格往下砍,然后赶紧接进产品里。 想抄作业,可是没人给钱 美国那边也有人看懂了这个趋势。 2025 年底,Arcee AI 把账上的钱几乎全押了进去。33 天,2048 块 B300,2000 万美元,全公司只有 30 个人。做出来的 Trinity Large 总参数 4000 亿,单次推理激活 130 亿,训练数据里将近一半是合成的。今年 7 月,Arcee 又和美国能源部签了合作,准备做一款面向科研的模型。 团队、成绩、成本、政府订单,该有的都有了。偏偏融资这道门,怎么也敲不开。 Arcee 至今总共融了 5000 万美元,估值 2.4 亿美元。放在今天的大模型赛道,这点钱别说上桌吃饭了,连包间的门都进不去。 CEO Mark McQuade 说:「几乎所有一线 VC 都拒绝了我们。」 美国的开放模型还没跟中国正面交手,先被自家投委会拦下了。 2026 年第一季度,全球 AI 初创公司融了 2555 亿美元,接近三分之二集中在三笔交易里,分别是 OpenAI 的 1220 亿、Anthropic 的 300 亿、xAI 的 200 亿。钱几乎全流进了闭源公司。 Arcee 的早期投资人、Emergence Capital 合伙人 Joe Floyd 说,他从不少 VC 那里听到的拒绝理由都差不多: 「我不希望这种模式成功。我不想投资,因为这会损害我对 Anthropic 和 OpenAI 的投资。」 真正肯为开放模型花钱的,反倒是卖芯片的。 今年 3 月,英伟达在 SEC 文件里披露,未来五年准备投入 260 亿美元支持开放权重。Reflection AI、Poolside、Thinking Machines Lab 都拿到了它的钱。 这笔账黄仁勋算得比谁都清楚。闭源模型赚的是 API 的钱,开放模型烧的是卡。模型卖得越便宜,开发者蹬得越多,英伟达的卡就卖得越好。 7 月 24 日晚上,黄仁勋注册 X 账号,发出的第一条推文是转发一封公开信,题目叫《开放权重与美国在 AI 领域的领导地位》。信里说,美国能不能继续领导这个行业,不能只看手里有没有最先进的模型,还要看有没有一套能扩散到各行各业的生态。 后来近 200 家美国初创公司的创始人联名致信特朗普政府,反对封禁中国开放模型。这封信我读下来,最有意思的地方是它一句漂亮话都没有。他们没替中国说好话,也没打开放主义的旗号,理由只是便宜的中国模型已经变成了生产工具,真要封掉,他们只能回头去买昂贵的美国 API。 McQuade 接受采访时还说过另一句话,大规模普及只是时间问题。 便宜出来的需求 硅谷还在争论开放权重该不该做,中国已经开始闯下一关了。 「AI 应用元年」这几个字,过去三年喊了好多遍。但是判断一项技术有没有真的进入应用期,只看两件事,用户肯不肯掏钱,企业有没有把它接进业务。 今年 Claude Code 和 Cursor 的年化收入都过了 10 亿美元,AI 编程工具在个人开发者里的渗透率接近一半。 企业那头变化更大。沙丘智库的调研里,中国企业的 AI Agent 采纳率从 2024 年底的 17.3%,涨到 2026 年年中的 40.3%。 李彦宏为此提了个新指标,叫 DAA,日活跃智能体数量。以前互联网公司数的是每天有多少人打开产品,往后要数的是每天有多少 Agent 在替人干活,又真正交付了多少结果。 调用量的曲线更惊人。按央视的统计口径,中国日均 token 调用量从 2024 年初的约 1000 亿,涨到今年 3 月底的 140 万亿,两年多翻了一千多倍。 模型越来越便宜,算力却越来越紧俏。今年 3 月,腾讯云、阿里云和百度智能云在十天里接连上调算力价格,涨幅三成左右。上半年智能体一爆发,推理算力的租赁价又涨了四成以上。 原因就在于,人们使用 AI 的方式已经变了。以前问一句答一句,花不了多少 token。现在一个 Agent 要真把活干完,得带着上下文,调好几个工具,来回检查,做错了还得从头再来。单价是降了,消耗量成倍地往上涨。 降价没有把市场做小,它把过去那些算不过来账的需求全放了进来。 1981 年,IBM 开放 PC 架构,兼容机很快涌进市场,硬件价格一路往下走。最后真正赚到大钱的不是造机器的,是长在机器上面的 Lotus 1-2-3、WordPerfect,以及后来的微软。 今天这条路走得几乎一模一样。大家还盯着底层能力差了几分,上面的公司已经开始抢用户、抢入口、抢工作流。 美国公司可以研究 DeepSeek 的架构,可以用 Kimi 生成的数据,也可以花 2000 万美元训练出一款成绩不错的开放模型。但是应用没有这么容易照搬。 应用没有可以下载的权重,也没有 benchmark。决定它跑不跑得起来的,是一家公司十几年摸爬滚打攒下的那点门道。 过去大厂习惯把模型做成一个独立产品,等着用户专门打开一个聊天框。现在模型开始往钉钉、飞书、企业微信里钻,Agent 直接长在原来的组织和流程里。 在美国,一个办公 Agent 可能沿着 Gmail、Slack 和 Salesforce 生长。在中国,它会先从钉钉、飞书和企业微信进去,再往下接财务软件、供应链、工厂系统和政务平台。两边就算使用同一款模型,最后做出来的产品也不会一样。 价格打下来之后 2022 年到 2025 年,美国对华芯片限制层层加码。H100 不卖,B300 不卖,先进制程和制造设备也被管起来。中国公司就在这样的条件下,做出了全球规模最大的开放模型。 到了 2026 年,美国开始讨论限制中国模型的权重。OpenAI 和 Anthropic 据报道已经向监管机构表达了担忧,国会也在研究,模型权重还能不能继续跨境流动。 刀还没落下来,自己人先喊疼了。 芯片禁令卡的是中国公司的供给,模型禁令先砍到的,却是美国创业公司的成本。那封联名信里也写得很清楚,封禁拦不住传播,只会逼着开发者赶在关门之前,把能下载的模型先全部下载下来。 芯片是实体,可以卡订单、卡物流、卡代工厂。权重只要流出去一次,就能被无限下载、镜像、量化、微调和蒸馏。 更管不住的是价格。 美国在最尖端的闭源模型上依然领先。OpenAI 和 Anthropic 还坐在第一排,训练最顶级的模型也依然离不开英伟达的卡,这一点短期内不会变。 可是到了应用这一程,输赢很少由某一款最强模型决定。它比的是模型够不够便宜,企业手里有没有一个现成的数字化入口,以及开发者能不能真的钻进业务流程里去。 回头看过去三十年,中国赢过很多次,赢法却大体相同。 移动支付、电商、外卖、直播,都是把外面发明的技术塞进十几亿人的日常,再做成规模惊人的生意。最底下那层基础,长期由别人提供。晶体管来自贝尔实验室,x86 属于英特尔,TCP/IP 由美国政府资助,Windows、安卓和 iOS 都长在西海岸。就连深度学习时代最常用的 TensorFlow 和 PyTorch,也分别出自谷歌和 Meta。 「发明在美国,规模在中国」,这句话说了三十年,很少遇到真正的例外。 现在,例外出现了。 Thinking Machines Lab 的技术说明写得很清楚。硅谷最受瞩目、也最有钱的新公司之一,在模型的基座层参考了中国公司的架构,后训练又使用了另一家中国模型生成的数据。 过去,硅谷从中国采购产能、招募人才或者寻找市场。现在,它开始直接照着中国公司验证过的技术路线往下做。 硅谷崇拜当然有来历。过去几十年,计算机产业最重要的底层技术,大多确实从那里长出来。从机器里的芯片,到程序员每天打开的 IDE,硅谷长期站在技术链条的上游。 但技术世界最终看的是结果。谁能提出新的架构,谁能把成本打下来,谁能让同行开始模仿,谁就有资格重新定义上游。 现在,这张名单上开始出现中国公司的名字了。 硅谷未来大概率会追上来,那里有足够多的工程师、资本和芯片。但是已经接进真实业务的应用不会停下来等人。谁先钻进企业的流程,谁就先拿到客户、数据和下一轮改进的机会。起跑线从来不是同一条。 AI 的应用时代不会挑一个黄道吉日敲锣打鼓地开张。它最先出现的地方是财务报表,是暴涨的调用量,是一个程序员在半夜又一次把额度用光。 大规模普及只是时间问题。这句话是一个美国人说的。 原文链接

抄中国作业的硅谷,下一道题是AI应用

原文标题:《抄中国作业的硅谷,下一道题是AI应用》
原文作者:动察Beating
硅谷开始抄中国的作业了。
最近,美国冒出了一批低价开放模型,目标是能力追上中国的开源模型,价格也压到同一个水平。
Mira Murati 的 Thinking Machines Lab 上个月发布了第一款模型 Inkling。官方说明里写了两件事,底层架构参考 DeepSeek-V3,后训练数据由 Kimi K2.5 生成。
硅谷最贵的一批人,用中国开源模型的骨架,喂中国模型生成的数据。放在两年前,这种事只会反过来发生。
今年早些时候,Arcee AI 的 Trinity-Large-Thinking 在 PinchBench 上拿到 91.9 分,比 Anthropic 的 Opus 4.6 低 1.4 分,价格是后者的 4%。
Arcee AI 的 CEO Mark McQuade 说:「我们正在努力让美国追赶并超越中国。」
硅谷现在照着抄的,已经不只是模型,还有中国公司打下来的价格。
架构可以借鉴,训练方法可以复现,数据能交给别的模型批量生成。权重一旦放出去,开发者还能接着开发。价格这件事更简单,只要有一家先砍下来,剩下的迟早都得跟上。
过去三年,大模型公司靠参数、算力和闭源起了朱楼,也宴了宾客。现在这栋楼眼看着就要塌了。
十六天
7 月 17 日凌晨,月之暗面发布 Kimi K3。总参数 2.8 万亿,上下文 100 万 token,全球规模最大的开放模型。
在 Frontend Code Arena 前端编程榜上,K3 拿到 1679 分,排在它后面的是 Claude Fable 5 和 GPT-5.6 Sol。这是开放模型第一次坐到闭源模型前面。七个前端细分方向,它拿下六个第一。
马斯克在评测结果下面留了一句「Impressive」。
K3 的 API 不便宜,每百万输出 token 收 100 元。可是在 SuperCLUE 的横向测试里,它的任务得分比第二名高 18%,跑完同一批任务,平均成本反而低了 16%。
模型贵不贵,不看每百万 token 标价多少,看把一件事从头做完要花多少。这两个数越离越远,标价本身就越没意义。
两天后的深夜,月之暗面暂停了 C 端新用户订阅。48 小时的请求量远远超出预估,算力不够用了。
7 月 27 日,K3 开放完整权重,连同技术报告和配套基础设施一起放出。
紧接着轮到 DeepSeek。
市场原本一直在等 V4 正式版。4 月底,DeepSeek 先放出 V4-Pro 和 V4-Flash 两个预览版,都支持 100 万 token 上下文,官方管这叫「百万上下文普惠时代」。之后两三个月没什么动静,直到 8 月 2 日,V4 Flash 正式发布并开放权重。总参数 2840 亿,单次推理只激活 130 亿,DeepSWE 编程测试的分数从 7.3 涨到 54.4。
更狠的还是价格。5 月那次,V4-Pro 直接降到原来的四分之一,那已经是 DeepSeek 一个月里第四次调价。等到 Flash 正式上线,大家还是对它的性价比大吃一惊。
「一分钱一分货」是过去的规矩。现在中国模型越来越能打,钱收得越来越少。外国友商当然难受,可是也没什么办法。用户已经见过又便宜又好用的东西,谁都不愿意再回去当冤大头。
随后阿里宣布将在下周放出 Qwen3.8-Max 的权重。过去一直摆在闭源旗舰位置的 Max 系列,也开始开放。它的国际价格,输入大约是 Opus 5 的 40%,输出只有 24%。
这些事情是在短短 16 天内发生的。
过去模型公司靠稀缺定价,只有我能做,你就只能照我的价钱付。榜单上只差几分,价格能差出几十倍。
Kimi、DeepSeek、Qwen 三家公司的技术路线不一样,但做的事是同一件,都在把能力往上推,把权重开放出来,把价格往下砍,然后赶紧接进产品里。
想抄作业,可是没人给钱
美国那边也有人看懂了这个趋势。
2025 年底,Arcee AI 把账上的钱几乎全押了进去。33 天,2048 块 B300,2000 万美元,全公司只有 30 个人。做出来的 Trinity Large 总参数 4000 亿,单次推理激活 130 亿,训练数据里将近一半是合成的。今年 7 月,Arcee 又和美国能源部签了合作,准备做一款面向科研的模型。
团队、成绩、成本、政府订单,该有的都有了。偏偏融资这道门,怎么也敲不开。
Arcee 至今总共融了 5000 万美元,估值 2.4 亿美元。放在今天的大模型赛道,这点钱别说上桌吃饭了,连包间的门都进不去。
CEO Mark McQuade 说:「几乎所有一线 VC 都拒绝了我们。」
美国的开放模型还没跟中国正面交手,先被自家投委会拦下了。
2026 年第一季度,全球 AI 初创公司融了 2555 亿美元,接近三分之二集中在三笔交易里,分别是 OpenAI 的 1220 亿、Anthropic 的 300 亿、xAI 的 200 亿。钱几乎全流进了闭源公司。
Arcee 的早期投资人、Emergence Capital 合伙人 Joe Floyd 说,他从不少 VC 那里听到的拒绝理由都差不多:
「我不希望这种模式成功。我不想投资,因为这会损害我对 Anthropic 和 OpenAI 的投资。」
真正肯为开放模型花钱的,反倒是卖芯片的。
今年 3 月,英伟达在 SEC 文件里披露,未来五年准备投入 260 亿美元支持开放权重。Reflection AI、Poolside、Thinking Machines Lab 都拿到了它的钱。
这笔账黄仁勋算得比谁都清楚。闭源模型赚的是 API 的钱,开放模型烧的是卡。模型卖得越便宜,开发者蹬得越多,英伟达的卡就卖得越好。
7 月 24 日晚上,黄仁勋注册 X 账号,发出的第一条推文是转发一封公开信,题目叫《开放权重与美国在 AI 领域的领导地位》。信里说,美国能不能继续领导这个行业,不能只看手里有没有最先进的模型,还要看有没有一套能扩散到各行各业的生态。
后来近 200 家美国初创公司的创始人联名致信特朗普政府,反对封禁中国开放模型。这封信我读下来,最有意思的地方是它一句漂亮话都没有。他们没替中国说好话,也没打开放主义的旗号,理由只是便宜的中国模型已经变成了生产工具,真要封掉,他们只能回头去买昂贵的美国 API。
McQuade 接受采访时还说过另一句话,大规模普及只是时间问题。
便宜出来的需求
硅谷还在争论开放权重该不该做,中国已经开始闯下一关了。
「AI 应用元年」这几个字,过去三年喊了好多遍。但是判断一项技术有没有真的进入应用期,只看两件事,用户肯不肯掏钱,企业有没有把它接进业务。
今年 Claude Code 和 Cursor 的年化收入都过了 10 亿美元,AI 编程工具在个人开发者里的渗透率接近一半。
企业那头变化更大。沙丘智库的调研里,中国企业的 AI Agent 采纳率从 2024 年底的 17.3%,涨到 2026 年年中的 40.3%。
李彦宏为此提了个新指标,叫 DAA,日活跃智能体数量。以前互联网公司数的是每天有多少人打开产品,往后要数的是每天有多少 Agent 在替人干活,又真正交付了多少结果。
调用量的曲线更惊人。按央视的统计口径,中国日均 token 调用量从 2024 年初的约 1000 亿,涨到今年 3 月底的 140 万亿,两年多翻了一千多倍。
模型越来越便宜,算力却越来越紧俏。今年 3 月,腾讯云、阿里云和百度智能云在十天里接连上调算力价格,涨幅三成左右。上半年智能体一爆发,推理算力的租赁价又涨了四成以上。
原因就在于,人们使用 AI 的方式已经变了。以前问一句答一句,花不了多少 token。现在一个 Agent 要真把活干完,得带着上下文,调好几个工具,来回检查,做错了还得从头再来。单价是降了,消耗量成倍地往上涨。
降价没有把市场做小,它把过去那些算不过来账的需求全放了进来。
1981 年,IBM 开放 PC 架构,兼容机很快涌进市场,硬件价格一路往下走。最后真正赚到大钱的不是造机器的,是长在机器上面的 Lotus 1-2-3、WordPerfect,以及后来的微软。
今天这条路走得几乎一模一样。大家还盯着底层能力差了几分,上面的公司已经开始抢用户、抢入口、抢工作流。
美国公司可以研究 DeepSeek 的架构,可以用 Kimi 生成的数据,也可以花 2000 万美元训练出一款成绩不错的开放模型。但是应用没有这么容易照搬。
应用没有可以下载的权重,也没有 benchmark。决定它跑不跑得起来的,是一家公司十几年摸爬滚打攒下的那点门道。
过去大厂习惯把模型做成一个独立产品,等着用户专门打开一个聊天框。现在模型开始往钉钉、飞书、企业微信里钻,Agent 直接长在原来的组织和流程里。
在美国,一个办公 Agent 可能沿着 Gmail、Slack 和 Salesforce 生长。在中国,它会先从钉钉、飞书和企业微信进去,再往下接财务软件、供应链、工厂系统和政务平台。两边就算使用同一款模型,最后做出来的产品也不会一样。
价格打下来之后
2022 年到 2025 年,美国对华芯片限制层层加码。H100 不卖,B300 不卖,先进制程和制造设备也被管起来。中国公司就在这样的条件下,做出了全球规模最大的开放模型。
到了 2026 年,美国开始讨论限制中国模型的权重。OpenAI 和 Anthropic 据报道已经向监管机构表达了担忧,国会也在研究,模型权重还能不能继续跨境流动。
刀还没落下来,自己人先喊疼了。
芯片禁令卡的是中国公司的供给,模型禁令先砍到的,却是美国创业公司的成本。那封联名信里也写得很清楚,封禁拦不住传播,只会逼着开发者赶在关门之前,把能下载的模型先全部下载下来。
芯片是实体,可以卡订单、卡物流、卡代工厂。权重只要流出去一次,就能被无限下载、镜像、量化、微调和蒸馏。
更管不住的是价格。
美国在最尖端的闭源模型上依然领先。OpenAI 和 Anthropic 还坐在第一排,训练最顶级的模型也依然离不开英伟达的卡,这一点短期内不会变。
可是到了应用这一程,输赢很少由某一款最强模型决定。它比的是模型够不够便宜,企业手里有没有一个现成的数字化入口,以及开发者能不能真的钻进业务流程里去。
回头看过去三十年,中国赢过很多次,赢法却大体相同。
移动支付、电商、外卖、直播,都是把外面发明的技术塞进十几亿人的日常,再做成规模惊人的生意。最底下那层基础,长期由别人提供。晶体管来自贝尔实验室,x86 属于英特尔,TCP/IP 由美国政府资助,Windows、安卓和 iOS 都长在西海岸。就连深度学习时代最常用的 TensorFlow 和 PyTorch,也分别出自谷歌和 Meta。
「发明在美国,规模在中国」,这句话说了三十年,很少遇到真正的例外。
现在,例外出现了。
Thinking Machines Lab 的技术说明写得很清楚。硅谷最受瞩目、也最有钱的新公司之一,在模型的基座层参考了中国公司的架构,后训练又使用了另一家中国模型生成的数据。
过去,硅谷从中国采购产能、招募人才或者寻找市场。现在,它开始直接照着中国公司验证过的技术路线往下做。
硅谷崇拜当然有来历。过去几十年,计算机产业最重要的底层技术,大多确实从那里长出来。从机器里的芯片,到程序员每天打开的 IDE,硅谷长期站在技术链条的上游。
但技术世界最终看的是结果。谁能提出新的架构,谁能把成本打下来,谁能让同行开始模仿,谁就有资格重新定义上游。
现在,这张名单上开始出现中国公司的名字了。
硅谷未来大概率会追上来,那里有足够多的工程师、资本和芯片。但是已经接进真实业务的应用不会停下来等人。谁先钻进企业的流程,谁就先拿到客户、数据和下一轮改进的机会。起跑线从来不是同一条。
AI 的应用时代不会挑一个黄道吉日敲锣打鼓地开张。它最先出现的地方是财务报表,是暴涨的调用量,是一个程序员在半夜又一次把额度用光。
大规模普及只是时间问题。这句话是一个美国人说的。
原文链接
Статья
对话Creader创始人Tim:让AI记住世界,把故事留给作者原文标题:《对话Creader创始人Tim:让AI记住世界,把故事留给作者》 原文作者:动察Beating 7 月 23 日,东野圭吾去世,终年 68 岁。 四十多年里,他写下了 106 本书。《白夜行》《恶意》《嫌疑人 X 的献身》《解忧杂货店》,共同构成了一个庞大的平行世界。 许多读者对那个纸面之内的世界并不陌生。他们知道加贺恭一郎会沿着东京的街道继续追查,汤川学总能从物理现象里看见被掩盖的真相,也知道在案件之外,还有陷入债务的家庭、被升学压住的学生、无法摆脱过去的普通人。 凶案只是入口,真正留在故事里的,是欲望怎样产生,秘密怎样扩大,一个人被自己的选择慢慢推向结局。 东野圭吾笔下的世界显得真实,因为每件事都有来处。一个人在三章前说过的谎,不会凭空消失;一段童年经历,会在许多年后改变并肩前行者的命运;一只摆错位置的杯子,一封没有寄出的信,都可能在故事结束前重新获得意义。 推理小说把庞杂的世界缩小成一个可以进入的现场。在现实里,许多事情没有解释,许多关系无疾而终,但在这几百页的辗转游移中,至少有一些痕迹能够被追溯,一些选择会产生后果。 读者由此获得一个暂时的落脚点。 作家让这个平行世界始终拥有自己的重力。世界观越庞杂,保持重力越是难事。人物会增加,时间线彼此交错,一句无意间写下的话,可能在十万字后变成伏笔。一个角色不能突然忘记自己的过去,一场战争不能发生在错误的年份,一段关系也不能在毫无理由的情况下改变方向。 长篇写作真正缺少的,往往是承载整个世界的记忆。 Creader 想处理的,正是这部分工作。它把人物、地点、事件、关系和时间线从小说中提取出来,让它们成为彼此连接的结构。 在大量 AI 产品尝试替人生成故事时,Creader 的创始人 Tim 更关心另一个问题:技术能不能进入创作,但别那么着急替创作者把一切完成? 这不是 Tim 第一次接近这个问题。 2014 年,Tim 来到英国。那时英语还不熟练,网络小说成为他进入另一个世界的入口。后来他学习计算机,做过阅读平台,研究过区块链与知识产权,也进入过围绕 IP 基础设施建立的创业公司。十多年里,技术不断变化,问题却始终留在原地。一个人怎样把头脑里的世界完整地表达出来,又不在工具的帮助下失去自己的判断? 2025 年年底,Tim 开始重新做这件事。他认为,写作最重要的部分,仍是是那些无法被加速的时刻。作者还不知道答案,人物仍然拥有几种可能,故事没有过早变成一个完整、流畅,却不再属于任何人的东西。 世界的重力 Tim 爱读网络小说,也读历史小说。最近看的一本以咸丰年间为背景。作者把人物放进清廷、英法联军、大沽口之战,以及东南亚华人社会的变化中。真实历史构成边界,虚构人物则在边界内生活、迁徙和作出选择。 Tim 喜欢这种写法。历史没有被当作简单的背景板,而是持续进入人物的命运。读者可能因为一个虚构人物去接近一场真实的战争,又因已知晓战争最后的结局,对人物尚未发生的命运产生担忧。 世界的可信,来自历史、人物与后果之间的连接。 动察 Beating:你会怎样判断一个故事是不是好故事? Tim:我最在意的是人物有没有真正生活在那个世界里。一个故事可以有很复杂的设定,但如果人物只是帮助作者推动情节的工具,读者很快就会感觉到。真正让我记住的故事,人物都有自己的理由。即使他做了一件错误的事,你也能理解他为什么走到那里。 我最近会看很多历史小说和架空历史。历史小说很有意思,因为作者不能完全随意。Ta 要尊重已经发生过的事,同时在真实历史留下的空隙里创造人物。 比如我读到一本写咸丰年间的小说,里面涉及英法与清廷的关系、大沽口之战,也写到吕宋、爪哇一带的华人。读到某些地方,我会停下来查真实历史。一个虚构故事把我重新带回了现实。 对我来说,这就是一个故事有生命的表现。它不是把你封闭在小说里,而是让你从小说出发,重新理解外面的世界。 动察 Beating:你提到今年获得布克奖的小说《台湾漫游录》。它吸引你的是什么? Tim:它写的是日据时期的中国台湾,通过一位日本女作家和一位中国台湾译者的同行,把食物、语言、殖民关系和两个人之间的情感放在一起。我很喜欢它对「翻译」的处理。翻译不是把一句话换成另一种语言,而是一个人怎样帮助另一个人理解陌生的地方。这里面有知识,也有权力关系。谁在描述这个世界,谁又在替谁解释,都会影响读者最后看到什么。 这也让我想到,文学不应该只是专业作家的特权。一个人认真记录自己和世界的关系,本身就已经是在写作。普通人的经历未必缺少价值,很多时候只是缺少一种把经验组织出来的方式。 技术真正能帮助的,也应该是这一部分,让已经经历过的东西,有机会被表达得更完整。 一个追了十多年的念头 2014 年,Tim 来到英国。在陌生的语言环境里,网络小说为他提供了最初的稳定感。他被其中庞大的世界、清楚的规则和持续生长的人物关系吸引,也开始思考,中国网络文学已经形成的创作和连载机制,能不能出现在英语市场。 为了回答这个问题,他开始学计算机,后来进入中国的大型科技公司,从运营做起;又在研究生阶段学习超级计算,研究区块链和知识产权。他和伙伴参加比赛,写白皮书,做演示,尝试把故事的确权和收益分配搬到链上。此后,他又先后进入 Story Protocol 和 FLock 等公司,继续接触 IP、区块链、AI 与开发者生态。 这条路径看起来绕了很远,最后仍然回到了写作。 动察 Beating:做 Creader 最早的起点是什么? Tim:我小时候就很喜欢结构完整的世界。我玩《宝可梦》《火焰纹章》《黄金太阳》,也拼高达。吸引我的不只是某一个角色,而是这些世界有自己的规则。人物、地点、历史和关系可以不断延伸,但它们不是随意拼接的。 到英国以后,这种感受变得更明显。那时我的英语还不够好,网络小说对我来说既是逃离,也是一个落脚点。它让我在陌生环境里还有一个熟悉的世界可以进入。 我当时就在想,亚洲网络文学的创作和发布机制,能不能在西方市场成立。为了做这个东西,我开始学习技术,也做过一些很小的网站。本科毕业项目就是一个阅读平台,只是当时的技术能力和对商业的理解都有限,没有真正继续下去。但我一直没有忘记这件事。 动察 Beating:后来为什么转向区块链和 IP? Tim:那时我认为,创作行业最重要的问题可能是所有权。一个故事被谁写出来,后续怎样改编,收益怎样分配,这些环节一直不够透明。区块链看起来提供了一种新的基础设施,作品可以登记,授权关系可以被追踪,收入也可以按照规则自动分配。 这套系统在技术上可以成立,但做得越深,我越意识到,它没有解决创作本身的问题。钱包、Token、登记流程,反而可能让阅读和写作变得更重。我们解决了作品完成之后怎样确权,却没有回答一个作品在完成之前,怎样从一个模糊的想法变成真正的故事。 这也是我后来发生方向变化的原因。问题不只在经济关系里,也在人的认知过程里。 动察 Beating:为什么是在现在重新开始做 Creader? Tim:一个很直接的原因是,AI 编程工具让个人可以完成过去需要一支团队才能做的东西。 以前做一个复杂产品,首先要考虑融资、招人、开发周期。现在一个人也可以快速做出原型,先验证最重要的部分。这让我重新回到十年前的问题。但生成式 AI 也让我看到另一种危险。很多产品都在加速输出,却没有真正帮助创作者思考。它可以快速给你一段完整的文字,但完整不代表这就是你想表达的东西。 我开始意识到,真正需要被保护的不是写字这个动作,而是写作过程中形成判断的能力。 记忆的书写 Tim 把 Creader 称为一个「叙事引擎」。它尽量保留了作者熟悉的写作路径——打开章节,直接落笔。需要帮助时,可以调出对话、结构和分析面板;不需要时,这些功能退到页面之后。 一部长篇小说则被分成几个彼此连接的层次,正文、场景、章节、人物、地点、时间线、规则与关系。系统持续阅读作者写下的内容,把其中可以确认的信息纳入故事的内部档案。 在一个不断生长的世界里,Creader 试图维护的,是人的记忆上限所无法抵达之处。 动察 Beating:你为什么把 Creader 称为「叙事引擎」,而不是 AI 写作工具? Tim:因为写作工具很容易让人想到生成:你给一个要求,它替你写出一段话。但叙事不只是句子。它还有人物、事件、时间、关系,以及整个世界如何运转。Creader 真正想处理的是这些东西之间的连接。 我们主要看两种一致性。第一种是叙事一致性。比如一个人物的转变有没有铺垫,一条暗线有没有结束,一个章节是否真的推动了故事。第二种是时间一致性。比如人物现在知道什么,不知道什么;他在三天前做了什么;两个地点之间的距离是否允许他在这个时间出现。 随着时间的流逝,很多长篇小说的作者很难同时记住整个世界。AI 在这里最适合做的不是决定,而是记忆和提醒。 动察 Beating:具体使用时,它和 Word、Google Docs,或者直接与大模型聊天有什么不同? Tim:我们希望主路径永远是写作。用户打开一个页面就可以开始,不需要先完成几十项人物设定,也不需要先学习一套复杂的软件。其他功能应该像支线,需要时再出现。 比如写到一半卡住,可以通过快捷键打开一个面板,询问某个角色此前做过什么,或者检查这一段有没有违背前面的设定。写完以后,系统也可以像编辑一样给出批注。 通用聊天工具的问题是,每次对话都在推动你进入下一轮。它很容易不断给出新内容,却很难长期保存一个故事内部的结构。 Creader 会把故事事实从正文中提取出来。人物、地点、事件和关系不再只是散落在几万字里的名字,而会进入同一个知识系统。AI 调用的不是一段临时聊天记录,而是这个故事已经建立起来的内部现实。 动察 Beating:这会不会反过来让小说变得公式化? Tim:这是我们很警惕的事情。我们早期选择《红楼梦》《哈姆雷特》等作品作为模型学习的语料来做叙事分析,后来逐渐扩大到大约三十部作品。目的不是学习某个作家的风格,更不是告诉作者应该怎样模仿,而是寻找一些跨越不同作品仍然成立的问题。 比如一段描写有没有承担叙事功能,一个比喻是否来自人物真实的观察,一场冲突有没有改变人物关系。系统可以把这些问题提出来,但不能把文学变成统一答案。 我们更接近编辑,而不是代笔者。编辑可以说,这个地方似乎缺少动机,这条线很久没有出现,或者这一段解释得太多。但作者完全可以不同意。文学里没有所有人都必须遵守的评分标准。 动察 Beating:Creader 允不允许 AI 生成? Tim:会允许,但生成不是核心。不同用户需要的东西不一样。职业作家可能完全不希望 AI 进入正文,只需要它帮助整理人物、时间线和伏笔。普通用户可能有非常完整的生活经历,却不知道怎样把它变成结构,也可能需要更多帮助。 关键是保留边界。我们希望未来能够清楚区分,哪些内容由人独立完成,哪些是 AI 辅助修改,哪些主要由 AI 生成。使用 AI 本身不意味着没有创作,但读者应该知道它是怎样被完成的。 我不认为必须在「纯手工」和「全部生成」之间选择一个极端。问题是,作者有没有持续作出决定,有没有保留自己的意图、经验和责任。 动察 Beating:如果一个人有自己的想法和创意,只是把打字、整理材料这些「辛苦活」交给 AI,这还算创作吗? Tim:我觉得这是一个很有意思的问题,你怎么定义创作? 比如你在创作一篇文章的时候,真正投入的是你的想法、创意,以及你想把哪些材料组织进去。以前这些东西要靠手写、打字一点点完成,其中有一部分在我看来就是纯辛苦活。现在用 AI 替代这部分辛苦活,它算不算创作?我觉得还是算。 首先还是要把 AI 定义成一个工具。它没有办法代替人。至少现在,大多数 AI 生成仍然需要由人主动发起,你要和它沟通,告诉它想写什么、从什么角度写、最后希望得到什么。 有些人可能有一个很好的构思,但没有能力把它完整地表达出来。现在 Ta 借助 AI 完成了这件事,不能因此就磨灭掉他原本的想法。Ta 仍然在创作,只是使用了新的工具。 动察 Beating:如果最终的文字主要由 AI 完成,作者的身份应该怎样判断? Tim:我觉得未来需要把三种情况分开:人工创作、AI 辅助创作,以及 AI 生成创作。 有人只是用 AI 检查语法、整理思路,有人会让 AI 生成一部分,也有人可能几乎全部使用 AI。这些都可以存在,但应该有清楚的标签,让读者知道作品是怎样完成的。 之前有作家被曝出作品中有相当一部分使用了 AI。大家真正愤怒的地方,可能不完全是 Ta 用了 AI,而是 Ta 没有披露这件事,甚至把「读者没有发现」当成一种成功。 专业作家有自己的思维和创作理念。Ta 能够和 AI 合作,写出一本让读者没有察觉到 AI 参与的书,并不意味着换一个人来也可以做到。「如果我上,我也行」其实未必成立。 动察 Beating:但很多读者仍然会本能地排斥 AI 生成的小说。 Tim:如果一个故事足够好,语言也足够好,我个人不会仅仅因为它使用了 AI,就拒绝阅读。但很多人担心的是,AI 是不是要代替作家。媒体也经常用「AI 能够替代什么」来描述它,这会让创作者产生直接的威胁感。 我觉得有人对古法的执着不是坏事。编程也一样,有人愿意自己一行一行写。AI 不是万能的,传统方法有时仍然有价值。 关键还是要看一个人为什么使用 AI。 一个专业作者可以一天写八千字、一万字,Ta 可能根本不需要 AI 替自己生成。相比之下,Ta 真正需要的可能是整理思路,我脑子里有这么多人物、线索和情节,应该怎样把它们编排进去? 所以对不同的人来说,AI 的位置是不一样的。有人需要生成,有人只需要协作。工具应该适应人的能力,而不是要求所有人用同一种方法写作。 让答案晚一点出现 AI 生成式写作最明显的问题,是事实错误、陈词滥调和语言重复。但 Tim 认为更难察觉的危险来自于速度,AI 总是能太快给出一个看起来正确的答案。 文本变得完整了,思考却可能在完整之前停止。 Tim 把这种状态称为「过早的连贯」。大模型擅长为缺口寻找最合理的补全,而创作恰恰需要缺口暂时存在。人物可以不稳定,动机可以彼此冲突,一个想法也可以在很长时间里没有名字。 在这些尚未确定的部分里,创作者才有机会发现自己真正想写什么。 动察 Beating:你自己写东西,为什么还是更愿意自己打字? Tim:和 AI 交流是很快的。它是一个来回的过程。它生成一段,你读完,发现这里不对,马上就会开始下一轮对话。你的大脑会不断往前走,很难真正慢下来。 但自己写的时候不一样。写作其实是一个放慢脑海中思考速度的过程。你写到一半,会停下来想,我现在是不是走在一条对的路上?我写的是不是我真正想写的东西? 如果直接使用 AI 生成,你更多是在阅读和判断它的答案。这里错了,就让它再改;那里不对,就马上进入下一轮。中间少了一个自己慢慢形成句子的过程。 所以我觉得,手写也好,自己打字也好,这种古法写作是在帮助人放慢思考,让你有更多时间不断拷问自己表达的价值。 动察 Beating:对你来说,写作或者文学最珍贵的部分是什么? Tim:当然我不是文学背景出身,我是从一个计算机背景去看文学。对我来说,文学主要有两个意义。 第一个,是记录你和世界的交互。人为什么要记录、为什么要写?最早是希望很多事实可以被后世看到。一个人在什么地方生活,经历了什么,Ta 怎样理解那个时代,都可以通过文字留下来。 第二个,是记录你脑海里的想象力。当人看到更多、经历更多,和世界发生更多交互以后,想象力也会被打开。为什么会有科幻、玄幻,为什么会有《百年孤独》?就是因为一个想象在某个人的脑海里萌发,然后被记录下来,最后成为一个不存在于现实,却能够被很多人进入的世界。 我觉得文学的本质,还是让人把内心的世界表达出来。 每个人都在想一些东西,只是 Ta 不一定愿意说,也不一定愿意把它发到微博或者其他公开的社交网络上。但有些时候,Ta 仍然想把这一刻的想法记录下来,于是就会写一篇笔记。 文学不是强制性的,不是说写出来就一定要给别人看。 你把这一刻的想法留给自己,我觉得它也可以是文学。最重要的是,你把脑海里的东西记录了下来。 动察 Beating:听说你们还想把 Creader 放进教育场景里,这个是怎么考量的? Tim:我们正在和新加坡、越南的一些机构接触,看这个产品可以怎样用在教育里。 我们这一代人小时候没有 AI。因为没有 AI,遇到问题就要自己学习、自己想办法。这个过程会给思考留下一层底色,你知道自己要去思考、去转化,把看到的东西变成自己的知识。但对 2005 年、2010 年以后出生的孩子来说,AI 可能会伴随他们很长时间。他们在最需要学习、最需要建立自我学习能力的时候,已经有了一个随时可以提供答案的工具。 未来五到十年,可能会出现一种惯性,我看到一个陌生的东西,第一反应也是问 AI。 问题是,人脑有一种很重要的能力,我们会把生活里看到的、课堂上学到的,以及一些原本不相关的东西串在一起,最后形成自己的理解。模型更擅长沿着相关性提供答案。如果一个人长期只接收这些已经被整理好的相关内容,Ta 的思考也可能越来越依赖既有路径。 所以在教育场景里,我们反而不希望一开始就提供生成。学生要先自己写大纲,从大纲出发思考要写什么,然后再完成正文。老师则可以看到 Ta 怎样修改、怎样与系统交流,以及一个想法是怎样逐渐形成的。 先把文字做好 接下来的一个月,Tim 计划与一家越南艺术出版机构更深入地共同工作。 这也是产品第一次更具体地面对地区差异。一套写作工具进入另一个国家,变化的不只是界面语言。 动察 Beating:Creader 接下来的发展规划是什么? Tim:接下来可能会和一家帮助越南艺术家走向国际市场的机构合作。他们每年会出一本杂志,在世界不同地方发行,介绍手上的越南艺术家。我们希望看看 Creader 能不能进入他们真实的创作、编辑和出版流程。对我们来说也是学习,因为专业作者和机构的反馈周期比较长。他们往往已经在写一本书,不会今天使用、明天就给你一个结论。 这是一个小而美的产品,很多东西还是要住进真实的使用场景里,才能知道到底有没有用。 动察 Beating:不同国家的作者使用同一套产品,会不会出现水土不服? Tim:会。语言就是一个非常大的差异。 比如英式英语和美式英语,是两套很不一样的语言习惯。最表面的差别是拼写和用词,比如 colour 和 color、flat 和 apartment、lift 和 elevator,再往下,还有俚语、对话方式和写作节奏的区别。 我们接触过一位英国作者,但他写的是发生在美国的故事。他写作时需要不断查字典、查资料,确认一个美国人物会不会这样说话。因为人的教育背景会进入写作。你受到英式英语教育,很多词会本能地写成英式表达。即使是专业作者,也不是写下来就结束了,他要不断研究、检查和替换。 目前我们主要支持英式英语、美式英语和中文。之后也会探索日文、韩文和法文市场。欧洲的写作氛围很浓,美国则有很多自出版作者,每个市场的写作和出版方式都不一样。 动察 Beating:AI 出现以后,未来的内容还会是一本书、一篇文章吗?它会不会变成可以与读者互动的东西? Tim:我们也在思考交互式小说、世界观构造和多线叙事。但讨论到最后,我还是觉得,文字给人的想象空间远远超过视频和图像。你一旦看到一个画面,脑子里就会形成一个相对固定的形象,很难再完全脱离它。 但读文字的时候,每个人都可以重新想象。为什么一个作品会有那么多同人文和同人图?就是因为大家从同一段文字出发,最后看到的东西并不一样。 未来当然可以有互动小说,可以让读者进入不同叙事,也可以让一个世界长出许多故事。但首先还是要把文字做好。 动察 Beating:投资人会不会觉得这不是一门足够大的生意? Tim:会。和一些投资人聊的时候,他们可能会拿它和 Agent、AI 记忆层这些方向比较,觉得写作工具不是一门特别大的生意。它当然也可以往「记忆层」上套,说我们在帮助 AI 保存一个世界的记忆。这样讲也可以,但我觉得没有什么必要。 我做这个产品,是为了让人写出一个好故事。如果它能帮助我讲出一个融资需要的好故事,那当然也是一种证明。但真的有必要把它讲得那么大吗?我觉得不一定。 它可能不是一个赚大钱的生意,但可以是一个能够延续下去的产品。有兴趣、真正理解这件事的投资人,可以聊。但我更希望先把自己喜欢的东西做好。 今年的目标也很简单,有一百位作者真正使用 Creader,其中十位通过它完成并出版自己的书。做到这一点,我觉得今年的 KPI 就达到了。 我相信 AI 生成的内容越来越多以后,大家也会重新寻找一块相对干净的地方。 被省掉的时间 在《时间与自由意志》中,柏格森区分了两种时间。一种是可以被切分和计量的时间。它属于钟表、日历和生产计划:一分钟接着一分钟,每一个单位看起来都相同。 另一种时间发生在人的意识内部。过去并没有真正消失,而是不断进入现在。一次迟疑可能带着十年前的记忆,落笔写下的文字也带着昨日争吵遗留下来的温度。 柏格森把它称为「绵延」。而写作发生在这样的时间里。 一个作者在两个词之间停下来斟酌,删掉刚写完的一段,又在第二天把它翻找回来。Ta 可能因为一个人物迟迟无法作出决定,也可能在写到一半时离开桌子。那段没有实际产出的时间里,某些东西仍在变化,只是还没有变成句子。 创作不是把时间换算成字数。时间本身就是创作的材料。 大模型生成一千字,可能只需要几秒钟。它能够迅速调动语言中已经存在的模式,根据上下文预测接下来最可能出现的表达。它会停顿,但那是计算意义上的等待,不是一个人在犹豫中重新理解自己。 博尔赫斯把巨大的时间压进很短的篇幅,普鲁斯特则让一个瞬间不断向记忆内部延伸。不同的语言并不只是一套风格选择,也记录了一个人怎样经历世界、怎样忍受停顿,又怎样与自己的时间相处。 写作的瑕疵同样属于这段时间。 一处没有完全收紧的转折,一次过分执拗的重复,一个作者多年以后可能不再认同的判断,都说明写下它的人曾经处在某个具体的位置。Ta 当时只知道这些,也只能走到这里。 不完美有时不是技术上的不足,而是文本仍然与一个有限的人相连的证据。 Creader 处在这个矛盾里,试图给出它的答案。 Tim 把 Creader 形容成一块土地。工具能做的不是提前长出一片森林,而是保留土壤,整理边界,让一个尚未成形的世界有地方继续生长。 土地与生产线不同。生产线要求稳定、准确和准时交付,土地则允许等待。种子可能迟迟不发芽,枝叶可能长向错误的方向,杂草丛生也可以再造一个新世界。 把创作理解为土地,意味着工具提供的不是一个更快抵达终点的办法,而是一种容纳未完成的空间。 在一个结论变得过于容易的时代,我们也可以选择暂时不把故事写完。 原文链接

对话Creader创始人Tim:让AI记住世界,把故事留给作者

原文标题:《对话Creader创始人Tim:让AI记住世界,把故事留给作者》
原文作者:动察Beating
7 月 23 日,东野圭吾去世,终年 68 岁。
四十多年里,他写下了 106 本书。《白夜行》《恶意》《嫌疑人 X 的献身》《解忧杂货店》,共同构成了一个庞大的平行世界。
许多读者对那个纸面之内的世界并不陌生。他们知道加贺恭一郎会沿着东京的街道继续追查,汤川学总能从物理现象里看见被掩盖的真相,也知道在案件之外,还有陷入债务的家庭、被升学压住的学生、无法摆脱过去的普通人。
凶案只是入口,真正留在故事里的,是欲望怎样产生,秘密怎样扩大,一个人被自己的选择慢慢推向结局。
东野圭吾笔下的世界显得真实,因为每件事都有来处。一个人在三章前说过的谎,不会凭空消失;一段童年经历,会在许多年后改变并肩前行者的命运;一只摆错位置的杯子,一封没有寄出的信,都可能在故事结束前重新获得意义。
推理小说把庞杂的世界缩小成一个可以进入的现场。在现实里,许多事情没有解释,许多关系无疾而终,但在这几百页的辗转游移中,至少有一些痕迹能够被追溯,一些选择会产生后果。
读者由此获得一个暂时的落脚点。
作家让这个平行世界始终拥有自己的重力。世界观越庞杂,保持重力越是难事。人物会增加,时间线彼此交错,一句无意间写下的话,可能在十万字后变成伏笔。一个角色不能突然忘记自己的过去,一场战争不能发生在错误的年份,一段关系也不能在毫无理由的情况下改变方向。
长篇写作真正缺少的,往往是承载整个世界的记忆。
Creader 想处理的,正是这部分工作。它把人物、地点、事件、关系和时间线从小说中提取出来,让它们成为彼此连接的结构。
在大量 AI 产品尝试替人生成故事时,Creader 的创始人 Tim 更关心另一个问题:技术能不能进入创作,但别那么着急替创作者把一切完成?
这不是 Tim 第一次接近这个问题。
2014 年,Tim 来到英国。那时英语还不熟练,网络小说成为他进入另一个世界的入口。后来他学习计算机,做过阅读平台,研究过区块链与知识产权,也进入过围绕 IP 基础设施建立的创业公司。十多年里,技术不断变化,问题却始终留在原地。一个人怎样把头脑里的世界完整地表达出来,又不在工具的帮助下失去自己的判断?
2025 年年底,Tim 开始重新做这件事。他认为,写作最重要的部分,仍是是那些无法被加速的时刻。作者还不知道答案,人物仍然拥有几种可能,故事没有过早变成一个完整、流畅,却不再属于任何人的东西。
世界的重力
Tim 爱读网络小说,也读历史小说。最近看的一本以咸丰年间为背景。作者把人物放进清廷、英法联军、大沽口之战,以及东南亚华人社会的变化中。真实历史构成边界,虚构人物则在边界内生活、迁徙和作出选择。
Tim 喜欢这种写法。历史没有被当作简单的背景板,而是持续进入人物的命运。读者可能因为一个虚构人物去接近一场真实的战争,又因已知晓战争最后的结局,对人物尚未发生的命运产生担忧。
世界的可信,来自历史、人物与后果之间的连接。
动察 Beating:你会怎样判断一个故事是不是好故事?
Tim:我最在意的是人物有没有真正生活在那个世界里。一个故事可以有很复杂的设定,但如果人物只是帮助作者推动情节的工具,读者很快就会感觉到。真正让我记住的故事,人物都有自己的理由。即使他做了一件错误的事,你也能理解他为什么走到那里。
我最近会看很多历史小说和架空历史。历史小说很有意思,因为作者不能完全随意。Ta 要尊重已经发生过的事,同时在真实历史留下的空隙里创造人物。
比如我读到一本写咸丰年间的小说,里面涉及英法与清廷的关系、大沽口之战,也写到吕宋、爪哇一带的华人。读到某些地方,我会停下来查真实历史。一个虚构故事把我重新带回了现实。
对我来说,这就是一个故事有生命的表现。它不是把你封闭在小说里,而是让你从小说出发,重新理解外面的世界。
动察 Beating:你提到今年获得布克奖的小说《台湾漫游录》。它吸引你的是什么?
Tim:它写的是日据时期的中国台湾,通过一位日本女作家和一位中国台湾译者的同行,把食物、语言、殖民关系和两个人之间的情感放在一起。我很喜欢它对「翻译」的处理。翻译不是把一句话换成另一种语言,而是一个人怎样帮助另一个人理解陌生的地方。这里面有知识,也有权力关系。谁在描述这个世界,谁又在替谁解释,都会影响读者最后看到什么。
这也让我想到,文学不应该只是专业作家的特权。一个人认真记录自己和世界的关系,本身就已经是在写作。普通人的经历未必缺少价值,很多时候只是缺少一种把经验组织出来的方式。
技术真正能帮助的,也应该是这一部分,让已经经历过的东西,有机会被表达得更完整。
一个追了十多年的念头
2014 年,Tim 来到英国。在陌生的语言环境里,网络小说为他提供了最初的稳定感。他被其中庞大的世界、清楚的规则和持续生长的人物关系吸引,也开始思考,中国网络文学已经形成的创作和连载机制,能不能出现在英语市场。
为了回答这个问题,他开始学计算机,后来进入中国的大型科技公司,从运营做起;又在研究生阶段学习超级计算,研究区块链和知识产权。他和伙伴参加比赛,写白皮书,做演示,尝试把故事的确权和收益分配搬到链上。此后,他又先后进入 Story Protocol 和 FLock 等公司,继续接触 IP、区块链、AI 与开发者生态。
这条路径看起来绕了很远,最后仍然回到了写作。
动察 Beating:做 Creader 最早的起点是什么?
Tim:我小时候就很喜欢结构完整的世界。我玩《宝可梦》《火焰纹章》《黄金太阳》,也拼高达。吸引我的不只是某一个角色,而是这些世界有自己的规则。人物、地点、历史和关系可以不断延伸,但它们不是随意拼接的。
到英国以后,这种感受变得更明显。那时我的英语还不够好,网络小说对我来说既是逃离,也是一个落脚点。它让我在陌生环境里还有一个熟悉的世界可以进入。
我当时就在想,亚洲网络文学的创作和发布机制,能不能在西方市场成立。为了做这个东西,我开始学习技术,也做过一些很小的网站。本科毕业项目就是一个阅读平台,只是当时的技术能力和对商业的理解都有限,没有真正继续下去。但我一直没有忘记这件事。
动察 Beating:后来为什么转向区块链和 IP?
Tim:那时我认为,创作行业最重要的问题可能是所有权。一个故事被谁写出来,后续怎样改编,收益怎样分配,这些环节一直不够透明。区块链看起来提供了一种新的基础设施,作品可以登记,授权关系可以被追踪,收入也可以按照规则自动分配。
这套系统在技术上可以成立,但做得越深,我越意识到,它没有解决创作本身的问题。钱包、Token、登记流程,反而可能让阅读和写作变得更重。我们解决了作品完成之后怎样确权,却没有回答一个作品在完成之前,怎样从一个模糊的想法变成真正的故事。
这也是我后来发生方向变化的原因。问题不只在经济关系里,也在人的认知过程里。
动察 Beating:为什么是在现在重新开始做 Creader?
Tim:一个很直接的原因是,AI 编程工具让个人可以完成过去需要一支团队才能做的东西。
以前做一个复杂产品,首先要考虑融资、招人、开发周期。现在一个人也可以快速做出原型,先验证最重要的部分。这让我重新回到十年前的问题。但生成式 AI 也让我看到另一种危险。很多产品都在加速输出,却没有真正帮助创作者思考。它可以快速给你一段完整的文字,但完整不代表这就是你想表达的东西。
我开始意识到,真正需要被保护的不是写字这个动作,而是写作过程中形成判断的能力。
记忆的书写
Tim 把 Creader 称为一个「叙事引擎」。它尽量保留了作者熟悉的写作路径——打开章节,直接落笔。需要帮助时,可以调出对话、结构和分析面板;不需要时,这些功能退到页面之后。
一部长篇小说则被分成几个彼此连接的层次,正文、场景、章节、人物、地点、时间线、规则与关系。系统持续阅读作者写下的内容,把其中可以确认的信息纳入故事的内部档案。
在一个不断生长的世界里,Creader 试图维护的,是人的记忆上限所无法抵达之处。
动察 Beating:你为什么把 Creader 称为「叙事引擎」,而不是 AI 写作工具?
Tim:因为写作工具很容易让人想到生成:你给一个要求,它替你写出一段话。但叙事不只是句子。它还有人物、事件、时间、关系,以及整个世界如何运转。Creader 真正想处理的是这些东西之间的连接。
我们主要看两种一致性。第一种是叙事一致性。比如一个人物的转变有没有铺垫,一条暗线有没有结束,一个章节是否真的推动了故事。第二种是时间一致性。比如人物现在知道什么,不知道什么;他在三天前做了什么;两个地点之间的距离是否允许他在这个时间出现。
随着时间的流逝,很多长篇小说的作者很难同时记住整个世界。AI 在这里最适合做的不是决定,而是记忆和提醒。
动察 Beating:具体使用时,它和 Word、Google Docs,或者直接与大模型聊天有什么不同?
Tim:我们希望主路径永远是写作。用户打开一个页面就可以开始,不需要先完成几十项人物设定,也不需要先学习一套复杂的软件。其他功能应该像支线,需要时再出现。
比如写到一半卡住,可以通过快捷键打开一个面板,询问某个角色此前做过什么,或者检查这一段有没有违背前面的设定。写完以后,系统也可以像编辑一样给出批注。
通用聊天工具的问题是,每次对话都在推动你进入下一轮。它很容易不断给出新内容,却很难长期保存一个故事内部的结构。
Creader 会把故事事实从正文中提取出来。人物、地点、事件和关系不再只是散落在几万字里的名字,而会进入同一个知识系统。AI 调用的不是一段临时聊天记录,而是这个故事已经建立起来的内部现实。
动察 Beating:这会不会反过来让小说变得公式化?
Tim:这是我们很警惕的事情。我们早期选择《红楼梦》《哈姆雷特》等作品作为模型学习的语料来做叙事分析,后来逐渐扩大到大约三十部作品。目的不是学习某个作家的风格,更不是告诉作者应该怎样模仿,而是寻找一些跨越不同作品仍然成立的问题。
比如一段描写有没有承担叙事功能,一个比喻是否来自人物真实的观察,一场冲突有没有改变人物关系。系统可以把这些问题提出来,但不能把文学变成统一答案。
我们更接近编辑,而不是代笔者。编辑可以说,这个地方似乎缺少动机,这条线很久没有出现,或者这一段解释得太多。但作者完全可以不同意。文学里没有所有人都必须遵守的评分标准。
动察 Beating:Creader 允不允许 AI 生成?
Tim:会允许,但生成不是核心。不同用户需要的东西不一样。职业作家可能完全不希望 AI 进入正文,只需要它帮助整理人物、时间线和伏笔。普通用户可能有非常完整的生活经历,却不知道怎样把它变成结构,也可能需要更多帮助。
关键是保留边界。我们希望未来能够清楚区分,哪些内容由人独立完成,哪些是 AI 辅助修改,哪些主要由 AI 生成。使用 AI 本身不意味着没有创作,但读者应该知道它是怎样被完成的。
我不认为必须在「纯手工」和「全部生成」之间选择一个极端。问题是,作者有没有持续作出决定,有没有保留自己的意图、经验和责任。
动察 Beating:如果一个人有自己的想法和创意,只是把打字、整理材料这些「辛苦活」交给 AI,这还算创作吗?
Tim:我觉得这是一个很有意思的问题,你怎么定义创作?
比如你在创作一篇文章的时候,真正投入的是你的想法、创意,以及你想把哪些材料组织进去。以前这些东西要靠手写、打字一点点完成,其中有一部分在我看来就是纯辛苦活。现在用 AI 替代这部分辛苦活,它算不算创作?我觉得还是算。
首先还是要把 AI 定义成一个工具。它没有办法代替人。至少现在,大多数 AI 生成仍然需要由人主动发起,你要和它沟通,告诉它想写什么、从什么角度写、最后希望得到什么。
有些人可能有一个很好的构思,但没有能力把它完整地表达出来。现在 Ta 借助 AI 完成了这件事,不能因此就磨灭掉他原本的想法。Ta 仍然在创作,只是使用了新的工具。
动察 Beating:如果最终的文字主要由 AI 完成,作者的身份应该怎样判断?
Tim:我觉得未来需要把三种情况分开:人工创作、AI 辅助创作,以及 AI 生成创作。
有人只是用 AI 检查语法、整理思路,有人会让 AI 生成一部分,也有人可能几乎全部使用 AI。这些都可以存在,但应该有清楚的标签,让读者知道作品是怎样完成的。
之前有作家被曝出作品中有相当一部分使用了 AI。大家真正愤怒的地方,可能不完全是 Ta 用了 AI,而是 Ta 没有披露这件事,甚至把「读者没有发现」当成一种成功。
专业作家有自己的思维和创作理念。Ta 能够和 AI 合作,写出一本让读者没有察觉到 AI 参与的书,并不意味着换一个人来也可以做到。「如果我上,我也行」其实未必成立。
动察 Beating:但很多读者仍然会本能地排斥 AI 生成的小说。
Tim:如果一个故事足够好,语言也足够好,我个人不会仅仅因为它使用了 AI,就拒绝阅读。但很多人担心的是,AI 是不是要代替作家。媒体也经常用「AI 能够替代什么」来描述它,这会让创作者产生直接的威胁感。
我觉得有人对古法的执着不是坏事。编程也一样,有人愿意自己一行一行写。AI 不是万能的,传统方法有时仍然有价值。
关键还是要看一个人为什么使用 AI。
一个专业作者可以一天写八千字、一万字,Ta 可能根本不需要 AI 替自己生成。相比之下,Ta 真正需要的可能是整理思路,我脑子里有这么多人物、线索和情节,应该怎样把它们编排进去?
所以对不同的人来说,AI 的位置是不一样的。有人需要生成,有人只需要协作。工具应该适应人的能力,而不是要求所有人用同一种方法写作。
让答案晚一点出现
AI 生成式写作最明显的问题,是事实错误、陈词滥调和语言重复。但 Tim 认为更难察觉的危险来自于速度,AI 总是能太快给出一个看起来正确的答案。
文本变得完整了,思考却可能在完整之前停止。
Tim 把这种状态称为「过早的连贯」。大模型擅长为缺口寻找最合理的补全,而创作恰恰需要缺口暂时存在。人物可以不稳定,动机可以彼此冲突,一个想法也可以在很长时间里没有名字。
在这些尚未确定的部分里,创作者才有机会发现自己真正想写什么。
动察 Beating:你自己写东西,为什么还是更愿意自己打字?
Tim:和 AI 交流是很快的。它是一个来回的过程。它生成一段,你读完,发现这里不对,马上就会开始下一轮对话。你的大脑会不断往前走,很难真正慢下来。
但自己写的时候不一样。写作其实是一个放慢脑海中思考速度的过程。你写到一半,会停下来想,我现在是不是走在一条对的路上?我写的是不是我真正想写的东西?
如果直接使用 AI 生成,你更多是在阅读和判断它的答案。这里错了,就让它再改;那里不对,就马上进入下一轮。中间少了一个自己慢慢形成句子的过程。
所以我觉得,手写也好,自己打字也好,这种古法写作是在帮助人放慢思考,让你有更多时间不断拷问自己表达的价值。
动察 Beating:对你来说,写作或者文学最珍贵的部分是什么?
Tim:当然我不是文学背景出身,我是从一个计算机背景去看文学。对我来说,文学主要有两个意义。
第一个,是记录你和世界的交互。人为什么要记录、为什么要写?最早是希望很多事实可以被后世看到。一个人在什么地方生活,经历了什么,Ta 怎样理解那个时代,都可以通过文字留下来。
第二个,是记录你脑海里的想象力。当人看到更多、经历更多,和世界发生更多交互以后,想象力也会被打开。为什么会有科幻、玄幻,为什么会有《百年孤独》?就是因为一个想象在某个人的脑海里萌发,然后被记录下来,最后成为一个不存在于现实,却能够被很多人进入的世界。
我觉得文学的本质,还是让人把内心的世界表达出来。
每个人都在想一些东西,只是 Ta 不一定愿意说,也不一定愿意把它发到微博或者其他公开的社交网络上。但有些时候,Ta 仍然想把这一刻的想法记录下来,于是就会写一篇笔记。
文学不是强制性的,不是说写出来就一定要给别人看。
你把这一刻的想法留给自己,我觉得它也可以是文学。最重要的是,你把脑海里的东西记录了下来。
动察 Beating:听说你们还想把 Creader 放进教育场景里,这个是怎么考量的?
Tim:我们正在和新加坡、越南的一些机构接触,看这个产品可以怎样用在教育里。
我们这一代人小时候没有 AI。因为没有 AI,遇到问题就要自己学习、自己想办法。这个过程会给思考留下一层底色,你知道自己要去思考、去转化,把看到的东西变成自己的知识。但对 2005 年、2010 年以后出生的孩子来说,AI 可能会伴随他们很长时间。他们在最需要学习、最需要建立自我学习能力的时候,已经有了一个随时可以提供答案的工具。
未来五到十年,可能会出现一种惯性,我看到一个陌生的东西,第一反应也是问 AI。
问题是,人脑有一种很重要的能力,我们会把生活里看到的、课堂上学到的,以及一些原本不相关的东西串在一起,最后形成自己的理解。模型更擅长沿着相关性提供答案。如果一个人长期只接收这些已经被整理好的相关内容,Ta 的思考也可能越来越依赖既有路径。
所以在教育场景里,我们反而不希望一开始就提供生成。学生要先自己写大纲,从大纲出发思考要写什么,然后再完成正文。老师则可以看到 Ta 怎样修改、怎样与系统交流,以及一个想法是怎样逐渐形成的。
先把文字做好
接下来的一个月,Tim 计划与一家越南艺术出版机构更深入地共同工作。
这也是产品第一次更具体地面对地区差异。一套写作工具进入另一个国家,变化的不只是界面语言。
动察 Beating:Creader 接下来的发展规划是什么?
Tim:接下来可能会和一家帮助越南艺术家走向国际市场的机构合作。他们每年会出一本杂志,在世界不同地方发行,介绍手上的越南艺术家。我们希望看看 Creader 能不能进入他们真实的创作、编辑和出版流程。对我们来说也是学习,因为专业作者和机构的反馈周期比较长。他们往往已经在写一本书,不会今天使用、明天就给你一个结论。
这是一个小而美的产品,很多东西还是要住进真实的使用场景里,才能知道到底有没有用。
动察 Beating:不同国家的作者使用同一套产品,会不会出现水土不服?
Tim:会。语言就是一个非常大的差异。
比如英式英语和美式英语,是两套很不一样的语言习惯。最表面的差别是拼写和用词,比如 colour 和 color、flat 和 apartment、lift 和 elevator,再往下,还有俚语、对话方式和写作节奏的区别。
我们接触过一位英国作者,但他写的是发生在美国的故事。他写作时需要不断查字典、查资料,确认一个美国人物会不会这样说话。因为人的教育背景会进入写作。你受到英式英语教育,很多词会本能地写成英式表达。即使是专业作者,也不是写下来就结束了,他要不断研究、检查和替换。
目前我们主要支持英式英语、美式英语和中文。之后也会探索日文、韩文和法文市场。欧洲的写作氛围很浓,美国则有很多自出版作者,每个市场的写作和出版方式都不一样。
动察 Beating:AI 出现以后,未来的内容还会是一本书、一篇文章吗?它会不会变成可以与读者互动的东西?
Tim:我们也在思考交互式小说、世界观构造和多线叙事。但讨论到最后,我还是觉得,文字给人的想象空间远远超过视频和图像。你一旦看到一个画面,脑子里就会形成一个相对固定的形象,很难再完全脱离它。
但读文字的时候,每个人都可以重新想象。为什么一个作品会有那么多同人文和同人图?就是因为大家从同一段文字出发,最后看到的东西并不一样。
未来当然可以有互动小说,可以让读者进入不同叙事,也可以让一个世界长出许多故事。但首先还是要把文字做好。
动察 Beating:投资人会不会觉得这不是一门足够大的生意?
Tim:会。和一些投资人聊的时候,他们可能会拿它和 Agent、AI 记忆层这些方向比较,觉得写作工具不是一门特别大的生意。它当然也可以往「记忆层」上套,说我们在帮助 AI 保存一个世界的记忆。这样讲也可以,但我觉得没有什么必要。
我做这个产品,是为了让人写出一个好故事。如果它能帮助我讲出一个融资需要的好故事,那当然也是一种证明。但真的有必要把它讲得那么大吗?我觉得不一定。
它可能不是一个赚大钱的生意,但可以是一个能够延续下去的产品。有兴趣、真正理解这件事的投资人,可以聊。但我更希望先把自己喜欢的东西做好。
今年的目标也很简单,有一百位作者真正使用 Creader,其中十位通过它完成并出版自己的书。做到这一点,我觉得今年的 KPI 就达到了。
我相信 AI 生成的内容越来越多以后,大家也会重新寻找一块相对干净的地方。
被省掉的时间
在《时间与自由意志》中,柏格森区分了两种时间。一种是可以被切分和计量的时间。它属于钟表、日历和生产计划:一分钟接着一分钟,每一个单位看起来都相同。
另一种时间发生在人的意识内部。过去并没有真正消失,而是不断进入现在。一次迟疑可能带着十年前的记忆,落笔写下的文字也带着昨日争吵遗留下来的温度。
柏格森把它称为「绵延」。而写作发生在这样的时间里。
一个作者在两个词之间停下来斟酌,删掉刚写完的一段,又在第二天把它翻找回来。Ta 可能因为一个人物迟迟无法作出决定,也可能在写到一半时离开桌子。那段没有实际产出的时间里,某些东西仍在变化,只是还没有变成句子。
创作不是把时间换算成字数。时间本身就是创作的材料。
大模型生成一千字,可能只需要几秒钟。它能够迅速调动语言中已经存在的模式,根据上下文预测接下来最可能出现的表达。它会停顿,但那是计算意义上的等待,不是一个人在犹豫中重新理解自己。
博尔赫斯把巨大的时间压进很短的篇幅,普鲁斯特则让一个瞬间不断向记忆内部延伸。不同的语言并不只是一套风格选择,也记录了一个人怎样经历世界、怎样忍受停顿,又怎样与自己的时间相处。
写作的瑕疵同样属于这段时间。
一处没有完全收紧的转折,一次过分执拗的重复,一个作者多年以后可能不再认同的判断,都说明写下它的人曾经处在某个具体的位置。Ta 当时只知道这些,也只能走到这里。
不完美有时不是技术上的不足,而是文本仍然与一个有限的人相连的证据。
Creader 处在这个矛盾里,试图给出它的答案。
Tim 把 Creader 形容成一块土地。工具能做的不是提前长出一片森林,而是保留土壤,整理边界,让一个尚未成形的世界有地方继续生长。
土地与生产线不同。生产线要求稳定、准确和准时交付,土地则允许等待。种子可能迟迟不发芽,枝叶可能长向错误的方向,杂草丛生也可以再造一个新世界。
把创作理解为土地,意味着工具提供的不是一个更快抵达终点的办法,而是一种容纳未完成的空间。
在一个结论变得过于容易的时代,我们也可以选择暂时不把故事写完。
原文链接
Войдите, чтобы посмотреть больше материала
Присоединяйтесь к пользователям криптовалют по всему миру на Binance Square
⚡️ Получайте новейшую и полезную информацию о криптоактивах.
💬 Нам доверяет крупнейшая в мире криптобиржа.
👍 Получите достоверные аналитические данные от верифицированных создателей контента.
Эл. почта/номер телефона
Структура веб-страницы
Настройки cookie
Правила и условия платформы