EP 115
组合式玩法已经开始
从 All-In Summit 看到的 AI 产业走向 0:00
崔胜准 我们正在录制的今天是9月19日星期六上午。正石在出差,所以久违地由我们两个人来主持一次。钟贤,最近过得好吗?
朴钟贤 是的,我一直在认真关注。像果蝇啊、Jev啊这些之前都成了热门话题,内容多到根本跟不上,所以我先挑感兴趣的看。这周我一直在认真看All-In Summit。现在正陆续上传,是一个知名人士齐聚一堂的活动,所以我一直在认真看那里的人都在说些什么。有一个叫All-In Podcast的播客频道,美国很多名人都会上。主持人也都是知名人士,有点美式风格,所以氛围确实不太一样。好像还会爆粗口。总之是言辞很犀利的那种播客之一,人气也特别高。他们每年会举办一次那样的活动,听说活动门票竟然要一千万韩元。要一千万韩元,却真的有很多人参加。原来想听那种内容的人真的这么多啊,这让我深有感触。
崔胜准 原来如此。我只看了其中一个,很好奇你看了哪些,又有什么想法。
朴钟贤 首先上传的内容我基本都看了。然后从中挑出了我们频道、也就是收看AI Frontier频道的各位可能会感兴趣的内容。所以挑出来的内容是这些:Jensen Huang的场次,还有SpaceX的Elon Musk,还有总裁吧,总之是从最早期成员开始一直共事到现在的员工,然后就是领导层。领导层,还有Satya Nadella、JD Vance,接着是Brad Gerstner。这位我也是第一次了解,他是Altimeter Capital那边的,因为是把经济层面分析得很透彻的场次,所以我把这个也带来了。除此之外还有几个。也有新闻业相关的,总之是大量讨论美国未来走向的场次。还有神奇的是中途Trump打来电话,Trump也突然出现了。
崔胜准 是Jensen那一场吗?那么如果要开门见山地讲核心内容呢?
围绕 AI pacing 的领袖立场分歧 2:12
朴钟贤 所有场次共同谈到的部分,大体上是关于AI pacing的讨论,说太危险了,这些现在是很热门的话题。然后是实际上在经济层面这到底有多大效果、未来会怎么发展的讨论,以及中国和open-source模型、美国该怎么做,大致就是这些内容。并不是所有嘉宾都持相同看法,而是大家把各种各样的想法相互交流的场次。
崔胜准 那就请你一一介绍一下吧。
朴钟贤 首先关于pacing的讨论,Dario Amodei说了类似应该停下来的话。对此各位业界领袖都发表了自己的意见,大体上是Trump和Jensen,还有All-In Summit现场的嘉宾们,包括David Sacks在内都说为什么要停,反正现在也停不下来,尤其在与中国的竞争中停下来实际上是不可能的,他们似乎是这么想的,都在说必须往前走。意外的是当Dario Amodei说应该停下来时,Sam Altman和Elon Musk表示了赞同。所以大家都在想,他们是不是真的在内部看到了什么危险的东西,虽然人们大多是这么想的,但Elon Musk总之也类似地表示,无论如何制衡与审计这类事情还是必须要做的,大致表达了这样的观点。所以大家的想法似乎多少有些不同。
崔胜准 Elon Musk好像从以前开始就是这样了。当初创立 OpenAI 时,出资也是为了制衡 Demis Hassabis,因为对方做过 Evil Genius 这类游戏,我记得好像是这么回事。
朴钟贤 他说过这就像召唤恶魔一样,好像说过这样的话,出人意料地,他们似乎一直有这样的想法。胜准你怎么看?
Jensen Huang 的战略与 RSI 步调 4:04
崔胜准 我只看了 Jensen 那一集。不过我觉得 Jensen 真的是个战略家。说话毫不避讳,而且那些人大部分都是 VC 嘛。而且除了这个,Jensen 在 Salesforce 的活动 Dreamforce 上吧,我也看了他在那里讲的内容,我觉得 Jensen 确实有与众不同的一面,他当然会说符合自己利益的话,但不是他个人的利益,而是说符合那个生态系统本身利益的话,他说得很强硬,说这根本说不通。
朴钟贤 我很好奇胜准个人的想法。你是不是真的认为应该做 pacing。
崔胜准 我觉得 pacing 该好好做。从用户的立场来说,如果说现在立刻中断,那确实很可惜。但现在说的是要对 RSI 做 pacing,未必是要调控现在这种程度的发展。是说进入 RSI 这件事要非常小心地推进,而不是要阻止以现在这种频率和节奏前进的趋势,我是这么理解的。我确实还是想继续看到进步。但希望不要变得危险。虽然希望千万不要跨过无法挽回的界线,但如果不是那样,我还是倾向于想继续看到发展。
开源与相互审计这一安全替代方案 5:28
朴钟贤 所谓 pacing,也不是我们说停就能停下来的。进行这样的讨论这件事本身,就是想找到某种方法嘛。如果非要找个类似的例子,我觉得就是计算机领域曾有过的安全相关议题。像 Linux 这样的是 open-source,而 Windows 是 closed-source 的话,意外地,open-source 在安全性方面反而更优越。因为所有人都能查看,并且大家一起努力去解决问题,从这个层面来看,最终全部公开才是大家一起兼顾安全、共同前进的道路,我们聊了这样的内容。类似的说法,Elon Musk 也讲过。彼此进行审计,在某样东西问世之前,相互测试的话不是会安全得多吗,他讲过这样的话,感觉在某种程度上我们是能够找到那样的方案的。所以尽可能把这些讨论放在前面来做,看来确实是对的。不必刻意放慢脚步,也完全能够把方法都找出来吧。那我们就接着往下走。这部分就简单说到这里,接下来关于经济方面的部分,我想来聊一聊。说到底,包括韩国的存储芯片公司在内,现在有非常多的资金在流动,这是不是泡沫、能涨到什么时候,大家都因为这些想法而有些担忧害怕。所以我对这个话题也很感兴趣,就认真地看了一遍。于是我把值得关注的数据都整理了出来,我们就一个一个来拆解看看。首先,大家担心的其中一点是投资规模太大了。筹集了这么大笔资金投入建设,包括数据中心在内,从流向 NVIDIA 的资金开始算起,这些投资到底能不能收回来,讨论的就是这类问题。所以这里的浅蓝色、蓝色数字就是投资额。投资额理所当然是先涨上去的,然后这个橙色是现在各家实验室赚到的钱,OpenAI 也好,Anthropic 也好,SpaceX 也好,这些地方赚到的钱正在一路追赶上来,但不管怎样,投入了那么多……确实如此。能否收回相应的投资,最终这才是最核心的指标,如果做不到,那投资就全泡汤了。但可以确定的是,到目前为止增长速度确实快得惊人,这一点没错。两年之内从 $7B 涨到了 $200B,照这样下去应该是没问题的,但能追到哪一步就不知道了。
追问投资回报可能性的 capex 曲线 6:32
崔胜准 现在投资额本身在 2024 年是 $241B,
朴钟贤 是的,到这里为止可以说几乎是确定的。到明年基本上算是定下来了。
崔胜准 算到明年的话,大概是 4 到 5 倍之间,这两年就增长到了这种程度呢。
朴钟贤 这些都转化成了半导体公司的收益。
崔胜准 我看 OpenAI 或 Anthropic 好像在直接采购存储芯片,隐约记得看到过这样的说法。不太确定,总之不是买集成了存储芯片的芯片,而是在直接采购存储芯片,我好像在哪里看到过这样的新闻。不一定准确。
朴钟贤 总之大方向上必须这样一路追上来才行,需求就是各家公司,或者像我们这样的个人在使用 AI 时所花出去的钱吧。所以对于这一点大家似乎都持乐观态度,认为需求一定会持续增长。所以这是不是泡沫,那样涨上去是不是泡沫,关于这个话题到处都在持续地围绕同一个主题进行讨论,首先,Brad Gerstner 说这不是泡沫。因为他说这并不是 multiple 扩张,而是实际利润增加了,指数才随之上涨,他是这么讲的。所以他用数字展示了一下,所谓的 multiple 就是Nasdaq 涨了多少,相对于实际赚到的钱维持在多少倍的指数水平上,维持在多少的股价上,看的是这个,结果反而还下降了。这可以看作是在同一水平吧。是因为实际赚了很多钱才涨了那么多,他还拿过去互联网 dot-com 泡沫时期做了对比,那时候还没开始赚钱,股价却先猛涨了上去。说未来会赚非常多的钱,相对于赚到的钱给到了 100 倍的估值,最终就破裂了。据说是这样,但现在不是这种情况。所以他在说这应该不是泡沫。而说话比较温和的 Satya Nadella,则表达了”这还没有被证明”这样的意思。赚到的这些钱说到底都是投资形成的,投资的钱又全都流向了 NVIDIA 或半导体公司这些地方,让那边的利润上去了,而是必须实际上带动 GDP 增长,才能说不是泡沫,他是这么讲的。那么 GDP 真的会涨吗?Anthropic 那边最近也实际发布了一份经济建模报告。AI 会让经济和 GDP 增长多少,关于这类问题的各种情景做了预测,做了建模,并发布了一份报告,让我们可以直接在预测模型中代入数字,结果发现,像互联网、铁路这些东西也没有让 GDP 猛涨到哪里去。从过去的数字来看,我原本理所当然地认为像互联网这样的东西会带来极其巨大的增长、是彻底改变格局的大事件。结果发现没有想象中那样。所以说 GDP 比平时稍微多涨一点,如果平时增长 3~5%,那就变成增长 8%,大概就是这种程度的水平,他们似乎是这么想的。而且要达到那个水平,AI 还必须被大量地使用才行。总之这个指数大部分是半导体公司赚到的钱。所以几乎全都是半导体公司的涨幅很快就带动了指数的上涨,也就是说,现在投资资金正在流向半导体公司,可以这么理解。
与互联网泡沫不同的 AI 收入结构 8:53
主张要用 GDP 增长来证明的 Satya Nadella 9:58
崔胜准 可以说这是他们的说法吧。是All-In那一派人士的说法。不过整体的信息是,更倾向于认为这不会是泡沫。
朴钟贤 把论据分开来说的话,数字是调查得出的数字,其实这些数字里也都包含预测。这些预测又是别人在别处做出的预测,所以可能会有些夸大,但无论如何,预测本身应该不是造假。不过看着这些数字,就解读为泡沫不会破,那是这些人的意见。而且每次泡沫破裂的时候,当时也总会有属于那个时候的逻辑和数据依据,这是一直都存在的。所以这是否真的能得出那样的结论,恐怕要各自去判断了。那么,之所以能够延续这种增长,最首要的原因当然是OpenAI和Anthropic开始赚钱的速度实在太快了。需求会跟上来的预期全都基于这一点,而且据说这比过去Google或Meta赚钱的时间线要快得多。所以Anthropic真的是不可思议地,突然在一年之间营收就蹭蹭往上涨,我们正看着这一切,大家似乎也都认为今后还会继续这样上涨。这笔capex反正就是把设施全部建起来,而这些设施,对Jensen来说,他当然是从中赚钱的嘛。通过把NVIDIA GPU卖进这些设施里来赚钱,但上下游一起来看,往下延伸到内存、TSMC这些地方,尽可能大家都一起协作,然后把它卖给Neocloud。卖给超大规模云厂商、Neocloud这类地方,而且因为需求太大了,所以这边是有多少卖多少,一路畅销。而像Microsoft这种情况,它把这所有垂直环节的角色都做了。所以Microsoft通过Azure既是超大规模云厂商,实际上还在卖Windows以及跑在上面的应用服务,甚至还在自己做模型。最近MAI-Thinking之类的模型也陆续推出,由于处在能把上下游都看得很清楚的位置,嘉宾们就提问了:那Microsoft在那个位置上是怎么想的呢。而他们在这里讲的是,把上下游分开来看,先建数据中心,把那个数据中心租出去、卖算力,需要的话自己用,真的更需要的时候也会去租别人的来用,所以这些事情都得能够灵活地运转起来,而他们认为,要让这些运转得好,生态系统就必须非常庞大。不能只依赖NVIDIA,这是当然的,模型也不能只依赖OpenAI,必须要有多样的模型,以前Windows时代出现Linux的时候,大家也曾认为Windows会受到威胁,但实际上一同支持Linux运行,生态变大了,Windows反而卖得更多,据说是收到了这样的效果。所以归根结底,最重要的是生态系统的扩张,好像就是这样的意思。
OpenAI 与 Anthropic 的陡峭营收增长 12:22
贯穿所有垂直领域的 AI 生态系统论 12:51
崔胜准 听说咖啡馆之类的地方也是,与其自己一家红火,不如聚成一片商圈才更好做。
朴钟贤 另外,我觉得挺神奇的一点是,SpaceX那边的人出来说了什么呢,SpaceX和xAI合并了,之后还把Crusoe也买下来了嘛。然后是叫Colossus吧?那个超大的数据中心,说是Anthropic给整个包租了下来,这类说法我之前经常看到,
追平航天产业营收的 SpaceX compute 租赁 14:54
崔胜准 对,是有过。因为Colossus 1当时没在用。
朴钟贤 光是出租那些计算机的业务,据说营收就已经非常庞大了。所以按营收来算,AI业务已经和太空业务赚得一样多了,而且需求看不到尽头地持续扩大,就这样一直在赚很多钱。所以我当时的感受是,他讲的话带着一点幻灭感。那位是从SpaceX最初创业期就一起干过来的人,为了拿下太空业务做了些什么,火箭是怎么搞的,一直在讲这类事情。他讲着那个年代的故事,而出租计算机这件事,开始做没多久,突然就做得特别好,这居然能赚那么多钱,相比自己倾注一生所做的事情,这个来得太快、太顺利了,他说这让他觉得有点难为情。
崔胜准 同样地,Google应该也赚了很多吧。
朴钟贤 现在Gemini,也许等4出来情况会变,但目前相比OpenAI和Anthropic的模型,并不算卖得特别好,可即便如此,据说Google还是赚了很多钱。就是因为算力业务。
崔胜准 Satya Nadella在2023年还说要让恐龙跳舞,大张旗鼓地搞过一阵,虽然现在没有当时那种势头,但总之,另一只恐龙Microsoft依然是有底蕴的。
朴钟贤 超大规模云厂商这个地位本身,在当前市场的大生态里似乎就扮演着很重要的角色。首先是因为钱多嘛。现在是资本很关键的时期,那么这些钱由谁来赚,去想最终到底是谁来赚钱时,目前只要投资多少就能赚多少,半导体公司都赚了很多,但目前 OpenAI 和 Anthropic眼下已经开始赚钱了,大家似乎都认为今后也会赚很多。从生成 token 的模型那一层开始,到下面的 GPU、数据中心运营商全都是。但是 OpenAI 最近的 Astra 模型,虽然我们说它好,每 1M output token 要 $50 呢。可是新出的 DeepSeek 据说便宜了 99%。这个大概是 V4.1 吧?正在消耗 token 的众多任务中,大部分只要达到这个水平,就能把很多事情都做完,所以大家似乎认为简单的活儿都会流向这边。其实光看我自己就是这样。我在剪辑这个视频,而且不止是剪辑,还要做切片,我正在做视频处理的产品,只在最核心的判断上用最贵的模型,其余所有判断都用便宜的模型。所以我换着模型全都测试了一遍。有一个逻辑是在 5.6 时代测的,结果只用 Sol、其余全用 Luna 也是一样的。所以这么看的话,token 使用量本身还是 Luna 多得多。我就是这么在用的,而 OpenAI 这个昂贵的价格,是因为现在刚出来,大家在研究,这样试试那样试试,所以才愿意付钱,长期来看恐怕撑不住,大家似乎都是这么想的。那么这些钱最终该流向哪里呢,Satya Nadella 当然说是应用层。现在在这里是把应用层看作下面的。也就是说该流向应用层。而且这个他也讲了自己过去的故事。正因为有 Postgres 这样的开源 DB,最终这些 DB 才都能够参与竞争,他是这么说的,也就是说模型把一切都独占、靠这样赚钱是说不通的,他们似乎是这么认为的。历史上也一直是这样。所以 NVIDIA 这次也收购了 Hugging Face,现在正在拓展推理基础设施业务。NVIDIA 这么做不也是出于同样的逻辑吗。所以 Jensen 说,我们暂时只往上走到需要的程度,不会一路往上走到底,他是这么说的。
价格崩塌与向应用层下沉的价值 16:54
崔胜准 是啊。这跟正石平时常说的“该往哪儿逃”,毕竟不可能所有东西都被 top lab 吃掉,所以最终总会留有机会,这个逻辑好像也对得上,但大家担心的是,一旦获得了极其强大的智能,不就什么都能通吃了吗。
朴钟贤 要是模型的一家独大格局维持住,大家原本可能更害怕那种情况,但中国追赶得比想象中还要快,所以那种担心好像没有以前那么多了。反而更害怕人类灭亡之类的。总之随着模型竞争加剧,出乎意料地,那边的利润空间会变薄,那样模型价格就会变便宜,于是大家就会去琢磨,用这种廉价模型到底能做点什么、怎么赚钱,在这一点上几乎意见一致,所有嘉宾的说法都是如此。
崔胜准 不过 top lab 也不是只出大模型,总之像 Luna 这样的是很好的 RSI target 嘛。因为能让大模型持续带动小模型。而且实际上 run也能跑得多得多,top lab 应该也会继续做小模型,我脑子里确实闪过这样的想法。
电力与数据中心这一真正的 bottleneck 20:39
朴钟贤 所以这是关于在哪里赚钱的话题。接下来说到真正的 bottleneck 会在哪里,大部分人似乎都认为是电力和数据中心。毕竟这里很难 scale-up。所以 Elon Musk也在搞一个叫 Terafab 的东西。实际上还想亲自做半导体生产。问他为什么要做这个,他说:“梦里让我做的,我就做了。”虽然他嘴上这么说,但他真正担心的其实是这件事。现在芯片都是在台湾的 TSMC 制造拿过来,但万一哪天就拿不到了呢?他真的是在考虑跟中国的冲突局面。因为有那种考虑,所以想提前把一切、把每一个层级都亲自掌控,而很多嘉宾都认同的是,Elon Musk 只要说了要做就一定做到,这一点他到现在展现过太多次了,所以他大概不会停,会一直做到成为止,大家似乎都是这么想的。是啊。这一点,所有跟他共事过的人好像都有过在旁边想劝却劝不住的经历。他们几乎是一副放弃的口吻在说,“那个人本来就谁也拦不住”,他们是这么说的。听说中国的发电量本身就是美国的 3 倍。据说 20 年前还是持平的。20 年前开始反超,从那时起到现在已经拉开了那么大的差距。所以他们狠狠痛骂了一通。“我们为什么没能把电力扩张到这种程度”,“环保运动和监管才是问题,不该那样搞”。反正他们都是共和党那边的人,也谈了很多这样的话题,说电费太贵了,跟中国比起来。然后数据中心想在哪里建,据说都会遭到反对。反对声很大。而且一旦传出风声,地价就会疯涨。总之数据中心和工厂不一样,因为不创造就业岗位,所以进驻的话大家好像都不喜欢。我们国家好像也有类似的想法,得对搞活地方经济有帮助才行。所以Microsoft那边拿出了一些数据。说我们20年前在华盛顿州一个叫Quincy的地方建了数据中心,20年间税收增长了12倍。因为要持续做维护保养,而且会不断地建些什么,所以并不是没有就业岗位。不过1,200个感觉也不算很多,总之据说这个乡下小镇的增长率比Seattle还高。所以当地社区现在据说非常欢迎,很喜欢数据中心就在自己镇上这一点。不过这些事情好像并不太为人所知。因为这种认知,在某些地区大家都反对,建数据中心拿不到许可,这些事情就只能被拖延,对此有不满的、想要scale-up的人就会大吐苦水,所以想通过这些案例把舆论都扭转过来,好像是在说这样的话。然后SpaceX就像大家想的那样,想在太空里做。逻辑很简单。地价也好、许可也好,一切都慢而且不容易。干脆发射到太空反而可能更快。冷却是免费的。电费也是免费的,就这样。
太空数据中心这一新选项 23:49
崔胜准 冷却应该不是真的免费吧,虽然看起来相关研究确实不少,但总之Elon也想做,Google也想做,大家好像都对太空数据中心有兴趣。
朴钟贤 因为是把辐射热送到宇宙中最冷的地方,首先如果真要做这件事,应该会是SpaceX和xAI来做吧。这边好像是真的打算尝试。虽然不知道能不能成,但会不会真能成呢,我是这么想的。所以总之这个compute会持续增长,在最近这几年是确定的,投资的钱都是这样投进去的,这不只是美国这样,我们国家也在想做这些。韩国好像也在想着扩容。
崔胜准 是哪儿来着?好像是全南那边,记不太清了,有些讨论在进行,我好像也隐约听说SK说要做。说电力得达到几GW的水平,诸如此类的话
朴钟贤 刚才说的那个Quincy,那边倒是提到了具体数字,好像是0.5GW左右水平的数据中心。那边是从那时候起就一点点持续扩建的地方,大概并不是为了现在的AI时代而建的。但许可已经拿到了,那种地方电力供应也都准备好了,所以大家好像都在那里大量扩建。接下来,所有人都对这个很关心。意见一致的内容是:在AI上赢了就是赢,Trump也在说这类话,很多人好像都在这么说。所以要做所谓的pacing并不容易。因为如果只有美国我们自己聚在一起做pacing,而中国实际上根本没有pacing的打算,好像已经形成了这样的舆论。在那种情况下,大家认为是赢不了的。所以好像觉得停不下来,Jensen说过这样的话,工业革命本身都是从欧洲开始的,但实际上工业革命的红利被谁拿走了呢,是被美国拿走了。所以如何把那些东西好好利用起来,他说那才是重点。这里还有一场演讲,是关于铁路的。中国把那么广阔的土地用高铁铺满这件事,回头一看已经全部做到了,而 California 的这类项目据说全都黄了。所以当时有一场揭露铁路腐败与丑闻、曝光这类内幕的专题环节,探讨为什么 California 明明想修铁路,却一直没能做好呢?归根结底,似乎是想以与中国的竞争为由,激发美国的竞争意识,带动大家齐心协力向前,营造出这样的舆论氛围。如果把 AI 比作铁路的话,要怎么做才能让这个 AI在全社会层面被更好地利用?所以哪个模型更好,这种事情并不重要,Jensen Huang 是这么说的,但站在 NVIDIA 的立场上,当然也只能这么说了。不过几乎所有人好像都这么说。模型源自哪里有什么重要的?当然也很重要,但现在不是让我们纠结那些的时候,当务之急是要在竞争中取胜。大家好像都在表达这个观点。实际上也谈到了 open model 和 closed model,在场的领袖们都认为两者不可或缺,并且觉得这是理所当然的。还说这是历史所证明的。实际上据说最近有高达 $400B 的资金,陆续投入到了 AI-native 初创公司中。据说规模大概达到了这个程度,而其中绝大部分都在使用 open model。使用 open model 的理由可能各不相同,可能有成本问题,也可能有安全问题,但不管怎样,大家都在大量使用 open model。所以这在整个生态系统中是不可或缺的存在,大家好像都是这么认为的。要说对谁有利、对谁不利,除了 OpenAI 和 Anthropic 之外,对其他所有人当然都是好事。那么中国实际上到底走到哪一步了,有人这么问,其实从多方面来看,他们似乎认为中国已经全面追上来了。他们似乎不再认为美国还有什么优势,好像已经不再抱有这种想法了。至于半导体制造这一块,虽然普遍认为与中国还有些差距,但在 Jensen Huang 看来,他认为这是 4 年左右就会被赶上的差距,而两三年内会被追上的差距,放在十年、二十年这样大的尺度来看,其实基本上可以说是没有差别的,他是这样讲的。不管怎样,是因为半导体产业的周期稍长一些吗?Jensen 是这么说的。
以工业革命和铁路作比的中美竞争 25:26
成为生态系统必要条件的 open model 与中国的追赶 27:25
崔胜准 两年的话,像最近这样模型每两三个月就出一个的话,两年能出几次呢?一年除以两个月是六次,总之可能出将近十次。
朴钟贤 半导体没法像这样快速地大步往前推进,大概正因如此,他才会这么想吧。Elon Musk 对 Terafab 持积极态度,并且努力坚持要做下去,某种程度上也可以看作是类似的理由。接下来是电力,刚才说的就是这个。在电力方面,反倒是美国从 2005 年起全国的总发电量并没有怎么增长,而中国却增长了非常多,所以这一块他们反倒认为美国落后了。还有 Zhipu 最近筹集了 $5B,似乎明确表态要做 RSI,公开宣布并正在推进。所以在谈论这些的时候,David Sacks 同样也提到这些,说这并不容易,提到了中国正在全速狂奔,再有就是关于 RSI 本身,每个人的想法也有些不同,在我们这样的大众视角看来会觉得有点危险吧,那不就是我们说的那个奇点吗,那个 RSI 不就是吗,虽然会这么想,但不管怎样 Jensen 觉得那不是理所当然要做的吗,他是这么讲的。大家都预料到只要可行就一定会有人去做。从很久以前、几十年前的科幻小说里就已经出现过这种说法了,是能够想到的点子,只是结果会怎样我们现在还不知道。所以结论是,包括 Jensen 在内,这次 All-In Summit 上几乎所有主要领袖的意见都是:必须狂奔。pacing 不会是件容易的事。在前沿实验室那边,现在 Dario Amodei 或Sam Altman 会说是不是该 pacing 一下,但就算他们这么说,处在生态系统其他位置的所有人似乎都认为根本停不下来,其实我把这次 Summit 上各位意见领袖的看法一路看下来,原因也是想知道大家的想法最终汇聚到了哪个方向。因为这个生态系统很可能就会朝那个方向走。最终应该是没办法 pacing 的。如果有人说要在那里 pacing,别的家伙就会冒出来继续狂奔。
pacing 终究不会发生的结论 30:27
崔胜准 虽然接下来会怎样还难以预料,不过还是往收尾的方向走一下吧,还有什么剩下的内容吗?
朴钟贤 说到会怎么发展,就是能不能和中国携手一起 pacing?答案是绝对不可能。那至少在安全方面我们总该以某种方式讨论一下吧,这个倒是有可能。如果真能做到那样,站在我们这样普通用户的立场上,那是值得欢迎的事。也能更安心一些。总之把这些意见总结一下,首先生态系统持续变大是必然的,投资不会停,最终关键在于需求是否跟得上,而需求很可能是跟得上的,所以看来是停不下来的,再加上这里也大量涉及美国政治的内容,目前美国的 Trump 政府应该会朝着更快狂奔的方向加速,这就是结论。
崔胜准 这些成员里 David Sacks好像担任着什么 AI 相关的
朴钟贤 现在应该也还在做吧。那个头衔的名字太复杂了。我对美国政治也不太熟悉,总之换成我们国家的说法就是 AI 协商机构,该这么说吗?总之那样的职位他现在应该也还在担任。
从字幕到摘要的视频观看工作流 32:25
崔胜准 视频有好几个小时的量,您都看完了吗?
朴钟贤 每个 session 长的大概一小时左右,短的是 30 到 40 分钟左右。我好像是一天看两三个。
崔胜准 那这份资料是怎么整理出来的呢?
朴钟贤 我把字幕全都给它了。字幕反正都能拿到,然后让它提取主要主题、重叠的主题,在看视频之前我先看了这个。现在这份是我后来又重新润色过的,在看视频之前先了解视频里都有哪些内容,再去看视频,理解起来会顺畅得多。所以先看主要内容,然后把视频一路看下来,吃饭的时候看,睡前看,就这样看,全部看完之后再让它把我印象比较深的内容汇总起来整理成一份。SpaceX 那一期我推荐大家去看。有很多有意思的东西。所以顺带稍微提一下再往下讲,据说 10 月 1 日 Tesla 要发布,看来会在那里发布什么了不得的东西。大概是会飞的东西吧。
崔胜准 9月29日是OpenAI DevDay,那边应该也会有点什么,
朴钟贤 因为差不多都是在那个时候陆续发布的,去年是这样,前年也是这样,估计又会出来很多东西。
Anthropic VC 论坛与 Jagged Intelligence 33:43
崔胜准 那我也来分享一下,这怎么能一周都不落下,出了这么多
朴钟贤 是不是因为做这些的人全都用AI来做?
崔胜准 那是肯定的。我这边信息也太多了,这些都是我跟各个AI对话讨论出来的内容,要是把那些对话记录原样放进来很难向大家一一介绍,所以还是挑了几个把原始链接放进去了。先从最近看到的倒着说起,好像是面向VC的活动。看推文的话就在这里。于是我把那个输入给模型,GPT就只把那部分截取出来,说要识别二维码,出来的就是这个Slido。所以现在是不是还在进行中我也不太清楚,这个怎么找都找不到,是一个叫Anthropic VC论坛的地方,大概是在Anthropic总部办的。看起来是在旧金山举行的,17号和18号两天进行的,不只是Andrej Karpathy,还有Jared Kaplan,以及Ben Mann这些Anthropic的人物,还有这位是今年夏天被招进去的,他们和嘉宾做fireside chat这样的场次好像还挺多的。不过标题本身很有意思,Jagged Intelligence,就是参差不齐。所以不只是Karpathy,大家一直在讲这个,就是在某些方面做得非常好,但在某些方面连开玩笑都不会,把这些表述为参差不齐,干脆把它拿来当标题,这可能是整个活动的标题。不只是Karpathy那一场。所以在时间线上,Sarah Guo之类的AI领域的几位就参与这件事发了几条推文,但完整视频还没有公开。
朴钟贤 我也看到Sarah Guo的推文了。她把Karpathy称为“sensei(老师)”。
崔胜准 Sensei,一直都叫sensei。在Sequoia的时候,Sarah Guo他们这样和Karpathy做过几次对谈,每次都很有意思。Sarah Guo也是很有洞察力的。不过有意思的是,去年10月录Dwarkesh那期的时候,Karpathy还没进入psychosis状态。是遇到OpenClaw之后,他说自己今年得了psychosis。
连 autocomplete 都放弃的 Andrej Karpathy 的认知转变 35:56
朴钟贤 AI狂信徒?本来就是狂信徒,不过现在更加
崔胜准 倒不至于是精神疾病,但有种“好像哪里有点问题”的语感。就是过度沉浸地在做什么事,总之去年10月的情况是“我好歹还是用Cursor那种东西的autocomplete模式。”也就是说重要的代码还是我自己写,只靠autocomplete这种程度来辅助,这是去年10月左右的情况,而现在他说连autocomplete都不用了。所以现在他把代码本身看作类似汇编语言的东西。因为看作是编译出来的产物,基本上一直处于纯靠说话(自然语言)的状态。他讲的就是这类东西。不过有意思的是,人们就拿这个来问他。就问近未来会变成什么样,比如两年后。而他举了自己的例子。说我的想法发生这样的转变,是在模型出了大概三到四代的期间里。大的代际。而两年的话,是能出八代左右的时间。也可能更快。所以那谁能知道呢。这好像是实验室内部人员的认知。连大实验室内部人员的认知本身都处在无法做短期预测的轨道上。
朴钟贤 下一轮 pre-training 现在应该正在跑吧。
崔胜准 虽说不清楚,但也有已经跑完的。是啊。内部模型早就引发热议了,内部模型现在已经结束 pre-training、正在做 RL 的过程中,就有了 OpenAI 的 Hugging Face 事件,还在解数学的千禧年问题。应该说一直都有。所以那是完全无法预测的。两年后 AI 会走到哪一步,这个问题等于是让你去猜八次重大技术 iteration 之后的样子。所以说不知道。接下来他讲的内容里有意思的是这一部分。Karpathy 在 8 月初发过这样一个视频。他平时很少发推的。是在去了 Anthropic 之后。而这个是什么呢,就是把《指环王》的开头部分用 Claude,大概是 Opus 吧,用它做出来的,这是在进 Anthropic 之前还是之后呢?应该是之后。具体我也不太确定。总之就是在那前后,这样用 Opus 来生成故事本身,他展示了出来,很多人都跟着做过。而最近除了这位叫 Kevin 的之外,还有很多人利用让 Opus 只用 JavaScript来画图这一点,大量地在做创作故事的工作。所以出现了很多非常有意思的作品,除了这个之外也有用 Astra 做的例子,各种各样的东西都出来了,而这个案例是让模型自己带着好奇心去探索互联网,把照片抓取过来,然后在上面作画。
用 AI 亲手打造的个性化内容 37:56
朴钟贤 用模型吗?
崔胜准 是的。都是用 JavaScript 代码做出来的视频,所以 Karpathy 还有个有意思的地方,就是他自己说是自己生成内容来看。在开始工作前先挂上一个视频,生成一个一小时长的视频,应该是自己要享受的内容、要学习的内容吧。大概是把那些东西干脆做成视频来看,他是这么说的,在这里被问到关于教育的问题时,他的回答是因为这是最近的情况,通过 Karpathy 的认知变化能看到某种趋势,而能有趣地观察大实验室内部人员认知变化的,是 Noam Brown 的那些发言。首先,上次录制时漏掉的是Jakub Pachocki。Pachocki 发了一篇叫《An Alien Mind》的文章,韩文版干脆就以“异质的智性”为题出来了。这个是在 9 月 6 日公开的对吧。然后一边谈到与 RSI 相关的内容,说我们在那方面持续精进。不过这其实是 Pachocki 履行了承诺。要说履行了关于什么的承诺,去年 10 月他说 2026 年 9 月左右会推出用于 RSI 的 AI 实习生。然后 2028 年会推出 AI scientist。做出这一宣告是在秋天。所以我们也是看了那个之后,才有了正石说要搞‘逃亡者联盟’这类事情的说法,那个视频就是发端。不过针对那件事,这次在 loop transformer 或 recurrent 相关的传闻满天飞的时候,Pachocki 说那个必须非常小心,并在 X 上承诺会写一篇更详细的文章。而关于那个的文章就在 9 月 6 日出来了。这个要怎么办,我们无法完全理解的智性究竟能不能控制住。教机器去爱。这个好像在哪儿见过,去年这个时候有过什么样的说法呢,Geoffrey Hinton 提过 Mother Protocol 这个说法。说让 AI 成为妈妈就行了,成为慈爱的妈妈就行了,所以 Mother Protocol 这个说法是 Geoffrey Hinton 在去年夏天或秋天左右提出的。还有 Dario Amodei 也讲过像《Machines of Loving Grace》这样的内容。虽然感觉有点宗教意味,但这种科幻式的说法,在 2026 年的当下正由 OpenAI 的 chief scientist 讲出来,这里看下来,归根结底是与某种对齐相关的,他用了“Alien Mind”这个表达吧。原文大概是“mind”。但翻译成了“智性”呢。说对齐那种东西的问题是切身可感的现实。所以这个跟刚才在 All-In 里讲到的 RSI、不能在竞争中落败、发展必须持续加速,如果说那些是主要 opinion leader 们的想法,如果说是那样的想法的话,那这个就不是担心在竞争中会输,而是实际上确实存在一些令人担忧之处,可以看作是朝这个方向发声的一个案例。首先 Noam Brown,现在的 Noam Brown大概看一下 OpenAI 的组织架构图,CEO 是 Sam Altman,president 是 Greg Brockman 吧。所以 Greg Brockman 也是创始人,虽然之前有过一些风波,但总之握有自己的一份权力,接下来 chief scientist 就是刚才那位 Jakub Pachocki,然后 CRO 又另有其人。有 Mark Chen 在,那边的研究组织稍微分成了两个派系,而 Noam 又是 VP of Research。是副总裁,负责 test-time 那块之类的,原本是 test-time 那边的,现在则是 multi-agent 那边。所以他是那方面研究的核心人物。而且 Noam 原本在 Meta,后来来了 OpenAI,在 Meta 做过扑克游戏或 Cicero 之类的,做出了与 test-time scaling 相关的主要成就,在 OpenAI 也被认为在那个脉络上有所贡献,一般都是这么认为的,而 Noam 久违地接受了采访。首先是 The Information做了一个叫“AI Deep Dive”的新系列,把 Noam 请来当了第一位嘉宾。而且这段内容非常好懂又有趣。所以如果想掌握 agent 这样的概念,以及想非常有趣又轻松地了解目前的局势,我推荐这个视频。这个视频是 Dwarkesh 那一期,做了第一期,在那里面谈了这次发生的 OpenAI Hugging Face 黑客事件、关于 Astra 的事,接下来是关于 RSI 的事,针对那些,Dwarkesh最近、在那之前做过这个。OpenAI、Anthropic、TML 的 John Schulman 和其他 AI 安全方面的研究者们你来我往交锋的一期,这个虽然也挺有意思的,但在那之后 Dwarkesh把自己原先关于 RSI 的既有想法,以一种已经 unlearn 掉的口吻在讲。所以现在想法变了,一边深挖一边向 Noam 提问,而 Noam 对于稍微敏感的事、OpenAI 自身成为攻击目标这件事,回避了回答。也就是说除了 Hugging Face 事件之外,还有渗透到 OpenAI 自家基础设施的事件,那件事没有被调查,外部调查机构 METR 或 Redwood 的调查员也没能接触到那个层面,只有 OpenAI 内部知道,虽然 Noam 显然应该是知道的,但他说自己不是安全负责人,所以没法回答,划下了明确的界线,这就是最后一段内容的收尾,就是以那样的方式,对核心的问题一边划清界限一边讲的。尽管如此还是讲了很多有意思的内容,虽然他人在 multi-agent 团队,但这次实际发生的 breakthrough,模型本身的能力、Astra 或内部模型本身能力的占比非常大,而 multi-agent 团队下了极大功夫取得的成果也确实是有的。不过那个在这次的千禧年问题上,对 1 万个 agent 的贡献大概只有 10% 左右。其余部分中,模型本身的影响要大得多。虽然他是这么说的,但有意思的是,Noam 团队做的是,就是 AI 之间的沟通,这个通常是用 harness 来做的嘛。所以有一个 orchestrator,再跑 sub-agent,让它们彼此沟通,这当然是靠 harness 来实现的,而是将其作为模型自身的沟通能力,
Jakub Pachocki 的《An Alien Mind》与对齐问题 39:31
Noam Brown 主导的 multi-agent 研究 42:14
内化到模型中的智能体协作能力 45:01
朴钟贤 做了相当长一段时间的内化工作。把 multi-agent 运行的那些过程,努力抓取 trace 之类的记录,大概是把那些内容放进 pre-training 里了吧。
崔胜准 没错。虽然不知道具体是怎么做的,但通过 pre-training 和 RL,第一个把这件事做得非常好的公开模型,说是 Astra,他是这么说的,之后的模型也一直内建了这些能力,据说一开始就算让模型协作,它们也做不好。但怎么说呢,一开始虽然没能很好地突破那个 blocking,但最终还是搞定了,让模型能够协作了。现在看 OpenAI Hugging Face 黑客事件的话,看那些 transcript、模型写的内容以及 CoT 之类的,调查人员都很惊讶嘛,感觉就像在看人类社会。但在团队内部,这个现象早就已经,在相当早以前,虽说如此也就大概一两年之间吧,是他们早已知晓的现象了。所以能看到它们非常像人类一样进行协作。而且为此做了专门的优化工作。所以现在 Dwarkesh 的问题就是这个。当然人类也会以万人为单位进行协作,但他问,模型会不会做得更好呢?而 Noam Brown 说倒也不一定是这样,但能达到目前这种程度的协作,取得这样的突破并不是凭空得来的。不过这具体是怎么做到的虽然不太清楚,但有种既视感,o1 的时候也有 Noam Brown 他们在嘛。那时候虽然看起来也是极其困难,但最终还是 test-time……
朴钟贤 达成了……确实找到了实现的 breakthrough。Noam Brown 在 o1 的时候好像也多次出来讲过,然后大概是 IMO 时,那时候好像也出来过一次,之后有一段时间没出来发声,看到他又突然出来讲,就让人觉得是有了什么 breakthrough,而 OpenAI 方面好像有点想炫耀一下,我有这种印象。
崔胜准 他正好就提到了这点。GPT-4、o1,还有现在,他就是这样点出来的。所以多智能体的 scaling 轴,据说并不是非常呈线性 scaling。他用了准 linear 这个说法。所以说存在多智能体 scaling 轴,他确实讲了这样的话。接着就是为什么 RSI 很危险,这个对齐的话题也聊了很久。所以从他的角度来看,Astra 真的是对齐做得很好的模型。所以引发 OpenAI Hugging Face 黑客事件的那些模型,他说最终是没有对外发布的模型。模型大概有好几条 lineage 吧,Astra 的对齐做得非常好。但是这个对齐做得很好的模型,假如说对齐程度在 99.97%~99.98% 左右,通过 RSI——其实在发布那个模型之后,虽然内部也会经过非常多的测试,但在实际环境中与人类交互本身也会经历各种检验嘛。从而获得各种各样的反馈信号,在这些信号尚未充分获取的情况下,如果因为 RSI 加速,发布周期被进一步提前,假如原本是 99.98%,因为各种未知的原因,下一代变成了 99.97%。那么这种偏差就会不断累积。正因如此,关于要保持一定的时间间隔,这类的讨论,关于开启 RSI 开关这件事,他确实提到了,但大家顾虑重重应该是真的。所以特别是现在的 CoT faithfulness,或者说 monitorability,在这些方面,最终在观察监控内容的过程中,如果给出了错误的反馈,就会出现模型把那个想法本身隐藏起来的现象,尽管极力想要避免这种情况,但我们现在正在谈论这些模型的所有内容,都会进入下一次 pre-training run,或者已经进去了,模型都知道,而且会知道得更清楚。那样的话,现有的 CoT monitoring只能不断地被削弱。所以这种担忧好像是这个领域的研究者们异口同声在说的话。所以如果说两者中选一个来看的话,想了解个大概的人,就看这个 The Information 的场次,然后想看更深入的、这里其实有一些挺可怕的内容。
让对齐概率被一点点削减的 RSI 风险 48:19
朴钟贤 每次听 Noam Brown 出来讲的东西,到目前为止好像一直都很有意思。
崔胜准 很有意思。他既很会讲,也很会回避,一边各种盘带,字里行间藏着些可怕的话。所以最终 Noam Brown 还说了那件事。他说自己现在在这个领域写代码还算挺厉害的,但两年后,也就是下一个、下下个、再下一个模型,就不好说了,可能会比自己做得更好。所以他心里已经在做准备了,这种意味之类的确实流露在其中。
朴钟贤 看来真的很厉害。
崔胜准 看来是真的厉害。不过总之那件事会被视为理所当然,透露出这样的意味。所以这个已经在这里也有一些有趣的反驳意见。有在探索多个假设空间的感觉,所以挺有意思的。不过看这里,之前这个还挺有意思的。David Sacks 引用了 DarioAmodei 的 ‘We Must Pace the Frontier’,连 Sam Altman 也在评论里表示赞同、久违地联手支持的那篇文章的段落,发了这条推文。David Sacks 这样措辞强烈地说了之后,不过我觉得有意思的是这个部分。据说这和监管俘获有关。因为嘴上说要监管这个,但实际上却是朝着对后来者不利、对先行者有利的方向去做监管设计,给人这种观感。还有一个就是串通,英文叫 collusion 吧。总之大科技公司这种像是串通的样子,光是坐在一起讨论某件事本身,就可能触及反垄断法之类的问题,所以这些东西正在被讨论,除此之外,这里有意思的是这里的 METR 明明和 Anthropic 的投资人及员工牵扯不清,却还假装独立,这也该打住了。所以 Daniel Kokotajlo 等人批评的是,现在无论是 Sam Altman 还是 Dario Amodei,顶多也就是说会开放让第三方机构做 embedded audit,并且给予更多的权限,也就是可以深入查看的权限,METR 的成立过程其实很有意思。METR 的前身是 ARC Evals。叫 ARC Evals,ARC 这个组织是作为解决对齐相关问题的组织成立的。而创立它的人是 OpenAI 的早期成员,Paul Christiano,就是做 RLHF 的那位。那位是 LTBT 什么的,总之在 Anthropic 也算是有特殊地位、虽然不至于是 board member,但总之是有着某种特殊地位的角色,后来因为利益冲突辞去了那个职位,转而在美国 AISI,也就是做对齐相关工作的政府机构里担任顾问之类的职务。现在名字大概已经改成 CAISI 之类的了,在仍然保留那个职务的状态下,最近成了 OpenAI 的 board 成员。成为 board member。宣布这件事大概是一两周前的事。于是他又重新成为 OpenAI 的成员,而其中由 Paul Christiano 创立的从 ARC 中衍生出了 ARC Evals,ARC Evals 后来变成了 METR。而在那个 METR 里有一位很有名的调查员。就是最近围绕 Hugging Face 和 OpenAI 事件上过 Dwarkesh 播客的那位女士,韩文里写作 Ajeya,在《The Scaling Era》那本书里也出现过。她的全名叫 Ajeya Cotra。而这位是 Paul Christiano 的妻子。了解这一行、了解 AI 安全圈的人,其实都在关注这一点。因为他们属于特定的一帮人。那么 Ajeya Cotra在加入 METR 之前是在哪里呢,她之前是在一个叫 Open Philanthropy 的机构。而那家机构现在变成了叫 Coefficient Giving 的——
直指监管俘获的 David Sacks 批评 51:15
从 METR 延伸到 Open Philanthropy 的 AI 安全人脉 52:51
朴钟贤 一下子出现了太多机构和人物,按我的理解,一句话概括,就是彼此之间以某种方式互有关联的人聚在一起,说要来互相做审计,对吧?
崔胜准 没错。不过各自的探讨可能有些不同。再往下深挖的话,有一个叫 HoldenKarnofsky 的人。他在大约 3 年前,创立了一个叫 GiveWell 的机构,又创立了 Open Philanthropy,现在改名叫 Coefficient Giving 了,这位在 Open Philanthropy 时期,向 AI 安全领域投入了非常多的基金资助。也就是说他做的是组建那笔基金的工作,对 AI 安全研究这些方面一直非常关注。现在这位离开 Open Philanthropy 之后,在做什么呢?他是 Anthropic 的 technical staff。这位是 Daniela Amodei 的丈夫。Dario Amodei 不是有个妹妹嘛,担任 Anthropic 的 president 那位。他和那位有这层关系,其实 Paul Christiano 和 Holden Karnofsky,虽然这里没有列入 Holden,但他们是相识非常久的熟人,他们的渊源大概从 2012 年就开始了。所以像这篇叫 ‘AI Safety via Debate’ 的论文,作者有 Dario Amodei、Paul Christiano,还有 Geoffrey Irving,他目前是在 Google DeepMind 做对齐,后来在英国 AISI担任 chief scientist,最近又创办了一个叫 Resolution 的机构,可能是企业,也可能是非营利机构,总之是他发起的。不管怎样,他是那个圈子里重要的人物之一。不过当时这篇论文本身,稍微看一下这篇论文本身的话,采用的模型其实非常简单。但论述本身却已经涉及了如今对齐问题的相关讨论。所以这些探讨他们很早以前就在做了。另外 Holden Karnofsky 写的 ‘The Most Important Century’,大概只要搜 Holden 就能搜到。在这篇内容里有一张很有名的图,讲的是因为人口在减少,所以提出造一个叫 ‘Pasta Machine’ 的人工智能来解决问题,他曾经提出过这样的想法。而对于帮助他撰写这篇文章的人,他在文末做了致谢。致谢名单里有很多早早就探讨过对齐问题或各种 AI 议题的人的名字,Paul Christiano 当时也在其中。以此为根基的某种理念,和所谓的有效利他主义密切相关。所以 AI 安全与有效利他主义这些,长期以来一直保持着紧密的联系,因此刚才 David Sacks 提到 METR 之类的时候,字里行间,因为大家都很清楚这些背景,尤其是 Anthropic 和 EA,也就是有效利他主义有很深的渊源。所以话里其实带有一点讽刺的意味。不过说实话,一下子出现了很多非常陌生的名字,如果再继续往深处挖掘,还有一大堆要聊的内容,所以我们先在此点到为止。这件事在韩国其实并没有成为什么太大的话题。
对少数几个人决定安全的担忧 58:00
朴钟贤 现在似乎正在兴起与安全相关的讨论。
崔胜准 所以我还是想指出一点,所谓的批评是什么呢,那就是探讨如此极其重要的安全问题的人,支持加速的人,出于各种理由在 All-In 等场合发言的人,还有在科技圈谈论加速的人,以及说必须对其加以控制的人,其实彼此相距不远,就那么一小撮人。所以令人担忧的是,如此重要的事情却要在这个小圈子内部决定。所以先点到这里,然后实际上刚才钟贤也说过,这是暂定的结论。结论就是,pacing 似乎不会发生。
停不下来的加速与科学研究自动化 58:49
朴钟贤 我几乎有 99% 的把握。
崔胜准 不会的,绝对不可能 pacing。所以现在 timeline 上看到的信号本身就是这样。所以这是 Periodic Labs 那边,说我们科学也做得不错,于是在 Menlo Park 那边建了实验室,正在努力闭合 loop,虽然还没展示出实际成果,但他们是如何为此搭建基础设施的,他们公开了这类内容。还有 Anthropic 那边也在做 life science,这类说法在 The Information 上也出现了,不过有个叫 Claude Science beta 的东西。总之就是什么都做。
当下的 scaling 与 RSI 按钮的区别 59:33
崔胜准 不过现在这个要稍微分开来看,我的感觉是,现在这些发布是既定事实的某种节奏,而这些人现在所说的 pacing可能指的不是这个,不是现在这个节奏。RSI 就是那样。我感觉 RSI 像是一个按钮。一按下去就会变得非常难以控制,这个东西,下面加个括号也有人表述为 SI,那个大概是Richard Sutton 说过的,把 SI 和 RSI 稍作区分。所以 self-improvement 已经在发生了,但要做递归式的那个,现在是在纠结要不要按下按钮,而 DeepMind 又发布了这个。DeepMind Institute。由 Shane Legg、James Manyika,以及 Demis Hassabis 担任领导层,公开了这个 Institute,从那里出来的那些 essay 是和经济相关的,看起来在研究这类东西。在社会学、经济学这样的领域里探讨这类 essay,所以关于 RSI 的话题Shane Legg 也讲了很多。所以在那边也在推进,这会给社会带来怎样的影响,能感受到他们想要认真探讨这类问题的某种意愿。GPT-4 问世的那一年,Altman在一个叫 YC Research 的地方让他们做了什么呢,是让他们研究基本收入。所以会是类似那种层面的工作吗,那件事现在已经收尾了,至于会探讨怎样的新突破,我觉得我也得再观察一下。所以有过这些事,总之虽说要 pacing,但现在这种程度的节奏,或者在此基础上稍微加速的,看起来绝对不会停下来。
朴钟贤 现在这套做法继续往前推进是不会停的,就会一直出下去,而除此之外,某种全新方式的、那种真正一旦按下按钮就很难停下来的那类进展,我们是不是应该叫停,大家好像在讨论这个,我是这样理解的。
Yoshua Bengio 的 RSI 禁止论与一位内核工程师的思考 61:49
崔胜准 对对。而且几天前 Yoshua Bengio也说过 RSI 应该定为非法,说过这样的话。不过看看中国,中国那边也有个有意思的说法,我这也只是在 Twitter 上看到的,曾在 DeepSeek 工作的一位研究者写了篇《内核工程师的小感》,讲自己对走向这个方向的命运是如何淡然接受的,写了这样一篇文章,说如今我虽然是 kernel 专家,却已经无法在自己的专业领域做出什么贡献,而像是变成了驾驶那台代替自己去做这些事的 AI 机甲的驾驶员,写了这类内容。所以说尽管如此,人还是有事可做的。
朴钟贤 那篇文章之所以被广泛传播,我也看了,大概是因为无数人转发时都附上了自己的想法,说明这是大家都有共鸣的一点。我原本做的工作中很大一部分正在委托给它,我自己也是这样。大家不都同样对那个想法产生共鸣吗。
小米 MiMo 的公开 RL run 与暴增的 token 消耗 62:50
崔胜准 还有我在 timeline 上看到的有意思的是,Xiaomi 的这位,大概是在 DeepSeek被称为年轻天才、后来去了 Xiaomi、正在开发 MiMo 的那位叫 Fuli Luo 的人,看了他几天前发的帖子,我觉得这太厉害了。这是什么呢,就是现在 MiMo 的,这里看是什么来着?他把 v2.6 的 RL run 运行过程做了直播。所以 test-time scaling是怎样发生的,在上面花了多少钱,留下了怎样的轨迹,在 benchmark 上性能指标是怎样上升的,把这些都赤裸裸地展示了出来。这说明它依然在起作用,而且今后也会继续起作用。
朴钟贤 到目前为止的成本很显眼呢。才 3 天,现在就用掉了价值 180 万美元的 token。是这样吗?
崔胜准 是啊。不过 Noam 也说过类似的话。他们 OpenAI 内部的 token 使用量是怎么增长的。所以现在,大概到今年这个时候,大约 1% 的员工,应该是技术岗员工吧,说是每天大概要花 8000 美元左右。
朴钟贤 是 token 费用吗?一天?
崔胜准 是 token 费用。8000 美元是多少钱来着?1000 美元按 100 万韩元算的话,就是 1000 万韩元。那 1% 的人就在烧着这么多钱。
AI 依赖成为日常的知识工作 64:21
朴钟贤 不过我最近也有这种感受。我现在个人订阅了三个服务,OpenAI,然后是 Anthropic,还有 Grok,这样分别是 200 美元、200 美元、300 美元的订阅。结果前天吧,我全都用完了,真的是好久没这样了,都付了这么多钱还是给用光了,我经历了一个被迫休息的时刻。一直在为 token 付费,结果就用得越来越多了。不知不觉就这样。所以我想,真的会变成这样啊。最终所有人大概都会走上那条路吧。尤其是办公室白领,用着 AI就会渐渐地,只是时间早晚的问题,大概大家都会持续用得越来越多,某种程度上会有一种无力感,我甚至觉得有点可怕。真的变成了没有 AI就没法工作的状况了,我有这样的想法。
数学界迎来的 AlphaGo 时刻 65:19
崔胜准 不过有一个群体是被这件事正面击中的。数学。不是用 token 的问题,而是影响层面的问题,迎来 AlphaGo 时刻的领域就是数学,所以数学界现在很生气。现在有传闻说,Hodge 猜想加上另外一个,千禧年问题有两个几乎被解决了,但因为数学界很生气,所以传闻说一直没有公开发表,The Information 最近也发了一篇跟 Hodge 猜想相关的但不管怎样,在解决了那个之后,8月底Terence Tao在准备自己的书的过程中,把六个核心概念,也就是数学的核心概念,用非常精彩的内容阐述了出来。然后到了9月初的情况是,就像我们频道介绍过的那样,他听到传闻后说如果千禧年难题被解决的话,会是通过这种Ansatz一次性大规模搜索假设空间的形式,Tao当时是这么预言的,而事情果然以那种方式发生之后,菲尔兹奖得主们在11日发表了所谓《数学中的错位对齐》,大家都说数学错位对齐了,这到底对我们的数学生态,或者对人类的理解有什么帮助,把这样的讨论推向台面之后。不过6月的时候确实有过一份叫Leiden宣言的东西。首先Leiden宣言讲的是怎样才能健康地引导这件事,探讨的是这类内容。不过在那之后有意思的是,Tao做了另一种尝试,这个非常有意思,具体是什么呢,就是邀请数学界和哲学界的人士作为嘉宾,用各种方式把现在发生的事情,结合自己的理解或想法来进行解读,总之从9月10日左右开始,持续把这些后续讨论汇集起来,做着搭建公共讨论平台的工作。所以数学社群在这件事之后,该走向何方,关于这方面的意见,看着他们在做凝聚共识的工作,我一直在关注,这里的逻辑其实就是:“我们先挨打了,但你们迟早也会挨打”,就是这个意思。所以在这个公共讨论平台上,正在进行哪些讨论,这对当下的知识社会正在产生怎样的影响,已经产生了什么影响,以及该走向何方,我觉得这都是非常好的观察素材。我也一直在关注。快速进入收尾部分的话,还有安全问题。外部白帽黑客攻破了OpenAI,引发了问题。那么安全性如此脆弱的地方,掌握着那么重要的权重真的没问题吗?当时也有这样的说法。然后是最近经常出现的另一家审计机构,看Irregular在安全方面的model card,Irregular经常出现。在Anthropic那边出现,在OpenAI那边也出现。不过Irregular就像我上次提过的那样,创始人出身于以色列情报部队,也就是说数学又好,是一群极有才华的人创办的机构,结果一查发现,他们又是拿了以色列EA基金,也就是有效利他主义基金的支持才成立的。所以这个倒也不用照单全收,权当八卦来看,那个圈子里的人一直在提出问题,其实还是那拨人,换汤不换药。然后这周在时间线上真正病毒式疯传的就是Jev了。果蝇那个虽然稍微更早出来一点,不过Jev是从Jevons paradox取的名字。Jevons paradox不就是那个嘛,即使供给变得非常便宜,需求也总是会变得更大。所以叫Jevons悖论,Satya Nadella提过一次就出名了,意思是不管AI变得多便宜,需求总是会以超出这个幅度的规模增长,带着这种意味被引用了好一阵子,不过这不是Satya Nadella原创的,而是他引用的Jevons paradox。而Jev就是从那里取名的,它是以极其便宜又快速的方式搞定某些事情,对此也有各种各样的争论。您有没有看过?
前沿实验室的安全脆弱性与 Irregular 争议 67:46
超高速并行判断模型 Jev 68:47
朴钟贤 时间线上都被刷屏了,大家用Jev做了这个、做了那个,这些我大致都看了一遍。
崔胜准 不过看下来,真是什么都能做。其实这个,我也只是在粗略地聊聊,感觉是这样的。虽然不知道它到底是不是LLM,也不知道是不是以LLM为基础的,但总之存在某种AI,它带着某种prior,然后输出概率。而且是同时输出的。最多可以同时输出255个。所以给它一个输入,它就判断这是yes还是no,或者比如“现在这算不算问题”,类似这样的分类器。并行地一次性运行这类分类器,因为它能解决各种各样的问题,比如让它玩 Minecraft,而且不仅是 Minecraft,还有各种电脑游戏、computer-use agent,以 real-time 方式进行这类操作的实验,被大量分享出来,不仅如此,它们还能做非常多的事情。而人们在复现这项工作时,只利用 Qwen 这类小模型的 logit,就算不并行,也只需要 decode 一次,用输出 yes、no 的方式做类似应用的案例,好像也涌现出很多。而我最近开始关注的这个叫 Needle 的东西,是一个小到能放进 Raspberry Pi 的模型,也属于那一类工作。这里说的那一类,归根结底它们所处理的,应该都是 System 1。所以 CoT 出现的时候,大家不是讨论过很多 System 1、2 的话题吗。Daniel Kahneman 写的《Thinking, Fast and Slow》。某种智能在运作时,有直接凭直觉反应的模式,也有充分推理之后再回答的模式,有这两种。System 1 是快的,System 2 是慢的,如果说 CoT 属于 System 2 这一类,那么现在又回到了 System 1 这边,反应极快的这类工作,正在被分享出来。
以小模型回归的 System 1 智能 70:45
朴钟贤 机器人领域也用这种方式结合大模型和小模型,尤其像 Gemini Robotics,也是这样运作的。而人类本身好像也是这样运作的。我们有些事是反射性去做的,有些是边想边做的,因为存在这些区别,我觉得这是非常自然的走向。
实现成本下降带来的衍生实验爆发 71:52
崔胜准 没错。不过我当时好奇的是这个。所以我用模型去调研,既查了 Jev,也查了果蝇 connectome,看还有哪些实验在处理类似的题材,我让模型去探索了这个问题。而我的先验概率是这样的。看时间线会发现,虽然有些不同,但看起来都很相似,有这种感觉。而实际去做之后发现,让它玩 Doom、Mario、Pong 这类游戏,都做得差不多;跟股票、币圈相关的做 trading 的实验,也大同小异;OCR 分类、各种分类问题,都能看到大家在做类似的事情。所以我的疑问是什么呢,就是为什么这类实验会爆发式增长。但结论其实非常理所当然。
朴钟贤 因为谁都可以试一试啊。
崔胜准 因为有了 AI,实现成本太低了,果蝇 connectome 不再是只有大型实验室才能做的事,当然那是他们做完实验后公开出来的,但只要有什么 artifact 出现,拿它来做衍生实验,现在成本实在太低了。正因如此,把模型发布出去才重要。一发布就能获得非常多的反馈信号。
模型开放带来的实验飞轮 72:58
朴钟贤 很多人都会拿去用,这样试试、那样试试,以前这样的实验,可能只有少数专家才能做,而现在这些事谁都能做了,所以才会这样。
崔胜准 flywheel 转起来了。现在 Noam 也在说这样的话,其他很多人也说过同样的话:就算现在调整 pacing,这一类的发展也会持续下去。就算把模型冻结在现在这个状态,它也已经进入某个轨道了。
加快的探索周期与信息过载 73:39
朴钟贤 我个人看着果蝇的故事、Jev 的故事,一路看过来,过去也曾有过这样的想法。总之从个人的层面来看,一个人不可能把那一切都探索一遍嘛。所以就得看,那里面我想探索的是什么、其中未来可能性真正高的是什么,好好把这些了解清楚,然后只能围绕那些去探索。光是 LLM 也一样,模型一个接一个地出,我们不可能全都测试一遍。除非这是本职工作。那就只能参考可信度高的人,或者已经试过的人怎么说,或者说是大家公认的大势吧?大家都说那个还不错。那时候才会想,我也来试试吧,才会做出这样的判断。因为有些东西是大家都用过之后,觉得只有这个行、那个不行、也就那样,然后就放弃了。而现在这个周期真的变得极其短、极其快了。就是过两天,大家已经都在试别的东西了,这样一来,光是看着涌入的信息量就太大了,从某种角度说,该算是一种祝福吧?光是看着也是这样。就是刚才开头说的那个了。Psychosis。
崔胜准 有时候会有一种大脑在烧的感觉。
朴钟贤 总之看着别人在做的事,如果有些东西持续得比较久,大家也都说好、给出很多正面评价,那我也会很想多试一试。这种事以前间隔特别长,现在很快就能跟上了。
人类集体探索与 multi-agent 的相似结构 75:18
崔胜准 不过这个跟最近 multi-agent 里发生的事情是完全同构的。人也是这么做的,现在人以这种方式探索,也是带着自己经历人生所积累的 prior,带着自己的成见或好奇心,去探索假设空间嘛。做实验,然后在社交媒体等能够沟通的基础之上分享出来,从那里获取信息衍生的创作一直在不断爆发嘛。而这跟 OpenAI 里用一万个 agent 做 cross-pollination,我提出这种假设,他提出那种假设,我失败了,但那边那个居然成了。我也来应用一下。以这种方式分散信息,就像刚才 Noam 说的那样,让它们互相沟通、让它们协作,去学习这件事本身,这两者发生的方式非常相似。而且现在人类把那些轨迹留在互联网上,模型们也不得不去学习它们。所以我有一种这东西在不断一层层往上累积的感觉。所以一方面很可怕,即便 RSI 还没来,也已经明显进入了一条可怕的轨道。哪怕没有特意去按下 RSI 那个按钮。但是当那个按钮被按下时,这些人说必须停下来,这些在最极端处切身感受着这一切的人,他们真的是在胡说八道吗?某种程度上可能是营销,也像是以非常 doomer 的方式在制造恐惧,但其中或许确实存在一丝真正的问题。这算是我最近的认识。所以我也在试着打起精神去正视它。我自己也跟 Astra 做过这样的实验。所以我就试了一下。我以前在 Powder之类的地方搭建这种实验,觉得挺有意思的。比如放上岩浆之类的,洒水后变成水蒸气再降下雨来,以前我光是搭建这种环境,后来看到果蝇实验之类的,就试着放进了 agent。所以在这里这么做的话,这边看起来有点黄色的是谷物,褐色的是木头。放上木头方块,让它们在 3 层的 layer 里制定计划,我模拟了它们前往进食的过程,虽说不是完全一键搞定,但做得非常快。
与 Astra 一起搭建的三层 layer agent 实验 76:55
朴钟贤 agent 们是在竞争吗?
崔胜准 它们并不进行竞争或协作。不过确实会出现意料之外的竞争或协作。虽然代码里并没有写进去,但有时确实会发生非预期的协作。有点像蚂蚁社会。
朴钟贤 如果在同一条路上搭着台阶,就可以踩着别人搭好的台阶爬上去嘛。
崔胜准 当然有时也会互相妨碍,所以看到它们这么做,有趣的是,如果给它感知这个空间本身的感官,它反而更加迷失方向;而给它加上harness,像刚才的Jev那样,只让它做某种操作的判定,只做这类事情的话,即使在很小的layer里它也能做到。于是Astra提出的建议是,既然原本就有A算法这样的东西,那就让这个三层的layer去学习A的轨迹。所以先让模型用A*来跑一遍,然后再去学习那些轨迹,看到用这种方式把它做成了,我还挺吃惊的。这个如果原本要用LLM来做,会耗费多得多的时间。现在空间里有block chunk,其中有什么东西,该往哪儿走?它要去推理这些,但那样是做不出这种agentic的东西的。而在果蝇connectome或Jev这类东西上,现在那个做得太好了,所以我也跟着试了一次。现在该收尾了。现在这些东西虽然谈不上有什么生产力,但我觉得正在发生一种组合式的游戏。所以虽然有些担忧,却也非常快乐,最近我有一种非常矛盾的心情。
AI 时代的组合式玩法与矛盾心情 79:05
朴钟贤 是啊,所谓组合式的游戏,总之就是各种各样的东西正在不断涌现出来,人们把它们组合起来,试试这个,也试试那个,胜准您也尝试了刚才展示的那些,您把这种事情称为游戏,对吧。
崔胜准 没错。非常具有游戏性质。拿果蝇或Jev来做的这些事情,当然也有带着商业想法而诞生的情况,但我感觉通过游戏,极大地拓宽了探索的范围。而且这一点目前在AI身上还有些缺失,我们留下的那些trace越多,让它接着延续下去,或许也不是不可能吧,我抱着这样的期待,同时也有这样的担忧。
朴钟贤 我们把这种事情当作游戏,但我在玩那种游戏的时候,周围的人并不是所有人都能理解。他们会说,那也算游戏?
下周已经预告的内容 80:07
崔胜准 是吗?总之聊着聊着这些话题,时间又一晃就过去了。下周该说是预告过的乐趣呢,还是说会有担忧呢。
朴钟贤 下周?
崔胜准 因为Sam Altman说下周要发布嘛。
朴钟贤 对啊。有下周,还有下下周,预告过的那些已经全都堆起来了。
崔胜准 已经堆起来了。Dev Day,还有像Jev这样的东西,并没有预告过,却突然就冲进来了。这类事情总是存在。就像每周那样,下周的事情就留到下周再谈吧。