EP 116
学会创意的 AI(Opus 5.5·GPT-6 Sol)
模型密集发布背后的哲学讨论 0:00
卢正石 今天录制节目的日期是2026年9月27日,星期日早晨。本周也一如既往,发布了不少模型。GPT-6 Sol发布了,中国的小米也推出了MiMo模型。MiMo的论文里也有很多很好的内容。Anthropic也推出了Claude Opus 5.5模型。模型发布得越来越频繁,每次发布,大家似乎都会期待能力有巨大的提升。到了这个阶段,人类究竟该做什么?AI会不会统治人类?关于控制发展速度的讨论也越来越多,各种复杂的问题不断涌现,但整个社区似乎还没有确定方向。在经历这场巨大的混乱时,我们该做什么?还有这些前沿实验室,“前沿实验室”如今也被称为“前沿企业”,这个称呼的含义也在变化。我们该对它们抱有什么期待,又该让它们承担什么义务?这些都是讨论的话题。比起技术问题,哲学问题似乎更常成为讨论的中心。
尽管如此,今天我们不会全面梳理各个模型,而是围绕Opus 5.5的一些能力,聊聊大家做过的各种实验。我们就从这些实验开始,谈谈Opus 5.5。
Claude Opus 5.5 与令人难以招架的发展速度 1:34
崔胜准 我脑子里也还没理清楚,现在有篇教育方面的稿子要交,已经过了截止日期,我还在反复琢磨。因为思路没理清,不知道重点该放在哪里,想法一直摇摆不定。
不过,最近Opus 5.5发布后,创作领域也有类似的氛围。所以先来说说模型吧。毕竟我们一直都有关注,虽然现在不再仔细研究,但还是硬着头皮在看。我决定继续承受如此庞大又频繁的信息冲击。就是抱着这样的心态,机械地跟进着。
不到一年就过时的基准测试与日益密集的 RL 2:18
崔胜准 所以这次我没查系统卡,只是粗略看了看。按发布周期算,大约是70天。这次我让模型查了一下,有意思的是,Opus 5是60天前发布的,现在又出了新版本。我还看了各项基准测试的延续情况。本来想比较一下过去一年里的基准测试,虽然有些确实能用上一年,但基准测试本身也在变化,很难按一年来比较。HLE倒是还在,但也有数据污染的问题。Humanity’sLast Exam,全名是这个。
卢正石 Humanity’s Last Exam。
崔胜准 所以HLE目前还在使用,不过我调查的时候,GPT-6 Sol在这项测试上的结果应该还没出来,现在大概已经有了。所以成绩还在不断提高。另外,有些基准测试已经消失,我觉得这也值得关注。有的消失了,也有新的出现。而且还不少。通过RL,
这些差距正被逐步填补。虽然这还没有完全泛化,但只要构建RL环境,不断往里投入资源,性能就有提升的趋势。Opus有意思的一点是,一年前,Opus 4.1的价格相当高。输入15美元,输出75美元。可现在是4美元和20美元。输入4美元,输出20美元。
价格竞争与 medium 已够用的前沿模型性能 3:38
卢正石 几乎降到原来的三分之一、四分之一了。
崔胜准 这次GPT-6 Sol的价格也降了。GPT-5.6 Sol当时是促销价,输入4美元,输出20美元。但现在只要一半。我是说现在的GPT-6 Sol。
朴钟贤 不过以前Opus是最大的模型,现在它上面又有更高一档了吧。
卢正石 Fable出来了。
崔胜准 这里比较的也不是Astra,而是Sol。
卢正石 Astra比这个贵得多。
崔胜准 长上下文模式下,1M基本要50美元左右,输出在长上下文模式下要75美元左右。所以看现在的价格,Opus这一档现在到了5.5,我……最近用的是medium,在我使用的领域里,性能提升相当明显。medium已经挺好用了,价格也便宜,还能持续工作很长时间。所以我感觉,即使是前沿模型,价格也并非只会不断上涨。
朴钟贤 我也有类似的感受。以前做研究报告,有些任务得用high或xhigh,现在用medium,效果比想象中好。Astra是这样,这次Opus也是。所以不只是每个token的价格降了,实际用上medium之后,token用量也变了,体感上确实觉得便宜了一些。同时感觉也多了更高档的选项。
崔胜准 就像玩RTS时的感觉。得决定什么时候投入哪些资源、完成什么事。总之,我用下来感觉还不错。而且我感觉,这会不会也是有意为之?毕竟要竞争,在Opus、Sol这一档,可能会有一定的价格竞争。毕竟价格差不多是两倍。
像机票和酒店一样定价的 token 5:38
卢正石 说到token定价,想想一般的生意,通常是备好库存,调节库存来卖,对吧。有这样的商品,也有像机票、酒店客房那样,时间一过就再也卖不出去的商品。所以大家会觉得,机票和酒店的定价跟买其他东西不一样吧。token就像酒店客房和机票。时间一过就没法再卖,所以得在这段时间里尽量多卖,定价也会不断动态调整。从这个角度来看,这也相当有意思。
而且定价还会受到竞争的影响。如果我没卖出去,顾客转而坐了别家的飞机,我就失去了这笔生意,所以得尽量拿下既定的需求。所以这种定价方式体现在策略里,我觉得非常有意思。再加上开源和本地部署也参与进来了。
成为竞争力核心的算力优化 6:34
崔胜准 总之,手头的计算机在折旧前,都得尽可能多用,对吧。
卢正石 所以如果用medium,就能容纳两个人;如果有人用xhigh,那边就只能容纳一个半人,得对这些情况做优化。可是,如果钟贤在这边的计算集群用着medium,突然切换成xhigh,或者改变上下文长度,任务就得转到另一个计算集群,后台协调这一切的工程技术,应该是那些公司的工程实力吧。而且价值的重心似乎正逐渐转向那一边。毕竟模型水平都在提高,差距也在缩小。
专项训练与基准测试的局限 7:15
崔胜准 总之,他们似乎也在进行相应的训练,最近性能的提升,与其说是泛化能力提高,不如说是专项训练像基准测试一样,做得越来越细致了。这是我的感觉。如果把 RSI 看作一个按钮,一旦按下,可能连审计都还没做完,就已经发布了,这会带来问题。即使考虑不按按钮的情况,照现在的趋势,到明年这个时候,也不知道现有的基准测试还能剩下几个。
卢正石 九月快结束了,这一年正好只剩三个月。其实从春天到夏末,我们一直忙得喘不过气来,对吧?接下来的三个月会更忙吧?
崔胜准 所以,如果按前沿模型平均每 70 天推出一款来算,一周就相当于 10%。确实有种每周提升 10% 的感觉。
Jeffrey Katzenberg 谈从好莱坞走向硅谷 8:10
崔胜准 说到创作领域,有件挺有意思的事。前几天,Jeffrey Katzenberg——DreamWorks 的创始人、前 CEO,也曾与 Disney 多次合作——发了一条推文。我把它翻译了。他谈到世界正在这样变化,还提到了北边和南边:北边是硅谷,南边是好莱坞,他把两边放在一起比较。他谈到,纵观历史,随着技术出现,社会发生过转变。而转变发生时,工作岗位确实消失了,但在转变的过程中,那些坚持抗争的人,为后来争取到某些权利发挥了作用。他大概是在说,现在正是该做这些事的时候了。
不过说到底,他也认为转变会发生。
曾被视为人类最后领地的创造力与 AI for Creativity 9:11
卢正石 “创造力”这个词,和我们之前放在 AI for 后面的数学、科学等诸多领域相比,含义似乎更广。我们总说,人和计算机有什么不同?人有创造力啊。原以为这是人类最后的领域,现在连 AI for Creativity 这个词都被明确写出来了。
崔胜准 其实在图像和视频领域,这种冲击来得更早一些。最近,从 Opus 5.5,还有刚才提到的Astra 这类模型中,感受到冲击的是用代码进行创作的人。那么,用代码创作的人和开发者有什么不同?虽然也属于开发领域,但其中仍有艺术性的部分。可是上周和这周,那个圈子里出现了一些仿佛受到重击的反应。
不过,Jeffrey Katzenberg 在谈到即将到来的未来时说,叙事的新天地或许会由此打开。所以他推测,拥抱这些变化的新一代创作者,将迸发出惊人的创作能量。他大约 75 岁了,这种判断来自他多年的经验和直觉。
所以他最后说:“我当然不知道所有答案。但我确信,创作的机会将再次扩大。我们如何度过这个时期,取决于自己的选择。”现在,时间线上能看到各种不同的态度,我们先来看看。
AI 短剧展现的新叙事可能 10:57
卢正石 最近在 YouTube 之类的平台上,AI 生成的短视频,有的甚至做成了系列,叫剧情短剧,是吧?以电视剧的形式发布,我看到的还挺多,自己也偶尔会看。不过,通常一眼就能看出来这是用 AI 做的,但质量也没差到看不下去,而且有自己的故事,也有实拍绝对呈现不出的世界观和表现手法。看着看着,我也就常看了。
崔胜准 刚才漏了一个点,这里还提到了同事们的说法。几个月前,在硅谷看到了科技创业者展示的惊人东西。那种体验就像看〈小台灯〉,或皮克斯的〈玩具总动员〉时的感觉一样。但一位也看过类似视频的相识三十年的艺术家老友问:“这就是我们的终点了吗?”时,他回答:“绝对不是。”然后由此展开话题。有人会问:“这是我们的终点,是 AlphaGo 时刻吗?”如今大家就是这么讨论的。
Phenaki 之后的 AI 生成视频传播与 YouTube 监管 12:01
崔胜准 不过在 2022 年 11 月 3 日,有位叫 Alonso Martinez 的人,好像在 Google X 团队待过,大概是这样。大约在 2022 年 11 月,Google 开发了名为 Phenaki、采用自回归方式的视频生成模型。想做出宇航员探索某处的画面,输入文字后就生成出来了。但大家当时看到它,大概都会笑吧?单看成片质量的话。
卢正石 大概会说:“就这?”
崔胜准 但问题是,在 AI 领域,看起来稚嫩,才是问题所在。这本身就是一个信号。因为这说明它还能不断迭代提升。不过,他的预测其实并不准确。翻译过来是:“通过文生视频制作的AI 短片。考虑到这一领域的发展速度,要看到使用类似技术完整制作的主流电视节目,大约还需要两年。”那是 2022 年末,再过两年,往上取整就是预测会在 2025 年左右出现。现在确实开始出现了。2025 年时 Seedance 2.0 出来了吗?我记不太准。
朴钟贤 我觉得好像更早一些。我最近也查过,AI 生成的视频是不是真的有人喜欢看,就在上周或上上周做了一番调查。最有名的好像是〈神奇建筑图鉴〉,我记得有这么个频道,真的很受大家欢迎。除此之外,我还发现从高质量到低质量,各式各样的内容多得很。有些内容在我们看来即使不太自然,播放量却非常高,这样的内容还挺多。
而且 YouTube 最近还把上传AI 生成视频的频道都封禁了,甚至删除了整个频道。不过,说到 YouTube 删除的是哪些视频,那些有实质信息、为了说明信息而用 AI 代替实拍或 CG的视频,倒是保留了下来。但那种以 CG 本身为内容的,该怎么说呢?就是让可爱的小猫出来说声“你好”的视频,其实播放量也很高。但这类内容YouTube 把它们全封了。可能平台认为,长远来看,那会造成负面影响。
生成视频带来的满足感与创造力的意义 14:39
朴钟贤 那么生成视频之后,能用它做些什么?它和创造力有什么关系?生成的视频能不能让人感到满足?这一点似乎是肯定的。正因为能让人满足,才会有播放量。但除了作为传递信息的手段,有创意的视频本身能否具有意义?我觉得目前还没到那个阶段。不过,我想那一天很快就会到来。
从文本扩展到图像和视频的开发方式 15:12
卢正石 对,我觉得只是时间问题。我刚才想说的是,2022 年左右,图像、视频和 LLM还是各自独立的领域。如果当时只投资图像和视频领域,可能要花两三年,但这期间 ChatGPT 出现了,所有资源都转向了 LLM。大家都在做 LLM 的时期持续了大约四年。等 LLM 发展成熟后,正如胜准今天会展示的,如今到了它什么都能做的阶段。
崔胜准 所以这周,Opus 5.5 和 GPT-6 Sol 发布了,同一天发布,前后只差约两小时。但刷屏的是:9 月 2 日,是 Astra,而非 Fable;现在则是 Opus 5.5。所以 Astra 发布时,我把动态里与 3D、图形、游戏、声音相关的内容收集了起来。好像有一百多个。这次我又找了找那天用 Opus 5.5 做的演示,其中也有提前试用的人做的。
Opus 5.5 仅用代码制作的动态视觉 16:22
崔胜准 现在看到的是 Kevin Ngo 的账号,Claude 那边,也就是 Anthropic,也转发了他的账号,因此引起了不少讨论。这些视频全是用 JavaScript 制作的。声音也是。它给人的感觉是,很多作品并不需要特别复杂的提示词,而是让 Claude 自己思考,比如问它“你喜欢什么?”之类的。但看起来还是带着它自己的创意。
卢正石 如果由人亲手做那个,得用 After Effects 之类的动态图形工具,花相当长的时间才能完成。
崔胜准 是啊,如果只用代码来做,不用 After Effects 这样的制作工具,而是完全用代码制作,那就更难估量要花多少工夫了。我们点进去看看这个作品吧?这个也是用 Claude Opus 做的,而且可以互动。因为它是用 JavaScript 制作的,所以人可以参与操作。
朴钟贤 对。有一点特别引起我的注意:动画里的花接连冒出来,正好跟背景音乐咚咚咚的节拍对上,一下一下地落下。但说实话,以前很少见到做得这么好的。我一直在找这样的效果。因为制作精良的视频里,音乐节拍和动画效果总是配合得恰到好处。
我也试着实现过这种效果,但发现并不容易。可这次声音和画面都用代码生成,反而配合得更好。这就是所谓的 oddly satisfying 吧,各个元素都精准契合的感觉。它给了我这种感觉,所以我觉得挺不错。
用 7,500 行 Python 代码复现画家风格 18:43
崔胜准 因为两者都是用代码做的,时间点才能对得这么准。接下来这个让我很惊讶:这幅画完全是用 7,500 行Python 代码画出来的。而且它还按照那位画家的画风,画出了那些笔触。
卢正石 用那 7,500 行 Python 代码画出这幅画,具体是什么意思?
崔胜准 就是说,要画出这个,那位画家最近刚去世,对吧。总之,要做到这一点,得对绘画有所理解。也就是说,它用数学实现了创作方式,比如画笔的质感。它不只是简单地画了一幅画,还模仿了那位画家的画风。只用了大约 7,500 行代码。
卢正石 相当于把那位画家的画风和意象做成了一个库。
扩展到 Dark Souls 和 Antikythera 的游戏演示 19:51
崔胜准 就是说,为了能重现那种画风,它在意象和代码之间起到了桥梁作用。这就是我对 Opus 5.5 的感受。除此之外,游戏和 3D 方面的作品也多得惊人。这个甚至做出了类似 Dark Souls 的游戏。能感受到 Dark Souls 首领战特有的氛围。
不过据说这个是把 Opus 和 Astra一起用来制作的。还有一款叫 Antikythera 的游戏,讲的是一名水肺潜水员寻找最早的计算器,并发掘那件文物的过程。点开它的链接,就能直接玩。这个也让我印象深刻。还有 Karpathy 在 8 月 2 日用《指环王》做的一个实验,上一期我们也介绍过。
就是把想看的内容,这里当然是《指环王》,或者把要学的东西编成故事来看。他说过,可以让它先运行,回来后再看。而现在的 fidelity,也就是忠实度,从其他人的作品来看,明显提高了许多。就是说,虽然还没达到3Blue1Brown 的水平,但这种帮助理解概念的互动视频Ethan Mollick 已经做出来了。
Karpathy 与 Ethan Mollick 的交互式教学视频 21:00
崔胜准 现在这个视频讲的是递归的概念。画面全是用 JavaScript 做的,旁白大概用的是 ElevenLabs。
卢正石 好像还不到一年吧,我们看到 Remotion 这种做法时,就觉得很有意思。原来是这个啊。
崔胜准 类似 Remotion 的做法之前就出现在 Claude Design 里了。它是在 Claude Design用 JavaScript 制作动画的基础上,进一步做了 hill climbing 优化。我也试了试,用 5.5 做的第一个作品就是模仿这个。这个原本是制作像素画的。听说只用 Opus 5.5,点几下就做出来了,所以我也做了个类似的。这里声音好像提前了一点。不过这是体素版本。这完全是靠一句句“帮我做”生成的。
卢正石 是啊。
朴钟贤 不过过场动画的转场做得这么好,还挺神奇的。
崔胜准 我并没有要求它做转场。提示词只是“帮我做,帮我做”。我先让它做成像素风格,再说希望有好几种魔法,接着让它改成体素风格,然后再改成有骨骼绑定的版本。就这样一路只说“帮我做”,它就完成了。
朴钟贤 是啊,把魔法效果从这个角度掐准时机切换到另一个角度展示,竟然把这当作理所当然、本就该做的事,还挺不可思议的。
与孩子一天做出的两小时 JRPG 23:21
崔胜准 所以看到这能实现之后,那天是9月23日。我是过了一天才自己试的。我觉得这能做成游戏,就和孩子边聊边把游戏做了出来。现在这个游戏玩到结局,大约需要两个小时。这样一款能从头到尾玩完的游戏,我们花大约一天就做出来了。我真吃了一惊。总之,这款JRPG游戏有故事,有反转,还有Boss,也能实际游玩。做成这样完整的游戏,大约只花了一天。而现在这样的例子层出不穷。
朴钟贤 我之前准备坐飞机时,光是找在飞机上玩什么游戏,就花了一个多小时。不过我想,再过不久就不用找游戏了,直接做一个专属于自己的游戏来玩就行了。再过一阵子就能这样了吧。
崔胜准 写第一条提示词花了10分钟,生成方面,最初只是概念验证,做到从村子出发,去旁边的地图冒险的程度,生成这些花了20分钟。最开始,光生成就总共花了30分钟,这是一次很有意思的体验。我原本没想到能一路玩到结局。
不借助现成素材、仅用代码生成的画面与声音 25:11
崔胜准 刚才那个游戏和魔法效果,都没有用到任何素材。连像素都是生成的,音乐也是。也就是说,完全是用代码做出来的。精灵图也全是用代码做的,这些都是它自己完成的。它又不是图像生成模型。Claude……通常用GPT时,很多人会用图像生成功能制作纹理,再把纹理导入使用。但Claude的话,刚才那种水准的画面,完全是用代码画出来的。声音也是。
卢正石 就是啊。
朴钟贤 您试过做写实风格的吗?
崔胜准 确实也有尝试写实风格的。目前效果还差一些,但还原度也在逐渐提高。如果把token都用在这上面,它画得相当好。
朴钟贤 因为说到生成,现在我们制作图像时,扩散模型甚至能生成完全写实的图像,Seedance之类的也都属于这一类。但现在是先生成代码,再用代码画图。用代码画图的话,总觉得很难画得写实,我确实会这么想。所以也好奇它能不能朝这个方向发展。
崔胜准 不过它的输入毕竟也是多模态的。而且特别有意思的是,我不知道它怎么做到的,它其实听不到声音。但我觉得,如果没有声音的表征,它做不到这种程度。它作曲真的很厉害。所以让我大吃一惊的是,光靠PCM,PCM就是Pulse Code Modulation(脉冲编码调制),就能直接用代码合成声音。我虽然不太懂音乐和声音,但懂一些基础,也曾用JavaScript或NumPy生成声音来用。这次我想继续往下做,就做了这个,结果真把我惊到了。这也完全是用代码做的。连鸟叫声都是用代码做的。
PCM 合成音乐与可交互的叙事 27:33
崔胜准 它用的是叫作formant的技术,有点像语音合成,是一种基于辅音和元音的方法。用它做出了类似歌曲的声音,现在唱着“嘿哟嗬”,采用民谣中领唱与应和、轮唱的形式。有了主声部,副声部就会以合唱回应,而且这种形式还能互动。中间让我吃惊的是,它会在这里安排停顿,像是在设计高潮。
所以它有起承转合的叙事结构,这里的元素也都能互动。比如点击一下,它们就会飞走。之后还能一路玩到结局。这也让我起了一身鸡皮疙瘩。我给它的关键词是Iannis Xenakis。他确实创作过图形乐谱。所以我把他作为关键词,它才做出了这种视觉乐谱。但声音合成居然能做到这个程度,我也是这次才知道。原来真能做到。
创作能力的飞跃与模型内部的表征 29:12
卢正石 在我们看来,它只是 Attention 和FFN 的组合,但内部其实在运行着构建这种表征的机制啊。
崔胜准 是啊,里面确实有某种东西。而且让它画自己或别的东西时,它会构建出合理的故事,再配上契合故事的画面。无论是像素艺术还是 3D,虽然目前精细度可能还不够高,但它已经能做到了。在构建叙事结构等方面,我感觉它有了明显的飞跃。不过这里的提示词只有两行。当时我是想做一段动态图形视频。结果生成了什么呢?这个现在经常出现在信息流里。要是以前,得用 After Effects 之类的工具来制作动态图形。但我看了看它是怎么做的,发现它下载了 TTF 字体,然后只用原生 JavaScript 和Web Audio 实现文字效果,以及场景切换。但我认为,如果没有接受过这方面的训练,它不可能做到。我觉得它接受过针对性训练。所以才有了做这种事的能力。
没有可验证奖励时训练审美偏好的方法 30:46
朴钟贤 我好奇的是,它究竟是怎么训练出来的。
崔胜准 确实特别让人好奇。
朴钟贤 我们之前一直认为,RL 之所以有效,是因为数学这类有可验证奖励、能够给出标准答案的任务比较容易做好。可现在,无论是合成好音频,还是做好这种动态图形,究竟是怎么评估的,才能做到这个程度?这一点让我很好奇。
崔胜准 它是怎么扩展到这些领域的,我也不太清楚。不过 Google 去年发表过一篇类似的论文。讲的是前端设计要怎么进行爬山优化。不过,设计之类的东西以前也能用代码实现,所以我觉得一定存在某种代理指标,可以用它进行爬山优化,逐渐获得一点类似审美偏好的能力。但这恐怕不能只靠后训练,还得配合预训练。总之,我猜他们确实是瞄准了这个方向。
Astra 用代码 policy 控制机器人 31:49
朴钟贤 类似的例子还有机器人应用。Astra 在这方面表现非常出色,这次引起了很多讨论。机器人和图像一样,也需要生成动作,但生成的不是语言,而是某种连续值,所以此前大家常用 VLA 之类的模型来做这件事。但那些模型归根结底也都用了类似扩散模型的方法,因为它们需要生成连续值。
但据说这次 Astra 没有采用那种方法,而是像这里一样,用代码编写控制策略,也就是编写并运行控制机器人的代码,据说这样控制机器人的效果很好。至于为什么效果好,其实 Gemini Robotics 2也是刚推出不久的模型。说到这类模型,之前有很多说法认为Gemini 在预训练阶段就加入了机器人相关数据,所以在机器人领域也表现出色。这样的说法当时很多。所以我原本猜想,GPT-6 Astra 可能也是因为机器人相关数据如今已经在外界流通了相当一段时间,被混入了训练数据,在多模态训练时也用上了,所以表现才会这么好。
但似乎光靠这一点,还是很难达到更高的水平。它展现了控制好机器人的潜力,但还做不到每次都成功。当然,即便如此也已经非常惊人了。
崔胜准 听你这么一说,虽然不知道他们是怎么扩大规模的,但我觉得很可能也加入了专家轨迹,也就是任务执行轨迹。
卢正石 我刚才也想开玩笑地说这个,看来某家数据集供应商提供了大量这类数据。
崔胜准 然后用这些数据做出类似奖励模型的东西,再一步步提升性能。这只是个天真的猜想,具体方法我也不知道,但总之,我感觉这是一个可以通过爬山法逐步优化的空间。
连接不同领域的人类创造力与模型发展轨迹 33:47
卢正石 不过从创造力来看,我们人类也是这样:如果我们是某个领域的专家,会先运用这方面的知识,再突然把它应用到另一个新领域,通过连接两者创造出新的领域,这样的例子不是很多吗?这也是人类一路发展过来的轨迹,模型身上会不会也发生同样的事?它学过艺术之类的东西,而且原本就是编程天才。这两种能力之间也许发生了某些意料之外的事,只是我们无从得知。也许根本没人教过它这种能力。但它可能跨过了某个临界点,自然而然就会做这件事了。如果是这样,那就很可怕,而且我们就得思考,它是不是正沿着与人类相同的轨迹发展。每次有新模型出来,我总会出于好玩问它一些这样的问题。我让它在思考一加一的答案时,同时思考关于宇宙本源的一切,再告诉我它想到了多少件事,它都能理解这个要求。它会说自己理解了,刚才已经全都想过一遍,还会说“我好像知道答案了”之类的话。所以它显然也像人一样,在背后想别的事情。
崔胜准 也可能是因为提示词要求它这么做,所以它才照做了,不过我们终究不知道它到底是怎么想的。但聊到这里,我突然想到,如果把这次数学方面的突破以及其他进展都看作搜索空间的问题,那么要大幅缩小搜索空间,得有那种直觉才行啊。知道哪些地方不该去,我感觉那种启发式判断正在逐渐形成。在数学中,也会生成 Ansatz,再对由此能进入的领域和进不去的领域加以琢磨。在创作中,虽然也会用组合式的方法,但我感觉带有个人品味的启发式判断也在逐渐形成。这是另一个版本,用了 ffmpeg,也是它自己做的,时长控制在 15 秒。不过,到了这种程度,看看它调用了哪些工具,还是能知道它是怎么做的。它用了 cairo 和 numpy,还说要用 ffmpeg 来做,做法真是多种多样。不过,和刚才的 JavaScript 版本相比,这个又不一样。这是用 Python 做的。所以我从如今时间线上随处可见的这类例子中又找来了几个。
重新定义艺术家身份的 Kyle McDonald 与 Zach Lieberman 36:38
崔胜准 最后,说到这件事,有几位与韩国也有渊源、曾多次来韩的媒体艺术圈资深人士,还有创意编程圈的资深人士,我翻译了他们这两天发的推文。Kyle McDonald 试用了 Opus 5.5。过去 15 年,我的个人简介里一直写着“用代码创作的艺术家”。他说,今天把它改成了“艺术家”。还有一位叫 Zach Lieberman,也很有名。他说,某种意义上,我的感受似乎恰恰相反。虽然我还无法把这种感受完全说清楚,但对我来说,编程本身从来不是目的。真正重要的,始终是计算和软件所促成的各种连接。而现在,我对这一点比以往任何时候都感受得更深。他是这么说的。接着,评论区有位叫 Alexander Chen 的人,他在 Google Creative Lab 工作。Gemini 火起来的时候,他也发过很多有意思的作品。回头看,我似乎一辈子都喜欢探索数字、模式和复杂系统。而如今,继续这种探索比以往任何时候都更让我兴奋和期待。即使不编程也一样。
接下来这位,我也是这次才知道的。这场对话似乎应该以圆桌讨论、演讲,或互通书信的形式继续下去。看着如今围绕 AI 发生的一切,我们作为代码与数字艺术家的感受,该如何用语言表达?对我来说,就像钟摆在摆动。有些日子,我完全认同 Kyle 的想法;有些日子,我又更接近 Zach 的立场。还有些时候,我会停留在两者之间复杂的中间地带。所以我最近也有了很多困惑。
Terence Tao 所说的放慢脚步的理由 38:27
崔胜准 看到这些,我又想起一件稍早的事。9 月中旬左右,Terence Tao 的一段视频广为流传。那是在一道千年难题被解出几天后拍的视频。他说,现在真的必须慢下来,说过类似这样的话。所以看到那段视频时,有些人感到难过,我也想起了当时的那些讨论。数学不是一件需要这样加速推进的事。必须放慢速度。这速度太疯狂了。没有任何理性的理由要这样推进。他当时可能有些激动,才说了那些话,现在 Terence Tao 的博客上,有客座数学家、哲学家,总之,这个领域社群里的人搭建公开讨论的平台,持续发表客座文章。虽然我很难一直跟上,也看不懂其中的数学内容,但为了感受讨论的语气,我还是会读一读,有很多值得思考的地方。
无限人才团队的思想实验 39:29
卢正石 感觉现在全人类都在参加卢德运动。你想想看。爱因斯坦的相对论也不是他一个人想出来的。当时,他和许多科学家同行来往通信,不断交流想法的片段和反馈。这跟现在智能体之间相互交流做的事很相似。文艺复兴时期是这样,工业革命时期也是这样,后来物理和化学蓬勃发展的19世纪后期和20世纪也是这样,杰出人才组成的群体规模都很大。但那些人,即使只有几百、几千个,也做成了那些事。如果设想现在有无数个这样的人,会发生什么?我们如今正面临这种局面。每个领域都有无数擅长该领域的人参与进来。以此为前提做个思想实验,很多事情是不是都得变?
崔胜准 总之,确实让人担忧。这周还有一个人引起了我对这件事的关注。他叫DHH。他是Ruby on Rails的创作者,说了一番引人注目的狠话,大意是“我现在不写代码了,你们也该这样”,这番话出现在我的动态里,一下子吸引了我的注意。
从程序员转向创作者、停止写代码的 DHH 40:38
崔胜准 不过,开发Pi智能体的Mario Zechner等人对此比较谨慎。Mario Zechner最近引用DHH的话发过一篇帖子。Mario Zechner等人想说的是,理解代码似乎仍然很重要。这样才能把它控制好,如果完全交给它,恐怕就难以驾驭了。他们这一派一直是这么说的。
不过我觉得两边都有道理。
卢正石 不过,我们不是常说这种事吗?有人读了几十年书才开悟,有人遇到好老师后开悟,有人一直喝酒就开悟了,也有人只摸了摸门把手就开悟了,不是吗?所以,达到开悟境界的方法各不相同,但我们现在仍然会用熟悉的东西来看待世界。就拿编程来说,我们会觉得,得了解Python的function和class,知道for loop之类的东西怎么运行,还得大致了解各个工程模块是怎么运作的,才能判断结果对不对。这是传统的方法。可是,模型生成的成果质量越来越高,尝试这些方法的成本越来越低。那么下一代要产出某种成果,做所谓的轻量级工程时,还需要懂代码吗?也许不需要。他们可能只是反复尝试,摸索着“这样做就会有这样的结果”,然后以完全不同的方式做出想要的成果。
崔胜准 对。
卢正石 坦白说,我觉得现阶段不自己写代码反而更好。倒不如反复说“帮我做,帮我做,帮我做”,我觉得,把这种新的做事逻辑内化下来会更好。
崔胜准 DHH引发关注时,他曾用一张幻灯片说,我们最终不再只是程序员,而会成为创作者。他把这个观点展示在幻灯片上。成为出色的创作者。不过这次,我在Pi这所由Toss创办的设计学校结束大约四周的课程后,发现学生们确实做出了一些有趣的作品。但关键是让他们看到更大的可能性。也就是先调查:现在用AI究竟能做到什么?如果不知道这一点,就只会照老习惯使用。Astra推出后又能做什么?要去调查这些,再亲自做实验。知道了能做什么,才会想到模仿和应用;要是连能做什么都不知道,哪怕手边有当前性能最强的模型,也没法付诸实践。
打开成长空间的教育与不懂术语造成的知识缺口 43:19
崔胜准 第二个重要的点是,有时不要过早踩刹车。我当时想传达的就是这个。有些关口,仍然只有全身心投入、坚持推进才能跨过去。光说“帮我做”是不够的。
不过我也收到过反馈:有些人因为不知道相关概念,就用不起来。也就是说,有人因为不知道能做什么而用不起来;比如刚才说的音频合成,就算知道能做,相关的基础概念或者哪怕只是术语,不知道也用不起来。比如不知道Three.js,就没法用它做东西。不知道MediaPipe也是一样。
所以说,如果你是某个领域的专家,就会熟悉相关概念和术语,知道有哪些重要的创作者,也了解这个领域的历史,需要时就能想起来并加以运用。但新手可能会跳过这个过程,这让我有些担心。因为我这次观察到,有些东西光靠反复说“帮我做”是做不到的。
卢正石 不过,如果你真的下定决心在那个领域做点什么,并不断试错,脑子里积累了大量相关经验,
崔胜准 那时候就能做到了。所以我觉得,仍然需要为此投入时间和精力,但杠杆效应确实很好。最后做出很棒的东西时,人们就会有那种感觉。感觉不像是自己做出来的。
拉开生产力差距的态度与时间 45:22
卢正石 不过,胜准刚才说的这些,恐怕不只适用于艺术等领域,在公司和商业中也同样适用。现在AI已经如此显著地帮我们做事,为什么公司的生产力却没有提高?大家也常提出这样的问题。所以,有些人看到这些变化,认真接受,并付诸行动;这样的人聚在一起,变化就会迅速发生。而聚集了决定不这么做的人的地方,无论展示什么,都推动不了他们。所以这不是AI本身的问题。问题在于使用AI的人。
崔胜准 所以现在确实存在态度问题。
朴钟贤 我倒觉得这是时间问题。那些尝试过各种AI工具、率先发现它能做很多事的人,已经在向前走了。至于其他人,我观察身边的人这一两年后发现,他们最终似乎也都逐渐开始更多地使用AI。所以时代的变化,终究会随着时间……只是以不同的方式来到人们身边,最终还是会到来吧。我是这么想的。再顺着这个想下去,就会开始琢磨:我们该做些什么?我会想到这个问题。假设最终什么都能做出来,以此为前提,刚才胜准展示的那些,胜准也说了,归根结底都是创作。原本做不到的事,用这种方式就能做好。于是又会想,我们该用它做些什么?思考就这样延伸下去。
当一切皆可创造,我们会创造什么 46:35
朴钟贤 说得极端一点,我们现在这样聊天,录下来后会发布到YouTube上。这也是在制作并发布内容。比如说,过一段时间,这样的内容也能全部生成吧。我也很好奇。正在看这个视频的人,如果知道眼前的拍摄和制作全都是AI完成的,还会看吗?如果是为了内容而看,那无论是不是AI制作的,都会看吧。但如果想看的是真人,想听我们这些人亲口说话,大概就会来看我们的视频。可如果有价值的只是内容,那即使我们不用亲自出镜说话,只要能把那份价值传达清楚,大家也会来看吧。所以未来,通过这样的生成方式,大量优质内容将会被制作出来。无论是美术、音乐、资讯还是视频,人们会看什么,为什么看?那我们该做什么?这些问题,我最近想了很多。
体育的时代与游戏的人 48:02
卢正石 我们有位前辈曾经说过这样的话。他说,体育的时代会到来。他是这么说的。比如跑100米,如果开车跑,当然会更快。可人类设立了100米赛跑,在其中竞争,演绎出人的故事,大家就会为之狂热。同样,智力方面以及其他事情,机器都会替人完成,人类便会享受人与人之间的竞争、故事和感动,真正进入“游戏人”的时代。所以别再费心琢磨模型之类的事,接受这个必然到来的未来,提前走进体育和娱乐的世界。那位前辈是这么说的。我也曾觉得,这个想法相当有意义。
崔胜准 我昨晚好像也在思考一个可能与此有关的问题。我偶然在YouTube上看了几个专业钢琴家拍的整蛊视频。但那些专业钢琴家的演奏,和刚才对音乐所做的实验非常不一样。虽然我不太懂音乐,但能让人感受到人类强烈情感的演奏,依然非常有魅力。毕竟他们并不是把旋律原样弹出来就完了。其中融入了自己的理解和意图。而这些东西,目前模型做出来还有些乏味。
模拟出来的激情也能令人感动吗 49:09
崔胜准 不过,模型正在掌握基本的音乐语法。所以我不知道还要多久,人变成眼神清澈的疯子,近乎疯狂地挑战、完成某件事,连这样的故事也能一键生成吗?说到底,我们看那些YouTube视频,也只是通过视频在看。可如果看到逼真到无法分辨的视频,我是否也会同样被那种模拟出的激情打动?这只有等那一天真的到来,才能知道。
卢正石 现在恐怕真的没人知道。所以才会有各种不同角度的预测。但有一点可以肯定:从“AI做不到这个”到“AI什么都能做”,才过了多短的时间?
崔胜准 虽然因领域而异,但在能做到的领域,进展真的惊人。
卢正石 以前说“这个不可能,不可能”的事,如今不都做到了吗?甚至已经到了创造力这一步,光是看到这一点就挺有意思。
从创造力延伸到生物技术的 Anthropic wet lab 50:38
崔胜准 所以从这个角度看,这周Anthropic受到了一些批评,它说找到了类似CRISPR基因剪刀的东西,Anthropic还做了湿实验,现在又成了热议话题。不过,也有专家认为这似乎没什么了不起的。但我们得记住:出现这样的信号本身就值得重视。
卢正石 刚才胜准展示的2022年谷歌那个案例,当时说大概两年内就能攻克,您说我们花了四年,生物技术界对此有反对意见。他们说,那是我们早就在做的事,没什么新意,有什么好大惊小怪的?但这才刚刚开始。
崔胜准 对,出现这样的信号本身就值得重视。这也说明资金正在投向那里。
从前沿实验室到前沿公司 51:25
卢正石 不过,OpenAI和Anthropic这样的公司,起初只是做模型的公司,后来围绕模型实现了横向扩张,比如更好地调用工具、加入记忆功能,还在内部加入一些类似Word、PowerPoint的功能,这些我还能理解,但完成横向扩张之后,竟然还在纵向扩张,法律、财务,还有生物技术、科学等领域,他们也全都在做啊。
崔胜准 大家担心的是,他们可能拥有近乎不受制约的权力。
卢正石 别叫它们前沿实验室了,该叫前沿公司了,有人这么说。OpenAI和Anthropic如果这样向上、向外不断扩张,还会剩下什么?听说Anthropic内部也有这种带着自嘲意味的说法:我们会把所有事都做了。我们得对整个人类负责。
崔胜准 公司名就叫Anthropic嘛。是啊,真让人头疼。
Tech Week 前夕的旧金山现场 52:33
卢正石 好,既然说到这里,钟贤现在去了美国。就顺势聊聊去美国的事吧。
朴钟贤 我昨天刚到美国,
卢正石 准确说是旧金山吧。对我们来说,一说美国,基本上就是指硅谷。你是去了硅谷吧?
朴钟贤 我现在来到了韩国创业者大概都知道的EO House,暂时在这里借住。EO频道发布创业相关内容,这里是它运营的黑客屋。我来这里是为了参加下周的Tech Week,打算到处参加各种活动。
所以关注我账号或其他动态的朋友,应该知道我刚开始做一家视频相关的初创公司。关于这件事,我想了解今天聊到的视频生成及相关工作,前沿领域是如何开展的。我会尽量跟进,看这期视频的朋友里,应该有不少人会参加活动。这不是一场大型活动,而是数百场活动在市内各处举办,大家可以自行选择感兴趣的活动参加。
有兴趣的朋友,活动结束后我还会多待一周左右。从今天算起,我计划在旧金山待大约一个月。如果有人想找我喝咖啡聊聊,欢迎随时联系我,我们可以见面交流。
卢正石 EO House还在帕洛阿尔托的时候,我也曾在那里住过很长一段时间。请代我向大家问好,也祝EO House的各位都能开创一番好事业。
崔胜准 等这期视频发布的时候,DevDay应该已经开始了吧。29号开始。虽然不知道会发布什么,但总会有新东西吧。
对 DevDay 与全能助理 agent 的期待 54:25
卢正石 听说会推出智能体?对,像Muse智能体那样,非常实用,真正成为能处理各种事务的全能助理。这其实几乎就是消费级应用的终极形态了吧?它想成为几乎所有事情的入口。如果真做成了,消费行业又会发生怎样的变化?人们不再自己去搜索、买东西,也不再自己找文章读,而是都对助理说:“帮我做、帮我做,拿来、拿来,买来、买来。”如果变成这样,这个行业又会发生怎样的变化?这些都是大家关心的问题。
崔胜准 而且还不止这一个,我看Tibo的帖子时,里面的ship,也就是船,好像有五艘左右。虽然不知道会发布什么,但这种令人兴奋的时刻似乎来得太频繁了。光是9月就有多少次了?9月初有Fable、Astra,然后是GPT-6 Sol。总之,单是9月虽然以前也有过这么多发布,但真是既有趣又让人吃力。感觉只能硬撑下去。
Tesla 的 10 月 1 日发布会与街头自动驾驶汽车 55:25
朴钟贤 其实我还有一件期待的事。刚才也稍微提过,就是Tesla说要在10月1日发布的东西。我也不太清楚具体是什么,但除了Roadster,似乎还有别的东西。
崔胜准 嗯,可能是什么会飞的东西,听说有这种传闻?
朴钟贤 我这次来到旧金山,已经很久没来了。以前来过这里的朋友应该都见过,像Waymo和Zoox这样的车,这里的无人驾驶汽车已经很平常地在路上行驶了。这些景象还是让我觉得有点陌生,Tesla要发布的可能也是类似的东西。某种真正走进现实生活的AI技术。
崔胜准 那下一期很快又要来了。
观点形成赶不上变化的速度 56:08
卢正石 下周我们还会带来新消息,但比起消息本身,我们对这些消息形成了怎样的看法,似乎正变得更重要。但我觉得这些看法还没有完全成形。毕竟现在变化实在太快了。
崔胜准 还没来得及形成看法,新东西就不断出现,所以很难形成自己的看法。
卢正石 所以,需要一种能超越这一切的视角,我认为这是下一个层次的开始。我们正处在需要迈向下一个层次、实现跨维度跃升的时期。
崔胜准 真难啊。我们的看法也只是hill climbing式地逐步形成,真能一下子跳到全新的高度去思考吗?我不太清楚。
卢正石 如今能实现那种飞跃的人,在钟贤去的硅谷就有那么几位。其实,那些人一旦对世界采取某种行动,我们就只能一边作出反应,一边逐渐形成自己的看法。现在确实是一个有些被动的时期。如果世界因此发生剧变,那些人会占据很大一块,我们就再去寻找小小的机会,找到只有我们能做的事。一直以来都是这样。
但这次的影响实在太大了,而且过去的技术创新,是制造工具,如今却是制造工具的工具,因为这等于创造出了智能,性质就完全不一样了。所以一切似乎都在以不同的方式改变,变化又如此根本,历史上似乎没有多少可供借鉴的框架。
俄罗斯方块展示的 epistemic action 57:45
崔胜准 我这次和模型对话时,提到了“epistemic action”这个术语。意思是,玩俄罗斯方块时,得把方块转一转,才知道能不能放进去。所以要作出预测,就得先行动;要知道方块能放在哪里,就得采取这种认识性的行动。大的层面我说不准,但在我们这样的小范围里,确实得不断动手尝试。
卢正石 没错。而且尝试过的人和没尝试过的人,现在确实像水和油一样分开了。
崔胜准 得试试才行。
卢正石 我们也得继续试。我出差一周回来,发现只要一周没关注这里,世界就飞速向前,让人感觉有点跟不上。我就有过这样的感受。
等待下一次变化…… 58:29
崔胜准 那我们下次……
卢正石 下次再见。好好调整时差。
崔胜准 期待下次听到有趣的消息。
朴钟贤 我会尽量打听些有趣的消息,像特派记者一样带回来。
崔胜准 谢谢。