三年前,Meta CEO扎克伯格在Joe Rogan节目上说过,有一天人们戴上眼镜、AI Agent就会随之出现。如今,这一幕或正在发生。
Meta推出的个人AI Agent——Muse上线两周用户即达数百万。扎克伯格在9月25日一档访谈节目中表示:“每隔几年我们才能遇到这种情况。”他将Muse的早期反响定性为“一出手就是全垒打”——这在Meta产品历史上属于少数。
与此同时,他宣布Muse将整合至全线Ray-Ban智能眼镜,用户无需再说“嘿Meta”,而是可以自定义唤醒词直接呼叫自己的个人AI Agent。
多年来被外界视为三场独立豪赌的元宇宙、智能眼镜和大模型,正在Meta内部产品层面加速合流。
在这场访谈中,扎克伯格还坦承了Llama 4失败是“最可怕的时刻”,并透露Meta正在建设5吉瓦级训练集群,认为足够大的算力可“暴力破解”AGI。
Muse为何能“一出手就是全垒打”
Muse的起点,是扎克伯格和团队成员Nat与Alex坐在一起,用开源工具在家里“拼凑”出一个早期版本。
“我们意识到,这是一种神奇的体验,”扎克伯格说,“如果我们能把它做成任何人都可以用——不需要自己买Mac Mini、不需要在终端里折腾——那么这将是数十亿人想用的东西。”
这句判断,驱动了此后整套研发逻辑:不只是训练模型,而是从模型、脚手架、到Agent的“心跳”机制全栈自研——Agent会定期自动唤醒,检查用户目标,主动推进待办事项。
上线后的数据印证了这一判断。两周,数百万用户。
个人AI:重点是执行、记忆与“判断力”
对于个人AI与通用AI的差别,扎克伯格将当前竞争焦点概括为让模型成为更好的Agent。
“过去一年最大的事情,基本上就是编程Agent。”他说,编程能力很重要,因为即使用户没有直接写代码,“你的Muse也会在后台一直为你写代码,去完成各种事情”。
但他认为,个人Agent不能只具备编码或任务执行能力,还需要理解隐私边界和社交语境。
扎克伯格举例称,用户让Muse预订餐厅时,Agent可能知道用户存在过敏情况或怀孕等信息,但并不意味着这些信息应该被自动披露。“你会希望它完成任务,同时尽可能少地披露信息。”
他称,这种能力属于人类通常具备的“基本社交技能或常识”,但如果只是训练编码Agent,许多公司并未将其纳入模型能力范围。
“我们训练的是整个模型,而不是拿别人的现成模型,再在外面搭一个框架和Agent。”扎克伯格说。Meta还在产品层面加入记忆、任务追踪、虚拟角色动画和实时语音互动等功能。
在个性化方面,他表示,Meta并不认为AI应该只有一种固定人格。“很多实验室都在关注怎样把人格调到正确状态,但我从来不认为人格只有一个正确答案。”
他称,Muse允许用户修改头像、声音和基础性格,模型设计目标是具备较高的可操控性。“你可以定义自己希望如何与它互动,这对个人Agent很重要。”
每个Agent都有自己的“电脑”
Muse区别于其他AI产品的核心基础设施之一,是Meta为每个Agent单独配备了一台安全虚拟机(Secure VM)。
扎克伯格解释了为什么这是必要的:
你的Agent会了解你很多敏感信息。我们不认为这些信息应该跟所有人的数据混在一个池子里。
他把Muse Secure VM比喻为“放在你桌子底下的那台只属于你的电脑”——用户数据加密存储,密码等敏感凭证通过独立安全模块管理,Agent本身无法直接读取。
在此基础上,Meta还设计了“Sentinel”安全Agent,专门监控进出Muse的数据流,一旦检测到异常或高风险操作,会直接拦截并提示用户授权。
元宇宙、智能眼镜与Agent,三条路线正在汇合
扎克伯格在访谈中透露,Muse将全面接入Ray-Ban系列智能眼镜,并对现有交互方式做出升级。
目前的眼镜是“单轮对话”体验——说一句,得一个回复,结束。接入Muse之后,眼镜变成Agent的前端入口:用户开口,后端Muse在安全虚拟机里持续工作,完成任务再反馈。
对于眼镜的产品路线,他描述了一条清晰的硬件梯队:
无摄像头的纯音频眼镜:已搭载Muse,可处理通话、音乐、语音任务
带小显示屏的Meta Ray-Ban:已发布,具备基础视觉反馈
全视场角全息AR原型:已发布,扎克伯格称“会非常令人兴奋”
他称,Meta在眼镜上的长期投入,使公司在AI Agent成熟后处于较有利的位置。Meta正在将Muse及更多AI功能引入眼镜产品,而过去相对更强调“临场感”的元宇宙技术仍在继续推进,只是当前更多资源转向了Muse和智能眼镜的AI功能。
对于虚拟形象,扎克伯格称,Meta此前需要通过房间级设备、多角度扫描以及企业级GPU环境,生成较高质量的写实化身;目前,用户通过少量照片即可完成设置,相关能力已可运行于一副VR眼镜中。
展望2030年,扎克伯格称,元宇宙的核心愿景始终是融合物理世界和数字世界。他举例称,未来人们可以在线下与通过全息影像接入的朋友共同参与活动;在工作场景中,人类与多个Agent也可以共同参与群聊或会议,Agent可以以全息形象或其他具身化形式出现。
“最可怕的时刻”:Llama 4的失误
并非所有押注都一帆风顺。扎克伯格在访谈中罕见地直接谈及了Llama 4的失败。
Llama 4之后,那是最可怕的时刻……我以为我们在正轨上,但我们没有。这是一个相当大的负面意外。
他把问题归结为团队结构的根本性错误:
我按照Instagram推荐系统或广告系统那种方式来组建团队——几百上千人并行推进。但训练语言模型需要的是一支紧密协作的小团队,把它当作一个群体科学项目来做。每个席位都极为宝贵。
由此,Meta彻底重组,从业内广泛引入顶尖人才,成立Meta超级智能实验室(Meta Super Intelligence Lab,MSL)。扎克伯格表示,新一代模型即将发布,但不会在Connect大会上公布。
算力路线:暴力破解AGI,5吉瓦项目在建
谈及通往AGI的技术路径,扎克伯格给出了一个直接的判断。
我不确定还需要什么根本性的架构突破……我认为我们已经大致知道配方了。如果你能建造一个足够大的超级计算机集群,就可以暴力破解,到达那里。
目前Meta的算力扩张路线:俄亥俄州超过1吉瓦的集群已基本投入使用,用于训练下一代模型;路易斯安那州5吉瓦级集群正在建设中。
他表示,“当你拥有多吉瓦集群进行训练时,你基本上就会得到某种接近AGI乃至超级智能的东西。”
不过他也补充,当前算力驱动路线并不意味着架构研究不重要——
人脑只消耗约10瓦,而我们的系统可能比它低效一百万倍。如果把大规模算力和架构突破结合起来,才能真正领先。
对齐,不是负担,是产品必须解决的问题
扎克伯格对AI安全的态度很务实——他不把它视为监管压力,而是产品能否成功的前提。
如果你让Muse做一件事,它却做了相反的事,谁还会用它?我们需要让模型不只是理解你的具体指令,还要理解你的意图和你的价值观。
“Muse要触达十亿用户,我们就必须解决对齐问题,或者说在这上面取得非常大的进展。”他说。
对于训练过程中的安全边界,他用了一个类比:“就像父母给孩子立规矩——如果它通过修改系统配置来'完成'一道编程题,我要告诉它:不,我让你去学解题方法,不是让你找捷径绕过去。”
访谈全文如下:
大举押注
主持人: 这件事将会有数十亿人想要使用。对您来说,做建设是一种怎样的感受?"永生"是一种可能吗?好,如果您带我进入您的思维,快进到2030年,那会是什么样子?
这位是马克·扎克伯格。22年前,他构建了一个连接数十亿人、永远改变了世界的社交网络。而如今,他决定建造更宏大的事物。为此,他正在元宇宙、智能眼镜和人工智能领域大举押注。多年来,怀疑者认为这是三场各自独立、不可能成功的赌注,但他们忽略了更宏观的图景——因为当下,这些押注正在汇聚,共同创造出一种全新的超级智能。
今天,我们将向大家呈现这一切,我也将向马克提出一些他从未被问过的问题,倾听他对未来的愿景,让您能够提前布局,构建下一件大事。
主持人: 非常感谢您来到节目。
马克: 谢谢,很高兴来这里。
主持人: 为了这次对话,我把您做过的每一次采访都看了一遍。
马克: 好家伙,那比我自己看的还多。
主持人: 很好玩,收获颇丰。有两件事给我留下了深刻印象:第一,您对"建造"的热爱,我感觉您就是最顶尖的建造者之一;第二,您押注的能力——敢于做出巨大的赌注。我觉得这周,所有这些押注正在汇聚到一起,所以我们就从这里说起吧。
马克: 好的。这些事情我们已经做了很长时间了。AI方面,作为一家公司,我们几乎从创立之初就在做了——第一版新闻资讯流在某种程度上就是一个机器学习产品。然后我们大约在15年前创建了AI研究实验室。
但现在我们进入了新阶段——大约一年多前,我们启动了Meta超级智能实验室。这是一次相当彻底的研究重启,从整个行业引进了大量优秀人才,令人振奋。目前,我们看到模型越来越好,下一代模型即将发布,不过不是在Connect大会上宣布。此外,我们还有Muse个人助理,目前来看反响非常好。
在构建这些东西的时候,你其实并不确定结果如何。我们自己是喜欢的。早在今年年初,我就在家里用自己的方式把Open Claw拼凑起来,感受这个东西是怎么运作的,以及怎样才能把它打造成一种任何人都能使用的神奇体验。
基本上,当我们——我、Nat和Alex——坐在一起,意识到这是一种神奇的体验,并且如果能把它打造成一个开箱即用的版本,让那些不懂技术、不想去自己安装Mac Mini、不想进终端折腾、也不想在出问题时调试的普通人也能用的时候,我就觉得,这将会是数十亿人都想要使用的东西。
从那以后,我们一直在围绕这个目标努力:专门为它调优模型,不仅构建了助理本身和运行框架,还构建了为每个助理提供独立计算环境的技术——我们为此构建了整套Muse安全虚拟机。
我们内部一直觉得这很特别,内部人员也很喜欢,但你永远不知道产品发布后大家会怎么反应。偶尔会出现一鸣惊人、开门红的情况,但大多数时候你会收到一些正面反馈,还需要迭代几个地方才能真正让产品"咔哒"一声落地。而这一次,它一出来就直接"咔哒"了。看到这一切发生真的非常令人振奋——才两周,使用人数就已经有数百万,这相当罕见。每隔几年我们才能遇到这样的情况,但这绝对是创业公司最令人享受的时刻之一。
主持人: 您能坚持在赛场上、不断尝试,这让我非常佩服。而且这么多次都打出了安打,真的很厉害。您之前有一次和乔·罗根的访谈,大概是三年前,最后您提到有一天可以直接戴上眼镜,AI助理也会随之出现。所以我感觉Muse已经有实体化的形象,这一点非常聪明,因为那感觉是必然会发生的事。
马克: 我觉得这也只是让它显得更友好可爱。我认为太多人把AI描述得像个令人恐惧的东西,但AI应该只是有用又有趣的。那个实体化的形象——项目早期有位设计师做出了那个角色,不知为何他们一直想迭代,但第一版就是最好的。后来有人说,"哦,它得是蓝色的,因为是Meta嘛。"我说,"不,我觉得这个形象就是对的,你第一次就钉住了。"就这样,就是好玩。
个人AI与通用AI有何不同?
主持人: 很好的细节。如果您想让模型在个人事务方面表现得非常出色,而不仅仅是通用智能模型,那么训练方式会有什么不同?
马克: 我认为目前的核心在于让模型成为优秀的"智能体(agent)"。过去一年,最大的风口是编程智能体,其中蕴含两个核心思想:编程专业能力,以及成为优秀智能体的通用能力。
我们的策略是,将智能体本身做好放在首位,而不是专攻编程能力。
编程能力之所以重要,是因为即使用户自己不认为在写代码,Muse也在后台一直为你写代码来完成各种任务。但我们认为,智能体应该首先是一个出色的智能体,编程能力服务于此目标。
此外,在构建个人助理时,有些事情比构建企业软件产品更为重要。比如,如果你在构建一个企业编程工具,模型根本不需要有任何关于"信息披露尺度"的概念——比如什么信息该说、什么不该说。但对于Muse来说,这非常重要。
你需要把这种能力训练进模型里,就像训练其他任何能力一样。你会告诉它很多事情,然后希望它去帮你实现目标。比如,你想让它帮你订餐厅,你在找一家合适的餐厅,但你可能有某种过敏症,或者你怀孕了,而你可能不想把这些透露给餐厅。但Muse会知道这些信息,你希望它在尽量少透露信息的同时完成任务。这是一种具体的技能,本质上是人类的基本社交常识。
但那些只做编程智能体的公司,大多数都没有把这种能力训练进去。我们之所以能做到,是因为我们在做全栈——我们不是从别人那里拿来一个现成的模型再套个框架,我们是从头训练整个模型,专门为这些能力服务。
模型当然需要具备广泛的通用智能,但它同时也具备这些特定能力。然后在此基础上,你构建整个助理,以及它周围所有的细节:记忆、运行框架,还有它"心跳"的方式——它定期唤醒,检查一下"好,这些是我了解的关于你的目标,有什么我现在可以推进的吗"。
我们还有一个专门的团队,只负责打磨虚拟形象的实时动画效果,因为不仅仅是默认形象——你可以自定义任何形象,然后它就自然地动起来,效果非常棒。我们还在推出语音模式,你可以进行实时语音对话,你的助理就在那里陪着你。这些细节,我觉得都源于我们在做全栈——模型和产品是一起开发的。
主持人: 另一件大事是虚拟机。能解释一下它为什么重要,以及它解锁了什么吗?
为什么Meta要为每个AI助理配备独立计算机?
马克: 基本上,一个智能体要能替你做事,就需要一个地方来存储你的信息。我们认为这些信息不应该和其他所有人的信息混在一个资源池里。
可以这样理解:你的助理会知道很多关于你的敏感信息。很多人最初接触OpenCloud这类智能体时,会在家里自己配一台Mac Mini。于是我们想,很多人并不想买Mac Mini或者自己设置。那么,什么样的体验能最好地近似这种效果呢?答案是:你只需下载一个App、注册,就能获得一台专属于你的计算机,供你的助理工作、存储数据,并围绕此建立安全模型。这样就近似于在你桌下有一台自己的电脑——就连我们Meta也无法访问。
比如Muse机密虚拟机,这是我们正在开发的功能,就连我们自己也无法看到你虚拟机里的内容。
我们还围绕这些构建了很多东西,比如安全凭证存储——当你的助理需要处理密码之类的信息时,它本身不需要能看到这些密码,只需要在你要求它登录某个服务时能"插入"凭证,并且只在你明确要求时才这样做。系统应该这样设计:那些信息本身就不可随意访问,因为意外总会发生,有人可能试图入侵,或者系统可能出现问题。
所以你要确保智能体无法访问这些数据,Meta也无法访问。为每个助理提供独立计算机,并把安全性做到极致,是这项技术的根本基础——既赋予Muse帮助用户实现目标所需的能力,也保证了隐私和安全,使其成为该领域世界级、行业领先的产品。
主持人: 那这是否意味着,就像WhatsApp一样,Muse连接到的虚拟机上的数据是加密的?人们该如何理解数据在虚拟机中的实际存储方式?
马克: 我们基本上构建了两个版本。Muse安全虚拟机(Secure VM)包含各种隐私功能,其中包括我们构建的整套Sentinel智能体架构。你有一个正在为你执行任务的普通Muse助理,同时还有一个我们称为Sentinel的安全智能体,专门监控进出你的Muse的数据流。
如果有外部内容试图破坏安全,Sentinel会直接切断,阻止其发生。如果它认为你的Muse即将采取某个需要你介入的行动,它会覆盖Muse的操作,并触发提醒,让人来确认权限——比如"你希望Muse能做这件事吗?"
这整套系统,加上安全凭证存储,再加上多层纵深防御,共同构成了Muse安全虚拟机。
我们还在开发另一个项目。Nat和我专门招募了Moxie Marlinspike——他就是当年和我们合作实现WhatsApp端对端加密的那个人——来设计Muse机密虚拟机(Confidential VM)。其核心思想是,在安全虚拟机的基础之上,再赋予你一个专属加密密钥,使得连Meta都无法访问其中的内容。
这个版本实现难度更大,因为如果Meta无法访问虚拟机内部,调试和保证系统正常运行就困难得多。所以我们花了一些时间,但很快就会推出。这基本上将达到人们在WhatsApp以及我们其他最安全产品上已经熟悉的安全标准。
主持人: 这样做的优势,只是让人们心理上觉得更安全,还是有实际的好处?
马克: 我认为安全本身就很重要。我们的目标是近似于让你在桌子下拥有一台本地机器。那台本地机器能给你什么?它意味着没有任何公司能访问它。
所以,假设Meta想为你提供这项服务,我们怎样才能给你同等级别的隐私和安全保障,使得没有任何公司——无论是Meta,还是任何试图入侵我们的人,或者在某些国家,你不信任当地政府的情况下——都无法访问它?因为我们自己也进不去,因为我们没有访问权限。
我认为这非常重要,这也是人们信任WhatsApp的重要原因。这对隐私、安全和信任来说是真实存在的价值。
如果你要拥有一个对你的一切了如指掌的助理——我猜几乎我们所有人都会拥有这样的助理——快进5年,每个人都会有一个能深入了解你的目标和一切的助理,并能帮你完成事情。在这种情况下,在隐私和安全方面做到行业领先就非常重要。我们从一开始就想这样做。
如何塑造AI的个性?
主持人: 您还有一点很有意思——您在大学学过心理学。
马克: 嗯,在那里只待了很短的时间,两年,但我感觉它影响了我后来构建的很多东西。
主持人: 我们看模型的时候,经常会说某个模型"非常聪明"。但就像我们选择朋友,肯定是因为他们聪明,同时也因为我们喜欢他们的能量和相处方式。您在塑造模型个性方面是怎么考虑的?
马克: 我认为理想的模型应该有足够的适应性,能够契合不同人的风格。我觉得很多行业人士在这一点上都搞错了方向——很多其他实验室都在专注于"如何把个性设计对",但我从来不认为个性是一个固定的东西。这也是我如此坚信开源、如此坚信人们能够定制化的原因之一,也是我们把Muse设计成一个高度个人化产品的原因。
你可以自定义和个性化Muse——不只是形象和声音,在你第一次注册时,它问你的第一件事就是"你希望我的基本个性是什么样的",而且你随时可以去修改。
我们努力让模型具有很强的可引导性,让你能定义自己想要的互动方式。这是让它成为优秀个人助理的重要组成部分——这种围绕个性的适应性非常关键。
主持人: 您自己的Muse是什么风格?
马克: 我让它直接、注重效率。它挺有意思的。早些时候的版本很爱讽刺、很幽默,但现在这个版本更直截了当。我的助理用的是默认的Muse形象,但我给他穿了一件托加长袍,还给他配了一个深沉到有些滑稽的嗓音,和他互动很有趣。
主持人: 我觉得要有幽默感,你必须真的很聪明。很多人没意识到,喜剧演员是社会上最聪明的一批人——反应要快,机智要够。您肯定有这个特质。看了您所有的采访,您一直表现很好。
马克关于AI与元宇宙的出人意料的预测
主持人: 您和Theo的访谈中,你们谈了很多关于技术的下一个前沿以及这一切最终指向何处。AI领域曾经历过几个"寒冬",人们以为不会有突破。元宇宙也经历了几次这样的时期,大家觉得这是个无法兑现的赌注。我昨天试用了新的全息形象功能,非常酷。在和Lex的访谈里,感觉要花11个小时才能把您的脸录进去,现在只需要3分钟了。这是怎么推进到今天的?
马克: 在元宇宙的整体发展上,我们在创立Reality Labs时,始终认为最终会有外形正常的普通眼镜,并且随着时间推移,它既能提供沉浸式的临场感,又能成为出色的AI设备——因为眼镜是唯一能让设备看到你所看、听到你所听的形态,整天在你耳边与你交流,并最终显示图像。
但10到15年前,我当时假设我们会先实现全息技术,再有高度发达的AI。然而技术演进的路径很有趣——我们实际上先有了AI和个人超级智能,然后才有技术来让全息技术变得足够普及和实惠。这是我没有预料到的,但我很高兴我们两个方向都在做。
我们在眼镜上的大量投入,让我们在AI助理准备就绪之际,处于了非常有利的位置。Connect大会上的很多发布,正是关于把Muse和大量AI功能引入眼镜,我认为用户会非常喜欢。这是个大事。
关于临场感方面,我们仍在推进,但进度相对慢一些,因为我们大部分精力已经转向为眼镜构建Muse和AI功能。不过,我们有一个持续已久的项目,就是实时高保真的虚拟化身。
就像您说的,三四年前,你需要一整个扫描室从各个角度录入一个人,然后还需要企业级GPU才能渲染,非常费事。我们为Lex播客做的那个演示就是那种设置。而现在我们基本上让它在一副VR眼镜里就能运行——这是第一副能实现这种惊人VR体验的眼镜形态,而不是一个大头显。只需几张照片就能建立你的虚拟化身,进展之快令人惊叹。
主持人: 而且还能基于声音来驱动表情。在演示里,它让我笑,让我互动,然后理解我的面部如何随着音轨运动。您在那期播客里提到,一些平时表情比较内敛的人,实际上在虚拟世界里会想要更丰富的表情。您怎么看待人们区分"虚拟自我"和"现实自我"这件事?
马克: 我认为我们在理解这方面的社会学和心理学上还处于很早期的阶段。我觉得人们对自己的认知和想要投射出去的形象,往往和实际的自己有些不同。从社交网络诞生之初,人们就在精心挑选头像。在Muse的虚拟形象上,我们也看到了类似的现象。那不太是在"策展"自己,而是在"策展"你想要与之交流的那个"人"。
我认为,当你在给人们提供表达自我的能力时,你既希望它能真实捕捉到他们,同时它本身也是一种表达形式,而不只是纯粹的镜像映射——它既是传达,也是表达。我们希望能构建出兼顾两者的东西。这始终是一个迭代循环:看看人们怎么用,然后改进。经过多年工作,我们现在才真正站在了起跑线上——第一次能将相当高质量的写实化身真正做进产品里,在手机上可以用,在VR里也可以用。我非常期待看到结果。
2030年会是什么样子?
主持人: 好,带我进入您的思维,快进到2030年,如果一切顺利,全息技术那边会是什么样子?全息加Muse,加上眼镜,它们如何汇聚在一起?
马克: 我对元宇宙愿景的理解,始终是关于将物理世界与数字世界有效融合。基本理念是:我们有这个美好的物理世界,同时也有一个精彩的数字世界——互联网上20到30年来积累的海量内容,令人叹为观止。但我们访问它的方式,要么是坐在桌前,要么是通过口袋里的一块小屏幕,这从根本上看非常受限。
我认为这件事最理想的版本,就是物理与数字世界的无缝融合。可以这样想:现在我们两个人在这里。未来的某个版本里,我们其中一个人可能是一个全息投影,但你依然感受到彼此真实在场的那种感觉,这和视频通话完全不同。
而虚拟现实的核心,正是传递这种临场感——让你真切感受到自己与他人同处一室,或置身于另一个地方。你可以用全息技术实现这一点,并以各种方式混合。比如,我可以和朋友打一场扑克,一部分人在场,另一部分人通过全息形象加入,也能打牌,牌桌本身也可以是全息的,这样不在场的人也能融入其中。
与此同时,AI也可以被赋予实体,出现在这个场景里。在工作场景中这很有意义——我现在就一直在用各种编程智能体来构建东西。试想一下:你有一个群聊频道,里面有几个人和几个智能体,你给智能体分配任务。但有时候,大家会聚在一起开会,智能体也许也应该在场。它们怎么出现?很简单,沙发上多几个位置,它们以全息形象出现就好。或者用Muse那个可爱的小角色,或者是龙,或者是任何你创造的奇奇怪怪的形象。
我猜这在未来会感觉相当自然。
主持人: 有意思。您之前的采访中说过,科技行业经常忘记"好玩"这件事。我觉得有个实体助理出现在那里,也会让感觉更真实——就好像真的把工作外包出去了。当你看到Muse在打字,就感觉有什么事情真的在发生。这一点做得很好——能看到浏览器里正在发生什么。那么您认为有没有可能出现这样的场景:你戴着眼镜,然后控制你的电脑,让Muse在电脑上帮你做事?
马克: 哦,肯定的。VR已经可以做到了。你可以随便找个地方坐下,咖啡馆也行,然后打开你的工作站,有六个显示器,在上面写代码,一切都有。
眼镜这边,最受欢迎的那款目前还没有显示器,这样一方面可以让价格更实惠,让更多人使用,另一方面我们仍在努力让显示器做进最紧凑的形态里。但我们已经发布了Meta Ray-Ban的显示器版本,很受欢迎,是一块小显示器。我们还发布了全视场全息AR的原型版本,我认为会非常令人兴奋。
所以,整条产品线就是这样的:从纯音频眼镜——没有摄像头,看起来就是普通眼镜,但里面有Muse,可以用各种音频工具、听音乐、打电话——到更高阶的版本,全都有。
主持人: 我在想,戴着那款音频眼镜,能不能一边跟Muse说话,一边让家里的电脑在做事?
马克: 对,完全可以。我们刚刚在Connect大会上发布了这个功能。现在所有眼镜都连接到Meta AI,是一种"单轮"体验——你发一个提示,它回复,就这样。但有了Muse,我们基本上要把所有眼镜都升级为Muse。首先,你不需要再说"Hey Meta"了,你可以给它取任何名字,这本身就是乐趣的一部分。然后你就直接和它说话,它连接到你的Muse,你的Muse在你的安全虚拟机里处理任务,帮你把事情搞定。
主持人: 太厉害了!
创始人心态
主持人: 好,我们现在在这里,Muse进展很顺利,眼镜也做得不错,但大约一年前,很多人都在问"超级智能实验室到底怎么了"。在那个时刻,您内心是什么感受?当事情进展不顺、但您又看到了长期愿景,那是一种怎样的体验?
马克: 真正出了问题的是Llama项目和Llama 4。
Llama 1是一个相当有趣的模型,它开创了整个开源AI运动,我们对此非常自豪。Llama 2实现了规模化,Llama 3是一个很好的模型,在当时几乎达到了前沿水平。然后到了Llama 4,我们基本上偏离了应有的发展轨迹。
每当事情没有按我预期的方向发展,我都会花大量时间思考:为什么会这样?我们需要改变什么才能做得更好?这次,我的反思是:整个团队的架构我搞错了。
我把它建模成了我们做Instagram信息流或广告系统这类机器学习工作的方式——有数百甚至上千人并行工作在很多事情上。但对于构建语言模型来说,你真正需要的是一个极其紧密的小团队,把它当成一个团体科学项目来做。人不需要多,但这意味着团队里的每一个席位都极其宝贵。
于是我们从Meta各处网罗了最优秀的人,同时从行业各地引进了很多牛人,组建了一个全新的团队——就是Meta超级智能实验室。
从我的角度来看,在MSL启动之时,我就知道这需要一段时间来重启、重建基础设施、训练下一代模型。但我知道我们拼起了一支出色的队伍,如果团队能磨合好、运转良好,结果就会很好。
对我来说,最惊心动魄的时刻,其实是Llama 4发布后——我以为我们在这条轨道上,结果发现并没有。那是一个相当大的负面意外。我想,作为创业者,你总会在这些时刻被考验,因为不可避免地,并非所有事情都会一帆风顺。而真正决定发展轨迹的,是:当事情没有按你希望的方向发展时,你如何找到前进的方法。
主持人: 我猜反过来也是如此——当某件事远超你的预期时,比如Muse的首发,你如何确保能把握住这个机会?
马克: 完全是这样。现在公司全员投入——最开始只是一个构建产品的小团队,但现在大家都意识到,这真的准备好了登上大舞台。全公司都在想,怎么把这个东西做大,怎么让数亿人都能体验到。
从优化所有基础设施让一切顺畅运行、榨干现有GPU的每一分算力,到各个产品团队以不同方式将Muse嵌入——比如眼镜。看到大家齐心协力,确保Muse能顺利扩展出去,这种感觉非常棒。
马克如何书写和传达愿景
主持人: 作为创始人,我觉得那才是你最向往的时刻——一切汇聚在一起。您是怎么向公司传达愿景的?在同时推进这么多事情的情况下,我感觉您写了很多。您的流程是什么?
马克: 写作对我很有帮助,既能帮我提炼自己的想法,也能对外传达。今年夏天,我写了一篇很长的文章,叫《未来属于所有人》,大约15页,帮我系统梳理了自己在AI相关各种重要社会议题上的哲学立场:我认为什么是好的,与政府的互动应该是怎样的,如何防范人们担忧的各种危害,如何让数据中心成为社区的财富,真正创造就业而非消灭就业,如何维护国家安全,如何切实缓解人们担心的风险——无论是黑客攻击还是生物安全之类的事情。
这是一件非常复杂的事,花了很长时间,和很多人交流,经历了很多轮修改,内部很多人参与讨论、辩论。但这对我来说是一个非常有价值的过程。最后我们就有了这样一个东西——15页,"这就是我们相信的"。然后我把它精炼成一页的版本,作为专栏文章发表。我们还制作了一个短视频,因为我觉得要触达很多人,你往往不需要抛出一套理论论证,而是把它浓缩成:你的价值观是什么,你相信什么,你怎么传达。
在向公司或世界传达这些方面,没有一刀切的方式。不同时期需要不同的方法,不同群体的人,有些天然就认同你在做的事,有些则更担忧,需要你把他们带着走,需要额外花力气解释为什么这是有价值的。我认为这本身就是经营一家公司、作为一个创始人的一部分——你不是一遍遍重复同样的事,每一次所处的情境都略有不同,面临新的挑战,这也是它部分有趣之所在。
是什么驱使马克去建造?
主持人: 我觉得对您来说,这种创始人心态延伸到了公司之外——无论是您的农场,还是学习一项新技能。
马克: 我就是喜欢造东西。
主持人: 那对您来说,"建造"是一种怎样的感受?
马克: 我觉得那是一种内在的需求。不同的人有不同的自我表达方式。如果你是一个作家,你会感觉自己必须写。有些人有被认可的需求。但我就是需要建造东西。如果我不在运用创造力、不在建造什么,我就会变得脾气不好。这对我周围的人来说可不好受。
主持人: 学习成为一个优秀滑雪者,和学习构建一个产品,是同一种技能吗?
马克: 某种程度上是的,学习新事物的过程相当类似。在我的人生里,我刻意挑战过一些自己很不擅长的事情。比如,我一直非常不擅长学习语言。这实际上就是我最开始学拉丁语的原因——我在课堂上怎么也学不会法语和西班牙语,最后我想,好吧,拉丁语不用说,只用翻译,就像数学一样。
后来,我在开始经营公司时,给自己设立年度挑战,其中一年是学普通话。普通话真的很难,声调那个部分尤其如此。当然,学它有充分的理由——普里西拉的外婆只说普通话,所以如果我想和她交流,就需要学。但最大的动力其实是挑战本身。
所有这些事情,你只能去做,没有什么捷径可以"想明白"。你只能投入时间,然后它就慢慢渗进大脑里。学武术、学开直升机,也是一样——这些事情其实很难用理智去"理解",它们需要实战积累。
构建产品也有一部分是这样的。编程可以用理论方式思考,但构建产品的那种直觉,只能通过反复实战来培养。问题只在于你喜欢什么——因为我认为不是所有人都有和我一样强烈的建造需求,大多数人都有某种程度的需求,关键是找到那是什么,然后把时间投入进去,成为你真正想要在那件事上做到卓越。
老实说,我觉得这不仅仅是"想要",更是一种深层的心理需求或驱动力。把这种驱动力和某件事对齐,给自己时间让那些经验慢慢渗透沉淀,这非常关键。这也是我试图教给孩子们的——让他们找到自己真正感兴趣的东西,但如果他们遇到瓶颈,也要推一把。
我的一个女儿非常喜欢创作音乐,但她就是受不了上钢琴课。我跟她说:"你不需要成为钢琴大师,但如果你想创作音乐,你就需要对乐理和运作方式有直觉上的掌握。而且一旦你学会了钢琴,吉他你马上就能上手。"我觉得,无论是作为孩子需要家长推一把,还是作为大人,有纪律坐下来让这些东西慢慢在大脑里沉淀,都是关键所在。
建造者的黄金时代
主持人: 我觉得其实每个人都想建造。我认为Z世代也不像外界批评的那样——低能动性什么的。我觉得人们只是在寻找能够点燃他们建造力的火花。您在哈佛演讲里也谈到了很多这一点。
马克: 是的。我说"建造",主要是指这类产品——软件、硬件之类的。但我同意,我认为每个人都有某种创造驱动力。不过有些人有其他更强的性格特质压过了这一点,比如服务驱动——那些成为医生或护士的人,他们最核心的驱动力就是"我就是想照顾别人"。
我听说过一个故事,可能是普里西拉在医学院经历的:开学第一天,有人站起来问,"你们有多少人在小时候有过这样的记忆——看到某人,心里想着'我真的很想照顾那个人'?"结果所有人都举手了。对我来说,我的版本就是:我有很多小时候的记忆,是"我想去做这个东西,让它变得更好"。
不是每个人都有同样的驱动力,但每个人都有自己想做的事。我同意,有了以前的技术,对很多人来说,起步本身就很难。这也是我对个人超级智能、Muse和各种AI助理最感兴奋的一点——我认为这是有史以来第一次,人们真的可以快速起步。你有一个模糊的想法,AI可以帮你勾勒出轮廓,然后你去雕琢它,就像在塑造一件雕塑,而不需要在开始之前什么都已经懂得。
我认为这非常有力量,很多人将会因此找到他们想要创造或推动的事情。这将帮助人们感受到更广泛的能动性。
我们离攻克所有疾病还有多远?
主持人: 您在Meta之外的另一个项目是攻克所有疾病。我很好奇,第一,我们距离目标有多近?
马克: 比以前近多了。
主持人: 您觉得现实地来看有多近?
马克: 我们最初启动这个项目时,目标是在本世纪末帮助科学界攻克所有疾病。我们从来不是要自己去做,我们的理论是:所有重大科学进步,都以一种能够测量和理解某些事物的新工具为先导。比如发明了显微镜,然后我们理解了细菌;有了望远镜,帮助我们理解了宇宙。
这些工具有些还成了平台——比如第一个发明疫苗的人,之后人们就能用这个方法治疗很多疾病。
但历史上,科学资助的方式一直是广泛分散,让各人做个体探索,真正用于构建这些大型工具的资金并不多。我们在Biohub试图做的,就是设计几种新工具,赋予人们以新的方式"看见"生物学,从而帮助科学界加速进展。
最初我们认为"到本世纪末"已经是很有把握的目标了,很多生物学家当时还觉得这不可能。但现在我觉得,本世纪末太久了。
AI的进展,加上我们正在做的虚拟细胞模型——其基本思路是,不用在真实的活体细胞上做实验,而是用AI模型来模拟蛋白质,进而模拟细胞,再往后模拟虚拟免疫系统,或者整个生命体,甚至整个人。这将让科学家能运行大量实验,模拟不同情况下会发生什么,比如给某人服用这种药物,身体会有哪些反应。
我不想给出一个精确的年数,但我猜会比本世纪末早得多。
主持人: "攻克所有疾病"这个目标措辞感觉很刻意,而不是"永生"。永生是一种可能吗?
马克: 这不太是我深耕的领域。我认为两者是两件不同的事。"永生"更多关于延长——即使你不会生病,人体本身也有一个自然的预期寿命,这是另一个需要单独研究的问题。有些人会认为这也是一种"疾病",这是一个合理的视角,但我认为,人们也需要同时努力攻克那些即使你把寿命问题解决了之后、仍然会让你生病的疾病。
我们选择的那部分问题,并不是说你永远不会感冒。我们的说法是"治愈、预防或管理":有些疾病可以被完全治愈;有些我认为我们将来能够预防;还有一些,也许你还是会生病,但本来会造成真正伤害甚至夺去生命的事情,你现在可以将它作为一种持续的慢性状况来管理,不会对你的生活质量造成实质影响。
目标是让人体保持在平衡状态——不是说我们永远不会接触到病原体,而是在某一天,我们能够治愈、预防和管理所有疾病。
马克脑子里出现最频繁的念头是什么?
主持人: AI在很多不同的突破中都像催化剂一样,包括个人智能这个方面。您现在最常思考的是什么?在这个过程中,您脑子里出现最多的想法是什么?
马克: 这可能每周都在变。
现在非常专注于Muse。每次发布一个东西、快速推进,然后和真实世界接触,了解人们的反馈,再弄清楚接下来要做什么——这个阶段总是令人兴奋的。我们现在就处于这个阶段,正在收集大量信息,了解人们想要什么。好消息是人们非常喜欢它,所以我们在努力让尽可能多的人用上它。
模型方面还有很多工作,Muse Spark模型进展很大,我们希望继续推进,希望打造世界领先的模型。
下一步需要哪些突破?
主持人: 还需要哪些突破?
马克: 研究这种事,你未必能提前预知。我们对某些方向有一些预感,过去一年的工作很大程度上其实是在扩展基础设施。
大约一年半前,更多人会说,要达到超级智能,需要某些根本性的架构突破。但我现在不太确定这是否成立。我认为我们已经对"配方"有了相当的了解——如果你能建造一台足够大的超级计算机集群,就可以通过暴力计算到达那里。
我们正在建造俄亥俄州那个超过1千兆瓦的集群,基本已经上线,我们正在用它训练下一代模型。然后是路易斯安那州的5千兆瓦集群,很快就会投入使用。我估计,当你拥有多千兆瓦量级的集群在做训练时,你基本上就能得到接近AGI,乃至AGI之上超级智能的东西。
但这不意味着这是最好的方式。人类大脑只需10瓦就能运行,而我们建造的这些计算系统,效率大概比人脑低一百万倍。所以我确实认为,在架构方面还有改进空间,我们也在努力探索——如果把巨大的算力和架构改进结合起来,你真的能建造出领先全球的东西。但就目前而言,规模扩展本身就能带我们走很远。
主持人: 确实,规模扩展是最有保障的路径。研究你得寄望于重大突破,但规模扩展很快就能起效。
马克: 正因如此,大公司都选这条路。也许存在一种便宜得多的方式,但我们目前还不知道。而这是一个对世界如此有价值的东西,即使要花数千亿美元,只要实现的概率足够高,就依然值得去做——确保即使最终没有找到更便宜的突破方式,你仍然有一条清晰的路径能实现它。当然,如果你找到了更便宜的方式,那就更好了。
所以我不想说这个问题"已经解决了",因为在扩展基础设施的每个阶段,你都会遇到各种新的工程难题需要调试解决。研究本身就是这种迭代的方式推进的。
如何赢得AI安全这场战役
主持人: 现在可能最重要的事情之一是专注于对齐(alignment),让模型变得可信赖。
马克: 是的。关于对齐,行业里有一场争论:这些AI实验室会自然而然地去做吗?我的观点是:当然会。如果你告诉Muse做一件事,它却做了完全相反的事情,我不知道有多少人还会想用它。我们必须确保模型不仅理解你具体问了什么,还理解你的意图和价值观,这样它才不会用一种你不满意的方式去做那件事,或者产生你根本不想要的负面影响。这种深层理解,本质上就是对齐。
所以我的看法是,要让Muse成功、触达数十亿人,我们就必须在对齐方面取得切实进展,而不只是说说而已。
主持人: 对齐是通过用户说"那不是我想要的"来实现,还是靠你们后台自己发现?
马克: 两者都有。用户反馈是有的,但我认为,越来越清晰的是:你需要在训练阶段就做对齐,而不只是部署之后。现在模型已经足够聪明,如果你在训练阶段不做好,我们在其他实验室看到的那些安全和安全事故,大多数都发生在训练过程中,而不是部署给用户使用之后。
你需要为它制定一套非常好的"课程",就像父母教孩子一样,需要设定明确的边界。如果它做了错误的事,它需要学到"不,你应该真正去解决这个编程问题,而不是通过修改某个系统配置来绕过它、获得奖励"——我想要你通过实际的解题过程来学会这个方法,这才是训练的意义所在。
这很大程度上是关于建立良好的安全机制和明确的边界。这些都是行业必须去做的自然工作,我们正在投入大量时间,每天情况都不一样。
主持人: 我还记得您说过,AI安全这个问题——感觉最近两周突然成为焦点,但其实没有什么单一事件触发了这个时机。听起来您的意思是,我们其实多花了几个月时间在内部做训练。
马克: 对于Muse,我们知道这个产品需要非常注重隐私和安全。我们有一个早期版本的模型,认为可以进一步训练一些关于"信息披露尺度"的行为——就像我们之前聊到的那些。所以我们花时间去做了。同时也花时间把虚拟机做得更安全。这多花了几个月。
我不太认同某些其他实验室的说法——"我们在承受巨大痛苦以换取放慢速度"。对我来说,那对Meta和Muse的用户来说都是正确的事。我们想把产品做好,如果产品不够好,对用户不好,对我们也不好——我们不想把东西推出去,给人留下糟糕的第一印象,然后大家就不再有兴趣用了。
我认为,所有实验室都会有非常强的内在动力把这件事做对。如果把激励机制和"极度有价值且安全"这个目标对齐,那就是关键所在。
主持人: 非常感谢您在这个重要的一周抽出时间。
马克: 谢谢您,谢谢。
精彩评论