找回密码
 注册
搜索
查看: 30|回复: 0

[转贴] AI的下一个“ChatGPT时刻”会在哪里爆发?

[复制链接]
发表于 2026-8-13 08:50 AM | 显示全部楼层 |阅读模式


AI的下一个“ChatGPT时刻”会在哪里爆发?

Screenshot 2026-08-13 at 8.50.09 AM.png

躲猫猫不只是孩童的游戏,也是他们最早建立“物体恒存”认知的方式之一。当你捂住脸再突然露出,一句“躲猫猫!”换来孩子咯咯的笑声,也会帮助孩子实现认知成长。


1.jpg
当前的人工智能系统难以预测后续发展。研究人员希望改变这一现状。图片来源:Illustration by Max-O-Matic for Fortune


这种能力的形成并非依靠记忆。相反,婴儿通过观察,开始在大脑中构建关于世界运行规律的简单内部模型。大约在一岁时,他们就能够明白,滚到沙发后的球并没有消失,即使脱离视线,它仍然存在。


当今的人工智能系统尽管在对话和模式匹配方面表现出色,却无法可靠地掌握这一基本认知。它们可以描述眼前的事物,却难以理解隐藏的概念,也无法预判一连串行为后续会发生什么。


该领域的众多顶尖研究者认为,“世界模型”是破解这一难题的关键所在。这类人工智能系统的设计目标不再局限于识别文本或图像中的模式,而是模拟物理世界的运行规律。通过数百万小时的视频训练,这些模型能够构建出关于世界运作机制(包括物理规律在内)的精确内部图景——这是众多技术的核心能力,无论是帮助自动驾驶汽车预判儿童突然冲到马路上的后果,协助家用机器人学习如何折叠衣服,还是在医生下刀前模拟手术过程。


明星力量



为满足“物理人工智能”应用场景的系统构建需求,世界模型已经从冷门科研方向,一跃成为人工智能领域的研发重心。谷歌近期发布了名为“Project Genie”的研究预览,该系统可以根据简单提示词生成逼真的交互式虚拟环境,还能预测这些世界的演变过程,并响应用户的操作。


与此同时,“人工智能教母”李飞飞和“人工智能教父”杨立昆各自为专攻世界模型研发的新创企业筹集约10亿美元的资金。斯坦福大学教授李飞飞于2024年创立World Labs,致力于赋予人工智能更丰富的三维空间感知能力,使其可以精准地理解物体的存在方式与交互逻辑。Meta的前首席人工智能科学家杨立昆则在今年3月创立AMI Labs,旨在突破大语言模型的局限。


杨立昆在近期的一次演讲中表示:“现有的系统能够操控语言,让大众误以为它们很聪明,但实际上,这些系统在面对物理世界时束手无策。”


这一发展势头反映了研究人员对智能的认知不断革新。当今的许多世界模型研究都可以追溯到戴维·哈和于尔根·施米德胡贝在2018年发表的论文。数十年来,人工智能系统主要通过响应数据或蛮力试错来学习。该论文提出了全新方法:人工智能要做出智能决策,首先需要通过模拟环境来学习世界的运行规律。


戴维·哈后来与他人联合创立了日本人工智能研发公司Sakana,他对《财富》杂志表示,这些系统可以让人工智能在其模拟的现实场景中(他描述为“幻觉梦境”)开展训练,智能体可以在现实世界中采取行动之前,在上述场景中进行练习和提前规划。


在英伟达旗下Cosmos Lab担任副总裁的刘洺堉给出了更形象的说法,他类比了电影《黑客帝国》的设定——主角在虚拟世界中学习功夫。


刘洺堉将世界模型比作“生成式训练基地”,他说:“这里有反馈和指导,让人工智能可以不断提升自身技能。”

第四维度



除了李飞飞和杨立昆这些最受关注的项目外,多家新创企业正沿不同技术路线研发世界模型。


以Niantic Spatial为例,这是一家从《精灵宝可梦GO》背后的增强现实和地图技术分拆出来的新创企业。这家总部位于旧金山的公司利用超过300亿张实景照片和三维扫描数据,打造其所谓的大型地理空间模型,能够以三维形式解读现实世界环境,数据主要来自《精灵宝可梦GO》玩家多年的活动记录以及其Scaniverse应用程序。


总部位于以色列特拉维夫的Decart则致力于将世界模型推向实时应用,其打造的系统不仅能够模拟环境,还可以随着用户与环境的交互而持续生成和更新环境。通过自研优化系统,它能够以足够快的速度生成视频,逐帧匹配用户的操作。


“这才是关键突破。”Decart的研究科学家及创始成员之一克菲尔·阿贝尔曼指出,挑战不在于单纯生成视频,而在于以足够快的速度生成视频以实现即时响应。这一技术已经应用于虚拟试穿(使衣物贴合身形并自然摆动),以及主播实时切换直播背景等场景。


在某些世界模型中,时间元素是不可或缺的,构成了第四维度。例如,由自动驾驶领域先驱奥利弗·卡梅伦和杰夫·霍克创立的Odyssey公司,专注于构建能够预测世界随着时间的推移而演变的世界模型——直接从视频中学习物理规律、人类行为以及因果关系。该公司总部位于美国加利福尼亚州帕洛阿尔托。


“我们曾经觉得这个想法简直不可思议——你能够预测未来。”卡梅伦说道,“如果我们可以让这一能力应用于机器人、游戏、教育、医疗保健和国防等通用领域,会带来怎样的变革?”

“ChatGPT时刻”



尽管前景可期,但构建世界模型依然面临巨大的技术和经济障碍。训练可以模拟真实世界的系统所需要的算力远超如今的语言模型,因为它们不仅需要处理文本,还需要处理高分辨率的视频。


比如,卡梅伦曾经表示,通过应用程序接口访问其Odyssey 2模型的每位用户,都需要占用一块英伟达的高性能H200人工智能芯片。而单块H200芯片的售价最高可达4万美元。


数据是另一项制约因素。大语言模型能够依托从互联网海量文本中爬取的数据来完成训练,而世界模型高度依赖视频素材,视频数据采集、标注与规模化训练的难度远超文本。


但这些挑战并未浇灭世界模型研发者的热情。随着研究人员不断推进可以理解并与物理世界交互的系统,业界普遍认为突破性进展可能近在咫尺。


“当前的物理人工智能领域正在迎来前所未有的热潮和投资。”英伟达的刘洺堉表示,并补充道,该领域的“ChatGPT时刻”即将到来。他个人的终极目标是:让机器人仅通过几个示例——甚至从未见过的示例——就可以学会新技能,并能够持续运用。


“我相信,人们正在逐步摸索出正确的技术路线。”刘洺堉说。(财富中文网)






·技术范式革新:从语言模型走向物理世界模拟:AI正从文本处理演进至能理解物理规律、预测环境变化的“世界模型”,世界模型能力边界的拓展,有望重塑自动驾驶、具身机器人及医疗等实体产业的底层竞争格局。


·顶级资本与学术领军人物齐聚新赛道:以李飞飞和杨立昆为代表的AI领军人物分别下场创立公司,英伟达等算力巨头亦全力布局,预示着全球AI产业的下一波爆发点将聚焦于空间感知与物理交互能力。


·算力与数据壁垒揭示真实商业门槛:世界模型对视频数据与实时算力的要求远超大语言模型,这表明物理AI爆发的前夕仍面临高昂的硬件与计算成本考验。


财富中文网对原文有删减和调整


编辑:魏雨彤

您需要登录后才可以回帖 登录 | 注册

本版积分规则

手机版|小黑屋|www.hutong9.net

GMT-5, 2026-8-13 12:40 PM , Processed in 0.045205 second(s), 18 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表