Superfluid Lab这一个名字挺抽象,这是元戎启行打造的国内首个面向物理世界基础能力研究的 AI Lab,名字取自物理学里的“超流体”——一种摩擦力接近于零的物质状态。但它的技术方向其实很具体。
接近“分科教学”——识别车辆是一门课,预测轨迹是一门课,规划路线又是另一门课。工程师把这些能力分别训练出来,再拼成一套系统。
这种方式的问题就在于:每个模块都只负责自己那一亩三分地,缺乏对全局的理解。就像一个球队,前锋、中场、后卫各自练各自的,上了场才发现配合不起来。
基座模型的思路不一样。它先教机器理解世界——通过海量数据学习物体、空间、运动和因果关系,再把这些理解迁移到不同任务中。
这就是大模型和小模型的本质区别。小模型更像条件反射——见过的东西能处理,没见过的就抓瞎。大模型追求的是认知智能——理解规律,然后举一反三。
元戎在GTC上展示的VLA基座模型有约400亿参数规模。但参数规模只是表象,真正的差异在于架构的统一——驾驶决策、场景理解、行为评估全部放在同一套模型里,而不是多个模块拼接。
Superfluid Lab聚焦三个技术方向:VLA模型、世界模型、多模态理解。
VLA视觉-语言-动作模型把视觉感知、语言理解和动作执行揉在一起。以前的车只能“看”,VLA能让车既“看”又“理解”还能“行动”。
举个具体的例子:看到一块“前方施工”的牌子,传统系统只做文字识别,VLA能理解“施工”意味着什么——前面可能有障碍物、车道可能变窄、在大多数情况下要减速变道。理解语义,然后转化为行动。
传统无人驾驶的逻辑是“看见什么就应对什么”——看见一个人就刹车,看见一辆车就绕行。这是反应式的。
世界模型追求的是预测式的——理解物理世界的因果规律,提前预判接下来会发生什么。
一个塑料袋滚到路中央和一块石头滚到路中央,后果完全不同。塑料袋可以碾过去,石头得绕开。一个真正理解物理世界的模型,应该能区分这两种情况,而不是看见“有东西”就一律刹车。
元戎在模型预训练阶段采用了视频预测任务来让模型理解世界——视频的每一个像素都能作为监督信号,数据利用率达到100%。这在某种程度上预示着模型不只是“看”视频,而是在学习“视频里的世界接下来会怎么变”。
多模态则是把视觉、语言、传感器数据等各种信息融合起来,让模型对世界的理解更全面。
Superfluid Lab的定位文件里有一句话:不局限于单一应用场景,致力于打造支撑具身智能、机器人控制与真实环境交互的通用AI基座。
车只是一个载体,一个验证场景。真正想做的,是一个能理解物理世界、能在物理世界里行动的通用智能。将来机器人、无人机、机械臂都能用同一套底层能力。
这就是为什么元戎说自己的长期愿景是成为“物理世界的AI基础设施”——“就像通信、电力一样,成为支撑现实世界运行的基础能力”。
通信和电力没人会天天念叨,但离了它们什么都不转。元戎想做的就是这个——让AI理解并作用于物理世界的能力,变成像水电一样随时可调用的东西。
元戎已经有超过50万辆量产车在路上跑。研究人员的模型可以面对持续变化的真实交通环境,可以观察一个判断怎样变成车辆动作,也能够正常的看到算法在真实世界中犯下的错误。
对于研究物理AI的人来说,这是一套规模庞大的真实世界实验装置。其他AI实验室很难复制这个条件——他们没这么多车在真实世界里跑。
元戎的计划是:先让模型学会开车,完成之后再把模型从汽车迁移到更多机器和场景中。
能够应对开放道路的模型,才有资格进入更多物理场景。智驾因而成为物理智能的试金石——负责验证能力,却不再限定能力的边界。
Superfluid Lab因此不是传统意义上的智驾研发部门,也还不是一家独立的基础模型公司。它处在两者之间,借用商业化业务积累的资源,寻找超出业务边界的答案。
一个塑料袋和一块石头有什么不同?这样的一个问题看似简单,但让机器理解其中的物理差异,需要的是对世界本质的认知。
免责声明:本文系转载,版权属于原本的作者所有;刊载之目的为传播更多详细的信息,如内容不适请及时通知我们。
迎战高温旺季:TCL 空调联合京东创新场景营销,定制 AI 语音空调揭晓
4799元起!全新旗舰新品vivo X300 E正式开售,到迪信通购机尊享超多权益!
东芝全阵容存储亮相2026 ChinaJoy,以海量数据底座赋能“与AI同游”新体验
麦瑞克亮相2026服务消费季,全新《绝影之竞》AR健身游戏点燃全动热情
科技世界网创立于2009年,宗旨是科技创造财富,网络改变世界。多年来力争通过自主创新的技术实现为科技公司创造最大的价值。