尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

从堆数据到空间智能:李飞飞给AI开发者的数据效率启示

从堆数据到空间智能:李飞飞给AI开发者的数据效率启示 最近关于李飞飞的访谈里有一句话很值得做 AI 开发的同行停下来想一想人也不全靠现实数据学习。这句话如果只是放在学术讨论里听会显得像一句常识但放到当前大模型行业疯狂堆数据、堆算力的语境里它其实戳中了深度学习一个很少被正面讨论的软肋——我们可能把“学习的燃料”想得太单一了。过去十年AI 的主流叙事是“数据是新时代的石油”。模型要做得聪明就喂更多图片、更多文本、更多视频数据不够就上合成数据、爬虫、众包标注。这条路把大模型推到了今天的高度但它的代价也越来越明显高质量数据开始枯竭人工标注成本持续上涨模型在真实物理世界里的推理能力依然脆弱。一款视觉模型可以认识几百万张图片里的猫却很难回答“猫从桌子边缘跳下去落地前大概会划过一条什么样的轨迹”这种连一个三岁小孩都能凭直觉判断的问题。李飞飞在访谈里强调的正是人类学习里那些不完全来自外部现实数据的部分空间感、想象力、身体与世界的交互、在没有真实反馈时也能做出的心理模拟。这些能力在当前主流模型里几乎是缺失的。这篇文章不打算复述访谈的一字一句而是想把“人也不全靠现实数据学习”这个判断翻译成 AI 开发者可以理解的技术问题、工程路径和落地建议。读完之后你会知道这个观点为什么不是一句鸡汤它如何映射到空间智能、世界模型、数据效率这些具体方向以及你自己能在项目里先做什么验证。1. 这次访谈真正戳中了深度学习的痛点先从工程视角看一个普遍现象。今天我们训练一个有竞争力的视觉或多模态模型数据量通常以“亿”为单位。ImageNet 时代是 1.28 亿张标注图片到了大语言模型时代训练 token 直接进入“万亿”级别。数据规模上去了模型能力确实在涨但边际收益在快速下降。更麻烦的是互联网上的公开高质量数据不是无限的。很多团队已经意识到数据墙正在逼近想继续提升模型能力要么找到新的数据来源要么想办法把现有数据用得更高效。李飞飞的观点正好落在“更高效”这一侧。人类不是靠“见多识广”才学会思考的。一个婴儿看过几十只猫就能认出各种姿势、光线、遮挡下的猫一个孩子哪怕从来没有真的从高处摔下来过只要看过别人摔就能在脑子里模拟坠落的体感和轨迹。这些能力依赖的是超出“真实数据”之外的学习信号三维空间里物体恒存、遮挡之后物体仍然存在、运动有惯性、物体之间有物理约束。这些信号不需要外部每一个样本都标注得清清楚楚而是人脑自带的结构先验。如果只沿着“更多数据”这条路继续走模型始终会面临两个问题第一成本问题。高质量数据获取、清洗、标注、合规审查每一项都在消耗真金白银。很多中小企业连一个可用的业务数据集都凑不齐。第二泛化问题。依赖大量统计相关性的模型一旦遇到训练分布之外的场景表现很容易崩塌。自动驾驶里的 corner case、机器人操作里从未见过的物体摆放都是典型例子。所以“人也不全靠现实数据学习”这句话的真正价值在于它提醒我们数据驱动不等于数据唯一。AI 要走向通用必须在数据之外寻找新的学习信号。这正是空间智能、世界模型、具身智能这些方向最近备受关注的根本原因。2. 为什么“现实数据不够用”不是一句牢骚把上一节的问题展开你会发现“现实数据不够用”不是行业焦虑而是一个结构性的技术瓶颈。它体现在三个层面。2.1 数据质量与规模的边际矛盾模型参数从亿级涨到万亿级对数据量的需求也在急剧膨胀。但数据质量的提升速度远远跟不上参数规模的增长速度。互联网上的文本和图片大量是低质量、重复、错误标注的。工业界遇到的情况往往是数据管够但“有效信息密度”不够。模型学了很多学到的大部分是噪音。2.2 统计相关性不等于物理理解常规深度学习的本质是拟合数据的统计分布。模型看到一只猫的图片学到的是像素模式和标签之间的关联而不是“猫是一种有骨骼、会移动、被遮挡后仍然存在的三维生物”。在平面识别任务上这种统计相关性已经足够好用但一旦需要模型在真实空间里做判断、预测、规划问题就暴露了。一个典型的例子是当你给一个高性能视觉模型看一张“杯子在桌子边缘一半悬空”的图片它可以识别出杯子和桌子但无法判断杯子下一秒是否要掉下来。这不是因为它笨而是训练目标里根本没有“物理稳定性”这个维度。人类不需要大量摔杯子的样本就能建立这种直觉因为我们在三维空间里生活、运动身体本身就是数据的来源。2.3 长尾场景天然是稀疏的真实世界的场景分布是极端不均衡的。常见的交通场景、家庭场景、工厂场景数据相对丰富但真正带来危险的往往是极低频的长尾场景罕见天气、奇怪物体组合、非标准的交互方式。靠堆数据去覆盖长尾成本永远追不上场景的复杂度。李飞飞访谈里的观点本质上是在说如果模型具备空间推理和想象能力很多长尾场景是可以通过脑内推演覆盖的不必每一个都见过真实样本。这与基于模型的强化学习、世界模型的做法是一致的——先用一个内部模型预测未来再用预测结果指导决策从而减少真实试错。3. 李飞飞的判断为什么值得关注要理解这句话的分量得先理解李飞飞在 AI 领域的坐标。李飞飞是斯坦福大学计算机科学教授也是 ImageNet 的创建者。ImageNet 对深度学习的意义怎么强调都不为过——它在 2010 年代初为大规模视觉识别提供了基准数据和竞赛平台直接推动 AlexNet、VGG、ResNet 等一系列模型的诞生。可以说今天的深度学习浪潮里数据驱动路线的地基之一就是她参与打下的。但恰恰是这位“数据驱动”的标志性人物现在开始公开强调“人也不全靠现实数据学习”并且把公司 World Labs 的核心方向定为“空间智能”。这两件事放在一起看传递的信号非常明确数据驱动的黄金时代没有结束但下一代 AI 的竞争重心正在从“看见更多”转向“在空间和世界中理解更多”。这里的“空间智能”Spatial Intelligence并不是一个营销词汇。李飞飞在多个公开场合解释过空间智能是指理解和预测三维世界中物体之间几何关系、位置关系、遮挡关系、运动关系的能力。人类之所以能在复杂的物理世界里高效行动靠的就是这种能力。它比二维图像识别更接近“真正的理解”。从 ImageNet 到 World Labs李飞飞走的是一条连贯的技术路线先让机器学会“看见”再让机器学会“理解空间”。访谈里那句“人也不全靠现实数据学习”其实是她这套技术判断的另一种表达——人类学习的效率密码很大一部分藏在三维空间的结构和身体交互里而不是藏在无穷无尽的二维图片标注里。4. 空间智能从“看见”到“理解”的跃迁空间智能这个词听起来很抽象但把它放到具体的任务场景里就非常清晰了。现在的视觉 AI 大多在回答“这是什么”的问题这是一只猫这是一个杯子这是一个路口。而空间智能要回答的是“这些东西在空间里如何分布、如何相互影响、接下来会怎样”杯子在桌子的哪个位置、如果把杯子推一下它会往哪个方向倒、如果视角移动杯子被遮挡的部分应该是什么样。这正是人类学习省数据的核心原因之一。人在看到一个物体时并不会真的等到 360 度都看到才开始理解只需要看到一部分大脑会自动补全另一部分。这种“脑补”能力不是靠几亿张真实图片堆出来的而是来自长期在三维空间里与环境互动形成的先验。4.1 技术栈的演进路径空间智能在当前的技术世界里有几条清晰的落地方向3D 重建从多视角图片重建出物体或场景的三维结构技术代表包括 NeRF神经辐射场和 3D Gaussian Splatting。它们的共同目标是让模型不再停留在像素层面而是建立显式的空间表示。视频生成与世界模型通过大量视频学习物体运动的物理规律从而在没有真实下一步观测的情况下预测未来帧。这类模型开始具备初步的“想象力”。具身智能与机器人操作让模型在真实或仿真物理环境中执行抓取、移动、装配等任务利用动作反馈不断修正对空间关系的理解。这条路径和人类学习很像先感知再构造空间结构再预测动态再采取行动。4.2 从 2D 识别到 4D 世界如果说 2D 视觉是“看见”3D 重建是“理解结构”那么加上时间维度的 4D 世界理解就是“预测动态”。一个成熟的视觉系统应当能够回答三类问题是什么场景中有什么物体。在哪里物体的位置、朝向、尺寸、遮挡关系。会怎样给定一个动作或时间推移物体的状态会如何变化。当前大模型在第一个问题上表现优秀在第二个问题上正在快速进步在第三个问题上仍然非常薄弱。这和人类学习形成了鲜明的对照——人类恰恰是在第三个问题上极其擅长。一个没有受过任何物理训练的普通人也能相当准确地判断下落的物体会被风吹到哪、桌上的杯子被挤压后会不会碎。这种差异提醒我们如果 AI 要真正进入物理世界干活只优化识别准确率是不够的。模型必须拥有一个关于世界的内部模型能够在输入不完全的情况下做预测和推理。这也解释了为什么 World Labs 会把“空间智能”作为核心命题而不是继续做更大的图像分类模型。4.3 空间智能的商业场景空间智能不是实验室里的概念。它对应的商业场景非常具体机器人需要在未知环境里导航和抓取自动驾驶需要预测行人和车辆的轨迹AR/VR 需要让虚拟物体稳定地锚定在真实空间数字孪生需要根据真实场景生成可交互的三维副本。在这些场景里空间理解能力直接决定了产品能不能用、安不安全。对于开发者来说即使你目前不做机器人也不需要无视这个趋势。因为空间智能会逐步沉淀成通用的视觉基础能力最终以 API、模型权重、开源框架的形式进入普通应用的视觉链路。5. 不只是空间还有“想象”和“具身”李飞飞强调“人也不全靠现实数据学习”如果只理解成“空间智能很重要”可能还不够完整。人类学习的高效率其实来自一组互相配合的信号外部感知数据眼睛看到的、耳朵听到的。空间结构先验物体恒存、近大远小、遮挡关系、重力方向。心理模拟在不动手的情况下在大脑里预演动作和结果。具身反馈身体运动带来的触觉、平衡感、力量反馈。语言与社会指导别人告诉你的经验不需要自己重新试错。把这组信号拆开看就会发现问题所在当前主流模型几乎只用了第一类外部感知数据其他几类要么完全没有要么只是间接地从文本或图像里学到的影子。5.1 心理模拟怎么变成算法“心理模拟”听起来很玄但在 AI 里已经有明确的技术对应物世界模型World Model。世界模型的核心思路是构建一个关于环境的内部预测器。模型在采取动作之前先在内部模拟多步结果再选择最优路径。这就像人类在过马路前不需要真的跑到马路中间去试一试也能在脑子里想象出“如果我直接走可能被车撞”的场景。一个最小化的世界模型包含三部分状态编码器把观测变成紧凑的内部状态表示。动态预测器根据当前状态和动作预测下一状态。策略/规划模块在预测的状态空间里搜索有效动作。这套架构已经在强化学习里被广泛应用。它减少了真实环境的试错次数特别适合那些真实试错代价极高的场景比如机器人操作、自动驾驶、医疗决策。这和人类学习的方式高度一致先用想象力覆盖大量可能性再用真实数据校准。5.2 具身认知对 AI 的启示“具身”意味着智能不能只在无实体的数据里生长。身体的形态决定了智能体感知世界的方式。人类看到“杯子”不只是它的颜色和形状还包括“我一只手可以握住它”这种与身体绑定的信息。这种信息不是看图片能直接获得的需要身体与物体交互以后才能沉淀下来。这也是为什么机器人领域强调 Sim2Real仿真到现实迁移先在仿真环境里让智能体大量试错再把能力迁移到真实机器人上。仿真环境提供的本质上就是“海量的低成本心理模拟”。李飞飞强调人与现实数据的非线性关系和业界在仿真、合成数据上的投入其实是在收敛到同一个方向让模型在想象中预演而不是永远依赖真实世界的昂贵反馈。6. 从观点到实践三类可以落地的技术路径李飞飞访谈里的观点最终要变成工程收益才有意义。下面拆解三个与当前技术栈兼容的落地路径并给出最小可验证的代码示例。所有示例都只用常见 Python 库方便你直接在本机跑通。6.1 路径一用数据增强提升数据效率人类看物体不会因为遮挡就认不出来但标准图像分类模型很容易被遮挡打败。一个低成本改善方案是在训练时引入随机擦除Random Erasing之类的增强策略迫使模型学会从局部信息推测整体结构。这个思路与人类利用“物体恒存”先验的机制非常相似。下面是用 PyTorch 实现的一个最小示例给普通图片分类管线加上随机擦除# 文件路径examples/random_erasing_demo.py from torchvision import transforms from PIL import Image # 读取一张示例图片 image Image.open(example_cat.jpg).convert(RGB) # 训练时的增强管线 train_transform transforms.Compose([ transforms.Resize((224, 224)), transforms.RandomHorizontalFlip(p0.5), transforms.ColorJitter(brightness0.4, contrast0.4, saturation0.4, hue0.1), transforms.ToTensor(), # 随机擦除图像中的一块矩形区域模拟遮挡 transforms.RandomErasing(p0.8, scale(0.02, 0.2), ratio(0.3, 3.3), value0), ]) augmented_tensor train_transform(image) print(增强后的张量形状:, augmented_tensor.shape)这段代码的意图是在训练时随机遮掉图片的一块让模型不能只依赖某个局部强特征做判断。实际训练中这会增加模型对遮挡的鲁棒性也就相当于用更少的真实遮挡样本获得了更强的泛化能力。运行方式pip install torch torchvision pillow python examples/random_erasing_demo.py预期输出类似增强后的张量形状: torch.Size([3, 224, 224])如果换成一批图片继续训练建议把 RandomErasing 放在ToTensor()之后并且只在训练阶段开启推理阶段要关闭。否则推理图片被随机遮挡效果会打折扣。6.2 路径二显式建模空间关系二维图像模型默认把世界看成像素网格。人类理解世界时大脑里存在一个三维坐标系。想让模型具备空间智能一个直接的改进是在模型结构之外显式地处理空间坐标信息。下面示例展示一个极简的空间关系推理原型给定两个物体的三维坐标判断它们之间的相对位置关系。这个例子虽然简单却是一个可以扩展的方向——真实系统会用神经网络从图像里估计出坐标再在坐标层做关系推理。# 文件路径examples/spatial_relation.py class SceneObject: def __init__(self, name, x, y, z): self.name name self.x x self.y y self.z z def describe_relation(a: SceneObject, b: SceneObject) - str: 返回 a 相对于 b 的位置描述。 descriptions [] if a.x b.x - 0.1: descriptions.append(左侧) elif a.x b.x 0.1: descriptions.append(右侧) if a.y b.y 0.1: descriptions.append(上方) elif a.y b.y - 0.1: descriptions.append(下方) if a.z b.z 0.1: descriptions.append(前方) elif a.z b.z - 0.1: descriptions.append(后方) if not descriptions: descriptions.append(几乎相同位置) return f{a.name} 在 {b.name} 的 、.join(descriptions) if __name__ __main__: cup SceneObject(杯子, x0.5, y1.0, z0.2) table SceneObject(桌子, x0.0, y0.8, z0.0) print(describe_relation(cup, table))运行方式python examples/spatial_relation.py预期输出杯子 在 桌子 的 右侧、上方、前方这个示例说明的要点是空间关系不应该只隐式地藏在图像特征里而是值得被显式计算。在真实系统里坐标来自深度相机、SLAM 或 3D 检测模型关系推理可以做约束求解也可以交给图神经网络。6.3 路径三最小世界模型与想象预演人类最“省钱”的学习方式就是在脑子里预演。对应到算法就是一个能预测下一步状态的动态模型。下面用一个极简的二维运动模拟来展示世界模型的核心给定当前状态和动作预测下一时刻状态。# 文件路径examples/minimal_world_model.py import numpy as np class SimpleWorldModel: 一个极简的 2D 世界模型仅模拟匀速运动和重力。 def __init__(self, dt0.1): self.dt dt self.state None # [x, y, vx, vy] self.gravity -9.8 # 简化处理负值表示向下 def reset(self, x0.0, y10.0, vx1.0, vy0.0): self.state np.array([x, y, vx, vy], dtypefloat) return self.state.copy() def step(self, actionNone): 根据动作或默认策略推进一个时间步。 x, y, vx, vy self.state # 动作可以改变水平速度这里简化成直接控制水平加速度 if action is not None: vx action * self.dt vy self.gravity * self.dt x vx * self.dt y max(y vy * self.dt, 0.0) # 不允许穿透地面 if y 0.0 and vy 0: vy 0.0 self.state np.array([x, y, vx, vy], dtypefloat) return self.state.copy() def imagine(self, steps10, action1.0): 在不动真实环境的情况下预演未来若干步状态。 history [] model SimpleWorldModel(dtself.dt) model.state self.state.copy() for _ in range(steps): history.append(model.step(action).copy()) return np.array(history) if __name__ __main__: model SimpleWorldModel(dt0.1) model.reset() predicted model.imagine(steps20, action0.5) print(未来 20 步内 y 坐标的变化) print(predicted[:, 1])运行python examples/minimal_world_model.py预期输出是一组逐步下降的 y 坐标比如从 10 左右一路变化到接近 0体现重力作用下的轨迹预测。这个极简模型的价值在于演示“预测”并不需要一个庞大的神经网络。真实世界模型会用神经网络学习视频帧之间的转移规律但核心思想是一样的先用内部模型生成多条可能轨迹再评估哪条轨迹最优。这就是用想象替代部分真实试错。7. 落地难点与常见误区空间智能、世界模型这些方向看起来很美实际落地时问题不少。整理几个最常遇到的误区和坑。问题现象可能原因排查方式解决方案世界模型预测不准确观测信息不足模型没学到正确的状态表示检查状态编码器输出是否保留关键空间信息引入深度图、点云等显式空间输入3D 重建模型跑得慢渲染策略开销大定位耗时在渲染还是优化阶段改用 3D Gaussian Splatting 或降低分辨率加了空间分支后指标反而下降空间信息与 2D 特征存在冲突分开评估 2D 任务和空间任务做多任务训练给空间分支单独加权把空间智能等同于 3D 重建概念理解偏差观察任务是否包含预测和推理在重建之外增加动态预测评估合成数据训练后真实环境失效仿真与真实分布差异大对比仿真与真实数据的特征分布引入域随机化、逐步加入真实微调模型在未见过的布局上泛化差训练数据里空间布局单一统计训练数据中物体位置分布增加空间增强、场景随机化一个特别常见的误区是“李飞飞说人不是全靠现实数据学习所以我们不用再花精力整理真实数据了直接做合成数据、做仿真就行。”这个理解是错的。人类不全靠现实数据但依然需要现实数据做校准。婴儿的大脑中虽然有很多先验结构但如果没有真实世界的视觉和运动刺激这些先验也无法发育成完整的智能。更稳妥的做法是把真实数据和合成数据、空间结构、世界模型组合起来而不是放弃任何一方。另一个误区是把空间智能理解成一个模型架构问题认为换一个 3D 网络就能解决。实际上空间智能从数据采集、空间标注、模型结构、训练策略到评估体系涉及一整条链路。很多项目在数据层面就没准备好没有深度信息、没有相机内外参、没有多视角数据这种情况下换再先进的模型也难以奏效。8. 给 AI 开发者和架构师的工程建议如果“人也不全靠现实数据学习”这个观点让你认同接下来的问题自然就是我的项目该怎么调整这里有五条可以在实际工作中直接使用的建议。8.1 把数据策略分层而不是只做加法不要把所有希望押在“收集更多真实数据”上。更合理的数据策略是分层设计第一层真实标注数据用于定义任务边界和验收标准。第二层自监督数据用大规模无标注数据学习通用表示。第三层合成数据与仿真数据用来覆盖真实数据不足的长尾场景。第四层用户反馈与线上数据用于持续迭代。每层解决不同问题组合起来才能降低对“更多现实数据”的依赖。8.2 在既有 2D 视觉链路上增加空间分支如果团队已经有成熟的 2D 视觉系统不建议推翻重来。可以在现有特征提取器之上增加一个空间分支输入深度图、点云或视角参数输出空间关系、几何结构或动态预测。这样既复用了已有能力又为模型补上了空间理解维度。8.3 把世界模型当成一个工程模块来迭代世界模型不是只能整块上线。你可以先离线训练一个视频预测或状态预测模块作为仿真器的替代品等它足够准再接入规划或强化学习流程。每一步都用明确的指标验收比如预测误差、轨迹重合度、决策成功率避免把世界模型做成一个不可解释的黑盒。8.4 建立空间任务的评估基准没有评估就没有进步。建议在项目里单独定义一组合格的空间任务指标至少包括空间关系判断准确率。遮挡场景下的物体识别稳定性。未来状态预测误差。规划任务的成功率。这些指标可以和数据增强、模型架构、训练策略的变化形成对照方便持续改进。8.5 关注安全与合规边界空间智能涉及三维场景重建、人物识别、位置估计这些能力一旦用于真实场景可能带来隐私风险。在高精度空间建模类项目里必须遵守数据合规要求对敏感目标进行模糊处理并对模型输出做权限控制。任何涉及生产环境的变更都要先在测试环境里验证做好备份和回滚方案遵循最小权限原则。9. 总结下一阶段 AI 竞争的判断支点李飞飞在访谈里说“人也不全靠现实数据学习”这句话最好的理解方式不是否定数据驱动而是把“学习信号”这个概念拓宽了。外部现实数据仍然是 AI 的重要燃料但不是唯一燃料。空间结构、心理模拟、具身反馈、语言指导都能成为学习信号。谁能把这些信号更高效地组织起来谁就可能在下一阶段竞争中占据优势。对普通开发者来说这个判断不是遥远的前沿叙事而是可以立刻开始做的三件事第一重新审视自己项目里的数据依赖。哪些地方可以用数据增强、自监督、仿真来降低成本。第二关注空间智能和世界模型的技术进展。NeRF、3D Gaussian Splatting、视频生成模型、基于模型的强化学习这些方向的工具链正在快速成熟。第三在业务场景里找一个最小空间推理问题从今天给出的三个示例出发做出一个小原型跑通一个评估指标。如果你今年的技术规划里还只有模型参数和训练数据两个变量建议再加上第三个数据信号的多样性。这可能是未来一年里性价比最高的技术投资方向。
返回列表