30 秒快速回答
Next-State Prediction(NSP) 是一种新的 AI 训练范式:不再让模型”预测下一个词”,而是让它”预测世界在下一秒会变成什么样”。这是 AI 从语言理解迈向物理世界认知的关键一步,被智源研究院列为 2026 年十大 AI 技术趋势之首。
一句话核心价值:NSP 让 AI 学会预测”如果推一下杯子,它会倒向哪里”——这种事光靠背语料库是学不会的。
1. 为什么需要 NSP?「预测下一个词」的局限
过去几年,大语言模型的核心训练方式只有一个:Next-Token Prediction——给模型一段文本,让它预测下一个 token。GPT 系列、Claude、DeepSeek 都是这么训练出来的。
这个方法极其成功,但它有一个根本性的局限:
| 维度 | Next-Token Prediction | 人类的认知方式 |
|---|---|---|
| 学习对象 | 文本序列 | 物理世界 + 文本 |
| 因果关系 | 靠统计相关性「猜」 | 靠物理规律「推理」 |
| 空间理解 | 通过文字间接推断 | 直接感知三维空间 |
| 时间连续 | 离散 token,无连续时间概念 | 连续时间流 |
举个例子:你给 GPT 看「杯子在桌子边缘,手指碰到杯子」,它能生成「杯子掉到地上摔碎了」。但这只是因为它读过大量类似文本——它并没有真正理解重力、摩擦力和碰撞物理。
这就是 NSP 要解决的问题。
2. NSP 是什么?核心原理拆解
NSP 的全称是 Next-State Prediction(下一状态预测),核心思想很简单:
给模型一段视频或多模态序列,让模型预测画面在下一帧会变成什么样。
2.1 和 Next-Token Prediction 的本质区别
传统 NLP: 文本 token₁ → token₂ → token₃ → 预测 token₄
NSP 范式: 世界状态 S₁ → S₂ → S₃ → 预测 S₄(含图像、物理参数等)
NSP 的「状态」通常包括:
- 视觉信息:图像帧 / 视频片段
- 物理量:位置、速度、力、温度等
- 控制信号:机器人关节角度、方向盘转角等
- 文本描述:任务指令或场景说明
2.2 训练流程(简化版)
# NSP 训练伪代码
import torch
from world_model import WorldEncoder, StatePredictor
encoder = WorldEncoder() # 将多模态输入编码为「世界状态」
predictor = StatePredictor() # 预测下一时刻的状态
for batch in dataloader:
# S_t: 当前时刻的世界状态(图片+物理量+控制信号)
S_t = encoder(batch["current_frame"], batch["physics_params"])
# 模型预测下一时刻状态
S_pred = predictor(S_t)
# 与真实下一时刻状态对比,计算损失
loss = mse_loss(S_pred, batch["next_state"]) + perceptual_loss(S_pred, batch["next_frame"])
loss.backward()
关键点:损失函数不仅比较像素值,还会比较物理一致性——比如预测的物体运动是否符合牛顿力学。
3. NSP 的代表性模型
3.1 智源悟界(BAAI Wujie)
智源研究院在 2026 年 1 月发布的悟界多模态世界模型,是目前 NSP 范式的标杆。它的核心特性:
| 特性 | 说明 |
|---|---|
| 输入模态 | 图像、视频、文本、控制信号 |
| 预测能力 | 未来多帧视频 + 物理状态变化 |
| 应用场景 | 自动驾驶仿真、机器人训练、天气预报 |
| 亮点 | 可以在没见过真实场景的情况下,仅凭物理规律推演未来状态 |
3.2 国际对比
| 项目 | 机构 | NSP 方向 |
|---|---|---|
| Sora / 视频生成 | OpenAI | 从文本到视频,隐式学习物理 |
| Genie 2 | Google DeepMind | 从图像生成可交互 3D 世界 |
| UniSim | Google / MIT | 统一真实世界模拟器 |
| GAIA-2 | 微软 | 天气预报世界模型 |
与 Sora 的区别:Sora 的目标是「让视频看起来真实」,NSP 的目标是「让世界的演化符合物理规律」——一个是外观真实,一个是因果真实。
4. NSP 的实际应用场景
4.1 自动驾驶仿真
传统自动驾驶仿真需要手工建模(路面、车辆、行人),费时费力。NSP 世界模型可以直接从真实驾驶视频中学习交通规律,然后生成无限多样的虚拟驾驶场景用于训练。
4.2 机器人训练
在真实环境中训练机器人成本高、风险大。NSP 世界模型可以作为「低成本模拟器」——让机器人在虚拟世界中试错,习得的策略可以直接迁移到真实世界。
案例:某头部人形机器人公司使用世界模型进行「Sim-to-Real」训练,将真实训练时长从 6 个月压缩到 3 周。
4.3 科学研究
在材料科学中,NSP 可以预测分子在特定条件下的下一状态变化(如高温高压下的相变),大幅减少实验次数。
5. 动手体验:最小 NSP Demo
下面是一个极简的 NSP 概念验证代码(基于 PyTorch),用简单的物理模拟来直观感受「预测下一状态」:
import torch
import torch.nn as nn
import numpy as np
# 模拟一个简单的一维运动:小球在平面上运动
# 状态 S_t = [位置, 速度]
# 动力学:S_{t+1} = [位置 + 速度 * dt, 速度](匀速运动)
class SimpleWorldPredictor(nn.Module):
def __init__(self):
super().__init__()
self.net = nn.Sequential(
nn.Linear(2, 16),
nn.ReLU(),
nn.Linear(16, 16),
nn.ReLU(),
nn.Linear(16, 2)
)
def forward(self, state):
return self.net(state)
# 生成训练数据
dt = 0.1
states = [torch.tensor([0.0, 1.0])] # 初始位置0,速度1
for i in range(100):
prev = states[-1]
states.append(torch.tensor([
prev[0] + prev[1] * dt, # 新位置
prev[1] # 速度不变
]))
# 训练 NSP 模型
model = SimpleWorldPredictor()
optimizer = torch.optim.Adam(model.parameters(), lr=0.01)
for epoch in range(200):
total_loss = 0
for i in range(len(states) - 1):
pred = model(states[i])
loss = ((pred - states[i+1]) ** 2).sum()
optimizer.zero_grad()
loss.backward()
optimizer.step()
total_loss += loss.item()
if epoch % 40 == 0:
print(f"Epoch {epoch}: loss = {total_loss:.4f}")
# 测试:预测 10 步后的状态
current = torch.tensor([0.0, 1.5]) # 新初始状态
print(f"\n初始状态: 位置={current[0]:.2f}, 速度={current[1]:.2f}")
for step in range(10):
current = model(current).detach()
print(f"预测步骤 {step+1}: 位置={current[0]:.2f}, 速度={current[1]:.2f}")
运行这段代码,你会看到模型从数据中学到了「位置 = 位置 + 速度 × 时间」这个物理规律——这就是 NSP 的核心理念:从观测中学习世界的动力学。
总结
| 要点 | 说明 |
|---|---|
| NSP 是什么 | 从「预测下一个词」升级为「预测世界下一状态」 |
| 为什么重要 | AI 开始真正理解物理因果,而非统计关联 |
| 代表模型 | 智源悟界、Genie 2、UniSim 等 |
| 核心应用 | 自动驾驶仿真、机器人训练、科学计算 |
| 与大模型的关系 | NSP 是对 LLM 的补充,而非替代——两者结合才是 AGI 路径 |
延伸阅读:
- 智源研究院《2026 十大 AI 技术趋势》报告全文
- 论文:Learning World Models via Next-State Prediction (2025)
- diosblog 相关教程:什么是世界模型? / 什么是多模态 AI?