30 秒快速回答

Next-State Prediction(NSP) 是一种新的 AI 训练范式:不再让模型”预测下一个词”,而是让它”预测世界在下一秒会变成什么样”。这是 AI 从语言理解迈向物理世界认知的关键一步,被智源研究院列为 2026 年十大 AI 技术趋势之首

一句话核心价值:NSP 让 AI 学会预测”如果推一下杯子,它会倒向哪里”——这种事光靠背语料库是学不会的。


1. 为什么需要 NSP?「预测下一个词」的局限

过去几年,大语言模型的核心训练方式只有一个:Next-Token Prediction——给模型一段文本,让它预测下一个 token。GPT 系列、Claude、DeepSeek 都是这么训练出来的。

这个方法极其成功,但它有一个根本性的局限:

维度 Next-Token Prediction 人类的认知方式
学习对象 文本序列 物理世界 + 文本
因果关系 靠统计相关性「猜」 靠物理规律「推理」
空间理解 通过文字间接推断 直接感知三维空间
时间连续 离散 token,无连续时间概念 连续时间流

举个例子:你给 GPT 看「杯子在桌子边缘,手指碰到杯子」,它能生成「杯子掉到地上摔碎了」。但这只是因为它读过大量类似文本——它并没有真正理解重力、摩擦力和碰撞物理

这就是 NSP 要解决的问题。


2. NSP 是什么?核心原理拆解

NSP 的全称是 Next-State Prediction(下一状态预测),核心思想很简单:

给模型一段视频或多模态序列,让模型预测画面在下一帧会变成什么样。

2.1 和 Next-Token Prediction 的本质区别

传统 NLP: 文本 token₁ → token₂ → token₃ → 预测 token₄
NSP 范式: 世界状态 S₁ → S₂ → S₃ → 预测 S₄(含图像、物理参数等)

NSP 的「状态」通常包括:

  • 视觉信息:图像帧 / 视频片段
  • 物理量:位置、速度、力、温度等
  • 控制信号:机器人关节角度、方向盘转角等
  • 文本描述:任务指令或场景说明

2.2 训练流程(简化版)

# NSP 训练伪代码
import torch
from world_model import WorldEncoder, StatePredictor

encoder = WorldEncoder()      # 将多模态输入编码为「世界状态」
predictor = StatePredictor()  # 预测下一时刻的状态

for batch in dataloader:
    # S_t: 当前时刻的世界状态(图片+物理量+控制信号)
    S_t = encoder(batch["current_frame"], batch["physics_params"])
    
    # 模型预测下一时刻状态
    S_pred = predictor(S_t)
    
    # 与真实下一时刻状态对比,计算损失
    loss = mse_loss(S_pred, batch["next_state"]) + perceptual_loss(S_pred, batch["next_frame"])
    loss.backward()

关键点:损失函数不仅比较像素值,还会比较物理一致性——比如预测的物体运动是否符合牛顿力学。


3. NSP 的代表性模型

3.1 智源悟界(BAAI Wujie)

智源研究院在 2026 年 1 月发布的悟界多模态世界模型,是目前 NSP 范式的标杆。它的核心特性:

特性 说明
输入模态 图像、视频、文本、控制信号
预测能力 未来多帧视频 + 物理状态变化
应用场景 自动驾驶仿真、机器人训练、天气预报
亮点 可以在没见过真实场景的情况下,仅凭物理规律推演未来状态

3.2 国际对比

项目 机构 NSP 方向
Sora / 视频生成 OpenAI 从文本到视频,隐式学习物理
Genie 2 Google DeepMind 从图像生成可交互 3D 世界
UniSim Google / MIT 统一真实世界模拟器
GAIA-2 微软 天气预报世界模型

与 Sora 的区别:Sora 的目标是「让视频看起来真实」,NSP 的目标是「让世界的演化符合物理规律」——一个是外观真实,一个是因果真实。


4. NSP 的实际应用场景

4.1 自动驾驶仿真

传统自动驾驶仿真需要手工建模(路面、车辆、行人),费时费力。NSP 世界模型可以直接从真实驾驶视频中学习交通规律,然后生成无限多样的虚拟驾驶场景用于训练。

4.2 机器人训练

在真实环境中训练机器人成本高、风险大。NSP 世界模型可以作为「低成本模拟器」——让机器人在虚拟世界中试错,习得的策略可以直接迁移到真实世界。

案例:某头部人形机器人公司使用世界模型进行「Sim-to-Real」训练,将真实训练时长从 6 个月压缩到 3 周。

4.3 科学研究

在材料科学中,NSP 可以预测分子在特定条件下的下一状态变化(如高温高压下的相变),大幅减少实验次数。


5. 动手体验:最小 NSP Demo

下面是一个极简的 NSP 概念验证代码(基于 PyTorch),用简单的物理模拟来直观感受「预测下一状态」:

import torch
import torch.nn as nn
import numpy as np

# 模拟一个简单的一维运动:小球在平面上运动
# 状态 S_t = [位置, 速度]
# 动力学:S_{t+1} = [位置 + 速度 * dt, 速度](匀速运动)

class SimpleWorldPredictor(nn.Module):
    def __init__(self):
        super().__init__()
        self.net = nn.Sequential(
            nn.Linear(2, 16),
            nn.ReLU(),
            nn.Linear(16, 16),
            nn.ReLU(),
            nn.Linear(16, 2)
        )
    
    def forward(self, state):
        return self.net(state)

# 生成训练数据
dt = 0.1
states = [torch.tensor([0.0, 1.0])]  # 初始位置0,速度1
for i in range(100):
    prev = states[-1]
    states.append(torch.tensor([
        prev[0] + prev[1] * dt,  # 新位置
        prev[1]                   # 速度不变
    ]))

# 训练 NSP 模型
model = SimpleWorldPredictor()
optimizer = torch.optim.Adam(model.parameters(), lr=0.01)

for epoch in range(200):
    total_loss = 0
    for i in range(len(states) - 1):
        pred = model(states[i])
        loss = ((pred - states[i+1]) ** 2).sum()
        optimizer.zero_grad()
        loss.backward()
        optimizer.step()
        total_loss += loss.item()
    
    if epoch % 40 == 0:
        print(f"Epoch {epoch}: loss = {total_loss:.4f}")

# 测试:预测 10 步后的状态
current = torch.tensor([0.0, 1.5])  # 新初始状态
print(f"\n初始状态: 位置={current[0]:.2f}, 速度={current[1]:.2f}")
for step in range(10):
    current = model(current).detach()
    print(f"预测步骤 {step+1}: 位置={current[0]:.2f}, 速度={current[1]:.2f}")

运行这段代码,你会看到模型从数据中学到了「位置 = 位置 + 速度 × 时间」这个物理规律——这就是 NSP 的核心理念:从观测中学习世界的动力学


总结

要点 说明
NSP 是什么 从「预测下一个词」升级为「预测世界下一状态」
为什么重要 AI 开始真正理解物理因果,而非统计关联
代表模型 智源悟界、Genie 2、UniSim 等
核心应用 自动驾驶仿真、机器人训练、科学计算
与大模型的关系 NSP 是对 LLM 的补充,而非替代——两者结合才是 AGI 路径

延伸阅读