30秒快速回答: AI 视频生成就是给 AI 一段文字描述(如”一只猫在太空站里飘浮”),它自己”画”出一段几秒到几十秒的视频。主流工具包括 OpenAI Sora(物理效果逼真)、Runway Gen-3(专业创作)、可灵(国产免费)。目前生成一次约 5~60 秒,画质在 720p~1080p 之间。虽然细节偶尔会崩,但已经能用于短视频剪辑、广告 demo 和创意预览。


一、定义:AI 视频生成是什么?

AI 视频生成属于生成式 AI 的子赛道,输入是文字、图片或已有视频,输出是一段全新的动态视频。

核心流程:文本提示词 → AI 理解语义/物理规律 → 逐帧生成连贯画面 → 输出视频


二、原理:AI 怎么”想”出视频的?

1. Diffusion Transformer(DiT)

Sora 采用的核心架构——把扩散模型(Diffusion)和 Transformer 结合:

  • Diffusion 负责从噪声中逐步”还原”出画面
  • Transformer 负责理解文字描述并指导整个过程
  • 在时间轴上反复应用,生成连贯帧

2. 关键挑战

挑战 说明 现状
时间一致性 物体不能忽大忽小、颜色不能跳 已大幅改善
物理规律 水往低处流、人不能穿墙 Sora 领先
长序列 超过 10 秒容易崩 逐段生成+拼接
文字生成 视频中出现大段文字 仍不稳定

3. 图生视频 vs 文生视频

  • 文生视频(T2V):纯文字 → 视频,自由度最高但控制最难
  • 图生视频(I2V):给首帧图片 → 让 AI 动起来,效果更可控
  • 视频扩展:给一段视频 → 延长或补帧

三、实操:零基础生成第一段 AI 视频

步骤 1:选工具

  • 追求质量:Runway Gen-3、Sora(需白名单或付费)
  • 中文免费:可灵、即梦、PixVerse
  • 开源自建:CogVideoX、EasyAnimate

步骤 2:写提示词

好提示词公式:

[主体] + [动作] + [环境/背景] + [光影/氛围] + [镜头语言]

示例:"一位穿红裙的舞者(主体),在雨中缓缓旋转(动作),
老上海街巷背景(环境),霓虹灯倒映在湿润石板路上(光影),
从上往下俯拍,慢动作(镜头)"

步骤 3:生成 + 迭代

  • 首先生成可能不完美,微调提示词重试
  • 可先生成静态图(Midjourney/DALL·E),再把图片喂给视频工具
  • 多段素材拼接成完整短片

四、工具推荐表

工具 类型 时长 价格 亮点
Sora 文/图生视频 最长 60s 付费 物理效果最真
Runway Gen-3 文/图生视频 5~10s 付费/$12月起 专业创作
可灵 (Kling) 文/图生视频 5~10s 有免费额度 国产、效果好
PixVerse 文/图生视频 4~8s 有免费额度 上手快
Luma Dream Machine 文/图生视频 5s 有免费额度 电影感
CapCut(剪映) 剪辑+AI 免费 剪辑集成

五、FAQ 常见问题

Q1:AI 视频能商用吗? 取决于工具条款。多数允许商用,但需确认版权归属。建议用 Runway、可灵等有明确商用授权的平台。

Q2:生成的视频有声音吗? 目前大多数只生成画面,声音需后期添加(可结合 AI 音乐/音效工具)。

Q3:怎么让人物不崩? 脸崩是常见问题。可先生成高质量人物图 → 图生视频,或用 Runway 的 Lip Sync 修复口型。

Q4:AI 视频适合做什么? 短视频广告、创意预览、教学动画、社交媒体内容、产品 demo。暂时不适合长片叙事。

Q5:生成一次要多久? 5 秒视频约 30 秒到 3 分钟不等,取决于工具和排队情况。


延伸阅读:什么是 AI 音乐生成? 给你的视频配上 AI 创作的配乐。