30秒快速回答: AI 视频生成就是给 AI 一段文字描述(如”一只猫在太空站里飘浮”),它自己”画”出一段几秒到几十秒的视频。主流工具包括 OpenAI Sora(物理效果逼真)、Runway Gen-3(专业创作)、可灵(国产免费)。目前生成一次约 5~60 秒,画质在 720p~1080p 之间。虽然细节偶尔会崩,但已经能用于短视频剪辑、广告 demo 和创意预览。
一、定义:AI 视频生成是什么?
AI 视频生成属于生成式 AI 的子赛道,输入是文字、图片或已有视频,输出是一段全新的动态视频。
核心流程:文本提示词 → AI 理解语义/物理规律 → 逐帧生成连贯画面 → 输出视频
二、原理:AI 怎么”想”出视频的?
1. Diffusion Transformer(DiT)
Sora 采用的核心架构——把扩散模型(Diffusion)和 Transformer 结合:
- Diffusion 负责从噪声中逐步”还原”出画面
- Transformer 负责理解文字描述并指导整个过程
- 在时间轴上反复应用,生成连贯帧
2. 关键挑战
| 挑战 | 说明 | 现状 |
|---|---|---|
| 时间一致性 | 物体不能忽大忽小、颜色不能跳 | 已大幅改善 |
| 物理规律 | 水往低处流、人不能穿墙 | Sora 领先 |
| 长序列 | 超过 10 秒容易崩 | 逐段生成+拼接 |
| 文字生成 | 视频中出现大段文字 | 仍不稳定 |
3. 图生视频 vs 文生视频
- 文生视频(T2V):纯文字 → 视频,自由度最高但控制最难
- 图生视频(I2V):给首帧图片 → 让 AI 动起来,效果更可控
- 视频扩展:给一段视频 → 延长或补帧
三、实操:零基础生成第一段 AI 视频
步骤 1:选工具
- 追求质量:Runway Gen-3、Sora(需白名单或付费)
- 中文免费:可灵、即梦、PixVerse
- 开源自建:CogVideoX、EasyAnimate
步骤 2:写提示词
好提示词公式:
[主体] + [动作] + [环境/背景] + [光影/氛围] + [镜头语言]
示例:"一位穿红裙的舞者(主体),在雨中缓缓旋转(动作),
老上海街巷背景(环境),霓虹灯倒映在湿润石板路上(光影),
从上往下俯拍,慢动作(镜头)"
步骤 3:生成 + 迭代
- 首先生成可能不完美,微调提示词重试
- 可先生成静态图(Midjourney/DALL·E),再把图片喂给视频工具
- 多段素材拼接成完整短片
四、工具推荐表
| 工具 | 类型 | 时长 | 价格 | 亮点 |
|---|---|---|---|---|
| Sora | 文/图生视频 | 最长 60s | 付费 | 物理效果最真 |
| Runway Gen-3 | 文/图生视频 | 5~10s | 付费/$12月起 | 专业创作 |
| 可灵 (Kling) | 文/图生视频 | 5~10s | 有免费额度 | 国产、效果好 |
| PixVerse | 文/图生视频 | 4~8s | 有免费额度 | 上手快 |
| Luma Dream Machine | 文/图生视频 | 5s | 有免费额度 | 电影感 |
| CapCut(剪映) | 剪辑+AI | — | 免费 | 剪辑集成 |
五、FAQ 常见问题
Q1:AI 视频能商用吗? 取决于工具条款。多数允许商用,但需确认版权归属。建议用 Runway、可灵等有明确商用授权的平台。
Q2:生成的视频有声音吗? 目前大多数只生成画面,声音需后期添加(可结合 AI 音乐/音效工具)。
Q3:怎么让人物不崩? 脸崩是常见问题。可先生成高质量人物图 → 图生视频,或用 Runway 的 Lip Sync 修复口型。
Q4:AI 视频适合做什么? 短视频广告、创意预览、教学动画、社交媒体内容、产品 demo。暂时不适合长片叙事。
Q5:生成一次要多久? 5 秒视频约 30 秒到 3 分钟不等,取决于工具和排队情况。
延伸阅读:什么是 AI 音乐生成? 给你的视频配上 AI 创作的配乐。