加载中...
Stability AI于2023年11月开源的视频生成扩散模型,基于Stable Diffusion图像模型扩展而来,可从单张图片生成短视频,是开源视频生成领域的重要基础模型。

| 开发者 | Stability AI |
| 发布时间 | 2023年11月 |
| 输入类型 | 图片到视频(Image-to-Video) |
Stable Video Diffusion(SVD)的训练分三阶段:先在大量图像上训练(继承SD的能力),再在视频数据上做预训练,最后用高质量视频数据微调。SVD-XT版本支持生成25帧(约4秒)的视频,分辨率1024×576。
最典型的使用场景是图生视频(Image-to-Video):给定一张静态图片,SVD生成图片中的物体或场景的自然运动。效果在某些场景下(风景、简单物体运动)相当流畅,但对复杂人体动作和多物体交互仍有明显瑕疵。[1]
SVD的开源对视频生成生态的意义类似Stable Diffusion对图像生成的意义:提供了一个可以本地运行、可以微调的基础模型,让研究者和开发者不依赖商业API也能做视频生成实验。基于SVD,社区开发了多种微调版本(特定风格、特定动作类型)和ComfyUI工作流节点。
2024年,Stability AI经历了严重的财务危机(联合创始人Emad Mostaque离职,公司濒临破产被收购),但SVD模型本身仍是开源视频生成的重要参考基准。

| 开发者 | Stability AI |
| 发布时间 | 2023年11月 |
| 输入类型 | 图片到视频(Image-to-Video) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧