Open-Sora 1.1发布:视频生成质量和持续时间显著提升

AOuPMh.jpg

今天,我们很高兴地推出 Open-Sora-Plan v1.1.0,它显着提高了视频生成质量和持续时间以及文本控制功能。与之前的 Open-Sora-Plan v1.1.0 版本相比,改进了:

更好的压缩视觉表示:我们优化了 CausalVideoVAE 架构,该架构现在具有更强的性能和更高的推理效率。

生成质量更高、时长更长:我们使用了更高质量的视觉数据和标题以及ShareGPT4Video对长视频进行注释的能力,我们可以生成更高质量和更长的视频。

除了性能改进外,Open-Sora-Plan v1.1.0 还保持了 v1.0.0 的极简设计和数据效率。值得注意的是,我们发现 v1.1.0 表现出与 Sora 基础模型相似的性能,这表明我们版本的演变与 Sora 演示的缩放定律一致。

我们开源了 Open-Sora-Plan,以促进社区视频生成的未来发展。代码、数据、模型将公开提供。

演示:Hugging Face 演示在这里。

代码:所有训练脚本和示例脚本。

模型:此处为 Diffusion Model 和 CasualVideoVAE。

数据:此处为原始视频和字幕。

GitHub:https://github.com/PKU-YuanGroup/Open-Sora-Plan/tree/main

在线体验:https://huggingface.co/spaces/LanguageBind/Open-Sora-Plan-v1.1.0

Open-Sora-Plan v1.1.0基于 transformer 的文本到视频扩散系统,基于 T5 的文本嵌入进行训练。


收藏
最新工具
Awesome LangGraph
Awesome LangGraph

一份精心整理的 LangGraph 资源合集,涵盖了基础介绍、入...

VDSpeak
VDSpeak

一个专注于为YouTube视频提供多语言翻译和配音服务的在线工具...

PydanticAI
PydanticAI

一个Pydantic 团队开发的Python代理框架,可以通过生...

AutoGLM沉思
AutoGLM沉思

智谱推出的一款集深度研究与实际操作能力于一体的AI Agent产...

JustAI
JustAI

一款AI文案写作与营销工具,能生成多场景文案,包括小红书笔记、抖...

巧文书
巧文书

原通答AI,一款专为企业打造的AI智能写标书工具,通过AI大模型...

Ai2 Paper Finder
Ai2 Paper Finder

一款由艾伦AI研究所发布的基于LLM的文献搜索系统,Ai2 Pa...

Vivago AI
Vivago AI

北京智象未来科技有限公司面向全球市场推出的一款综合性在线 AI ...

Ghibli AI
Ghibli AI

一款专门用于生成吉卜力风格的AI图像生成器,能够根据用户的文本描...

快出题
快出题

金数据旗下的一款AI驱动的在线考试软件,能够快速生成题库并自动组...