AIGC宇宙 AIGC宇宙

腾讯版Sora开源后,被提速八倍!官方点赞并预告:下月上新图生视频

提速8倍! 速度更快、效果更好的混元视频模型——FastHunyuan来了! 新模型仅用1分钟就能生成5秒长的视频,比之前提速8倍,步骤也从50步减少到了6步,甚至画面细节也更逼真了。

提速8倍!

速度更快、效果更好的混元视频模型——FastHunyuan来了!

新模型仅用1分钟就能生成5秒长的视频,比之前提速8倍,步骤也从50步减少到了6步,甚至画面细节也更逼真了。

图片

和普通速度的混元对比一下,原来50步才能生成1条视频,而现在新模型在相同的时间里可以生成8条

腾讯版Sora开源后,被提速八倍!官方点赞并预告:下月上新图生视频

再来看看和Sora的画面对比,可以看到Fast-Hunyuan和Sora两者的效果都更逼真一些,衣服、水果和山峰的细节也非常清晰。

图片

图片

图片

图片

甚至在一些物理细节的理解上,Fast-Hunyuan比Sora还强,比如下面拿取柠檬的视频:

图片

更重要的是,Fast-Hunyuan的代码也开源了,这下不用为Sora的订阅费和限额发愁了。

研究团队来自加州大学圣地亚哥分校(UCSD)的Hao AI实验室,他们主要专注机器学习算法和分布式系统的研究。

图片图片

混元官方账号还特意发博感谢了他们:

图片

有网友看完后直呼,混元才是最好的开源视频模型。

图片

开创性的视频DiT蒸馏配方

团队是如何做到8倍提速的情况下还能提升视频清晰度呢?

下面就一起来看一下Fast-Hunyuan的技术原理——

首先,他们开发了全新的视频DiT蒸馏配方。

具体来说,他们的蒸馏配方基于阶段一致性(Phased Consistency Model, PCM)模型。

图片

在尝试使用多阶段蒸馏后发现效果没有显著改进,最终他们选择保持单阶段设置,与原始PCM模型的配置相似。

其次,团队使用了OpenSoraPlan中的MixKit数据集进行了蒸馏。

图片

为了避免在训练过程中运行文本编码器和VAE,团队还预处理了所有数据,用来生成文本嵌入和VAE潜在变量。

在推理阶段,用户可以通过FSDP、序列并行和选择性激活检查点进行可扩展训练,模型可以近乎线性扩展到64个GPU。测试代码在Python 3.10.0、CUDA 12.1和H100上运行。

官方推荐使用80GB内存的GPU,不同模型有相应的下载权重和推理命令。

最低硬件要求如下:

  • 40 GB GPU 内存,每个 GPU 配备 lora
  • 30 GB GPU 内存,每 2 个 GPU 配备 CPU 卸载和 LoRa。

在模型微调方面,Fast-Hunyuan提供了全微调(需准备符合格式的数据,提供了一些可下载的预处理数据及对应命令)和LoRA 微调(即将上线)两种方式。

此外,他们还结合了预计算潜变量和预计算文本嵌入,用户可以根据自己的硬件条件选择不同的微调方式来执行命令,也支持图像和视频的混合微调。

图片

模型已于2024年12月17日发布了v0.1版本。

未来的开发计划还包括添加更多蒸馏方法(如分布匹配蒸馏)、支持更多模型(如CogvideoX模型)以及代码更新(如fp8支持、更快的加载和保存模型支持)等等。

图片

One More Thing

除了加速模型,混元还预告了大家都非常期待的图像到视频生成功能。

最快1月份,也就是下个月就可以看到!期待住了。

图片

图片

GitHub:https://github.com/hao-ai-lab/FastVideo。HuggingFace:https://huggingface.co/FastVideo/FastHunyuan。

参考链接:[1]https://x.com/TXhunyuan/status/1869282002786292097。

相关资讯

DeepSeek-R1 登顶 Hugging Face:以10000 赞力压 150 万个模型

今日凌晨,全球最大开源平台之一 Hugging Face 的首席执行官 Clement Delangue 在社交平台发文宣布,DeepSeek-R1在 Hugging Face 上获得了超过10000个赞,成为该平台近150万个模型中最受欢迎的大模型。 这一里程碑式的成就标志着 DeepSeek-R1在全球 AI 社区中的广泛认可与影响力。 DeepSeek-R1的崛起速度令人瞩目。
2/24/2025 9:30:00 AM
AI在线

腾讯云上线DeepSeek全系API接口并打通联网搜索

腾讯云宣布完成对深度求索(DeepSeek)大模型的深度整合——正式上线DeepSeek-R1和V3原版模型的API接口,并创新性接入自研大模型知识引擎,同步开放联网搜索能力。 凭借腾讯云在推理并发和生成速率等方面的优化,用户可以获得更加稳定、安全、低门槛的使用体验。 开发者只需在云上简单三步即可实现API接口调用,并通过大模型知识引擎提供的文档解析、拆分、embedding、多轮改写等能力,灵活构建专属的AI服务。
2/8/2025 2:09:00 PM
AI在线

微信搜索接入DeepSeek大模型 称AI不会使用朋友圈聊天等信息

近日,微信宣布其搜索功能接入 DeepSeek-R1模型,目前处于灰度测试阶段。 部分用户在微信搜索框选择 AI 搜索时,可体验到 DeepSeek-R1提供的深度思考功能。 微信方面表示,引入大模型旨在提升搜索的智能化和精准度,更好地理解用户搜索意图,分析处理复杂查询。
2/19/2025 11:18:00 AM
AI在线
testab