字节开源Bernini:让AI视频编辑理解你的创意,先思考再生成

在当今的内容创作领域,视频生成一直是一个令人头疼的话题。很多创作者常常发现,AI模型并不能准确理解他们的意图,导致最终生成的画面与预期相去甚远。对此,字节跳动的商业化技术团队推出了一个全新的开源框架——Bernini,旨在通过先理解再生成的方式,解决这一难题。

Bernini的核心思路是让多模态大模型先进行语义理解与规划,然后将任务交给Diffusion模型来完成高质量的视觉渲染。这一框架支持多种视频生成和编辑任务,重点在于「可控」性。例如,在改变整体视觉风格时,Bernini不仅能够确保每一帧都美观,还能保持前后帧的一致性,让创作过程变得更为稳定。

具体来说,Bernini的工作流程可以看作是一个视频片场中的「导演+后期团队」。首先,名为MLLM-based planner的多模态大模型负责理解用户的文本指令,并综合源视频、参考图片等素材,制定出目标画面的语义规划。接下来,DiT-based renderer负责将这些规划转化为连续、高质量的视频画面。这样的分工确保了每一步都能精确执行,从而提升了生成视频的质量。

Bernini在可控编辑方面展现出了强大的能力。通过简单的一条指令,用户可以改变视频中的天气、季节、材质和风格。例如,在一段城市航拍视频中,用户可以将晴天的画面轻松转换为雨天或雪天,而这一切变化都能自然地融入原场景中。更进一步,Bernini还能够理解场景中的三维关系,调整画面的视角、焦点和动作,从而实现更复杂的编辑需求。

在实际应用中,Bernini的优势不仅体现在对已有视频的编辑上,还能通过参考图像和视频生成全新的创作。例如,用户只需提供一张产品图,就能生成相应的产品展示视频,保证细节高度一致。此外,Bernini支持多角度的参考图,确保在不同视角下生成的内容保持一致性。这样的能力为广告创意、电商展示等场景带来了极大的便利。

Bernini的创新还体现在其对场景连续性的理解上。通过将多张关键帧输入模型,Bernini能够生成连续的平移镜头,展现出更长线的世界模型能力。这一特性在虚拟漫游、游戏关卡生成等领域具有广泛的应用前景。

总的来说,Bernini的推出标志着AI视频生成技术的一次重要进步。它不仅让创作者在生成过程中减少了「玄学」的成分,更让视频创作变得更加可控、稳定。未来,Bernini将继续完善其功能,助力创作者在数字内容创作的道路上走得更远。