字节开源Bernini:让AI视频编辑理解你的创意,先思考再生成
在当今的内容创作领域,视频生成一直是一个令人头疼的话题。很多创作者常常发现,AI模型并不能准确理解他们的意图,导致最终生成的画面与预期相去甚远。对此,字节跳动的商业化技术团队推出了一个全新的开源框架——Bernini,旨在通过先理解再生成的方式,解决这一难题。
Bernini的核心思路是让多模态大模型先进行语义理解与规划,然后将任务交给Diffusion模型来完成高质量的视觉渲染。这一框架支持多种视频生成和编辑任务,重点在于「可控」性。例如,在改变整体视觉风格时,Bernini不仅能够确保每一帧都美观,还能保持前后帧的一致性,让创作过程变得更为稳定。
具体来说,Bernini的工作流程可以看作是一个视频片场中的「导演+后期团队」。首先,名为MLLM-based planner的多模态大模型负责理解用户的文本指令,并综合源视频、参考图片等素材,制定出目标画面的语义规划。接下来,DiT-based renderer负责将这些规划转化为连续、高质量的视频画面。这样的分工确保了每一步都能精确执行,从而提升了生成视频的质量。
Bernini在可控编辑方面展现出了强大的能力。通过简单的一条指令,用户可以改变视频中的天气、季节、材质和风格。例如,在一段城市航拍视频中,用户可以将晴天的画面轻松转换为雨天或雪天,而这一切变化都能自然地融入原场景中。更进一步,Bernini还能够理解场景中的三维关系,调整画面的视角、焦点和动作,从而实现更复杂的编辑需求。