字节跳动开源Bernini:AI视频编辑新纪元,告别“碰运气”时代

在人工智能技术飞速发展的今天,视频生成与编辑领域也迎来了革命性的变革。字节跳动商业化技术团队最近正式推出了面向视频生成与编辑的统一框架——Bernini,旨在通过“先理解、再生成”的创新机制,解决行业内长期存在的痛点问题。传统的视频编辑工具常常面临主体变形、背景漂移和动作断裂等技术瓶颈,而Bernini的出现,似乎为这一难题提供了新的解决思路。

Bernini的核心理念在于将工作流分为“语义规划”和“视觉渲染”两大部分。通过多模态大模型规划器(MLLM-based planner),系统能够深入解析用户输入的文本、视频和参考图像,提取出关键的语义信息。这一过程可以被看作是生成了一张不受像素限制的“语义草图”,为后续的视觉渲染打下基础。接下来,基于Diffusion Transformer的渲染器(DiT-based renderer)将这一语义目标转化为高质量、稳定且连续的视频画面。得益于这种分工,Bernini在可控编辑方面展现出了极高的实用价值。

用户在使用Bernini时,只需通过简单的指令,就能够实现对视频中天气、季节、材质和视觉风格的逼真变化。更进一步,用户还可以对镜头视角、焦点以及主体动作进行精准控制。例如,在确保环境与镜头稳定的情况下,系统可以让视频中的动物动作自然变化,使得AI视频编辑的效果更接近于传统后期软件的精准度。此外,Bernini不仅支持文本指令,还能接受图片和视频作为视觉参考,大幅提升了创作过程中的一致性。

在实际应用场景中,Bernini展现出了令人惊叹的能力。它能够将特定材质、指定主体甚至广告海报精准植入目标视频区域,确保在编辑过程中不破坏边界和透视。而在新视频生成的场景中,该模型支持单图参考生成、多角度参考生成,以及关键帧到连续镜头的演变,甚至能够将多张风格迥异的单品图像完美融合到同一视频角色上。为了进一步解决多视觉片段串联时可能出现的混淆问题,团队还引入了SA-3D RoPE位置编码机制,为不同视觉片段赋予专属标记,从而在保留时空位置关系的同时,明确区分参考素材与输出目标。

Bernini的推理代码与第二阶段模型Bernini-R的权限已经正式放开,包含完整MLLM规划器的全版本也将在近期迎来全面开放。经过字节自建的测试,Bernini已稳居行业第一梯队,显示出其强大的技术优势和市场潜力。随着这一框架的开放,AI视频编辑的未来将更加光明,用户将不再依赖“碰运气”的方式,而是能够更精准地掌控视频创作的每一个细节。

总的来说,Bernini的推出标志着AI视频编辑领域的一个新纪元。它不仅为创作者提供了更为高效和灵活的工具,也为整个行业的技术进步注入了新的动力。随着技术的不断演进,我们期待在不久的将来,看到更多基于Bernini的创新应用,为我们的视觉创作带来更多的可能性。