字节跳动开源Bernini:AI视频编辑新纪元,告别“碰运气”时代
在人工智能技术飞速发展的今天,视频生成与编辑领域也迎来了革命性的变革。字节跳动商业化技术团队最近正式推出了面向视频生成与编辑的统一框架——Bernini,旨在通过“先理解、再生成”的创新机制,解决行业内长期存在的痛点问题。传统的视频编辑工具常常面临主体变形、背景漂移和动作断裂等技术瓶颈,而Bernini的出现,似乎为这一难题提供了新的解决思路。
Bernini的核心理念在于将工作流分为“语义规划”和“视觉渲染”两大部分。通过多模态大模型规划器(MLLM-based planner),系统能够深入解析用户输入的文本、视频和参考图像,提取出关键的语义信息。这一过程可以被看作是生成了一张不受像素限制的“语义草图”,为后续的视觉渲染打下基础。接下来,基于Diffusion Transformer的渲染器(DiT-based renderer)将这一语义目标转化为高质量、稳定且连续的视频画面。得益于这种分工,Bernini在可控编辑方面展现出了极高的实用价值。
用户在使用Bernini时,只需通过简单的指令,就能够实现对视频中天气、季节、材质和视觉风格的逼真变化。更进一步,用户还可以对镜头视角、焦点以及主体动作进行精准控制。例如,在确保环境与镜头稳定的情况下,系统可以让视频中的动物动作自然变化,使得AI视频编辑的效果更接近于传统后期软件的精准度。此外,Bernini不仅支持文本指令,还能接受图片和视频作为视觉参考,大幅提升了创作过程中的一致性。