字节跳动开源Bernini框架:AI视频编辑新突破
告别"听不懂人话",Bernini框架提升AI视频编辑精度
- 核心痛点:现有AI视频生成模型难以精准理解人类意图,导致生成结果偏差。
- 解决方案:字节跳动开源Bernini框架,采用"先理解后生成"机制,提升AI对视频编辑意图的理解能力。
- 双模型协作:多模态大模型(MLLM-based planner)负责语义解析与规划,扩散模型(DiT-based renderer)负责视觉渲染。
- 语义草图:MLLM分析文本指令、源视频及参考素材,生成包含内容结构、编辑区域等关键信息的"语义草图"。
- 时空连续性:DiT基于规划结果进行视觉渲染,确保生成画面在光照、透视、运动关系等方面保持时空连续性。
- 天气变换:同步调整天空云层、路面反光、建筑阴影等20余个环境参数,呈现真实的积雪厚度变化与光线衰减效果。
- 镜头语言控制:通过指令调整画面焦点,实现平滑过渡;在主体身份不变的前提下修改动作轨迹。
- 多模态参考:输入参考图后,系统能自动识别物体表面属性,生成具有相应质感的视觉效果,且该特征会随物体运动保持稳定。
- 风格迁移:不仅调整色彩基调,还能为原始视频添加细节元素。
- 多素材协同:通过SA-3DRoPE空间编码机制,自动识别参考图与源视频的时空坐标关系,生成符合透视原理的嵌入效果。
- Arena基准测试:Bernini在复杂场景编辑任务中表现出显著优势,达到行业顶尖水平。
- 开源计划:目前开源的Bernini-R版本聚焦视觉渲染模块,完整版预计将整合更强大的语义规划能力。开发者可通过GitHub、HuggingFace等平台获取代码。