在火山引擎FORCE原动力大会上,字节跳动再次向外界展示了其在图像和视频生成领域的创新实力。新推出的图像生成模型Seedream5.0Pro与视频生成模型Seedance2.5的亮相,标志着字节在多模态生成技术上迈出了重要一步。这些新技术不仅为用户提供了更高效的创作工具,还推动了AI生成技术的进一步发展。
Seedream5.0Pro具备交互式精准编辑功能,能够将图像拆解为多个图层,直接生成可编辑的分层设计图。这一功能的推出,使得用户可以更灵活地进行图像创作,不再受限于传统的单一生成模式。而Seedance2.5则将视频创作的原生时长延长至30秒,并支持多达50个素材的联合参考,为视频创作提供了更多的可能性。
回顾过去一年多的发展历程,字节跳动的生成模型几乎保持了每月更新的频率。其中,2025年9月发布的Seedream4.0是一个关键节点,它首次将“按文字生成图片”和“修改已有图片”两种功能整合到同一个模型中。然而,这种整合并非简单相加,实际操作中常常面临能力冲突的问题。例如,增加局部编辑功能可能会影响文生图的基本性能,而叠加全局改写功能又可能导致局部编辑出现混乱。
为了解决这一难题,字节Seed团队联合新加坡国立大学等高校,在arXiv平台上发布了一篇名为DanceOPD的论文,提出了一种新方法,旨在为生成模型添加新功能的同时,不削弱原有能力。这一研究不仅具有学术价值,更与用户实际使用场景高度契合。
在字节的AI创作工具即梦中,用户通常会进行多个操作:先生成图片,再修改背景、更换风格、扩展画幅或进行局部重绘。理想情况下,这些操作应由同一个模型完成,但现实中每增加一种编辑功能,往往需要额外部署专用模型,或者将功能硬塞进主模型导致文生图质量下降。
DanceOPD提供了一种新的解决方案:将训练好的“编辑专家”模型作为“冻结教师”,通过蒸馏技术将其能力迁移到主模型中,且仅更新少量轻量参数,避免对主模型的基础结构造成影响。这种方法实现了“增量加能力”,使得Seedream系列模型从4.0到5.0的迭代过程中,每次更新都为主模型增添了新功能。
传统做法通常采用重训或权重融合,但这些方法存在风险:新功能提升的同时,老功能可能退化。DanceOPD的实测结果显示,采用权重融合方式时,文生图分数基本保持不变,但图片编辑能力直接归零,这正是传统方法局限性的体现。而DanceOPD采用的硬路由蒸馏技术,理论上可以在不影响现有能力的情况下添加新的编辑功能,显著降低了迭代成本和失败概率。
论文还解决了两个具体问题:其一,将CFG(无分类器引导)作为一种能力场吸收进模型权重中,省去了推理时的额外计算,对于处理海量C端请求的即梦产品而言,每张图片节省一次计算都意味着实际成本的降低;其二,Seedream5.0主打的精致纹理和SeedEdit主打的“非编辑区域保持不动”功能,在DanceOPD框架中得到了明确支持。
尽管论文尚未明确说明这套机制已应用于哪个版本的Seedream模型,但其瞄准的问题、采用的技术底座与字节跳动的产品路线高度一致。要理解这篇论文的核心贡献,需先了解当前主流生图模型的工作原理。这些模型通常采用流匹配技术,将“从随机噪声生成清晰图片”的过程分解为无数微小位移,每个位置都有一个“速度场”指导数据移动方向。
文生图、局部编辑和全局改写分别对应不同的速度场,但这些场之间往往相互干扰,导致生成结果模糊不清。论文将这种能力丢失现象命名为“capability identity”,即能力的身份缺失。针对这一问题,业界此前尝试过多种方法,但均存在局限性。
DanceOPD提出了三招创新解决方案:第一招是硬路由,为每个训练样本指定唯一教师,确保能力身份不被模糊;第二招是采用在策略蒸馏,在学生模型实际生成轨迹的状态上进行教学;第三招是选择低噪声点进行单点对齐,采用简单的均方误差(MSE)作为对齐方式,避免复杂的奖励模型或对抗判别器。
实验数据显示,硬路由配单点MSE的组合在图像编辑评测GEditBench上取得了5.347的分数,比最强基线高出8.1%;在局部编辑加全局编辑的组合上取得5.498的分数,比最强对照高出16.1%;同时,衡量文生图基本功的Geneval指标不降反升。
对于字节跳动这样的企业而言,DanceOPD的研究为解决能力冲突问题提供了清晰的思路,也为AI图片的直接修改提供了高效路径。随着技术的不断进步,未来的图像生成与编辑将变得更加智能化、便捷化,用户的创作体验也将得到进一步提升。