GeminiOmni正式发布,AI视频生成迎来新纪元!

在科技界的期待中,Google终于正式发布了GeminiOmni,一个能够接受任意输入并生成任意输出的强大模型。这一发布标志着AI视频生成领域的重大进展,也被称为AI视频的“Nano Banana时刻”。与之前的预测不同,GeminiOmni的功能远不止于视频生成,它整合了文字、视频、图像和交互仿真,形成了一个全面的生成框架。

在发布会上,DeepMind的CEO Demis Hassabis展示了GeminiOmni的多种应用案例。通过上传一张照片,用户可以轻松修改背景、调整风格,甚至将简单的图形转化为复杂的视觉效果。比如,用户只需画一个简单的圆圈,GeminiOmni就能生成一个黑洞,或者将一个普通的傍晚漫步场景渲染成不同风格的环境。

GeminiOmni不仅在视频生成方面展现了强大的能力,它的核心优势在于视频编辑和物理模拟。用户可以通过自然语言与GeminiOmni互动,轻松进行多轮修改,像与人类剪辑师交流一样,调整视频的风格和元素。比如,用户可以告诉Omni:“让镜子像液体一样泛起涟漪”,而它能精准地实现这一效果,保留人物动作的同时,改变镜子的物理状态。

值得一提的是,GeminiOmni具备出色的多轮对话能力,能够在每次指令的基础上进行生成,保持人物、环境和物理效果的一致性。物理模拟方面,GeminiOmni在重力和动能的模拟上实现了质的飞跃,当要求它生成“在连锁反应轨道上快速滚动的弹珠”时,Omni展现了对物理现象的深刻理解。

此外,GeminiOmni还具备处理复杂场景的能力,比如在一个字母表物品视频中,能够展示每个字母对应的独特物体,并保持画面节奏和字幕形式的协调。

随着GeminiOmni的上线,Google已经在其所有产品中整合了这一功能,全球的Google AI Plus、Pro和Ultra用户可以通过Gemini应用和Google Flow体验这一新技术。用户只需输入提示词,就能生成多种风格的视频,极大降低了视频制作的门槛。这样的技术变革,不仅能为个人创作者带来便利,也将影响整个内容生产行业。

为了应对公众对AI伪造的担忧,Google还在GeminiOmni生成的视频中嵌入了肉眼不可见的数字水印,以确保视频的真实性。同时,推出的Avatar(数字分身)功能可以克隆外貌和声音,为用户提供更个性化的体验。

展望未来,GeminiOmni不仅将继续推动视频生成技术的发展,还将改变内容生产的速度、真实感验证和版权管理。随着技术的不断进步,视频创作者将面临新的机遇与挑战,如何在这个快速变化的环境中保持创作的独特性与原创性,将是一个值得深思的话题。