GeminiOmni正式发布,AI视频生成迎来新纪元!
在科技界的期待中,Google终于正式发布了GeminiOmni,一个能够接受任意输入并生成任意输出的强大模型。这一发布标志着AI视频生成领域的重大进展,也被称为AI视频的“Nano Banana时刻”。与之前的预测不同,GeminiOmni的功能远不止于视频生成,它整合了文字、视频、图像和交互仿真,形成了一个全面的生成框架。
在发布会上,DeepMind的CEO Demis Hassabis展示了GeminiOmni的多种应用案例。通过上传一张照片,用户可以轻松修改背景、调整风格,甚至将简单的图形转化为复杂的视觉效果。比如,用户只需画一个简单的圆圈,GeminiOmni就能生成一个黑洞,或者将一个普通的傍晚漫步场景渲染成不同风格的环境。
GeminiOmni不仅在视频生成方面展现了强大的能力,它的核心优势在于视频编辑和物理模拟。用户可以通过自然语言与GeminiOmni互动,轻松进行多轮修改,像与人类剪辑师交流一样,调整视频的风格和元素。比如,用户可以告诉Omni:“让镜子像液体一样泛起涟漪”,而它能精准地实现这一效果,保留人物动作的同时,改变镜子的物理状态。
值得一提的是,GeminiOmni具备出色的多轮对话能力,能够在每次指令的基础上进行生成,保持人物、环境和物理效果的一致性。物理模拟方面,GeminiOmni在重力和动能的模拟上实现了质的飞跃,当要求它生成“在连锁反应轨道上快速滚动的弹珠”时,Omni展现了对物理现象的深刻理解。