Gemini Omni Flash

整合文本、图像和音频,基于物理规则快速生成逼真的视频及同步音频。还支持用自然语言进行高级视频编辑,以及保持角色的一致性。

文本友好
音频支持
商业使用

输入

参考图片*

从电脑拖拽文件、从剪贴板粘贴 (Ctrl/Cmd+V) 或提供 URL。支持格式:.jpg, .jpeg, .png, .webp

结果

空闲

准备生成

配置输入并点击运行以生成图片预览。

Gemini Omni Flash 模型介绍

模型介绍

Gemini Omni Flash是谷歌倾力打造的新一代高速多模态视频生成与编辑模型。它不仅能将文本、图像、音频、现有视频等各类素材简单拼接在一起,还能深度推断各素材的上下文,将其整合为连贯、流畅的视频。通过先进的物理模拟技术,它能极为逼真地还原重力与流体的运动。此外,由于内置了丰富的现实世界知识,即便不给出详细指令,也能创作出具有真实感的场景。

该模型的优势在于具备通过自然语言指令进行灵活视频编辑的能力。在保持角色一致性的同时,用户可以反复进行对象的添加或删除、改变拍摄角度、调整环境光线等操作,对视频进行打磨优化。它能够输出最长达10秒的音视频,拓展创作者的表现力。从广告创意的快速验证,到面向社交平台的短视频,再到利用数字分身进行的演出创作,它都能为专业制作场景提供强大支持。

价格介绍

图像分辨率消耗积分(credits)
720p(credits/s)4

模型技术规格

技术参数具体规格
核心能力参考图像到视频
分辨率720p
比例16:9,9:16
时长3,4,5,6,7,8,9,10

探索类似模型