Gemini Omni Flash

图片转视频

可即时融合图像、音频和文本,生成高质量视频。支持基于自然语言的高级视频编辑,实现连贯的影像表现。

文本友好
音频支持
商业使用

输入

首帧图*

从电脑拖拽文件、从剪贴板粘贴 (Ctrl/Cmd+V) 或提供 URL。支持格式:.jpg, .jpeg, .png, .webp

尾帧图

从电脑拖拽文件、从剪贴板粘贴 (Ctrl/Cmd+V) 或提供 URL。支持格式:.jpg, .jpeg, .png, .webp

结果

空闲

准备生成

配置输入并点击运行以生成图片预览。

Gemini Omni Flash 模型介绍

模型介绍

谷歌开发的「Gemini Omni Flash」是一款开创性的多模态模型,可高度融合图像、文本和音频,并能以近乎实时的速度生成和编辑视频。它不仅能简单地将素材拼接在一起,还能深度理解场景语境与物理法则,生成连贯的视频,逼真还原重力、流体运动等细节。

该模型的优势在于其极具灵活性的高级视频编辑能力。通过自然语言指令,用户可在生成的视频中添加或删除特定物体,更改镜头角度或背景风格,还能在保留角色视觉效果和身份特征的同时,对场景进行无缝编辑。

它支持输出最长达10秒的音视频同步视频,可为社交媒体短视频、广告创意的快速原型制作、虚拟形象创建等场景提供直观且高品质的视频制作支持。

价格介绍

图像分辨率消耗积分(credits)
720p(credits/s)4

模型技术规格

技术参数具体规格
核心能力image_to_video
分辨率720p
比例16:9,9:16
时长3,4,5,6,7,8,9,10
License