Hailuo H3

同时参照画像、视频、音频,生成带有同步音频的2K影像。也能使用自然语言进行视频编辑或动作移植,是专业级别的高性能模型。

文本友好
音频支持
商业使用

输入

参考图片*

从电脑拖拽文件、从剪贴板粘贴 (Ctrl/Cmd+V) 或提供 URL。支持格式:.jpg, .jpeg, .png, .webp

结果

空闲

准备生成

配置输入并点击运行以生成图片预览。

Hailuo H3 模型介绍

模型介绍

「海螺H3」是专为商业内容制作优化的尖端多模态视频生成模型。它能够整合处理文本、图像、视频和音频,形成统一的上下文,同时生成本地2K分辨率(24帧/秒)的高质量视频,以及完全同步的逼真音频(包括台词、环境音、背景音乐等)。

其最大特点是支持「全参考控制」,可同时参考最多12张图像、视频和音频。通过这一功能,能够精确地保持角色一致性和品牌元素。此外,它还配备了基于自然语言指令进行视频局部编辑,以及从现有视频中仅移植动作的动作迁移功能。

该模型兼具对提示词的精准遵循能力和出色的文本生成效果,为广告、电商产品推广、动画制作、游戏PV等需要高质量且快速视频制作的商业场景带来了突破性的生产力提升。

价格介绍

图像分辨率消耗积分(credits)
2k(credits/s)6

模型技术规格

技术参数具体规格
核心能力参考图像到视频
分辨率2k
比例16:9,4:3,1:1,3:4,9:16,21:9
时长5,6,7,8,9,10,11,12,13,14,15

探索类似模型