Google 推出 Gemini Omni Flash,视频生成接入多模态输入

Gemini Omni Flash 的重点不是“又一个视频模型”,而是把文本、图片、视频和音频都纳入同一条生成链路。它先在 Flow、Gemini 和 YouTube Shorts 等产品内落地,API 与第三方长测还没有形成稳定结论。
Gemini Omni Flash 视频生成多模态界面

Omni 从视频开始

Gemini Omni 是 Google 新开出的生成模型系列,第一款模型叫 Gemini Omni Flash。这个名字容易误读:它不是 Gemini Flash 文本模型的普通小版本更新,而是一个面向生成媒体的 Omni 分支,首个落点是视频。

它能把文本、图片、视频、音频作为引用输入,生成一段带画面和声音的视频,或者在已有视频上做多轮编辑。产品化入口包括 Gemini、Google Flow、YouTube Shorts、Google AI Studio 和 Gemini API;但对普通创作者来说,当前最明确的使用场景还是 Flow 和 Gemini。Google AI 订阅是前置条件,具体功能会受套餐、地区、平台和年龄限制影响。

这条产品线真正要解决的不是“从一句话生成视频”,而是“拿现有素材继续改”。输入一段视频,再加一张参考图、一段音频或一句自然语言指令,让模型保持场景连续性、角色身份、声音和动作逻辑。这和传统 text-to-video 的差别很大:创作流程从一次性抽卡,变成围绕素材的迭代编辑。

多模态引用比单次生成更值得看

视频生成模型过去最难用的地方,常常不是第一版画面不够漂亮,而是第二轮修改会把角色、镜头、动作关系改坏。Gemini Omni Flash 把“多轮对话编辑”和“一致性”放在核心位置:换风格、替换角色、移动镜头、加入声音、让参考图片影响视频中的物体,都可以放在同一条链路里处理。

这会先影响三类场景。广告素材团队需要批量改口播、角色和画幅;短视频创作者需要把自拍、参考图和音频转成可继续编辑的镜头;游戏和交互内容团队需要快速试动作、材质和镜头。单段视频长度公开口径约为 10 秒,长叙事仍然要靠分镜、拼接和后期流程,不能把它当成完整影片生成器。

内部评测不能直接当实测结论

现有评测主要来自内部人类偏好测试。公开材料里能看到几组数据:视频编辑测试覆盖 504 个样例;MovieGenBench 文本到视频测试覆盖 1003 个 prompt;VBench 图像到视频测试覆盖 355 组图文对;Reference to Video 还使用了混合图片、音频和文本引用的 468 个样例。

这些数字有信息量,但还不是开发者可复现的 benchmark。现阶段更稳妥的读法是:Gemini Omni Flash 在视频编辑、图文/音频引用、多轮修改这些方向上被 Google 重点押注;至于提示词遵循、身份保持、声音同步、中文语音、字幕文本、长镜头稳定性、成本和延迟,还要等 API 和第三方评测跑出结果。

真正的门槛在可控性和溯源

Gemini Omni Flash 把“把自己放进视频里”“用参考素材迁移动作和风格”做成产品能力后,合成内容边界会更敏感。产品侧已经接入 SynthID 水印和 C2PA 内容凭证,并计划把验证入口扩展到 Chrome 和 Search。水印能降低误判成本,但不能替代平台治理、授权检查和滥用检测。

对开发者和创作者来说,短期判断点很直接:能不能稳定保留同一个人物或角色,能不能按镜头级指令修改而不污染其它部分,能不能在商业素材里给出可预测的成本和失败率。Gemini Omni Flash 现在提供了一个方向明确的入口,但它还缺少公开 API 价格、吞吐、失败样本和跨语言长测。先把它当成多模态视频编辑模型看,比把它当成“万能生成器”更接近事实。