跳到正文
Google DeepMind·· 2026-05-18精选AI 评分66

Google 推出 Gemini Omni:能理解任意输入并生成视频的多模态模型

Introducing Gemini Omni

AI 导读

Gemini Omni Flash 是 Google DeepMind 发布的首个能处理任意模态输入并生成高质量视频的模型,支持图像、音频、视频、文本组合输入。

推荐理由

模型的核心能力(任意模态输入生成视频、自然语言编辑)和具体开放时间线已给出,读者可据此判断它对自己工作流的影响。

来源:Google DeepMind · deepmind.google