据VentureBeat报道,Google DeepMind CEO Demis Hassabis在2026年Google I/O开发者大会上宣布推出Gemini Omni系列多模态模型,并发布了Gemini for Science工具集。Hassabis表示,AI发展已进入历史性转折点,“我们正站在奇点的山脚”。
Gemini Omni系列模型首次将生成堆叠整合到单一基础模型中,突破了以往多模态工作流程中文字生图、图生视频各自独立的限制。这一改进使Gemini的推理能力首次应用于“创作”,并朝着“世界模型”的目标更进一步。
Gemini Omni Flash是该系列的首个版本,用户可通过自然语言指令直接修改视频内容,每轮指令会延续上一次结果,确保场景、角色与物理细节的一致性。此外,该模型支持图片、视频、文字或音频作为风格与内容参考,能将多种素材融合为连贯的视频。目前,音频输入仅支持语音参考,其他类型仍在测试中。
在物理模拟方面,Gemini Omni Flash显著提升了重力、动能与流体动力学的精确度,使生成内容更加逼真,同时可将复杂概念转化为可视化说明视频。例如,模型生成的水晶球折射影像展示了手掌与棋盘纹路的无限递归效果,呈现出空间与现实的多重层叠。
目前,Gemini Omni Flash已向全球AI Plus以上订阅用户开放,并免费提供给YouTube Shorts与YouTube Create App用户。企业版Vertex AI API预计数周内上线。相比OpenAI于2024年5月推出的GPT-4o,Gemini Omni在架构上与其相似,但增加了视频生成能力。
大会压轴环节,Hassabis发布了Gemini for Science工具集,旨在协助科学研究与药物研发。他强调,AI将成为人类智能的倍增器,加速科学发现,推动社会进步,并解锁通用人工智能(AGI)的潜力,造福全人类。