谷歌创始人谈通用人工智能:从语言迈向物理世界
来源:赵辉发布时间:2026-06-18502浏览
询问 AI近日,谷歌联合创始人谢尔盖·布林(Sergey Brin)在回归公司两年后首次公开露面,并出席了硅谷AGI House举办的开放式问答活动。据活动现场透露,布林不仅分享了谷歌的发展现状,还详细阐述了公司重点投入的技术路线,同时指出业界关于通用人工智能(AGI)定义的争议正逐渐显现,而这或将决定该领域的未来走向。
在探讨通用人工智能的概念时,布林提出了两种不同的界定标准。第一种观点将其视为人工智能实现自我进化的关键转折点,按照这一标准,当前的大型语言模型已经非常接近甚至部分达到了该水平。第二种观点则强调,系统必须能够执行所有人类可以完成的任务。布林坦言,自己目前更认同后一种定义。他指出,若以此为最终目标,现阶段的人工智能在理解物理环境、与真实世界交互以及无文本情境下的决策等方面,仍存在明显的结构性短板,这也是谷歌调整技术研发方向的重要原因。
基于上述认知,谷歌的技术战略正致力于推动人工智能从单纯的语言处理向物理世界感知跨越。布林强调,仅掌握语言技能是不够的,系统还需洞悉现实世界的运行法则。他介绍称,无论是多模态大模型Gemini,还是专注于图像与视频处理的Omni模型,其底层均依托相同的Transformer架构及训练机制,区别仅在于输入数据涵盖了文本、图片和视频等多种模态。值得注意的是,在模型训练期间,语言与视觉的理解能力会自发实现收敛与对齐。这种并非人为刻意设计,而是随着参数规模扩大而自然产生的“涌现”现象,在人工智能发展进程中已屡见不鲜。
布林认为,视频作为记录现实世界信息的高密度载体,包含了丰富的物理规律和环境特征。因此,谷歌假设,如果模型能够准确预测视频的下一帧画面,其对物理世界的直觉认知便有可能自然涌现。这正是谷歌将“世界模型”确立为核心战略的关键所在。此类系统旨在内部构建物理环境的模拟机制,从而解析物体运动及行为后果。作为该技术路线的落地成果,谷歌DeepMind计划于2025年发布Genie 3模型,它能够根据文本指令实时生成可交互的三维空间,供人工智能智能体在其中进行训练。
此外,Gemini Robotics系列模型进一步将上述能力拓展至真实的物理场景,赋予机器人在没有精确指令时自主规划并执行复杂多步任务的能力。综合这些技术布局可以看出,谷歌正稳步向超级人工智能(ASI)的终极目标迈进。如果说通用人工智能意味着具备人类同等的工作能力,那么超级人工智能则代表着在几乎所有认知维度上全面超越人类,甚至能够提出人类未曾设想的问题并发现未知的规律。谷歌当前推进的各项研发工作,正是为了夯实这一长远目标的技术根基。
新闻来源:赵辉,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
