英伟达推出开源机器人视觉推理模型
来源:林慧宇发布时间:2025-08-122522浏览
询问 AI据财联社8月12日报道,在行业顶级会议SIGGRAPH上,英伟达发布了一系列面向机器人开发者的模型、应用库和基础设施,其中包括备受关注的开源物理AI应用和机器人视觉推理模型Cosmos Reason。这一模型参数量仅为70亿,旨在提升机器人在真实世界中的推理与执行能力。
英伟达表示,自OpenAI多年前发布CLIP模型以来,视觉语言模型已显著改变了计算机视觉任务,如物体与模式识别。然而,过去模型难以应对多步骤任务或模糊场景。Cosmos Reason通过其记忆与理解能力,使机器人能够“像人类一样推理”,并完成复杂操作。例如,机器人手臂可根据“面包+烤面包机”的场景,推断出下一步应将面包放入烤面包机中进行烘烤,并将逻辑转化为操作指令。

该模型的核心功能被称为“机器人规划与推理”。它能作为机器人的“大脑”,负责有意识、条理化的决策,解释环境并分解复杂指令为具体任务。此外,Cosmos Reason还可用于自动化数据整理、标注及从视频数据中提取有价值信息。
目前,该模型已在商业化领域取得进展。英伟达内部团队正使用其进行数据过滤、标注及视觉语言动作后训练。优步(Uber)也利用该模型为自动驾驶训练数据生成标注与说明。麦格纳国际则将其应用于全自动即时配送解决方案City Delivery,以帮助车辆快速适应新城市环境。VAST Data和Milestone Systems等公司也在交通监控自动化和视觉检测领域采用该模型。


此外,英伟达在Cosmos世界模型中新增了Cosmos Transfer-2,用于加速3D仿真场景的合成数据生成,并推出了更注重速度优化的版本。同时,公司还更新了Omniverse软件开发工具包,并发布了新的神经重建库,支持开发者利用传感器数据在三维中模拟现实世界。
新闻来源:林慧宇,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
