页面加载中,请稍候
来源:中科院半导体所发布时间:2023-03-141791浏览
询问 AI
原文标题:Machines Learn Better if We Teach Them the Basics
作者:Max.G. Levy,首发于quanta magzine。
“像人类有学前教育一样,机器也可以进行学前教育——预训练。这是一系列使用预先训练来提升强化学习算法的研究进展。”设想一下:如果你的邻居想要你帮忙给他的宠物兔子喂几根胡萝卜。你会怎么做?即使你压根没去过他们家的厨房,你也知道从冰箱把胡萝卜拿出来,从抽屉取出刀等等。虽然你根本不知道他们家的胡萝卜和刀长什么样,但是你一定不会用他们家的勺子切黄瓜。但是人工智能的程序可能会犯错。这些对人看起来十分简单的任务在程序眼中显得无比艰难。人工智能机器人在自己熟悉的厨房找到刀和胡萝卜,但是他们没办法在一个全新的厨房完成这些事。因为他们没有“抽象”的技能。“他们无法认知新的环境”,来自华盛顿大学计算机科学的毕业生Victor Zhong说道。机器花在“学习”上的时间比花在“探索”上的时间多得多。造成这样“行为”的原因就是这些机器人——以及一般的人工智能代理——没有来构建所有概念的基础。他们并不知道“刀”和“胡萝卜”是什么,该怎么打开抽屉,用刀切胡萝卜。许多高级人工智能系统都是通过一种名为强化学习(Reinforcement learning)的方法进行训练的,这种方法本质上是通过试错进行自我教育。通过强化学习的机器人可以很好地执行强化学习过程中学会的每个“任务”。但是只要到了一个陌生的环境,他们就变得没那么聪明了。为了克服这一限制,计算机科学家已经开始在“惩罚”之前教人工智能一些重要的概念。这就像在使用软件之前先阅读使用手册:你可以尝试在没有它的情况下探索,但有了它你会学得更快。普林斯顿大学的计算机科学家Karthik Narasimhan说:“人类通过做和读的结合来学习。”“我们希望机器也能做到这一点。”Zhong和他同行的新工作表明:对机器进行这样一种“学前教育”可以使得在线和现实中的机器人学习更快。不仅如此,“学前教育”还使得机器人学会了一些新的技能。研究人员希望机器人的“成长”也能“德智体美劳”,象棋、购物、家务样样精通。科学家认为人们和机器人的交互模式也会随着机器人能力的改变而改变。“这是一个相当大的突破,”谷歌的机器人研究科学家Brian Ichter说。“在一年半的时间里,它取得了难以想象的进步。”匮乏的奖励(Sparse Rewards)乍看之下,机器学习领域已经相当成熟。不过大部分算法模型还是基于强化学习,也就是机器做对了,人们会“奖励”。机器通过这样的过程会从一个无知的个体,通过不断的试错,最终百举百捷。这样的机器人可以在简单的游戏中叱咤风云。就比如经典游戏“贪吃蛇”,玩家控制一条蛇的移动,通过在有限空间中吃食物使得蛇身逐渐变长。如果吃到自己的身体游戏就会失败。这样清晰的正确和错误结果会给机器带来积极的反馈,足够多的尝试可以让它从“菜鸟”变成高分。但是加入稍微改动规则,比如从空间从二维变为三维。人类的学习速度就会比机器快很多。这里有两个原因:第一,更大的空间意味着蛇需要更长的时间才能找到食物,当奖励变得稀少时,学习速度会呈指数级下降。其次,新维度提供了全新的体验,强化学习很难对能力进行“拓展”。
Victor Zhong通过先为机器灌输基本信息来帮助它们学习概括知识。Zhong认为他们不需要接受这些障碍。“为什么当我们想下国际象棋时”——另一种强化学习已经掌握的游戏——“我们从头开始训练一个强化学习代理?”这种方法效率低下。机器人通过漫无目的的尝试,直到它偶然发现一个好的情况,比如“将军”checkmate。钟认为,如果直接告诉机器人什么方向是正确的或者让他们知道一个好的情况意味着什么。“我们已经有这么多关于如何下棋的书了,为什么还要让机器人从头开始?”因为机器一开始就很难理解人类语言和破译图像。对于一个机器人来说,要完成基于视觉的任务,比如寻找和切胡萝卜,它必须知道胡萝卜是什么——物体的图像必须“基于”对该物体是什么的理解。直到最近,还没有什么好的方法可以做到这一点,但是语言和图像处理的速度和规模的迅速增长使得这即将成为可能。新的神经语言处理模型(natural language processing )使得机器人可以从根本上理解词语或句子背后的意义。如果想要这么做,就不能仅仅只教机器人字典里的那些东西。计算机视觉就经历过相似的数字爆炸。2009年左右。ImageNet 最初是一个用于计算机视觉研究的注释图像数据库。而如今他们拥有约1400百万张图像数据。像OpenAI的DALL·E这样的程序就能根据命令生成看起来像人造的新图像,尽管没人去真正做比较。加州理工学院和英伟达的计算机科学家阿尼玛·阿南德库马尔认为。已经有足够的数据能用来对机器进行训练了。同时她也认为机器人可以像人一样去学习“概念”,然后通过概念来进化。她说:“我们现在正处在一个伟大的时刻。因为一旦新一代智能机器人出现,我们可以做的事情就更多了。”
阿尼玛·阿南德库马尔(Anima Anandkumar)与人合作创造了一个虚拟代理,它通过观看人类玩游戏的视频来学习玩《我的世界》。她的团队还进行了机器人的预训练,以使它们更快地学习来游玩全球最畅销的电脑游戏《Minecraft》。这是一款“沙盒”游戏,意味着它为玩家提供了一个几乎无限的空间来互动和创建新的世界。对于成千上万的任务,单独编程奖励函数毫无用处,因此团队的模型(“MineDojo”)通过观看带字幕的游戏通关视频来建立其对游戏的理解。不需要编码来定义行为的“好”与“坏”。“我们正在获得自动化的奖励函数,” Anandkumar说。“这是第一个具有数千个任务和通过文本提示指定开放式任务执行强化学习能力的基准测试。”
“人类在数以百计次的阅读和行动中学习,我希望机器也能这样。”Narsimhan说。当然,让机器人与现实世界互动也有其自身的挑战。例如,一瓶水。你可以通过其外观识别一瓶水,你知道它用于存储液体,你也知道如何用手操纵它。但是,现实中的机器是否能够将语言和图像转化为复杂的运动呢?为了弄清这个问题,Narasimhan与普林斯顿大学的机器人学家Anirudha Majumdar合作,他们教会了一个机械臂操纵它从未见过的工具,并使用来自成功语言模型的描述性语言进行了预训练。根据去年6月发布在arxiv.org上的结果,与传统探索学习的程序相比,该程序在几乎所有工具和动作方面都学得更快,表现更好。该团队与一款移动助手机器人合作,该机器人配备七关节机械臂。他们使用语言技能进行训练。对于任何给定的命令,比如“帮我清理洒出的饮料”,该程序使用语言模型从700个训练动作库中提出建议,如“抓住”纸巾,“拿起”罐子或“丢掉”罐子。Hausman表示,该机器人会使用诸如“我实际上无法擦拭它,但我可以给您带来一块海绵。”的短语来承认自己的局限性。该团队最近报道了这个项目的结果,称其为SayCan。为机器人赋予语言模型的另一个好处是翻译同义词和其他语言的单词变得轻而易举。一个人可以说“twist”,而另一个人说“rotate”,机器人都能理解。“我们尝试的最疯狂的事情是它也能理解表情符号,”Google的研究科学家Fei Xia说道。机器学习没有停止(The Bots Are Learning )
转载内容仅代表作者观点
不代表中科院半导体所立场
新闻来源:中科院半导体所,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!
2026-07-05

2026-07-01

2026-07-07