Google谈LLM挑战 TPU暂无芯片商用化打算
来源:林佳楠发布时间:2023-09-202054浏览
询问 AIGoogle杰出科学家纪怀新日前表示,近期发展大型语言模型(LLM)最具挑战之处是数据搜集、解决人工智能幻觉(AI hallucination)等问题,已陆续摸索出因应方法。而在GPU缺货下,Google自研TPU会否转为商用化芯片?Google目前似未有此打算。
纪怀新15日出席台湾人工智能学校年会,谈到团队发展LLM的历程。他提到,过去一二十年来,科技界每八年都会出现重大突破,例如2007年iPhone问世后,即大幅改变查找引擎的运作,这样的规律到了2015年却好像被跳过了。
不过,2015年前后,LLM相关研究已陆续浮现,如Google在2014~2015年发表了Sequence to Sequence Learning with Neural Networks、A Neural Conversational Model等论文。事实上,其于2017~2021年间也一直在开发对话机器人,然因技术未成熟,并未正式发表产品。
他坦言,OpenAI释出ChatGPT后,确实促使Google加速推出对应产品,OpenAI核心成员也有数码出自Google DeepMind团队。
谈到开发Google Bard的挑战,纪怀新先是强调数据搜集、版权问题。他笑说,「最近这一年来最头痛的部分,头发也开始白了的原因,就是跟数据搜集有关系。」
若将模型训练分为预训练(Pre-training)、微调(Fine-tuning)和提示(Prompting)三阶段,预训练所需大量数据就牵涉到数据所有权、生态系影响力等议题,而训练数据的年份则影响LLM输出答复的时新程度。
他也透露,近期也曾与国科会主委吴政忠讨论,触及数据微调相关议题。
为改善LLM答复品质,Google引入查找引擎、检索增(Retrieval augmentation)技术,藉外部知识活络既有数据。检索增是团队近期发展LLM的重要主轴。
而为提升LLM推理能力,则运用思维链(Chain of thought)方式训练模型;标准的少量样本提示仅有输入和输出,思维链提示工程则在输入输出之间,多加一道解释问题的环节。
纪怀新也提到,虽持续有所进展,开发LLM仍有不少挑战,包括责任和安全性、事实基础和归属、AI内容生成的循环、个人化和使用者记忆四大面向。责任/安全性即牵涉AI产生的幻觉、答案的事实基础等面向,这也是他自己过去一年来感觉最辛苦的部分。
而当AI生成内容趋近于人类的产出,模型的原始训练数据也有可能来自于AI生成的内容,这会造成什么样的影响,仍有待观察。此外,每个人、每个国家对语言模型的偏好可能不同,如何让模型更加个人化、符合在地使用情境,目前学研界仍没有很好的答案。
另一方面,外媒相继报导,Google将于秋季发表新一代LLM,即I/O大会曾预告的Gemini多模态模型。纪怀新表示,他个人不太清楚确切发表的日期,但Gemini应会在2023年底前问世。
近期有AI新创业者指出,因NVIDIA A100 GPU缺货,团队已将Google Cloud TPU纳入算力部署计划,并认为TPU支持中大型模型运作时,算力效能高出GPU数倍。因此让人好奇,Google会否将TPU商品化,成为新营收来源?
对此,纪怀新表示,目前应不会将TPU作为实体芯片对外贩售,而仍是Google Cloud的算力方案;Google内部多使用自家的TPU,很少人在用GPU,云端GPU主要是为了满足客户的习惯和需求。
至于两者效能相比如何?纪怀新认为,TPU在芯片间通讯(Inter-chip communication)的表现确实优于NVIDIA GPU,当中有许多技术环节,不过简言之,芯片用量一旦增,芯片间通讯效能就相当关键;据其了解,NVIDIA也持续在推进相关技术。
责任编辑:毛履万亿
新闻来源:DIGITIMES科技网,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。



