页面加载中,请稍候
来源:DIGITIMES发布时间:2023-06-12904浏览
询问 AI台大资工系副教授陈縕侬指出,生成式人工智能(Generative AI)改变既有查找引擎的运作方式,但也有其风险,相关模型将从通用走向垂直领域化,而人类的参与、判断和负责仍为必要。
陈縕侬曾在美国微软(Microsoft)深度学习中心担任研究员,后来回台大任教,专长是自然语言处理(NLP)、对话系统等,近期在许多AI相关论坛皆可看到她的身影。日前在台大系统芯片中心的论坛上,陈縕侬也分享了ChatGPT技术与未来发展。
OpenAI释出的ChatGPT爆红后,其投资者微软将相关技术整合进查找引擎Bing及各项产品线中。Google也已跟进,以实验方式开放试用。目前Google查找仍是市场龙头,全球市占率9成以上,但外界多认为,微软/OpenAI阵营已改写了查找引擎的游戏规则。
陈縕侬指出,以往查找引擎查找信息的方式是抽取式(Extractive),即从网络上现存数据抽取出用户所需部分,但如果网络上没有用户要的信息,查找引擎就不会给出答案。微软曾发表的聊天机器人「微软小冰」就是一例。
台大资工系副教授陈縕侬日前参与生成式AI论坛,分享ChatGPT相关技术和趋势。李建梁摄
若是基于生成式AI技术的查找界面,即便用户要查找的信息不存在网络上,模型仍可生成一定答案来,就像ChatGPT。
她认为,生成式AI查找的优势是可处理完全没看过的问题,较接近人类举一反三的能力,比起过往查找技术,也可处理更长篇的信息量。然而,生成的答案不一定正确,不像抽取式查找的答案来得可靠。因此,运用生成式AI查找时,人为判断仍必要。
陈縕侬指出,OpenAI释出GPT-4模型后,业内最关注的两项信息是,新版模型的参数量及训练数据量,但OpenAI并未如以往揭露这些信息。
模型功能变强,背后需要更多数据,这点几乎可以百分之百确定,但模型是否变得更大就不一定。曾有人分析,45T的数据量用到1,750亿参数量(如GPT-3)的模型训练,好像有点浪费,使用10分之1大小的模型也许就可。
因此,如何拿捏参数与数据量的比例是一个问题,毕竟大家都希望用最小模型做到最多事情。近期热门的研究方向之一,就是如何将大型语言模型缩小,以便放到芯片和终端装置上。
至于许多人担忧AI的负面影响,陈縕侬认为,生成式AI应用确实有其风险,例如难以判断用户提出的问题有无伤害性。
基于人类反馈的强化学习(Reinforcement Learning from Human Feedback;RLHF)可改善这类问题,也就是以人类主观觉得好的答案微调模型。然RLHF也可能强化人类的偏见。这也是为何,许多企业和国家都希望自有AI模型,就是担心模型的反应不符合自家需求和价值观。
针对生成式AI发展的趋势,陈縕侬也提出几项重点观察。
特定领域的预训练(Domain-specific pre-training):许多生成式AI模型是通用式,对各领域都有涉猎但不够深入,如何提升模型对特定领域的知识便是一门课题。此外,用来预训练的数据,变动性最好不要太大,以免模型在不同情境下产生错误答案。
学习AI行为(Learning from AI's behaviors instead of human):许多大型语言模型已相当成熟,可当作发展其他模型的基础,降低开发成本。例如想发展类似ChatGPT应用的开发者,就可运用GPT系列模型,而非让模型重新学习人类行为。
人类的参与(Human in the Loop):目前生成式AI提供的答案品质不一,许多领域的特殊知识是人类拥有,因此在相关应用上,人为判断仍必要。若有任何问题,人类也应该担任最后「负责」的角色,而非要求AI负责。
新闻来源:DIGITIMES,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!

2026-06-15

2026-06-15
2026-06-11