页面加载中,请稍候
来源:蔡静珊发布时间:2023-08-091418浏览
询问 AI生成式人工智能(Generative AI)模型训练需要使用大量数据,其获取来源与隐私保护等问题,如今也随着AI热潮席卷全球,受到更加严厉的审视目光。OpenAI新采行的作法,是让网站管理员可以采取主动,避免其网站数据被OpenAI的GPTBot网络爬虫搜集,进而拿去喂养模型。
综合The Verge与Fagen Wasanni报导,在使用者代理程序字串当中,GPTBot能够透过「GPTBot」此一使用者代理标记被识别出来,网站管理员可以将其加入到网站的robots.txt档案当中。
此外,OpenAI也公布了GPTBot所使用的网际网络协定位址区块,让管理员可以直接挡掉从这些位址而来的存取要求。
反过来说,如果管理员没有采取积极移动挡掉GPTBot,则其数据就有可能会被搜集,并使用在未来的AI模型训练当中。
有观点认为,OpenAI此举,或许是在为未来可能出现的反数据抓取相关法规预作准备。即便如此,也不能保证OpenAI先前已经搜集到的数据,就可以逃过监管单位的目光。
另外,这种作法还存在一个疑虑:除了直接挡掉以外,网站管理员还有可能可以在识别出GPTBot存在的时候,提供给GPTBot不同的回应,这意味着他们可以故意给出错误信息,恐怕会因此影响到OpenAI所使用训练数据集的数据正确性。
责任编辑:毛履万亿
新闻来源:DIGITIMES科技网,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!
2026-07-24

2026-06-22

2026-06-22