据WIRED发布的消息,目前在美国已经有不少网站开始屏蔽互联网档案馆旗下的“网站时光机”快照功能,也就是不再允许这个工具抓取和保存新闻网站的页面。原因是因为AI爬虫会抓取这些数据来训练模型。



现在AI热潮已经让大量网站的流量明显下滑,而AI公司想方设法绕过限制非法抓取网站内容,把抓到的数据用来训练聊天机器人或者后续的AI模型。对网站来说,这种行为既未经许可就使用内容,又会造成流量下降,所以很多网站已经在robots.txt里明确禁止AI爬虫抓取数据。

互联网档案馆和普通用户都被误伤了。为了保护自己的利益,包括《今日美国》《纽约时报》在内的多家知名新闻媒体已经屏蔽了互联网档案馆的网站时光机。这些新闻网站把互联网档案馆使用的ia_archiver爬虫排除在外。除了新闻媒体,像Reddit这种网络论坛也同样禁止互联网档案馆抓取内容。Reddit已经和Google、OpenAI等公司签了授权协议,允许它们抓取数据训练AI模型。对Reddit来说,如果允许互联网档案馆抓数据,AI公司再转头去抓互联网档案馆的数据,那自己就没法继续卖数据了。

问题在于,很多内容并不是永久存在的。网站时光机的意义在于可以查看网页内容的变化,以及在网页被删除后还能通过快照浏览内容,这对很多用户来说非常重要。所以在AI热潮下,新闻媒体屏蔽互联网档案馆,其实是对互联网档案馆和用户的误伤——为了防AI公司,结果把正常使用的用户也给屏蔽了。

《今日美国》表示,这并不是专门针对互联网档案馆。该公司发言人说,屏蔽互联网档案馆抓取内容是他们广泛屏蔽所有网络爬虫的正常计划。《卫报》商业事务和授权总监则表示,他们正在和互联网档案馆沟通,讨论AI公司可能滥用为保存目的而抓取的内容的问题,但目前还没有明确结果。

照这个趋势看,未来可能会有越来越多的媒体屏蔽互联网档案馆,防止自己的内容被AI公司通过这个渠道抓走。说到底,根源还是这些AI公司。它们未经授权就抓取内容,高频次抓取的行为也屡见不鲜。最终这可能会改变开放互联网的格局,让更多网站从公开访问转向注册登录甚至付费访问。