尼尔森旗下的元数据与内容识别公司 Gracenote 已在美国纽约南区联邦法院起诉 OpenAI,指控其在未经授权、也未支付任何费用的情况下,大规模抓取并使用 Gracenote 的媒体元数据库及其独特的数据关联框架,用于训练 ChatGPT 等商业大模型,构成严重版权侵权,并直接威胁到 Gracenote 的核心业务。

Gracenote 在诉状中强调,多年来,公司投入大量人力——包括数百名专业编辑——对全球影视、音乐和体育内容进行人工整理与标注,构建了一个包含节目简介、视频特征描述、唯一内容标识符以及复杂关系图谱的“节目数据库”。该数据库已在美版权局完成登记。Gracenote 指出,其价值不仅在于具体的文字内容,更在于对作品进行分类、关联和组织的专有“关系框架”,这正是其向流媒体平台、智能电视厂商等客户收费的关键所在。

诉状称,OpenAI 未经许可抓取了这些数据,并在用户通过 ChatGPT 提问时,以几乎逐字复述的方式输出与 Gracenote 节目简介高度一致甚至完全相同的描述。例如,当用户询问热门美剧《权力的游戏》剧情时,ChatGPT 给出的内容与 Gracenote 编辑撰写的版本几乎一模一样。更值得注意的是,即便用户只输入极简提示,多个 ChatGPT 版本仍能复现数据库中的大段说明,表明这些文本及其底层结构很可能已被直接复制进模型。

Gracenote 认为,OpenAI 的行为不仅侵犯了受版权保护的文字内容和数据库结构,还可能让媒体分发商或设备厂商绕过授权,利用 AI “反推”出类似元数据服务,从而削弱 Gracenote 的市场竞争力。诉状警告:如果放任不管,智能电视厂商完全可以依赖 AI 模型生成的数据,自建与 Gracenote 竞争的元数据平台,却一分钱都不用付。

在索赔方面,由于数据库已在美国版权局注册,Gracenote 除要求赔偿实际损失外,还寻求法定损害赔偿——这是针对规模化、持续性侵权的一种法律救济手段,可不依赖具体损失金额而直接主张固定赔偿额度。

对此,OpenAI 发言人回应 Axios 称,其模型“推动创新”,训练所用数据均为“公开可获取内容”,并主张这属于版权法下的“合理使用”。包括 OpenAI 在内的多家 AI 公司一贯认为,从公开网络抓取数据训练模型,经转化后能提供全新、有用的服务,应被视为合法。

值得注意的是,Gracenote 并非反对 AI 本身。公司此前已与三星、Google 等达成多项 AI 数据授权合作。诉状提到,Gracenote 曾多次主动联系 OpenAI 商谈授权,却长期遭到忽视或拒绝,最终才不得不诉诸法律。CEO Jared Grusd 表示:“支持 AI 发展和反对数据窃取并不矛盾,二者才是行业可持续发展的正道。”

法律界人士指出,在当前多起媒体公司诉 AI 企业的版权案中,本案尤为关键——它将考验法院是否认可数据库结构、元数据关联图谱等“非传统作品”的版权保护资格,以及如何界定大模型训练中的“合理使用”边界。Gracenote 强调,OpenAI 输出的内容与其授权数据“近乎完全相同”,并非创造新信息,而是实质性复制,这一点或将成为本案区别于其他 AI 版权纠纷的核心争议点。