科技巨头被曝未经授权用 YouTube 内容训练 AI,苹果、英伟达在列

admin 2024年7月19日00:02:07评论5 views字数 1014阅读3分22秒阅读模式

科技巨头被曝未经授权用 YouTube 内容训练 AI,苹果、英伟达在列

关键词

人工智能

IT之家 7 月 16 日消息,据 Wired 报道,包括苹果在内的一些科技巨头未经 YouTube 视频创作者同意,就使用了他们视频的字幕文件来训练人工智能模型。

科技巨头被曝未经授权用 YouTube 内容训练 AI,苹果、英伟达在列

IT之家注意到,此次事件影响到的创作者包括知名科技博主 MKBHD (Marques Brownlee)、MrBeast、PewDiePie、以及脱口秀主持人斯蒂芬・科尔伯特、约翰・奥利弗和吉米・坎摩尔等。这些被用于训练 AI 的字幕文件相当于视频的文本转录内容。

调查记者披露,一些世界上最富有的科技公司一直在利用来自成千上万个 YouTube 视频的素材来训练 AI,而这违反了 YouTube 禁止从平台上未经许可抓取内容的规定。据悉,超过 17.3 万个来自 4.8 万个频道的 YouTube 视频字幕文件被用来训练人工智能模型,其中就包括苹果、英伟达、Salesforce 等硅谷巨头。

据报道,下载这些字幕文件的是一个名为 EleutherAI 的非盈利组织,他们声称其目的是帮助开发者训练 AI 模型。虽然 EleutherAI 的初衷可能是为小型开发者和学术研究者提供训练材料,但该数据集也被苹果等科技巨头使用。

根据 EleutherAI 发布的一篇研究论文,这份数据集是他们发布的名为“The Pile”的大型数据集的一部分。“The Pile”中的大部分数据集都是公开的,任何拥有足够存储空间和计算能力的人都可以访问。除了科技巨头之外,一些学者和开发者也使用了该数据集。然而,苹果、英伟达和 Salesforce 等市值数百亿甚至数千亿美元的公司也在他们的研究论文和帖子中提到了他们如何使用该数据集来训练 AI 模型。

有文件显示,苹果在 4 月份发布了备受关注的 OpenELM 模型几周之前,就使用了“The Pile”进行训练。而 OpenELM 模型的发布恰逢苹果宣布将在 iPhone 和 Macbook 中加入新的 AI 功能。

需要注意的是,苹果自己并没有下载这些数据,而是由 EleutherAI 完成的。因此,从技术层面来说,是 EleutherAI 违反了 YouTube 的使用条款。

尽管苹果和其他公司可能使用了公开的数据集,但此事件凸显了从网络上抓取数据来训练 AI 系统所带来的法律风险。此前就曾出现过 AI 系统在回答小众话题时抄袭整段文本的案例,当公司使用第三方编译的数据集时,只会增加未经许可使用素材的风险。

END

原文始发于微信公众号(安全圈):【安全圈】科技巨头被曝未经授权用 YouTube 内容训练 AI,苹果、英伟达在列

免责声明:文章中涉及的程序(方法)可能带有攻击性,仅供安全研究与教学之用,读者将其信息做其他用途,由读者承担全部法律及连带责任,本站不承担任何法律及连带责任;如有问题可邮件联系(建议使用企业邮箱或有效邮箱,避免邮件被拦截,联系方式见首页),望知悉。
  • 左青龙
  • 微信扫一扫
  • weinxin
  • 右白虎
  • 微信扫一扫
  • weinxin
admin
  • 本文由 发表于 2024年7月19日00:02:07
  • 转载请保留本文链接(CN-SEC中文网:感谢原作者辛苦付出):
                   科技巨头被曝未经授权用 YouTube 内容训练 AI,苹果、英伟达在列https://cn-sec.com/archives/2971344.html
                  免责声明:文章中涉及的程序(方法)可能带有攻击性,仅供安全研究与教学之用,读者将其信息做其他用途,由读者承担全部法律及连带责任,本站不承担任何法律及连带责任;如有问题可邮件联系(建议使用企业邮箱或有效邮箱,避免邮件被拦截,联系方式见首页),望知悉.

发表评论

匿名网友 填写信息