商业热点 > 商业洞察 > 英伟达等巨头被曝违规使用YouTube数据训练模型 - 涉17万个视频

【YouTube】英伟达等巨头被曝违规使用YouTube数据训练模型 - 涉17万个视频

查看信息来源】   发布日期:7-17 12:28:48    文章分类:商业洞察   
专题:YouTube】 【英伟达

K图 NVDA_0

  据媒体透露,包含苹果、英伟达、Salesforce和Anthrophic在内的一些大型科技公司,被曝在训练AI模型时使用了来自谷歌旗下视频网站YouTube的未授权数据。这些公司使用了一个由第叁方提供的数据集,其中包含从YouTube上抓取的大量视频字幕文本,违反了YouTube禁止从平台上未经许可抓取内容的规定。报道指出,这些科技公司在训练AI模型时都使用了一个名为“YouTube Subtitles(YouTube字幕)”的数据集,大小为5.7GB,包含4.89亿个单词,来自Youtube上超过4.8万个频道中的17.35万个视频。该数据集由视频字幕的纯文本组成,包含视频站长上传的部分和Youtube自动转录的文本,除了英语外,通常还附带日语、德语和阿拉伯语等语言的翻译。

手机扫码浏览该文章
 ● 相关商业动态
 ● 相关商业热点
特斯拉】  【英伟达】  【2024】  【高开低走】  【寒武纪】  【人工智能】  【智能芯片】  【国产化】  【机器人】  【人形机器人】  【VeriSign】  【伯克希尔】  【巴菲特】  【利润率】  【施泰因迈尔】  【余永定】  【美股三大指数】  【科技股】  【投资者】  【国产英伟达】  【起死回生】  【独角兽】  【华尔街】  【马斯克】  【CrowdStrike】  【科技界】  【自动驾驶】  【半导体】  【东京电子】  【AI顺风】