商业洞察
【ChatGPT】需要更多数据训练,OpenAI宣布非注册用户也将能体验ChatGPT了
【查看信息来源】 4-2 8:57:23OpenAI正试图通过对数量庞大的非注册用户开放其较低版本模型ChatGPT,来扩充自己的练习数据来源。
当地时间4月1日,OpenAI宣布,用户无需注册即可使用ChatGPT,即其旗下大语言模型GPT-3.5版本的对话式 人工智能 产品。
OpenAI在其官方网站发布的博文中宣称,其核心使命是让ChatGPT等工具得到广泛使用,以便人们可以体验 人工智能 的好处。目前,每周有来自185个国家和地区的超过1亿用户使用ChatGPT。OpenAI选择逐步推出无需注册即可使用ChatGPT的功能,目标是让任何对其功能感兴趣的人都能使用 人工智能 。
另外,OpenAI可能会使用用户向ChatGPT提供的信息来改进其模型。不过,用户甭管是否建立帐户,都能通过“设置”关闭此功能。
OpenAI还补充到,其为使用ChatGPT的未注册用户引入了额外的内容保障措施,例如阻止提示和更广泛类别的生成。同时,OpenAI不忘提示称,“建立帐户有许多好处,包含能够保存和查看聊天历史记录、共享聊天和解锁语音对话和自定义指令等附加功能”。
说白了,不管用户是否注册使用ChatGPT,用户在使用进程中引发的数据都可能会被OpenAI用以训练模型,但用户可以主动选择关闭。相比起注册用户,非注册用户在使用ChatGPT时会试用更加严格的内容保护政策,但OpenAI没有详细解释这种限制政策具体包含什么。
其实,包含OpenAI、谷歌等巨头在内,所有的致力于发展 人工智能 的企业,都正在或即将面临数据短缺的困境,尤其是高质量数据的短缺。这主要由于,一方面需要数据训练模型的 人工智能 公司和大模型越来越多,对数据的切实需求越来越大;这时,一些数据所有者,好比纽约时报、reddit和马斯克拥有的X平台,正在不同水平上限制或阻止部分或全部 人工智能 公司对他们数据的访问。
据华尔街日报4月1日报道,一些高管和科研人员表示, 人工智能 行业对高质量文本数据的切实需求可能会在两年内僧多粥少,这可能会减缓 人工智能 的发展。曾在OpenAI工作的 人工智能 研究员阿里·莫科斯 (Ari Morcos) 表示,数据短缺“是一个前沿研究问题”。
为了应对这个问题,报道援引知情人士的说法称,OpenAI已经讨论了利用YouTube公共视频的转录来训练其下一代模型GPT-5。
在更早前的一次灾难采访中,OpenAI的CTO Murati在回答旗下视频生成模型Sora的练习数据来自哪里时,支支吾吾并试图回避回答这个问题,甚至称“不太确定”是否使用了Youtube、Facebook和Instagram等平台的数据。
同时,OpenAI和其竞争对手Anthropic的科研人员,正试图通过建立所谓的更高质量的合成数据来避免这些问题。OpenAI的讲话人表示,其还在探索合成数据生成。但也有另一些科研人员表示,这种方法实际上可能会造成严峻的故障。
值得注意的是,The Information在上周的一篇报道中援引知情人士消息称,微软和OpenAI的高管始终在制定一个 数据中心 项目计划,该项目将包含一台超级计算机,配备数百万个专用服务器芯片,为OpenAI的 人工智能 提供动力。报道称,据一位曾与OpenAI首席执行官Sam Altman交谈过的人士和一位看过微软部分初始成本估算的人士透露,该项目的成本可能高达1000亿美元,这一成本比现今一些最大的 数据中心 高出100倍。