商业热点 > 商业洞察 > OpenAI语音模型-炸场- 15秒样本即可复刻人声

【VoiceEngine】OpenAI语音模型-炸场- 15秒样本即可复刻人声

查看信息来源】   发布日期:4-1 6:33:49    文章分类:商业洞察   
专题:VoiceEngine】 【OpenAI】 【人工智能

  21世纪经济报道记者孔海丽实习生牛淑锐北京报道

  继文生视频大模型Sora后,最近,OpenAI终于将按捺许久的语音引擎模型—Voice Engine公之于众。

  利用文本输入和单个15秒音频样本,Voice Engine就能生成与原说话者非常相似且情感丰富的自然语音。不过,和文本生成视频模型Sora一样,目前OpenAI只针对少部分内测用户开放Voice Engine。

  OpenAI在其官方网站披露,2022年底,Voice Engine就被第壹次开发,并已经用它来支持文本转语音API和ChatGPT语音和朗读中可用的预设语音。但考量到合成语音被滥用的潜在风险,OpenAI选择了谨慎有序地推进和发布Voice Engine。

  近两年,全球生成式AI应用规模显现爆发式增长。据IDC预测,全球AI软件市场规模有望从2022年的640亿美元增长至2027年的2790亿美元,复合增长率为31.4%。

   华泰证券 分析师认为,随着基础模型能力优化,多模态应用有望在内容创作、AI教育、虚拟陪伴等场景加速落地。

  Voice Engine的问世,解锁了语音模型的更多可能性,例如辅助阅读、视频转译等,也将在发音障碍人群的语言表达上提供有效帮助。

  当AI瞄准声音克隆技术

  去年,霉霉说地道中文的视频火上微博热搜,而这背后的AI工具来自Voice Engine的采用者之一—AIGC草创公司HeyGen,此话题的阅读量超600万。

  通过Voice Engine进行实时转换翻译,说话者将保存原始口音,原语言不仅能转化成中文、英文、日文等各类语言,也能让面部嘴型完美匹配。

  除此之外,特朗普随口飙一段中文、郭德纲用英语说相声、蔡明阿姨讲段子的视频也在各大社交平台上广为流传。

  Voice Engine的官宣也有迹可循。2024年3月19日,OpenAI已经为“Voice Engine”申请了商标,商标的覆盖范围主要是围绕语音识别、语音合成和语音生成等方面。

  谷歌前员工Jonathan Chavez也曾在前阵子透露,OpenAI将在今年推出一款全球最好的个人助理产品,就像钢铁侠中的Jarvis。

  果不其然,Voice Engine如期而至,团队还公示了多场景下的内测结果与相关音频。

  根据OpenAI的介绍,Voice Engine能够通过自然、富有感情的声音为非读者和儿童提供阅读帮助;可以翻译视频和播客等内容,以便创作者和企业可以用自己的声音流利地接触世界各地的更多人;支持非语言人群和帮助患有突发性或退化性言语病症的病患恢复声音。

  OpenAI语音引擎产品团队成员杰夫·哈里斯 (Jeff Harris)表示,该模型是根据“许可数据和公开数据的组合”进行训练的。

  对于Voice Engine的进展,网友直呼:“ 人工智能 的发展速度令人兴奋,势不可挡。”

  从业人士认为,Voice Engine将对播客、配音艺术家、口语表演者、有声书和广告解说员、游戏玩家、流媒体主播、客户服务代理、销售人员等众多职业造成现实影响,这其中也包含就业压力。

  大众也向往,当OpenAI的Sora与Voice Engine这两项前沿科技相碰撞,又会擦出啥样的火花,真正意义上的有声AI视频甚至电影短片,是不是也就不远了。

  勒紧“深度伪造”的缰绳

  对于Voice Engine技术的使用,除了惊喜与赞叹声,也有人提出了疑问,如果这样的技术用于电信诈骗,后果会很可怕。

  有在校大学生告诉21世纪经济报道记者,家长曾接到AI伪造学生声音的诈骗电话。

  其实,OpenAI去年所发布“可以说话”的ChatGPT版本,长期以来一直为各种企业提供根据配音演员的录音所建立的声音,并没有发布从短视频中复制声音的技术。 OpenAI产品经理杰夫·哈里斯(Jeff Harris)表示,以这种方式复制任何声音的能力是有潜在风险的。

  2024年2月,美国曾发生利用AI生成语音影响选民投票事件。据了解,在大选之际,新罕布什尔州的部分选民接到一个神秘来电,电话中酷似美国总统拜登的声音号召他们不要在该州初选中投票。后经证实,该来电是 机器人 语音电话,其实不是拜登我录制。此事件在当时引起了不小的轰动,加剧了人们对竞选“深度伪造”的担忧。

  为加强语音引擎的安全构建,OpenAI在官方公告中称,公司正在与来自政府、媒体、娱乐、教育、民间社会等领域的美国和国际合作伙伴合作,以确保在建设进程中吸收他们的反馈。 不过,OpenAI与这些合作伙伴针对语音引擎的业务进展,需要原始讲话者的明确和知情同意,合作伙伴还务必清楚地向观众强调,他们听到的声音是由AI生成的。

  OpenAI将为AI生成的语音添加水印,以追踪并主动监控其使用方式,以确保其透明度和安全度。

  OpenAI官方表示:“我们目前不会广泛发布这项技术,仅小部分开放内测,希望语音引擎的这次内测既能强调其潜力,又能增强潜在问题的抵御能力,以应对越来越真切的生成模型造成的挑战。”

  另外,他们还将采取一系列安全措施,包含逐步淘汰基于语音的身份验证作为访问银行账户和其它敏感信息的安全措施;探索保护 人工智能 中个人声音使用的政策;教育公众了解 人工智能 技术的能力和局限性,包含坑骗性 人工智能 内容的存在性;加速开发和采用追踪视听内容来源的技术等。

手机扫码浏览该文章
 ● 相关商业动态
 ● 相关商业热点
娃哈哈】  【宗庆后】  【宗馥莉】  【农夫山泉】  【人工智能】  【消费行业】  【办公厅】  【金融服务】  【数字金融】  【金融机构】  【添翼赋能】  【大模型】  【科技股】  【超大盘】  【似乎远未结束】  【李彦宏】  【AI应用】  【2025】  【朋友圈出租】  【雷志勇】  【数字经济】  【确定性】  【摩根士丹利】  【DeepSeek】  【GPU】  【2024】  【新能源汽车】  【低空经济】  【人形机器人】  【飞行汽车】  【未来产业】  【生产力】  【AGI】  【高级别模仿】  【副教授】