您的位置:首页 > IT热点资讯

妥妥媲美真人!火山语音发布超自然对话语音合成技术_真人发声语音合成

发布时间:2022-09-16 14:27:31  来源:互联网     背景:

(原标题:妥妥媲美真人!火山语音发布超自然对话语音合成技术)

  •  

新号怎样申请微信号

NEPCON电子展

数星星盼月亮,万千杰迷苦等6年,不久之前终于等到周董发新专辑啦!一经上线引爆全网讨论,就像这样:

正当大家沉浸在对那时青葱岁月的美好追忆时,发来上述这段音频的小伙伴表示:这段对话居然是语音合成的!

提到“语音合成”,你脑海中可能会出现这样的种种:

真人发声语音合成

  • 导航中种类丰富但语气机械的“前方路口左转”
  • 接电话时,对面笨拙无感情的“您好,这里是xx信用卡中心”
  • 视频网站上,十个解说视频九个声音相同,看到就想赶快划走的“注意看,这个男人叫小帅”…...

而如今直接颠覆了许多人的刻板印象,语音合成技术已经能做到像上面那段音频一样完美自然的效果了。这段音频的发布者,火山语音,字节跳动 AI Lab Speech & Audio 智能语音与音频团队,为了更好地向大众解密里面的技术亮点,又提供了两段音频:

这几句输入的文本完全相同,即 “南方菜系偏爱蘸料,例如我第一次去上海才知道烧烤里的蔬菜也需要配蘸料” ,但合成的音频效果却有明显差异,即第二段音频来源于火山语音团队本次上新的超自然对话语音合成技术。

回想一下人在日常表达时的状态,大脑处理信息是需要思考时间的。体现到语言上,人就会不由自主的出现一些犹豫、拖音、倒装,甚至是说了一半改口、结巴重复的情况,也会刻意加重读音强调想表达的重点信息。这就带来了大量难以观测的细微表达。这些现象在传统的TTS中难以被捕捉还原。而这些细微之处的完美复现正是让声音真假难辨的奥妙之源,也是上述音频的奥秘所在。

具体来说,火山语音团队最新发布的超自然对话语音合成技术相较传统TTS更加真实自然,即语气词、吸气声、犹豫时的停顿以及字音拖长等细节统统被完美复现,而且只需常规音库1/4数据,就可完美还原真人说话细微的韵律特点、发音口癖,让合成效果更加真实。有专业评测结果显示,火山语音的这项新技术与真人录音对比基本没有差距,难以被评测者分辨出来。此外这项技术目前已在视频配音、电话客服等多个场景投入应用,近日即将上线火山引擎语音技术官网对外露出。

这么厉害的技术,究竟是怎么办到的?

据介绍,上述这些在实际交流中经常出现的倒吸气、吞音、思考时不由自主的拖长字音、低笑等表现被称为副语言现象(paralanguage),尽管这是人脑思考、表达过程中最真实的表现,但由于传统的语音合成技术框架无法对分布稀疏的副语言现象进行有效建模,所以在说话时的韵律还原度表现有限、过于“正确”。

基于上述难点,火山语音超自然语音合成技术分别从文本和语音建模两个层面进行突破,具体来说:

  • 在文本层面,火山语音采用了生成式的风格迁移模型,模仿真人说话的方式对文本进行可控的口语化转写,让文本更好地拥抱口语化,避免最终效果太过书面。
  • 在语音层面,团队则是通过文本分析模型的突破,在TTS的输入侧额外增加了副语言预测,模仿真人的发音特点来实现自然自发的语音效果。

真人发声语音合成

值得一提的是,团队通过使用无监督特征的TTS建模方案,有效提高了模型的稳定性与表现力,仅仅使用常规音库1/4的数据规模,就可以实现十分自然多变的韵律效果,很赞吧?

致力文本口语化 让“拟真人表达”跃然纸上

文本作为语音合成技术的输入,其风格是否贴近真人的表达方式,是合成效果提升的第一步;但受限于根深蒂固的书写用语习惯,大多数合成前的文本并不够自然,或者需要投入大量精力不断调整,费时费力。为了解决此类问题,火山语音团队采用了两阶段方案并取得了不错的效果:

  • 阶段一:采用自监督方法,使用伪数据对口语化模型进行预训练,降低了数据量的需求;同时在模型中引入了指针网络结构,增强了文本可控性。
  • 阶段二:利用少量优质的人工标注数据,对预训练好的口语化模型进行微调,最终实现可控的、自然的口语化文本效果。

为了更好地还原真人,区别于传统的语音合成技术,火山语音在副语言建模和韵律多样性上也分别进行了深入研究。在副语言建模方面,团队推出的合成技术实现了声学模型对自然表达中出现的吸气、笑声、犹豫、修正等多种副语言现象建模,并且结合文本的语义信息自动插入副语言现象。在插入过程中同时考虑合理性与随机性,表现更加自然真实。

副语言建模+韵律多样性可圈可点 语音真实感全面升级

“在韵律多样化的探究中,我们结合无监督表征学习技术,自主研发了高表现力的声学模型框架,通过发音、韵律、音色解耦等方式,不但降低了数据量的需求,实现对出现频率极低发音现象的高效建模;同时使用无监督表征特征并结合音素级别的基频、能量信息等,实现了韵律的自然多变,促成高质量对话语音生成。”火山语音团队总结道。

火山语音,字节跳动AI Lab Speech&Audio智能语音与音频团队,长期以来面向抖音、剪映、番茄小说、飞书等业务提供领先的AI语音技术能力及全栈语音产品解决方案,并通过火山引擎向外部企业开放技术服务。


返回网站首页

本文评论
华晨宇全新唱作专辑《希忘 Hope》在网易云音乐开售 35分钟销量破30万张
12 月 20 日消息,华晨宇全新唱作专辑《希忘 Hope》 已于网易云音乐正式上线。据悉,《希忘 Hope》 是华晨宇的第五张唱作专辑,包含在 2021 年火星演唱会上演唱的六首新歌、《小...
日期:12-21
华为Mate20在国内发布 余承东称手机未来会更加智能化_余承东手持华为Mate 50 Pro自夸:Mate系列设计每一代都是经典
华为Mate 50将在下周二正式发布,自从官方公布发布时间后,新机的热度就一直居高不下,各种爆料层出不穷,让大家非常期待。今早,余承东也手持Mate 50 Pro发文自夸”,称Mate系列的外观...
日期:08-30
RTX 4090现身Geekbench:跑分达RTX 3090 Ti 1.6倍_rtx3080显卡跑分
近日,NVIDIA最新的RTX 4090显卡已经正式出现在了跑分平台Geekbench,其CUDA跑分毫不意外的超越了此前的天花板”RTX 3090 Ti。根据目前放出的信息,在Geekbench CUDA跑分测试项目...
日期:10-04
蓝牙耳机哪个品牌好?实体店主盘点平价好用的蓝牙耳机「蓝牙耳机哪个牌子好平价品牌排行榜」
蓝牙耳机哪个品牌好一直困扰着很多新手消费者,作为实体数码店主,老郑也经常会被问到这个问题,大家都想买到平价好用的蓝牙耳机,为此我仔细对比了几十款平价蓝牙耳机,经过各方面的...
日期:08-16
苹果5W充电头售价145元 现官网已售罄 难道终于要下场了?「苹果25w充电头」
国内网友对苹果长期以来在快充上止步不前的态度很是调侃,直接称苹果为“五福一安”,而“五福一安”最早出现于2009年6月发布的iPhone 3GS包装盒,至今为止已经出场超过13年了。...
日期:08-17
特斯拉回应Model Y自燃致多辆豪车被烧 保留追究造谣者法律责任权利_特斯拉新款是否可能发生自燃
  来源:@时间视频保值率高的suvrealmegtneo2发布主机上的hdmi是什么接口  11月24日,上海一车主反映,刚买的奔驰大G送到汽车装潢店保养,因发生火灾被烧没了。该车主称,十几台...
日期:12-01
华为Mate 50 Pro海外版发布:有两大变化!比国内贵了2500多_华为mate20海外版区别
日前,华为推出了Mate 50 Pro海外版,目前已经在海外市场发布。其中,8+256GB版定价1299欧元(约合人民币9274元),比国行版的6799元售价贵了2540元左右!而8+512GB版定价1399欧元(约合人...
日期:10-03
Redmi K50版发布:骁龙8+芯片 1亿像素 2999起_红米k50像素
Redmi K50至尊版手机在今晚正式发布,新机也是Redmi旗下首款采用骁龙8+芯片的旗舰机,而售价方面:8+128G为2999元;8+256G为3299元,12+256G为3599元,12+512G为3999元。而随后还推出了...
日期:08-13
警惕!你的身份证可能绑定了多张电话卡!赶快自查…「电话卡重新绑定身份证」
警惕!你的身份证可能绑定了多张电话卡!赶快自查…先来问大家一个问题:你知道自己的名下有几张电话卡吗?1张、2张?微软chrome版edge下载甚至连你自己都不清楚?不查不知道,一查吓一跳...
日期:07-16
台积电7nm产能_台积电5nm工艺季度营收超过7nm 成大营收来源
10月15日消息,据国外媒体报道,当前全球最大的晶圆代工商台积电,已经发布了他们的第三三季度的财报,营收202.3亿美元,首次超过200亿美元,同比大增35.9%,创下新高,92.68亿美元的净利润...
日期:10-20
电子烟新规定_这类电子烟将全部下架!电子烟国标即将实施
  《电子烟强制性国家标准》将于今年10月1日起实施。近期,符合国标要求的电子烟产品陆续在各地上市销售。这意味着电子烟产业法治化、规范化发展步入新阶段。  在深圳福...
日期:09-16
或于9月26日发布  vivo折叠屏迭代机新发布时间确定?「vivo折叠屏概念机」
  按照此前的爆料,vivo折叠屏手机——vivo X Fold的迭代机型即将上市,并大概率会更名为vivo X Fold Plus。然而,有关这款手机的上市时间一直未得到确认。近日,手机中国了解...
日期:09-18
120英寸虚拟巨幕!华为首款智能观影眼镜Vision Glass开售:2999元
在华为12月初举办的冬季全场景新品发布会上,华为首款智能观影眼镜Vision Glass正式发布。该眼镜能在眼前投射出等效120英寸的虚拟巨幕,并支持0-500单眼近视调节,将于今日上午10...
日期:12-26
小米12S立减600元 24期免息 现仅3000出头「小米10 12期免息」
到了10月,不少的手机厂商促销力度都很大,而炙手可热的小米12S手机立减600元,现在到手只要3399元了,而且目前24期免息活动也是很人性的,强劲的性能配合MIUI 13不错的调校,用几年也...
日期:10-11
女子午睡1个小时右手瘫了!不是吓唬你!这些错误姿势越睡越伤身
女子午睡1个小时右手瘫了!不是吓唬你!这些错误姿势越睡越伤身中国睡眠研究会发布了《2022中国国民健康睡眠白皮书》,近一半人有午休习惯,其中,床和桌子是午休的最佳选择。近日,一...
日期:07-22
百度地图宣布切换为优先运用国产北斗系统进行定位_百度地图和北斗导航的关系
  IT之家9月30日消息,近日,百度地图发布了北斗卫星导航系统应用的最新进展,北斗卫星日定位量首次突破1000亿次。  百度地图今日宣布,正式切换为优先运用北斗系统进行定位,“...
日期:10-13
幻响推出小旺音响和电动口罩 坚持原创造爆款
幻响推出小旺音响和电动口罩坚持原创造爆款近日,幻响神州科技股份有限公司在北京举行发布会,CEO老张宣布推出18年狗年生肖系列产品——“幻响小旺”生肖音响,这也是幻响的第12...
日期:07-16
华为p40 pro 512g_满血复活!华为P40/P40 Pro内存升级来了:256G 559元
2月11日消息,今日,华为终端客户服务”微信公众号宣布,华为P40系列现已加入内存升级服务,机型包括华为P40、华为P40 Pro、华为P40 5G,三款机型从128G升级到256G优惠价均为559元。...
日期:09-26
华为5G智能机上架 支持双卡5G 超便宜「华为双卡5g手机」
日前,华为上架了一款5G智能新机,目前还支持双卡5G,作为华为旗下为数不多的5G手机有着很强的竞争力,在为数不多的5G华为手机范畴中也是最便宜的系列之一,引来了不少用户的青睐,随着...
日期:12-19
华为Mate50 Pro抢先上手!影像提升巨大「MATE50 PRO」
在华为Mate50系列发布会后,便有知情人士第一时间上手了华为Mate50 Pro这款产品,通过包装我们不难发现,华为Mate50 Pro的包装盒设计与老款保持一直,经典的家族式包装盒方案,通过烫...
日期:09-07