|
|
( o# P8 h$ g, i4 z4 b( A0 p {- q: Y1 z4 F
语音合成技术重大突破,只需 5 秒就能克隆别人的声音
& @' d- h7 E' ]& Y5 w# E. e- s* z; T! b
语音合成的出现已经有一段时间了,大家最熟悉的也许就是斯蒂芬·霍金的语音合成机器人了。这项技术这变得更加复杂和真实,近期康奈尔大学的研究团队完成了一个项目 — 只需要一段 5 秒的人声语音样本,他们的语音合成器就能生产完整的语音字符,甚至可以应用于其他语言。
/ i- X0 X2 E0 k( F& a' Q
% d+ {. @: M1 j9 i8 w
' u- f' T+ x) n
/ K, |3 A! y; z. p7 N" n* C9 ?% k4 o8 m" b
该团队开发了一种基于神经网络的文本到语音(TTS)合成系统,该系统能够生成许多不同说话者的语音音频,包括那些在人工智能训练期间没有囊括的语言。他们的系统由三个独立训练的组件组成:7 d* W' w# t3 u# c4 P3 E
3 |1 r, N0 v6 E4 J6 c4 Z# ?
说话人编码器网络,使用来自数千名没有抄本的说话人的有噪语音的独立数据集进行说话人验证任务的训练,从来自目标说话人的几秒钟的样本语音生成固定维度的嵌入向量。
/ @: h, O# f+ }( B基于 Taco tron 2 的序列-序列合成网络,它根据说话人嵌入的条件,从文本生成 MEL 语谱图。 d4 _# G# H; g7 i3 H" h* H
基于自回归 WaveNet 的声码器,其将 MEL 谱图转换为时域波形样本序列。
" H6 @$ ?, V# a1 Z8 N, e
. Y- `1 u- d/ K# ~3 U( ^
L o) Z* X; `! k原 Youtube 连接:https://youtu.be/0sR1rU3gLzQ% E) `. B, v2 p* a2 |
E4 z" L* f6 J" h% E该语音合成器的核心技术是谷歌的 Taco tron 端到端语音合成,结合了神经声码器技术,以生成语调和细微差别。这项技术经过了数千个语音样本进行训练,但尚不清楚生成合成语音需要多长时间 - 例如,它接近实时,或者需要大量的计算资源和时间。
, M1 K- d9 t; _7 z7 y2 t6 k! d' J- e1 {& B1 E& D
但它的结果真的非常惊人,它甚至还能够进行跨语言的语音克隆,还能生成非母语语音,甚至在不同程度的口音控制下的语气.... 总而言之,只需要一段 5 秒的音频样本,这个语音 AI 完成可以模拟一个人的说话方式。
. U+ Q' f8 l3 E9 k# f
/ R2 `' u- l8 e& H$ x4 Q感兴趣的小伙伴可以在官方页面查看该语音合成系统的效果:( e, h0 `3 B3 @7 X a' A# b
p) D* W3 o& |7 O `, }6 i" b
https://google.github.io/tacotro ... speaker_adaptation/ R8 w: o! Y; m' u; ^1 ]
5 \1 R. f6 L$ o, {% G令人好奇的是,这项技术是否可以应用到唱歌上? |
|