华盛顿大学的研究人员已经创建了一个将音频剪辑转换成与演讲者对口型的视频的系统。为了使这个系统工作,需要分析大约14个小时的现场演讲视频- 研究人员希望能够显着减少这个数字,也许减少至一个小时。随后他们利用神经网络进行改进。 当系统被提供包括演讲人员的“目标视频”(他们可以在其中谈论任何东西)时,连同他们的音频文件说出所需的单词,它将两者组合在一起。它可以通过放弃视频的原始音频,将其替换为所需的音频,并将计算机模拟版本的演讲者的口型加入到视频中。最终的结果是,人们听到他们说出所需要的话,而且看起来也是这样。原文链接