Brain2voice 2.0:高性能语音合成脑机接口

root 提交于 周二, 07/07/2026 - 06:47
脑机接口(BCI)通过直接从脑活动中解码预期语音,为因神经系统损伤导致的言语丧失提供了一种很有前景的解决方案。尽管近年来的BCI已经恢复了高准确率的基于文本的通信能力,但它们无法提供自然对话流所必需的即时语音输出。脑到语音BCI通过直接从神经信号中解码语音来弥补这一缺口。然而,即使是当前最先进(SOTA)的BCI合成语音,其可懂度仍不足以支持现实世界中的应用。我们提出了brain2voice 2.0,这是一种新的基于多模态Transformer的BCI解码器架构,能够从皮层内神经信号中实时合成高可懂度语音。Brain2voice 2.0基于连续声学目标、自定义分词的声学目标以及音素目标进行训练,从而利用它们在语音信息上的互补性。我们采用自监督和对抗式训练目标,以提升声学特征质量并改善合成语音的可懂度。在每个10 ms时间步上,该模型以因果方式输出用于实时语音合成的连续与分词化声学特征,以及时间对齐的音素预测(原始音素错误率:7%,可与最新的脑到文本模型相当)。我们在先前建立的皮层内脑到语音基准数据集(Wairagkar等,2025)上评估了这一新方法。未经训练的人类听者对brain2voice 2.0合成语音的转录词错误率为5.24%——与此前最先进结果(43.75%)相比,其可懂度提升了8倍。Brain2voice 2.0表明,从神经信号中实现高可懂度的实时语音合成是可行的,并且首次跨越了临床可行的面向瘫痪患者的脑到语音BCI所必需的可懂度阈值。

脑机接口(BCI)通过直接从脑活动中解码预期语音,为因神经系统损伤导致的言语丧失提供了一种很有前景的解决方案。尽管近期的BCI已实现高准确率的文本式交流恢复,但它们无法提供对自然对话流畅性至关重要的即时语音输出。脑到语音BCI通过直接从神经信号中解码语音来弥补这一缺口。然而,即使是当前最先进(SOTA)的BCI合成语音,其可懂度仍不足以支持现实世界中的实际应用。我们提出了brain2voice 2.0,这是一种新的基于多模态Transformer的BCI解码器架构,能够从皮层内神经信号中实时合成高可懂度语音。Brain2voice 2.0在连续的、定制词元化的声学目标以及音素目标上进行训练,从而利用它们在语音信息上的互补性。我们采用自监督和对抗式训练目标,以提升声学特征质量并改善合成语音的可懂度。在每个10 ms时间步,模型以因果方式输出用于实时语音合成的连续和词元化声学特征,以及时间对齐的音素预测(原始音素错误率:7%,可与最新的脑到文本模型相媲美)。我们在先前的皮层内脑到语音基准数据集(Wairagkar等,2025)上评估了这一新方法。未经训练的人类听者对brain2voice 2.0合成语音进行转录时,其词错误率为5.24%,与此前最先进结果(43.75%)相比,可懂度提升了8倍。Brain2voice 2.0表明,从神经信号实现高可懂度的实时语音合成是可行的,并且首次跨越了临床可行的面向瘫痪人群的脑到语音BCI所必需的可懂度门槛。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.06.30.735633v1?rss=1

🏷️ 脑机接口 语音合成 神经信号解码 多模态Transformer 实时通信