斯坦福大学开发新型脑机接口用于语音合成
斯坦福大学的研究人员开发了一种脑机接口(BCI)系统,能够通过从患者大脑中捕获的信号,并利用循环神经网络(RNN)进行处理,合成语音。该原型系统能以每分钟62个单词的速度解码语音,比之前的BCI方法快3.4倍。
系统设计与实验
该系统在一篇发表于bioRxiv的论文中被描述。研究团队与一名因肌萎缩侧索硬化症(ALS)失去语言能力的患者合作,通过植入患者大脑的微电极捕获其试图说话时产生的神经活动信号。这些信号被传递给一个RNN,特别是门控循环单元(GRU)模型,该模型经过训练将神经信号解码为语音的音素。在50个单词的有限词汇量上,系统实现了9.1%的错误率,而在125,000个单词的词汇量上,错误率为23.8%。
研究意义
研究人员表示,该系统首次证明了可以从大词汇量中解码不受限制的句子,速度达到每分钟62个单词,远超现有技术为瘫痪患者提供的通信速度。尽管这是一个概念验证,表明从颅内记录中解码尝试的说话动作是一个有前途的方法,但它还不是一个完整的、临床可用的系统。
相关研究背景
使用深度学习模型解释人类大脑活动是一个活跃的研究领域。InfoQ曾报道过多个涉及辅助设备的BCI项目,其中许多使用植入大脑的传感器,因为这些传感器提供最佳的信号质量。例如,2019年Meta开发的系统允许用户通过想象自己说话来“打字”。此外,2021年乔治亚理工学院开发的系统允许用户通过想象活动来控制视频游戏。
技术细节
斯坦福系统在患者的腹侧前运动皮层和布罗卡区植入了四个微电极阵列。为了收集训练RNN的数据,患者每天被要求“无声地”说出几百个句子,这些句子产生的神经信号被微电极捕获。团队总共收集了10,850个句子。研究人员使用来自语音识别领域的“定制机器学习方法”训练RNN,使其输出音素序列。
系统评估
团队让患者“无声地”说出未用于训练的句子来评估系统,测试句子包括仅使用50个单词词汇量和125,000个单词词汇量的句子。研究人员还尝试在解码器中加入语言模型,将错误率从23.8%降低到17.4%,并缩短RNN训练和测试之间的时间,以消除神经活动的日常变化。他们的结论是,通过在语言建模和更稳健的解码技术上的进一步工作,系统可以看到“显著的性能提升”。
研究人员的回应
首席研究员Frank Willett在Twitter上发布了这项工作并回答了一些问题。当被问及RNN是否预测下一个要说的单词时,Willett回答说,语言模型只是输出到目前为止所有RNN输出的最佳解释。他还表示,团队将在“经过同行评审的期刊发表”后发布他们的代码和数据。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。