跳到正文

Meta 新 AI 模型可预测人脑对图像、声音和语音的反应

Meta 的 TRIBE v2 基于 720 名受试者、逾 1,000 小时 fMRI 数据训练,可预测大脑对图像、声音和语言刺激的反应。测试中,它与群体平均脑反应的相关性往往高于单个受试者扫描。

功思 AI 编辑部

约 3 分钟读完

Meta 新 AI 模型可预测人脑对图像、声音和语音的反应

Meta 推出的一款新 AI 模型可以预测人脑对图像、声音和语音的反应。在测试中,它对典型脑反应的匹配度往往高于任何单个受试者的扫描结果。

脑科学研究每进行一项新实验都需要重新采集数据,这让神经科学研究进展缓慢且成本高昂。Meta FAIR 实验室的 AI 研究人员希望用一种预测脑活动而非直接测量脑活动的 AI 模型,彻底绕过这一瓶颈。

根据随附论文,该模型名为 TRIBE v2,基于 720 名受试者逾 1,000 小时的 fMRI 数据训练而成。功能性磁共振成像(fMRI)通过追踪血流和血氧水平变化,间接测量脑活动。TRIBE v2 利用这些数据,旨在预测大脑对任何视觉、听觉或语言类刺激的反应。

三种 Meta 模型负责预处理

TRIBE v2 接收三类输入:视频、音频和文本。每一路输入都会先经过一个预训练的 Meta AI 模型:文本对应 Llama 3.2,音频对应 Wav2Vec-Bert-2.0,视频对应 Video-JEPA-2。这些模型会把原始数据转换为嵌入表示,捕捉图像中可见的内容、声音中可听到的内容,以及句子中可读出的内容。

随后,一个 Transformer 会把这三种表示联合处理,识别在不同刺激、任务和人群之间都成立的模式。最后,一个个体专属层会把输出转换为包含 70,000 个体素的脑图,而体素正是构成 fMRI 扫描的三维像素。

预测结果比实际脑扫描噪声更少

单个 fMRI 图像天生噪声很大。心跳、头部移动以及设备伪影都会扭曲信号。为了弄清大脑对某一刺激通常会如何反应,研究人员必须把大量扫描结果取平均。

TRIBE v2 通过直接预测经过校正的平均反应,绕开了这一问题。在测试中,这一预测与真实群体平均反应的相关性强于大多数单个受试者的扫描结果。该效应在 Human Connectome Project 数据集中最为明显;该数据集使用 7 Tesla 扫描仪采集,信号质量远高于标准的 3 Tesla 机器。在这个数据集上,TRIBE v2 与群体反应的相关性达到单个受试者中位数的两倍。

论文称,与优化过的线性模型这一此前此类预测的主流方法相比,TRIBE v2 在所有数据集上都显示出显著提升。更早的 TRIBE v1 只基于 4 名受试者训练,只能预测 1,000 个体素而不是 70,000 个,但它仍在 Algonauts 2025 比赛中击败了另外 263 支队伍并获得冠军。

TRIBE v2 的预测准确率会随着训练数据量增加而稳定提升,而且尚未出现平台期。这表明,随着 fMRI 数据库继续增长,该模型可能还会继续改进。这一趋势呼应了大语言模型的规模定律,即更多数据会稳定带来更好的表现。

数十年的实验室工作在计算机上重现

研究人员用 TRIBE v2 测试了电影、播客等日常刺激,这些场景会让多种感官输入同时作用于大脑;他们也测试了经典神经科学中常见的单一刺激。在这些受控设置中,屏幕上可能会闪现一张图像 1 秒,以测量特定脑区的反应。团队采用了 Individual Brain Charting 数据集中的测试协议,这是一组已经确立的神经科学实验,并让模型预测哪些脑区应当被激活。

参与讨论

正在确认登录状态…