Le domaine des neurosciences s'est traditionnellement concentré sur l'isolement des fonctions cognitives dans des zones cérébrales spécifiques, ce qui a conduit à une compréhension fragmentée de la manière dont le cerveau traite l'information multisensorielle. Pour relever ce défi, l'équipe FAIR de Meta a développé TRIBE v2, un modèle de fond tri-modal qui aligne les représentations de l'IA avec l'activité cérébrale humaine, permettant des prédictions de haute résolution des réponses fMRI à travers divers stimuli.
TRIBE v2 utilise une architecture sophistiquée comprenant trois modèles de fond gelés pour l'extraction de caractéristiques : LLaMA 3.2 pour le texte, V-JEPA2 pour la vidéo et Wav2Vec-BERT 2.0 pour l'audio. Ces modèles traitent les entrées pour créer une série temporelle multimodale analysée par un encodeur Transformer. Cette approche innovante permet des prédictions spécifiques aux sujets de l'activité cérébrale, projetant les sorties sur des structures corticales et sous-corticales.
Le modèle a été entraîné sur d'importants ensembles de données fMRI, montrant une augmentation significative de la précision prédictive à mesure que le volume de données augmente. Notamment, TRIBE v2 excelle dans la généralisation zéro-shot, prédisant avec précision les réponses pour de nouveaux sujets sans formation supplémentaire. Il facilite également l'expérimentation in-silico, répliquant des zones fonctionnelles clés du cerveau à travers des simulations virtuelles, faisant ainsi progresser notre compréhension des réseaux neuronaux.
