Meta Presenta TRIBE v2: Un Modelo Avanzado de Codificación Cerebral para Predecir Respuestas fMRI

El equipo FAIR de Meta ha lanzado TRIBE v2, un modelo tri-modal que predice respuestas fMRI al integrar estímulos de video, audio y texto, mejorando nuestra comprensión del funcionamiento cerebral.

5 min readTecnología

El campo de la neurociencia se ha centrado tradicionalmente en aislar funciones cognitivas en áreas específicas del cerebro, lo que ha llevado a una comprensión fragmentada de cómo el cerebro procesa información multisensorial. Para abordar este desafío, el equipo FAIR de Meta ha desarrollado TRIBE v2, un modelo de fundación tri-modal que alinea las representaciones de IA con la actividad cerebral humana, permitiendo predicciones de alta resolución de respuestas fMRI a través de diversos estímulos.

TRIBE v2 emplea una arquitectura sofisticada que incluye tres modelos de fundación congelados para la extracción de características: LLaMA 3.2 para texto, V-JEPA2 para video y Wav2Vec-BERT 2.0 para audio. Estos modelos procesan las entradas para crear una serie temporal multimodal que es analizada por un codificador Transformer. Este enfoque innovador permite predicciones específicas del sujeto sobre la actividad cerebral, proyectando salidas en estructuras corticales y subcorticales.

El modelo fue entrenado en extensos conjuntos de datos de fMRI, demostrando un aumento significativo en la precisión predictiva a medida que crece el volumen de datos. Notablemente, TRIBE v2 sobresale en la generalización cero-shot, prediciendo respuestas para nuevos sujetos sin entrenamiento adicional. También facilita la experimentación in-silico, replicando áreas funcionales clave en el cerebro a través de simulaciones virtuales, avanzando así nuestra comprensión de las redes neuronales.

Tecnología