💬 Traitement du langage naturel (NLP)
Recherche sur la classification hiérarchique de textes, les grands modèles de langage, les systèmes de dialogue et les modèles informatiques du langage dans le cerveau.
Le traitement du langage naturel (NLP) est le domaine de l'intelligence artificielle qui s'intéresse à l'interaction entre les ordinateurs et le langage humain. Mes recherches en NLP couvrent un éventail de sujets, allant du développement de nouvelles méthodes de classification pour les espaces d'étiquettes structurés, à l'exploration des grands modèles de langage pour les applications industrielles, jusqu'à la modélisation informatique de la manière dont le cerveau humain traite le sens du langage.
Classification hiérarchique multi-label
Développement de méthodes de classification hiérarchique multi-dimensionnelle (MHC) pour les tâches de NLP. Dans la MHC, chaque instance est affectée simultanément à une catégorie de chacun des multiples arbres de classification hiérarchique. Il s'agit d'un cadre plus général que la classification multi-label ou hiérarchique standard, qui apparaît naturellement dans les systèmes de dialogue parlé, la catégorisation de produits et le codage médical.
La recherche aborde la caractérisation des problèmes de MHC, le développement de stratégies de résolution dédiées (approches locales vs globales, modélisation de la corrélation des étiquettes) et la conception de mesures de performance appropriées pour évaluer les systèmes de MHC.
Grands modèles de langage (LLM)
Systèmes de dialogue & Assistants virtuels
Cerveau & Langage
Chaire ENIA en IA & Technologie du Langage
Publications sélectionnées
- Santana R (2017). Reproducing and learning new algebraic operations on word embeddings using genetic programming. GECCO 2017.
- Santana R (2021). Semantic Composition of Word-Embeddings with Genetic Programming. GECCO 2021.
- Magalhães RPL, Santana R and Pozo A (2019). An empirical comparison of distance/similarity measures for Natural Language Processing. BRACIS 2019.
- Montenegro M, Marafioti A, Santana R, Alcaide JB, Bolaños M and Cuayahuitl H (2019). Data generation approaches for topic classification in multilingual spoken dialog system. INTERSPEECH 2019.
- Montenegro M, Santana R, Bolaños M and Cuayahuitl H (2020). Transfer learning in hierarchical dialogue topic classification with neural networks. IberSPEECH 2020.
- Montenegro M, Santana R, Bolaños M and Cuayahuitl H (2021). Analysis of the sensitivity of the End-Of-Turn Detection task to errors generated by the Automatic Speech Recognition module. INTERSPEECH 2021.
- Roman I, Santana R, Mendiburu A and Lozano JA (2019). Sentiment analysis with genetically evolved Gaussian kernels. GECCO 2019.
- Roman I, Santana R, Mendiburu A and Lozano JA (2021). Evolution of Gaussian Process kernels for machine translation post-editing effort estimation. Applied Soft Computing.
- Mei N, Carreiras M, Santana R and Pylkkänen L (2019). How the brain encodes meaning: Comparing word embedding and computer vision models to predict fMRI data. NeurIPS Workshop.
- Santana R (2022). An embedding space for SARS-CoV-2 epitope-based vaccines. European Journal of Clinical Investigation.
- Romero M and Santana R (2022). Creating wordless meaning in word-embedding. En préparation.