IMF

Currículum · actualizado en septiembre de 2026

Iván Martín-Fernández

Doctor en Ingeniería de Sistemas Electrónicos por la Universidad Politécnica de Madrid. Investigo cómo los modelos multimodales de gran escala pueden dar cuenta de la percepción subjetiva del contenido audiovisual.

Predoctoral de Inicio a la Carrera Docente · Departamento de Ingeniería Electrónica, ETSIT — Universidad Politécnica de Madrid · Grupo de Tecnología del Habla y Aprendizaje Automático (GTHAU) · ivan.martinf@upm.es · ORCID 0009-0004-2769-9752 · imartinf.github.io

English version

  • Doctorado Sobresaliente cum laude con mención internacional · junio de 2026
  • Publicaciones 7 artículos publicados · 4 en Q1 del JCR, los cuatro en el primer 25% · primer o segundo autor en 6
  • Congresos 17 contribuciones internacionales, 15 como primer o segundo autor · 2 en un congreso CORE A* · 5 más en innovación docente
  • Docencia 147 h en cuatro asignaturas de Grado y Máster · 2 proyectos de innovación educativa
  • Dirección de trabajos 2 TFG y 1 TFM defendidos · uno de ellos con Matrícula de Honor
  • Gestión y evaluación Comité organizador de MediaEval desde 2024, con cinco instituciones europeas · revisor en npj Artificial Intelligence · estancia de tres meses en Bucarest

Perfil01

Mi investigación estudia la percepción subjetiva del contenido multimedia: qué recordamos de un vídeo, cómo nos persuade un anuncio y qué impresión nos deja una persona a la que vemos hablar. Modelo esos fenómenos adaptando transformers y modelos de lenguaje multimodales con técnicas eficientes en parámetros, y los contrasto con señales biológicas —en concreto electroencefalografía— para acercar la predicción al mecanismo.

Formación02

Doctorado en Ingeniería de Sistemas Electrónicos

Universidad Politécnica de Madrid, junio de 2026. Sobresaliente cum laude con mención internacional. Tesis: Modeling Subjective Perception in Multimedia with Large-Scale Multimodal Models. Directores: Fernando Fernández-Martínez y Manuel Gil-Martín.

Máster Universitario en Ingeniería de Telecomunicación

Universidad Politécnica de Madrid, 2025. Nota media 9,04 — percentil 96,49. Matrícula de Honor en el Trabajo Fin de Máster. Premio ETSIT 2024 al mejor TFM del MUIT.

Máster Universitario en Teoría de la Señal y Comunicaciones

Universidad Politécnica de Madrid, 2024. Nota media 9,62 — percentil 93,75. Matrícula de Honor en 27 ECTS. Premio ETSIT-Empresa 2024 al mejor expediente académico.

Graduado en Ingeniería de Tecnologías y Servicios de Telecomunicación

Universidad Politécnica de Madrid, 2021. Nota media 8,03 — percentil 93,91. Matrícula de Honor en 31,5 ECTS. Premio ETSIT-Empresa 2021 al mejor expediente académico del itinerario de Sistemas Audiovisuales.

Trayectoria03

Desde Puesto Entidad
2026 Predoctoral de Inicio a la Carrera Docente Dpto. de Ingeniería Electrónica, ETSIT-UPM
2023–2026 Investigador predoctoral — Ayuda del Programa Propio UPM GTHAU, ETSIT-UPM
2024 Estancia de investigación (jul.–oct.) AI Multimedia Lab, Universitatea Politehnica din București
2020–2021 Beca de Colaboración del Ministerio de Educación GTHAU, ETSIT-UPM

Docencia04

147 horas impartidas en titulaciones oficiales de Grado y Máster de la ETSIT-UPM entre los cursos 2023-24 y 2025-26.

Asignatura Titulación Horas
Sistemas Digitales II Grado en Ingeniería de Tecnologías y Servicios de Telecomunicación 99
Proyectos en Ingeniería de Datos y Sistemas Grado en Ingeniería de Sistemas de Datos 21
Neurodevices Máster Universitario en Neurotecnología 18
Inteligencia en Sistemas Electrónicos Máster Universitario en Ingeniería de Sistemas Electrónicos 9

Participo además en dos proyectos de innovación educativa del departamento —DEMOSEI (2024) y DIRASEI (2023)— y firmo cinco publicaciones docentes derivadas de ellos, presentadas en END, ICERI y GELS.

Dirección de trabajos fin de estudios05

Año Trabajo Calificación
2026 TFM · Modelos de aprendizaje profundo para la predicción del recuerdo de extractos de películas a partir de señales cerebrales — Jaime León Ardyla 9,5
2026 TFG · Modelos de clasificación basados en EEG para la predicción del recuerdo en tareas de memoria audiovisual — Cristina Ruiz-Poveda Domínguez 9,5
2025 TFG · Modelos de lenguaje multimodales para la predicción de la memorabilidad en vídeos — David Luna García 10 — Matrícula de Honor

Del TFM de 2026 salió una contribución al MediaEval 2026 Workshop firmada con el estudiante.

Publicaciones en revista06

Siete artículos publicados, seis de ellos como primer o segundo autor. Cuatro están en el primer cuartil del JCR, los cuatro dentro del 25% superior de su categoría. Dos manuscritos más en revisión.

Principled Evaluation of Multi-Label Persuasion in Advertisements with Large Vision-Language Models

Iván Martín-Fernández, M. G. Constantin, B. Ionescu, M. Gil-Martín, F. Fernández-Martínez. ACM Transactions on Multimedia Computing, Communications and Applications, 2026. JCR 6.0 — Q1, primer 25%. Primer autor y autor de correspondencia. 10.1145/3788874

A Review of Computational Memorability: A Benchmark Framework

M. G. Constantin, C.-H. Demarty, C. Fosco, S. Halder, G. Healy, B. Ionescu, S. V. Luncanu, Iván Martín-Fernández et al. International Journal of Computer Vision 134(6):298, 2026. JCR 9.3 — Q1, primer 25%. 10.1007/s11263-026-02880-6

A Dataset with Bilingual TV Commands for Silent Speech Interfaces Using Electroencephalographic Signals

M. Lobo-Alonso, Iván Martín-Fernández, I. Oropesa, R. Barra-Chicote, G. Kontaxakis, R. San-Segundo. Scientific Data, 2026. JCR 6.9 — Q1, primer 25%. Segundo autor. 10.1038/s41597-026-07745-8

A comprehensive study on contrastive pre-training and fine tuning of vision and text transformers for video memorability prediction

Iván Martín-Fernández, S. Esteban-Romero, M. Gil-Martín, F. Fernández-Martínez. Multimedia Tools and Applications 85(1):30, 2026. JCR 3.5 — Q2. Primer autor y autor de correspondencia. 10.1007/s11042-026-21260-3

Parameter-Efficient Adaptation of Large Vision–Language Models for Video Memorability Prediction

Iván Martín-Fernández, S. Esteban-Romero, F. Fernández-Martínez, M. Gil-Martín. Sensors 25(6):1661, 2025. JCR 3.5 — Q2. Primer autor y autor de correspondencia. 10.3390/s25061661

Synthesizing Olfactory Understanding: Multimodal Language Models for Image–Text Smell Matching

S. Esteban-Romero, Iván Martín-Fernández, M. Gil-Martín, F. Fernández-Martínez. Symmetry 17(8):1349, 2025. JCR 2.2 — Q2. Segundo autor. 10.3390/sym17081349

Emotion recognition from body movement through interpretable motion-aware sequential modeling

S. Esteban-Romero, Iván Martín-Fernández, R. San-Segundo, M. Gil-Martín, F. Fernández-Martínez. Frontiers in Artificial Intelligence 9:1897208, 2026. JCR 6.7 — Q1, top 25%. Segundo autor. 10.3389/frai.2026.1897208

En revisión

Optimizing Video Transformers for Isolated Sign Language Recognition — Computer Vision and Image Understanding (Elsevier), enviado en junio de 2026.

Evaluation of Transformer-Based EEG Image Classification Under Subject-Dependent and Subject-Independent Protocols — Applied Soft Computing (Elsevier), enviado en septiembre de 2026.

Congresos07

Diecisiete contribuciones en congresos internacionales, quince de ellas como primer o segundo autor y dos en un congreso CORE A*. Selección:

Año Congreso Contribución
2026 MediaEval 2026 Workshop, Ámsterdam Tres artículos, uno de ellos el overview de la tarea que coorganizo
2026 MultiMedia Modeling, Praga Explicabilidad de la atención en modelos visión-lenguaje adaptados a persuasión
2026 ICAART Selección y normalización de landmarks temporales para reconocimiento de lengua de signos
2025 CBMI, Dublín Tamaño, arquitectura e hiperparámetros en la adaptación de modelos visión-lenguaje
2025 MediaEval 2025 Workshop, Dublín Dos artículos, uno de ellos el overview de la tarea
2024 MuSe @ ACM Multimedia, Melbourne Dos artículos (CORE A*) sobre percepción social multimodal
2024 Odyssey, Quebec Modelo multimodal audio-lenguaje para reconocimiento de emoción en habla
2024 IberLEF @ SEPLN, Valladolid Adaptación eficiente de LLM mono y multimodales para emoción en habla
2023 CBMI, Orléans Predicción de memorabilidad a partir de rasgos semánticos y visuales conjuntos

Proyectos, gestión y evaluación08

  • TrustBoost PID2023-150584OB-C21 · Flexibilidad y conformidad en IA conversacional · 2024–2027
  • GOMINOLA PID2020-118112RB-C22 · Agentes conversacionales socio-afectivos · 2021–2025
  • MediaEval Comité organizador de la tarea Predicting Movie and Commercial Memorability, con cinco instituciones europeas · desde 2024
  • Revisión Revisor para npj Artificial Intelligence

Firmo como primer autor los artículos de overview de la tarea en las ediciones de 2025 y 2026, que fijan el marco de evaluación con el que trabajan los equipos participantes.

Divulgación y transferencia09

En septiembre de 2026 impartí un taller de dos horas sobre inteligencia artificial generativa para los departamentos de comunicación de los dieciocho clubes de la Liga Endesa (ACB), centrado en usar estas herramientas sin renunciar al criterio editorial ni a la identidad de cada club.