Aguilera, AnaAnaAguileraFacundo Cortés MartínezDiego Mellado2025-08-252025-08-252023-01-0110.1109/chilecon60335.2023.104186722-s2.0-85189554627https://cris-uv-2.scimago.es/handle/123456789/6135Multimodal emotion recognition involves identifying human emotions in specific situations using artificial intelligence across multiple modalities. MERDWild, a multimodal emotion recognition dataset, addresses the challenge of unifying, cleaning, and transforming three datasets collected in uncontrolled environments with the aim of integrating and standardizing a database that encompasses three modalities: facial images, audio, and text. A methodology is presented that combines information from these modalities, utilizing �in-the-wild� datasets including AFEW, AffWild2, and MELD. MERDWild consists of 15 873 audio samples, 905 281 facial images, and 15 321 sentences, all of them considered usable quality data. The project outlines the entire process of data cleaning, transformation, normalization, and quality control, resulting in a unified structure for recognizing seven emotions.enacceso restringidoArtificial IntelligenceComputer Networks And CommunicationsHardware And ArchitectureInformation SystemsInformation Systems And ManagementEnergy Engineering And Power TechnologyElectrical And Electronic EngineeringControl And OptimizationMultimodal Emotion Recognition Dataset In The Wild (Merdwild)conference paper