Desarrollan repositorio de voz para la preservación de la lengua Yuhmu (Otomí)

¨*Con el objetivo de contribuir a la preservación y documentación de las lenguas indígenas en México, un equipo multidisciplinario de investigadores ha presentado el proyecto ZETZOHO-YUHMU. SPEECH DATASET, un repositorio de datos especializado en la variante Yuhmu del idioma Otomí.
Educativas16 de julio de 2026Braulio PaisanoBraulio Paisano

image
Ciudad de México, 16 de julio de 2026 – Con el objetivo de contribuir a la preservación y documentación de las lenguas indígenas en México, un equipo multidisciplinario de investigadores ha presentado el proyecto ZETZOHO-YUHMU. SPEECH DATASET, un repositorio de datos especializado en la variante Yuhmu del idioma Otomí.

Este conjunto de datos fue desarrollado por los catedráticos e investigadores Arturo Olvera López e Iván Olmos Pineda, adscritos a la Facultad de Ciencias de la Computación. La iniciativa surge ante la necesidad de generar herramientas para lenguas con pocos recursos tecnológicos y en riesgo de desaparición.

Un apoyo para la inteligencia artificial y la educación
El repositorio está diseñado principalmente para impulsar la investigación en áreas de reconocimiento automático del habla (ASR) y el análisis de la pronunciación. Su utilidad técnica es amplia, ya que proporciona una base sólida para:

Desarrollar sistemas de retroalimentación en procesos de aprendizaje de idiomas.

Facilitar estudios en escenarios donde los datos lingüísticos son limitados.

Fortalecer la documentación digital de las lenguas originarias del país.

Colaboración interinstitucional
El proyecto es el resultado de un esfuerzo conjunto en el que participan también Eric Ramos-Aguilar, Ricardo Ramos-Aguilar y Daniel Sánchez-Ruiz, investigadores de la Unidad Profesional Interdisciplinaria de Ingeniería del Instituto Politécnico Nacional (UPIIT-IPN), campus Tlaxcala.

Al respecto, el investigador Arturo Olvera López destacó la importancia de este lanzamiento: “El repositorio es de libre acceso y puede ser de mucha utilidad para la comunidad que hace investigación relacionada al procesamiento del lenguaje natural considerando lenguas indígenas en México que actualmente están poco representadas respecto a la cantidad de personas hablantes de la lengua”.

El conjunto de datos ya se encuentra disponible para consulta pública y uso académico, marcando un paso significativo en la integración de las lenguas indígenas en las tecnologías del lenguaje natural.

Ranking