Académicos de la Facultad de Ciencias de la Computación desarrollaron ZETZOHO-YUHMU. SPEECH DATASET, un repositorio de datos de voz diseñado para apoyar la investigación y preservación de la lengua Yuhmu, una variante del otomí considerada de pocos recursos y en riesgo de extinción.
El proyecto es encabezado por los catedráticos e investigadores Arturo Olvera López e Iván Olmos Pineda, quienes buscan fortalecer el estudio de las lenguas indígenas mediante el uso de tecnologías de procesamiento del lenguaje.
El repositorio reúne un conjunto de datos orientado al estudio de idiomas con escasa documentación lingüística, lo que permitirá avanzar en investigaciones sobre reconocimiento automático del habla (ASR, por sus siglas en inglés) y en el análisis de la pronunciación en contextos donde existe información limitada.
Los investigadores destacaron que esta herramienta servirá como base para el desarrollo de sistemas capaces de ofrecer retroalimentación sobre la pronunciación durante el aprendizaje de idiomas, además de contribuir a la documentación y conservación de las lenguas originarias de México.
Colaboración entre instituciones
En el desarrollo del proyecto también participan Eric Ramos-Aguilar, Ricardo Ramos-Aguilar y Daniel Sánchez-Ruiz, investigadores de la Unidad Profesional Interdisciplinaria de Ingeniería del Instituto Politécnico Nacional, campus Tlaxcala (UPIIT-IPN).
El repositorio, denominado Conjunto de datos de voz de Zetzoho-Yuhmu, está disponible para consulta pública y puede ser utilizado por investigadores interesados en el procesamiento del lenguaje natural aplicado a lenguas indígenas.
Repositorio de libre acceso para la comunidad científica
Los responsables del proyecto señalaron que el repositorio es de libre acceso y representa una herramienta de gran utilidad para la comunidad científica que trabaja en el procesamiento del lenguaje natural.
«El repositorio es de libre acceso y puede ser de mucha utilidad para la comunidad que hace investigación relacionada al procesamiento del lenguaje natural considerando lenguas indígenas en México que actualmente están poco representadas respecto a la cantidad de personas hablantes de la lengua», destacaron los investigadores.
Con esta iniciativa, los especialistas buscan impulsar el desarrollo de tecnologías que contribuyan tanto a la preservación del patrimonio lingüístico del país como a la inclusión de las lenguas indígenas en los avances de la inteligencia artificial y el procesamiento del habla.