- Los Investigadores del IPN elevaron de 1.99 a 28.88 la puntuación BLEU de un modelo al incorporar datos de un libro de gramática
- El experimento muestra el impacto que puede tener ampliar los datos disponibles para una lengua con pocos recursos digitales.
Investigadores del Centro de Investigación en Computación del Instituto Politécnico Nacional (CIC-IPN) mejoraron de manera significativa el desempeño de modelos de inteligencia artificial para la traducción automática del purépecha al español, mediante una técnica de adaptación de dominio.
El estudio fue encabezado por Cecilia González-Servín, junto con Christian E. Maldonado-Sifuentes, Olga Kolesnikova y Grigori Sidorov.
El trabajo, publicado en el International Journal of Combinatorial Optimization Problems and Informatics, analiza el comportamiento de modelos Transformer utilizados para traducir una lengua con recursos digitales limitados.
Modelos de IA enfrentaron un cambio de dominio
Los investigadores utilizaron modelos como mBART-50 y Marian, previamente ajustados con un corpus de traducciones bíblicas alineadas.
El problema surgió al evaluarlos con material de un libro de gramática, perteneciente a un dominio lingüístico distinto al utilizado para su ajuste.
En esa primera evaluación, mBART-50 obtuvo 1.9992 puntos BLEU, mientras que Marian registró 0.2272.
El resultado mostró las limitaciones de utilizar datos concentrados en un solo dominio para desarrollar sistemas de traducción de una lengua con pocos recursos digitales.
Mil 297 pares de oraciones cambiaron el resultado
Para adaptar los modelos al nuevo dominio, el equipo utilizó 1,626 pares de oraciones procedentes del libro de gramática.
De ese conjunto, 1,297 pares se utilizaron para adaptar los modelos y 329 se reservaron para la evaluación.
Después de la adaptación, la puntuación BLEU de mBART-50 aumentó de 1.9992 a 28.8776.
En Marian, la puntuación pasó de 0.2272 a 21.2699.
BLEU es una métrica utilizada para evaluar sistemas de traducción automática mediante la comparación de sus resultados con traducciones de referencia.
Los investigadores también reportaron mejoras en otras métricas de evaluación, como ROUGE, y observaron una reducción de salidas repetitivas o degeneradas de los modelos.
Adaptación mejoró traducción y manejo del purépecha
El análisis cualitativo realizado por los investigadores mostró mejoras en el tratamiento de terminología metalingüística y construcciones de uso cotidiano después de adaptar los modelos al nuevo dominio.
El resultado sugiere que incluso una cantidad relativamente pequeña de datos especializados puede mejorar de manera considerable el desempeño de sistemas de traducción para lenguas con pocos recursos.
Sin embargo, el estudio no demuestra que exista ya un traductor de purépecha-español capaz de funcionar con la misma eficacia en cualquier contexto.
La evaluación se realizó con datos procedentes del mismo dominio utilizado para la adaptación, por lo que los resultados no deben extrapolarse automáticamente a conversaciones, redes sociales, literatura u otros registros lingüísticos.
Una investigación sobre lenguas con pocos recursos
El estudio forma parte de una línea de investigación del CIC-IPN dedicada a desarrollar recursos y modelos para la traducción automática del purépecha.
Los autores destacan la importancia de ampliar los dominios lingüísticos disponibles y de incorporar la participación de hablantes en la evaluación de estas tecnologías.
El artículo cita una estimación de aproximadamente 120 mil hablantes de purépecha, basada en datos del INEGI de 1996. La cifra, por su antigüedad, no debe interpretarse como un conteo demográfico actual.
El trabajo, titulado Evaluating the Impact of Domain Adaptation on Transformer-based Models for Low-Resource Purépecha-Spanish Translation, fue publicado en 2026, como parte del volumen 17(2) de la revista científica.
Lee también:
Kuirisi-atakua: la cacería del pato, un rito purépecha casi extinto






