Cómo medir la calidad de los sistemas de traducción automática

Cuando una empresa decide integrar la traducción automática (TA) en sus procesos —ya sea para localizar contenido, atender a clientes en varios idiomas o acelerar la producción de documentación—, tarde o temprano surge la misma pregunta: ¿cómo sabemos que el sistema traduce bien?

La respuesta parece sencilla, pero no lo es. Medir la calidad de una traducción automática requiere decisiones metodológicas que, si no se abordan adecuadamente, pueden llevar a conclusiones erróneas. Este es el primero de una serie de artículos en los que repasaremos los elementos clave que hay que tener en cuenta en el proceso de evaluación de la traducción automática.

 

1. Datasets de evaluación

1.1. ¿Qué quiero medir?

En un post anterior ya hablamos de la importancia de los datasets como la base invisible sobre la que se sustenta la inteligencia artificial. A la hora de evaluar la traducción automática, elegir los datasets de evaluación no es una decisión menor. El primer paso es tener clara una cuestión: ¿qué nos interesa medir?

No es lo mismo evaluar:

  • la corrección lingüística de una traducción (gramática, terminología, fluidez);
  • su coherencia discursiva a lo largo de un texto completo;
  • su rendimiento en un dominio específico (jurídico, médico, técnico, etc.);
  • su comportamiento ante fenómenos concretos (traducción de URL, códigos, topónimos, etc.).

Cada uno de estos objetivos requiere un tipo de dataset diferente. Una empresa que traduce contratos legales no tiene las mismas necesidades que otra que traduce descripciones de productos para un catálogo. Definir con claridad el objetivo de la evaluación es el primer paso y, muchas veces, también uno de los que más se pasa por alto.

1.2. Tipos de datasets

1.2.1. A nivel de frase

Históricamente, los datasets de evaluación en TA se han construido a nivel de frase: conjuntos de frases originales con sus traducciones de referencia, evaluadas de forma independiente unas de otras (Costa-jussà, 2022; Federico et al., 2012; Tiedemann, 2020).

Este enfoque lleva décadas empleándose por razones prácticas e históricas. Desde la traducción estadística (en inglés Statistical Machine Translation, SMT) en los años noventa, los corpus de entrenamiento de los sistemas de TA estaban divididos en frases. Incluso con la llegada de los primeros Transformers (Vaswani et al., 2017), la capacidad de traducción de los modelos estaba limitada, en buena medida, a este nivel. Sin embargo, este enfoque tiene un problema fundamental: al evaluar frases aisladas, se pierde toda la información de contexto (Castilho, 2021).

Esto significa que un sistema puede obtener puntuaciones muy buenas frase a frase y, aun así, producir un texto final incoherente, con pronombres mal resueltos, terminología inconsistente entre párrafos o un registro que cambia sin motivo a lo largo del documento. En definitiva, la evaluación a nivel de frase puede hacer parecer "bueno" a un sistema que, en el uso real, genera textos poco naturales o difíciles de leer cuando se consideran en su conjunto.

1.2.2. A nivel de párrafo

En los últimos años, el paradigma de evaluación está cambiando. Como solución intermedia entre la frase aislada y el documento completo, existen datasets de evaluación a nivel de párrafo. Este formato permite capturar parte del contexto discursivo —como la coherencia entre frases próximas o la resolución de correferencias a corto alcance— sin requerir la complejidad de evaluar documentos enteros (Andrews et al., 2025).

Es una opción especialmente útil cuando se trabaja con contenido estructurado en unidades relativamente autocontenidas, como párrafos de una ficha de producto o secciones de una FAQ, y permite obtener una evaluación más realista que a nivel de frase.

1.2.3. A nivel de documento

Evaluar a nivel de documento significa observar cómo se comporta el sistema ante un texto completo, con toda su estructura, coherencia interna y dependencias entre frases (correferencias, tiempo verbal, terminología consistente, etc.).

Como se comentó anteriormente, hay errores en la traducción que solo son detectables cuando se evalúa el documento completo y no frases aisladas. Fenómenos como la resolución de anáforas, la consistencia terminológica a lo largo del texto o la coherencia estilística desaparecen —o simplemente no se pueden evaluar— cuando se trabaja con frases sueltas.

Las evaluaciones basadas únicamente en frases individuales tienden a sobreestimar la calidad real de los sistemas, ya que ocultan errores que solo emergen en el contexto más amplio del documento (Barrault et al., 2019; Castilho, 2020; Toral et al., 2018).

Para una empresa, esto es especialmente relevante: si el contenido que se traduce son manuales, artículos, correos, páginas web, documentos o cualquier texto con continuidad, una evaluación a nivel de documento dará una imagen mucho más fiel de la calidad que realmente recibirán las personas usuarias finales.

1.2.4. Test-suites

Las test-suites son un tipo de recurso de evaluación diferente de los anteriores. En lugar de intentar medir la calidad general de un sistema, están diseñadas específicamente para detectar cómo se comporta ante fenómenos lingüísticos concretos: concordancia de género, tiempos verbales, expresiones idiomáticas, ambigüedad léxica, negación, unidades de medida, etc.

Cada ejemplo de una test-suite se construye de forma controlada para aislar un fenómeno muy específico, de modo que se pueda determinar con precisión si el sistema lo resuelve correctamente o no. Esto hace que sean especialmente útiles para:

  • diagnosticar debilidades concretas de un sistema (por ejemplo, si traduce mal las URL, los códigos, los nombres propios, etc.);
  • comparar sistemas en aspectos específicos relevantes para un dominio o idioma determinado;
  • hacer seguimiento de la evolución de un sistema tras actualizaciones o nuevos entrenamientos.

Las test-suites pueden estar diseñadas tanto a nivel de frase como de párrafo (Balkan, 1994; Savoldi et al., 2023; Kocmi et al., 2025). No sustituyen a los datasets generales, sino que los complementan: mientras que un dataset general ofrece una visión global de calidad, una test-suite permite entender cómo se comporta el sistema ante casos concretos y diagnosticar posibles debilidades.

 

2. Problemas derivados de una mala construcción de los datasets

Tener datasets de evaluación no basta: si están mal construidos, los resultados pueden ser engañosos y llevar a decisiones erróneas. Algunas afirmaciones sobre la paridad entre la calidad de la traducción automática y la traducción humana han estado relacionadas con diseños inadecuados de los datasets de evaluación (Hassan et al., 2018).

2.1. El texto original y el problema del translationese

Una regla básica, pero frecuentemente ignorada, es que el texto original de un dataset de evaluación debe estar escrito directamente en el idioma de origen, y no ser ya una traducción desde otro idioma.

Cuando esto no se cumple, aparece el fenómeno conocido como translationese (Baker, 1993): un texto traducido —aunque sea por personas expertas— tiende a presentar patrones lingüísticos distintos de los de un texto original escrito por una persona nativa, como estructuras sintácticas más simples, calcos del idioma de partida o una menor variedad léxica.

Si el "original" empleado en un dataset de evaluación es, en realidad, una traducción de otro idioma, el sistema de TA está traduciendo un texto que ya presenta rasgos propios de la traducción. Esto puede hacer que el dataset resulte más sencillo para los sistemas de traducción automática (Graham et al., 2020; Zhang et al., 2019). Por eso, para realizar una evaluación fiable, es imprescindible verificar la procedencia real de los textos originales.

2.2. Las referencias no deberían ser posediciones de TA

Otro error habitual y potencialmente problemático es utilizar como "referencia humana" un texto que, en realidad, es una traducción automática poseditada por una persona.

Aunque una posedición implica intervención humana, el texto resultante puede conservar decisiones y estructuras propias del sistema automático que lo generó. Si esa referencia se utiliza posteriormente para evaluar sistemas de TA —incluido, potencialmente, el mismo sistema que la generó originalmente—, puede introducirse un sesgo sistemático: los sistemas cuyas salidas se parecen más al estilo del sistema que produjo la posedición pueden obtener puntuaciones artificialmente más altas, no necesariamente porque traduzcan mejor, sino porque la "referencia" ya está más próxima a su propio estilo.

Por eso, las referencias empleadas en una evaluación deberían ser siempre traducciones realizadas por personas expertas desde cero, sin partir de una salida de traducción automática. Si eso no es posible, el sesgo introducido debe tenerse en cuenta antes de extraer conclusiones o tomar decisiones a partir de los resultados.

 

3. Conclusiones

Medir la calidad de la traducción automática no consiste simplemente en ejecutar una métrica y obtener un número. Requiere:

  1. Tener claro qué se quiere medir antes de elegir un dataset.
  2. Elegir el nivel de granularidad adecuado (frase, párrafo o documento) en función del uso real que se le vaya a dar a la traducción.
  3. Complementar la evaluación con test-suites cuando sea necesario diagnosticar fenómenos lingüísticos concretos.
  4. Evaluar el sistema en el dominio específico en el que se va a emplear, ya que un mismo sistema puede ofrecer resultados muy diferentes según el ámbito. Por ejemplo, puede ir muy bien en el dominio legal y presentar más problemas en el periodístico.
  5. Garantizar que los datasets están bien construidos: textos originales realmente originales (no translationese) y referencias humanas genuinas, no posediciones de TA.

Para una empresa que depende de la traducción automática para comunicarse con sus clientes, invertir tiempo en una evaluación rigurosa no es un ejercicio académico: es lo que permite comprobar que la tecnología empleada responde realmente a las necesidades de su uso, y no solo ofrece buenos resultados sobre el papel.

 

BIBLIOGRAFÍA

Costa-Jussà, Marta R., et al. "No language left behind: Scaling human-centered machine translation." arXiv preprint arXiv:2207.04672 (2022). 

Tiedemann, Jörg. "The tatoeba translation challenge–realistic data sets for low resource and multilingual MT." Proceedings of the fifth conference on machine translation. 2020. 

Federico, Marcello, et al. "Overview of the IWSLT 2012 evaluation campaign." Proceedings of the 9th International Workshop on Spoken Language Translation: Evaluation Campaign. 2012. 

Vaswani, Ashish, et al. "Attention is all you need." Advances in neural information processing systems 30 (2017). 

Castilho, Sheila. "Towards document-level human MT evaluation: On the issues of annotator agreement, effort and misevaluation." Proceedings of the workshop on human evaluation of NLP systems (HumEval). 2021. 

Andrews, Pierre, et al. "BOUQuET: dataset, benchmark and open initiative for universal quality evaluation in translation." Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025. 

Castilho, Sheila, Maja Popović, and Andy Way. "On context span needed for machine translation evaluation." Proceedings of the Twelfth Language Resources and Evaluation Conference. 2020. 

Toral, Antonio, et al. "Attaining the unattainable? reassessing claims of human parity in neural machine translation." Proceedings of the third conference on machine translation: Research papers. 2018. 

Barrault, Loïc, et al. "Findings of the 2019 conference on machine translation (WMT19)." Proceedings of the Fourth Conference on Machine Translation (Volume 2: Shared Task Papers, Day 1). 2019. 

Balkan, Lorna. "Test Suites: some issues in their use and design." Proceedings of the Second International Conference on Machine Translation: Ten years on. 1994. 

Kocmi, Tom, et al. "Findings of the wmt25 general machine translation shared task: Time to stop evaluating on easy test sets." Proceedings of the tenth conference on machine translation. 2025. 

Hassan, Hany, et al. "Achieving human parity on automatic chinese to english news translation." arXiv preprint arXiv:1803.05567 (2018). 

Graham, Yvette, Barry Haddow, and Philipp Koehn. "Statistical power and translationese in machine translation evaluation." Proceedings of the 2020 conference on empirical methods in natural language processing (EMNLP). 2020. 

Zhang, M., & Toral, A. (2019). The effect of translationese in machine translation test sets. Proceedings of the Fourth Conference on Machine Translation (Volume 1: Research Papers)

Baker, M. (1993). Corpus: Linguistics and Translation Studies: Implications and Applications. In M. Baker, G. Francis, & E. Tognini-Bonelli (Eds.), Text and Technology: In honor of John Sinclair. Amsterdam (pp. 233-250). John Benjamins.  

Savoldi, Beatrice, et al. "Test suites task: Evaluation of gender fairness in MT with MuST-SHE and INES." Proceedings of the Eighth Conference on Machine Translation. 2023. 

¿Tienes un proyecto?

Pídenos presupuesto sin compromiso.