Como medir a calidade dos sistemas de TA: a avaliación humana como criterio de referencia

No artigo anterior vimos como as métricas automáticas e os LLM como xuíces permiten avaliar a tradución automática de forma rápida e a grande escala. Pero, cando necesitamos saber se un sistema responde realmente ás nosas necesidades —especialmente antes de tomar decisións importantes, como lanzar un produto ou cambiar de provedor de tradución—, a avaliación humana continúa sendo o referente para avaliar a calidade da tradución automática, do mesmo xeito que noutras tarefas do procesamento da linguaxe natural (PLN).

Neste artigo damos un paso máis e centrámonos nos principais métodos de avaliación humana: que mide cada un, que vantaxes e limitacións presenta e que boas prácticas debemos seguir para obter resultados fiables.

 

1. Tipos de avaliación humana

1.1. Ranking

Os métodos de ranking non miden a calidade absoluta dunha tradución, senón a súa calidade relativa en comparación con outras. A forma máis sinxela é a avaliación por pares: preséntase unha frase orixinal xunto con dúas traducións —a dun sistema de referencia e a dun sistema novo— e a persoa avaliadora decide cal considera mellor ou se ambas teñen unha calidade equivalente (Mukherjee, 2025).  

O Relative Ranking (RR) amplía esta idea: as persoas avaliadoras ven o texto orixinal, unha tradución de referencia e cinco traducións xeradas por distintos sistemas, e ordénanas da mellor á peor, permitindo empates. Para simplificar a tarefa, as traducións idénticas producidas por sistemas diferentes agrúpanse nunha única opción.

Existen tamén variantes a un nivel máis fino. No constituent ranking ordénase unicamente un constituínte sintáctico seleccionado automaticamente, en lugar da frase completa. No constituent judgement, en cambio, a persoa avaliadora decide mediante un si ou un non se ese constituínte é aceptable. A puntuación final corresponde á porcentaxe de constituíntes considerados aceptables (Mukherjee, 2025).

Por último, o método DARR (Direct Assessment Relative Ranking) deriva clasificacións a partir de puntuacións de avaliación directa. Obter puntuacións fiables de DA a nivel de segmento require que cada tradución sexa avaliada por varias persoas, algo que non sempre é posible. DARR resolve esta limitación xerando todos os pares posibles de traducións dunha mesma frase e considerando que unha é mellor ca outra só cando as súas puntuacións se diferencian en polo menos 25 puntos. Os pares cunha diferenza menor considéranse empates e descártanse para o ranking (Mukherjee, 2025).

A principal vantaxe do ranking é que resulta sinxelo e económico: comparar traducións adoita ser máis doado que asignarlles unha puntuación absoluta. A súa principal limitación é que só permite establecer preferencias. Saber que unha tradución é mellor ca outra non nos indica se algunha delas alcanza un nivel de calidade suficiente. Por iso, resulta especialmente axeitado para comparar sistemas, pero menos para medir a calidade das traducións de forma absoluta.

1.2. Categorización de erros

Os métodos de categorización de erros buscan non só medir a calidade dunha tradución, senón tamén explicar onde e por que falla. O marco de referencia é MQM (Multidimensional Quality Metrics), empregado en WMT desde 2020 (Lommel et al., 2013; Lommel et al., 2024).

En MQM, persoal experto identifica os erros a nivel de segmento, clasifícaos segundo unha taxonomía —que pode incluír categorías como precisión, fluidez, estilo, terminoloxía ou convencións locais— e asígnalles unha gravidade: crítica, maior, menor ou neutra. Cada nivel de gravidade ten asociado un peso, e a suma ponderada dos erros permite obter unha puntuación para o segmento ou para o sistema. As categorías poden engadirse, eliminarse ou adaptarse ás necesidades de cada tarefa, e o método pode aplicarse tanto á tradución humana como á automática.

MQM ofrece un nivel elevado de información e explicabilidade, pero tamén implica un maior custo de avaliación. Require persoas con formación específica, e a clasificación de cada erro dentro dunha taxonomía detallada pode resultar lenta e cognitivamente esixente.

Como resposta a esta limitación xurdiu a Error Span Annotation (ESA), adoptada como método principal de avaliación humana en WMT en 2024 (Kocmi et al., 2024). A ESA combina a identificación de erros coa puntuación en dous pasos.

Primeiro, a persoa avaliadora marca os fragmentos da tradución que conteñen erros e indica a súa gravidade —neutra, menor ou maior—, sen clasificalos por tipo. Tamén pode sinalar o contido omitido. Despois, tendo diante os erros identificados, asigna unha puntuación global de 0 a 100 ao segmento.

Ao obrigar a identificar primeiro os erros concretos, a puntuación final baséase en evidencias e pode resultar máis consistente ca unha avaliación directa. Ao mesmo tempo, ao prescindir da taxonomía de erros, o proceso é máis rápido ca MQM e reduce os requisitos de formación das persoas avaliadoras. A ESA busca así un equilibrio entre a explicabilidade de MQM e a eficiencia da avaliación directa.

1.3. Puntuación

Os métodos de puntuación asignan a cada tradución un valor numérico que representa a súa calidade absoluta. Un dos enfoques máis clásicos son as escalas Likert (Joshi et al., 2015), nas que as persoas avaliadoras puntúan, normalmente de 1 a 5 ou de 1 a 7, aspectos como a fluidez —a corrección lingüística na lingua de destino— e a adecuación —a fidelidade ao significado do orixinal—.

A Avaliación Directa (DA) estima a calidade absoluta dunha tradución nunha escala de 0 a 100, tendo en conta a adecuación e a fluidez. As puntuacións brutas convértense posteriormente en z-scores, normalizadas segundo a media e a desviación típica de cada persoa avaliadora. Deste xeito, inténtase compensar o feito de que unhas persoas poidan puntuar sistematicamente de forma máis xenerosa ou máis estrita ca outras.

Existen tres variantes principais. A ref-DA, monolingüe, compara a tradución cunha referencia; a src-DA, bilingüe, compáraa co texto orixinal, o que reduce o nesgo que pode introducir unha referencia concreta; e a DA contrastiva, na que se presentan simultaneamente traducións de varios sistemas para avalialas de forma comparada (Stanchev et al., 2020).

O SQM (Scalar Quality Metric) emprega unha escala de sete puntos e avalía cada segmento dentro do contexto do documento ao que pertence. As puntuacións poden proceder de persoas colaboradoras sen formación específica (cSQM) ou de tradutores profesionais (pSQM).

A variante DA+SQM combina ambos enfoques: mantén a escala de 0 a 100 da avaliación directa, pero incorpora sete puntos de referencia etiquetados que serven como guía para a avaliación. Isto permite estabilizar as puntuacións entre as persoas avaliadoras en comparación coa DA simple (Mukherjee et al., 2025).

A puntuación é máis custosa e esixente ca o ranking, pero presenta unha vantaxe fundamental: permite cuantificar a calidade. Ademais, a partir dunha puntuación é posible derivar unha clasificación, como fai DARR, mentres que obter unha puntuación absoluta a partir dun ranking resulta moito máis difícil.

Por este motivo, Mukherjee et al. (2025) propoñen que, sempre que os recursos o permitan, a puntuación sexa preferible ao ranking. Os autores presentan ademais unha árbore de decisión que clasifica os métodos segundo a súa explicabilidade, carga cognitiva e custo, e que axuda a seleccionar o máis axeitado en función da granularidade da avaliación, o tipo de valoración, a dispoñibilidade de referencias e o perfil das persoas avaliadoras.

 

2. Boas prácticas na avaliación humana

Unha avaliación humana mal deseñada pode levar a conclusións enganosas. Independentemente do método escollido, hai unha serie de factores que determinan a fiabilidade dos resultados e que deben terse en conta ao longo de todo o proceso.

2.1. Acordo entre persoas anotadoras

As avaliacións deberían realizarse, polo menos, con dúas persoas avaliadoras. En xeral, contar con máis persoas permite obter resultados máis robustos. O acordo entre persoas anotadoras mide ata que punto coinciden ao avaliar as mesmas traducións. Un acordo baixo pode indicar que a tarefa é ambigua, que as guías non son suficientemente claras ou que as persoas avaliadoras non están ben formadas, o que pon en dúbida a fiabilidade dos resultados.

Para medilo utilízanse coeficientes que teñen en conta o acordo esperado por azar, como o kappa de Cohen, para dúas persoas (Cohen, 1960); o kappa de Fleiss, para máis de dúas (Fleiss, 1971); ou o alfa de Krippendorff, que admite distintos tipos de datos, máis de dous persoas anotadoras e anotacións incompletas (Krippendorff, 2011). Nas puntuacións continuas, como as de DA, tamén se empregan medidas de correlación entre as persoas avaliadoras, como os coeficientes de Pearson (Pearson, 1895) ou Spearman (Spearman, 1961).

Nas tarefas de anotación de erros, como MQM e ESA, a situación é máis complexa e non existe un método estandarizado para medir o acordo. Cada persoa pode marcar un número diferente de erros, os fragmentos sinalados poden solaparse só parcialmente e, no caso de MQM, un mesmo problema pode clasificarse en categorías diferentes igualmente defendibles. Xa os primeiros estudos sobre anotación de erros baseada en MQM detectaron un acordo baixo tanto na identificación como na clasificación de erros concretos (Lommel et al., 2014), e traballos posteriores mostraron que moitas discrepancias non se deben necesariamente a erros das persoas avaliadoras, senón a interpretacións diferentes, pero igualmente válidas, dun mesmo fenómeno (Popović, 2021).

Por iso, a opción máis recomendable é medir o acordo a varios niveis, de máis estrito a máis laxo. En primeiro lugar, pódese medir o acordo na detección de erros, é dicir, se as persoas coinciden en que segmentos conteñen erros (Castilho, 2021). En segundo lugar, no caso de MQM, pódese medir o acordo nas categorías asignadas aos fragmentos marcados por cada persoa avaliadora (Popović e Belz, 2022). En terceiro lugar, pódese medir o acordo na puntuación a nivel de segmento, é dicir, na puntuación derivada dos erros en MQM ou na puntuación de 0 a 100 en ESA, mediante correlacións ou o alfa de Krippendorff para datos de intervalo (Freitag et al., 2021). Por último, pódese medir o acordo no ranking a nivel de segmento: dadas dúas traducións da mesma frase, compróbase se as persoas coinciden en cal é mellor, peor ou se hai empate —algo que se pode cuantificar mediante o alfa de Krippendorff (Song et al., 2025).

Estes niveis ofrecen información complementaria. É frecuente que dúas persoas discrepen nos fragmentos exactos que sinalan ou nas categorías que lles asignan e, porén, coincidan na valoración global ou na ordenación das traducións, que é, en última instancia, o que interesa para comparar sistemas. Así o mostraron, por exemplo, Freitag et al. (2021) ao analizar a anotación MQM a grande escala, e Kocmi et al. (2024) ao comparar ESA con MQM. Informar do acordo en varios niveis permite, polo tanto, interpretar mellor a solidez dos resultados e identificar en que parte da tarefa se concentran as discrepancias.

2.2. Concordancia intra-anotador

A concordancia intra-anotador mide a coherencia dunha mesma persoa consigo mesma: se avalía a mesma tradución dúas veces, debería proporcionar unha valoración similar. Para comprobalo, adóitanse incluír segmentos repetidos no conxunto de avaliación sen informar previamente a persoa avaliadora.

En DA, ademais, emprégase un control de calidade baseado en elementos trampa: traducións deliberadamente degradadas que deberían recibir unha puntuación claramente inferior á orixinal. As persoas que non superan estes controis son descartadas. Unha baixa concordancia intra-anotador pode indicar fatiga, falta de atención ou criterios pouco estables, e resulta especialmente relevante nas avaliacións realizadas con persoas colaboradoras non expertas.

2.3. Tipo de persoas avaliadoras

O perfil das persoas avaliadoras inflúe directamente nos resultados. Unha primeira distinción é entre persoas monolingües, que coñecen só a lingua de destino e comparan a tradución cunha referencia, e bilingües, que poden comparala directamente co texto orixinal. A avaliación monolingüe é máis económica, pero depende da calidade da referencia e pode herdar os seus nesgos.

Outra distinción importante é entre persoas colaboradoras non expertas (crowdsourcing) e profesionais da tradución ou lingüistas. As primeiras permiten avaliar grandes volumes a baixo custo, pero requiren un maior número de persoas por segmento —no caso da DA, polo menos quince para garantir a reproducibilidade— e controis de calidade estritos. As persoas profesionais son máis custosas, pero poden detectar erros sutís que pasan desapercibidos para persoas avaliadoras non expertas, algo cada vez máis relevante a medida que os sistemas de tradución melloran e os seus erros son menos evidentes.

Métodos como MQM requiren necesariamente persoal experto, mentres que ESA foi deseñada, entre outras cousas, para reducir esta esixencia.

2.4. Creación das guías

As guías de anotación son fundamentais para que todas as persoas avaliadoras interpreten a tarefa do mesmo xeito. Unhas boas guías deben definir con claridade cada criterio —por exemplo, que se entende por adecuación, fluidez ou erro maior—, explicar o significado de cada punto da escala e incluír exemplos concretos, especialmente para os casos límite.

É recomendable realizar unha fase piloto cun pequeno conxunto de datos, analizar os desacordos e revisar as guías antes de comezar a avaliación completa. Tamén convén ofrecer unha sesión de formación e, se é posible, habilitar un espazo para resolver dúbidas durante o proceso. As guías deberían publicarse xunto cos resultados para facilitar a reproducibilidade da avaliación (Hovy e Lavid, 2010).

2.5. Cantidade de texto a avaliar

A cantidade de texto avaliado determina en boa medida a fiabilidade estatística dos resultados (Lommel et al., 2024). Se se avalían poucos segmentos, as diferenzas observadas entre sistemas poden deberse ao azar, polo que é necesario contar cun volume suficiente para aplicar probas de significación. Ao mesmo tempo, un volume excesivo por persoa pode provocar fatiga e reducir a calidade das anotacións. Por iso, convén repartir o traballo en bloques suficientemente curtos.

Outro aspecto relevante, como vimos no primeiro artigo desta serie sobre os datasets de avaliación, é o contexto. Avaliar frases illadas é máis rápido, pero impide detectar erros que só se fan visibles a nivel de documento (Castilho, 2021), como incoherencias terminolóxicas, pronomes mal resoltos ou cambios de rexistro. Por iso, métodos recentes como SQM, DA+SQM ou MQM en WMT avalían os segmentos dentro do contexto do documento.

O equilibrio adecuado dependerá dos recursos dispoñibles, do número de sistemas que se comparan e do nivel de granularidade que se queira obter na avaliación.

 

3. Conclusións

Do mesmo xeito que vimos nos dous artigos anteriores desta serie —e especialmente no primeiro, dedicado aos datasets—, unha avaliación humana fiable require un deseño coidado e decisións metodolóxicas ben fundamentadas.

En primeiro lugar, cómpre determinar que queremos medir, xa que diso dependerá o método máis axeitado. Se o obxectivo é comparar sistemas entre si, un método de ranking pode ser suficiente; se necesitamos cuantificar a calidade, podemos recorrer a métodos de puntuación como DA ou SQM; e se queremos entender onde e por que fallan as traducións, a categorización de erros mediante MQM ou ESA ofrece información máis detallada.

En segundo lugar, hai que ter en conta os recursos dispoñibles e, en particular, o perfil das persoas avaliadoras. Non é o mesmo contar con profesionais da tradución ca con persoas colaboradoras non expertas, nin avaliar con referencia ca sen ela. Cada unha destas decisións condiciona tanto o custo como o tipo de erros que se poden detectar e a fiabilidade dos resultados.

En terceiro lugar, a avaliación debe prepararse con coidado: unhas guías claras, con exemplos e probadas nunha fase piloto; un volume de texto suficiente para que as diferenzas sexan significativas, pero sen provocar fatiga; e, sempre que sexa posible, a avaliación dos segmentos no seu contexto.

Por último, os resultados só son fiables se podemos demostrar a súa consistencia. Para iso é fundamental contar con varias persoas avaliadoras, medir o seu acordo —idealmente a distintos niveis— e dispoñer de datos suficientes para extraer conclusións significativas.

Só cando se coidan todos estes aspectos pode a avaliación humana cumprir o seu papel como criterio de referencia e proporcionar unha base sólida para tomar decisións sobre os sistemas de tradución automática.

 


BIBLIOGRAFÍA

Lommel, Arle, et al. "The Multi-Range Theory of Translation Quality Measurement: MQM Scoring Models and Statistical Quality Control." Proceedings of the 16th Conference of the Association for Machine Translation in the Americas (Volume 2: Presentations), edited by Marianna Martindale et al., Association for Machine Translation in the Americas, 2024, pp. 75-94. ACL Anthology, aclanthology.org/2024.amta-presentations.6/.

Lommel, Arle Richard, et al. "Multidimensional Quality Metrics: A Flexible System for Assessing Translation Quality." Proceedings of Translating and the Computer 35, Aslib, 28-29 Nov. 2013. ACL Anthology.

Lommel, Arle, et al. "Multidimensional Quality Metrics (MQM): A Framework for Declaring and Describing Translation Quality Metrics." Revista tradumàtica: traducció i tecnologies de la informació i la comunicació, no. 12, 2014.

Kocmi, Tom, et al. "Error span annotation: A balanced approach for human evaluation of machine translation." Proceedings of the Ninth Conference on Machine Translation. 2024.

Mukherjee, Ananya, and Manish Shrivastava. "Lost in translation? Found in evaluation: A comprehensive survey on sentence-level translation evaluation." ACM Computing Surveys 58.1 (2025): 1-47.

Joshi, Ankur, et al. "Likert scale: Explored and explained." British journal of applied science & technology 7.4 (2015): 396.

Stanchev, Peter, Weiyue Wang, and Hermann Ney. "Towards a better evaluation of metrics for machine translation." Proceedings of the Fifth Conference on Machine Translation. 2020.

Cohen, Jacob. "A coefficient of agreement for nominal scales." Educational and psychological measurement 20.1 (1960): 37-46.

Fleiss, Joseph L. "Measuring nominal scale agreement among many raters." Psychological bulletin 76.5 (1971): 378.

Krippendorff, Klaus. "Computing Krippendorff's alpha-reliability." (2011).

Pearson, Karl. "Note on regression and inheritance in the case of two parents." Proceedings of the royal society of London 58 (1895): 240-242.

Spearman, Charles. "The proof and measurement of association between two things." (1961).

Popović, M. (2021). Agree to disagree: Analysis of inter-annotator disagreements in human evaluation of machine translation output. En Proceedings of CoNLL 2021.

Song, Yixiao, et al. "Enhancing human evaluation in machine translation with comparative judgement." Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2025.

Popović, Maja, and Anja Belz. "On reporting scores and agreement for error annotation tasks." Proceedings of the Second Workshop on Natural Language Generation, Evaluation, and Metrics (GEM). 2022.

Castilho, Sheila. "Towards document-level human MT evaluation: On the issues of annotator agreement, effort and misevaluation." Proceedings of the workshop on human evaluation of NLP systems (HumEval). 2021.

Freitag, Markus, et al. "Experts, errors, and context: A large-scale study of human evaluation for machine translation." Transactions of the Association for Computational Linguistics 9 (2021): 1460-1474.

Hovy, Eduard, and Julia Lavid. "Towards a ‘science’ of corpus annotation: a new methodological challenge for corpus linguistics." International journal of translation 22.1 (2010): 13-36. 

Tes un proxecto?

Pídenos orzamento sen compromiso.