¿Cómo comparáis la calidad de traducción entre GPT, Claude y DeepL?

Respuesta rápida

Comparar la calidad de traducción entre motores como GPT-4o, Claude 3.5 Sonnet y DeepL requiere tres componentes: un conjunto de pruebas representativo extraído de tus tipos de contenido y pares de idiomas reales, puntuación automatizada estandarizada usando métricas como BLEU, MetricX o COMET, y un marco de evaluación consistente aplicado de forma idéntica en todos los motores. Ningún motor único gana en todos los pares de idiomas y tipos de contenido. El objetivo práctico del benchmarking es identificar qué motor funciona mejor para tu contenido específico a gran escala, y luego enrutar automáticamente los trabajos de producción a ese motor. El AI Hub de Smartling evalúa el rendimiento del motor de forma continua y enruta cada cadena al motor de mayor rendimiento según su par de idiomas y tipo de contenido.

Por qué hacer benchmarking de motores de traducción no es sencillo

El rendimiento del motor de traducción varía significativamente según el par de idiomas, el tipo de contenido y el dominio. Un motor que produzca un buen texto de marketing en español puede rendir por debajo de la documentación técnica japonesa. Un benchmark basado únicamente en conjuntos de pruebas públicos puede no reflejar el contenido real de tu organización, lo que significa que el ganador en una evaluación estandarizada puede no ser el ganador en producción.

Los tres errores más comunes en el benchmarking de traducción son usar un conjunto de pruebas demasiado pequeño, aplicar criterios de evaluación diferentes a diferentes motores y tratar una ejecución de benchmark como una decisión única en lugar de una medición continua. La calidad de la traducción de los LLM cambia con cada actualización de modelo, lo que significa que un motor que ocupaba el tercer puesto hace seis meses puede ahora superar al líder anterior.

 

Qué medidas medidas de puntuación automatizada realmente

 
BLEU (Suplente de Evaluación Bilingüe)

Las puntuaciones BLEU miden la superposición entre una salida traducida por máquina y una traducción de referencia humana, expresada como un valor entre 0 y 1. BLEU es rápida y se utiliza ampliamente como referencia, pero recompensa las coincidencias superficiales de palabras más que la precisión semántica, lo que significa que una alucinación fluida puede obtener una buena puntuación mientras que una traducción correcta pero redactada de forma diferente tiene una mala puntuación. Para benchmarking empresarial, BLEU es útil como filtro de primer paso, pero insuficiente como señal de calidad independiente.

 
MetricX y COMET

MetricX (Google) y COMET (Unbabel) son métricas de evaluación neuronal que utilizan modelos lingüísticos para evaluar la calidad de la traducción comparando el texto fuente, la salida automática y las traducciones de referencia en todas las dimensiones semánticas. Ambos tienen una correlación más fuerte con el juicio humano que con el BLEU, sobre todo para detectar errores fluidos y cambios de significado. Para los programas empresariales queevalúan la traducción de LLM a escala, MetricX y COMET proporcionan una señal más fiable que BLEU por sí sola.

 
Evaluación humana como capa de validación

Las métricas automatizadas miden la calidad de la traducción en relación con una referencia. Los evaluadores humanos evalúan si una traducción funciona en su contexto, mantiene la voz de la marca y se lee de forma natural para un hablante nativo. Para los tipos de contenido de alto riesgo, la evaluación comparativa automatizada reduce el campo y la evaluación humana valida al ganador antes de tomar una decisión sobre el enrutamiento de producción.

 

Cómo ejecutar un benchmark de traducción que produzca resultados accionables

  • Construye un conjunto de pruebas representativo. Selecciona entre 200 y 500 cadenas de código fuente de tu contenido real de producción, cubriendo los pares de lenguaje, tipos de contenido y dominios que más te importan. Un benchmark basado en datos públicos genéricos de prueba no predecirá cómo se comporta un motor con tu texto de marketing, artículos del centro de ayuda o cadenas de interfaz de producto.
  • Haz que las cuerdas sean idénticas en cada motor. Envía las mismas cadenas de código fuente a GPT-4o, Claude 3.5 Sonnet, DeepL y cualquier otro motor bajo evaluación sin diferencias de preprocesamiento entre ellos. Las condiciones controladas son la única forma de aislar el rendimiento del motor de otras variables.
  • Puntua con MetricX o COMET como métricas principales. Aplica la misma puntuación a todas las salidas. Haz un seguimiento de las puntuaciones por par de idiomas y tipo de contenido en lugar de promediar todos los resultados, ya que las puntuaciones agregadas pueden ocultar una variación significativa por idioma.
  • Aplica tu memoria de traducción y glosario antes de comparar. La calidad de la traducción empresarial depende en parte de lo bien que un motor se integre con tus activos lingüísticos existentes. Compara motores bajo condiciones que incluyan tu glosario y TM en lugar de evaluar la producción bruta del motor de forma aislada.
  • Planifica la medición continua. Las capacidades de traducción de los LLM cambian con cada lanzamiento de modelo. Una ejecución de benchmark es una instantánea en el tiempo. Los equipos que enrutan trabajos basándose en datos de rendimiento continuos en lugar de una única decisión de benchmark mantienen mejor calidad con el tiempo.

Cuando la comparación de traducción es la prioridad adecuada

Programas empresariales que evalúan qué motor LLM o MT usar por defecto para la traducción en producción y necesitan datos objetivos y repetibles para respaldar la decisión.
Equipos que han notado variaciones de calidad entre pares de idiomas y quieren entender si enrutar diferentes pares a diferentes motores mejoraría la calidad general de la salida.
Organizaciones que están incorporando un nuevo motor y necesitan validar su rendimiento frente a su línea base de producción existente antes de cambiar.
Programas que quieren reducir el tiempo de edición humana identificando qué motor produce la salida de primera pasada más potente para sus tipos de contenido específicos.

Cuando puede no ser necesario un punto de referencia formal

⚠️

Programas en las primeras etapas de la adopción de traducción por IA, donde establecer flujos de trabajo básicos, glosarios y MT es la prioridad inmediata y la selección del motor puede posponerse hasta que el volumen justifique la inversión en benchmarking.

⚠️

Equipos que usan una plataforma con enrutamiento de motor integrado que evalúa y enruta automáticamente, donde el benchmarking lo gestiona la plataforma en lugar de hacerlo manualmente por el equipo de localización.

¿Cómo gestiona Smartling el benchmarking y el enrutamiento del motor?

El centro de inteligencia artificial de Smartling evalúa la calidad de las traducciones en más de 20 motores de LLM y traducción automática, incluidos GPT-4o, Claude 3.5 Sonnet, DeepL, Amazon Bedrock, Google Vertex y otros. El equipo de IA de Smartling realiza evaluaciones comparativas periódicas con MetricX, COMET y BLEU para evaluar el rendimiento del motor en todos los tipos de contenido y combinaciones de idiomas. Los resultados sirven de base para la selección automática del enrutamiento de Smartling, que asigna cada cadena al motor con mejor rendimiento para su combinación de idiomas y tipo de contenido específicos, en lugar de aplicar un solo motor de forma universal.

Para los equipos empresariales que quieren hacer sus propias comparaciones, la plataforma de Smartling soporta perfiles LLM configurables que permiten a los equipos probar diferentes configuraciones de motores en contenido de producción antes de establecer una regla de enrutamiento por defecto.

 

Documento de ayuda: Smartling Auto Select MT

Documento de ayuda: Smartling Auto Select LLM

Calidad de traducción de benchmarks en GPT, Claude y DeepL

El AI Hub de Smartling evalúa la calidad de la traducción en más de 20 LLMs y motores de traducción automática y enruta cada cadena al motor de mayor rendimiento según su par de idiomas y tipo de contenido. Observa cómo los equipos empresariales usan Auto Select para eliminar las dudas en la selección del motor.