Este año, tres miembros de nuestro equipo tuvieron artículos aceptados en EAMT, la conferencia anual de la Asociación Europea de Traducción Automática que reúne a investigadores, profesionales y profesionales del sector para compartir conocimientos y debatir el estado del campo. Entre presentar nuestro propio trabajo y asistir a sesiones de todo el programa, nos hemos dado una visión bastante clara de cómo se encuentra la investigación en MT en 2026 y dónde aún le queda mucho por recorrer.

Marina Sánchez Torrón, Ph.D., Ingeniera Lingüística Senior en Smartling, subirá al escenario en EAMT 2026.
Aquí están nuestras principales conclusiones:
El debate sobre los LLMs ha terminado. Ahora viene la parte difícil.
Nadie en EAMT preguntaba ya si usar LLMs para traducción. Esa cuestión está resuelta. La conversación ha cambiado completamente hacia cómo desplegarlos bien, y ahí es donde las cosas se ponen interesantes.
Una de las señales más fuertes de la conferencia es que los LLM independientes rara vez son suficientes para entornos de producción. La arquitectura emergente no es "LLM en lugar de memoria de traducción". Es LLM más memoria de traducción más recuperación. Las memorias de traducción no van a desaparecer. Se están reutilizando como fuentes de conocimiento seleccionadas y verificadas que inyectan conocimientos lingüísticos específicos de la empresa directamente en los flujos de trabajo de los LLM. Las TMs limpias y de alta calidad son cada vez más la diferencia, ya sea que estés ajustando o construyendo una arquitectura RAG.
Los enfoques de traducción multiagente han recibido cierta atención, pero la conclusión honesta es que siguen siendo experimentales. Aún no está claro si la generación en comité está lista para la producción en un futuro próximo.
Terminología y estilo: progreso, pero no resuelto
Si hubo un tema que atravesaba casi todas las sesiones, era este: traducir el lenguaje general es en gran medida fácil. Traducir contenido especializado de forma consistente no lo es.
La gestión terminológica sigue siendo uno de los mayores desafíos de producción no resueltos en el campo. Una gran parte del programa técnico se centró en la traducción de terminología, contenido biomédico, traducción legal y adaptación específica de dominio, y la frustración era palpable. La adherencia a la guía de estilo salía una y otra vez como un punto doloroso compartido, sin que nadie afirmara haberlo resuelto.
Los investigadores demostraron que los LLM tienen huellas estilísticas claras y medibles en comparación con los traductores humanos: mayor densidad léxica, vocabulario más sofisticado, tendencia a abusar de rayas y subutilizar las elipses, y patrones distintivos de longitud de oración. Los intentos de incitar a los LLMs a imitar traductores literarios específicos en su mayoría fracasaron, con efectos de familia modelo (GPT vs. Claude) más fuertes que el propio estilo que provoca.
Una conclusión clave: los LLM han hecho que el estilo sea medible, pero no lo han resuelto. Los traductores humanos permanecen en un espacio estilístico claramente distinto al que los modelos modernos pueden acercarse pero no alcanzar del todo. La post-edición por IA puede mejorar el cumplimiento del estilo y la terminología, pero los modelos suelen sobreeditar y la retroalimentación humana sigue siendo esencial para que los resultados sean necesarios.
El ajuste fino sigue siendo importante
No hace mucho, había mucho entusiasmo por la idea de que el prompting sustituiría a la adaptación del modelo. Las pruebas de la conferencia no lo respaldan. Múltiples artículos mostraron beneficios claros de un ajuste fino específico de dominio en los ámbitos legal, biomédico, literario y técnico. Un EuroLLM-22B adaptado por la LoRA superó a Claude Sonnet en cero en la traducción legislativa de la UE.
El punto más amplio: para casos de uso en los que la precisión terminológica, los requisitos de estilo o las restricciones regulatorias son críticos, la adaptación especializada sigue siendo valiosa. El prompting y la recuperación son herramientas cada vez más importantes, pero no sustituyen la experiencia del dominio integrada en un modelo.
El prompting tiene más matices de los que la mayoría supone
Nuestro artículo sobre optimización manual frente a optimización automática de prompts (DSPy y GEPA) generó mucha curiosidad en nuestra sesión de pósteres. La mayoría de los asistentes no había oído hablar de GEPA, y muchos vieron inmediatamente su relevancia para sus propios retos de escalabilidad. La conversación no paró a la hora y estuvimos allí durante la pausa para el café. Slator informó sobre la investigación de Smartling, señalando que la optimización automatizada reducía la brecha con prompts expertos para terminología y traducción, mientras que el juicio experto seguía liderando la detección de errores en LQA.
De forma más amplia, la conferencia reforzó que el diseño por prompts no es un problema resuelto. La estructura importa más que el lenguaje: un rol completo + contexto + audiencia + propósito prompt reducen consistentemente los errores de estilo entre estudios. Los prompts en el idioma objetivo fueron preferidos por lingüistas expertos frente a los prompts en lengua fuente. Y la optimización automatizada no siempre gana; Depende mucho de la tarea.
Los lenguajes con pocos recursos siguen siendo la frontera más difícil
A pesar de los avances significativos en pares de lenguas con muchos recursos, las lenguas minoritarias y con pocos recursos siguen siendo un problema difícil y en gran medida sin resolver. Los LLM aún confunden variedades minoritarias con estándares dominantes, siendo el valenciano colapsando en el catalán estándar como un ejemplo que surgió. La generación paralela sintética de datos y la destilación de conocimiento basada en RAG son los enfoques más prometedores, pero los nuevos conjuntos de datos para lenguajes con pocos recursos siguen siendo escasos.
El NMT tampoco está muerto en este ámbito. Para contextos institucionales ricos en datos, los modelos especializados aún pueden ganar, principalmente porque tienen acceso a datos de entrenamiento masivos y específicos de dominio que hacen que la inversión merezca la pena.
La evaluación es el cuello de botella del que se habla
Generar traducciones se ha convertido en un problema más fácil de resolver. Definir y medir de forma fiable su calidad es donde el campo está atascado.
Las métricas tradicionales como BLEU y TER son cada vez más insuficientes para casos de uso reales. Una elección de género incorrecta puede afectar apenas a TER, pero ser un error crítico en contexto. Las métricas automatizadas, incluyendo métricas tradicionales y enfoques LLM como juez, aún no logran capturar de forma fiable la calidad a nivel de documento. Y como dijo un ponente: sin una mejor evaluación, la industria corre el riesgo de optimizar en la dirección equivocada.
El despliegue interno se está convirtiendo en una prioridad real
Otro tema importante fue la creciente importancia estratégica de los LLM internos y locales. Los flujos de trabajo gubernamentales, legales, parlamentarios y empresariales a menudo simplemente no pueden enviar contenido sensible a APIs externas. Los requisitos de residencia de datos son reales y no van a desaparecer.
Esto crea un mercado genuino para modelos más pequeños, desplegables localmente y especializados, no porque sean necesariamente mejores que los sistemas de frontera en calidad bruta, sino porque son controlables. La despliegue, el soporte de glosarios, el manejo de guías de estilo, la integración de la memoria de traducción y una historia de seguridad creíble son verdaderos diferenciadores para un gran segmento del mercado.
Lo que nos llevamos de vuelta
EAMT 2026 confirmó algo que nos convence bastante en Smartling: el futuro de la traducción en producción no son solo mejores modelos. Es una infraestructura de traducción controlable, auditable, específica de dominio y segura, construida sobre LLMs potentes, basada en memoria de recuperación y traducción, adaptada a dominios específicos y refinada por humanos para contenido de alto riesgo. También vamos por buen camino en cuanto a trabajar en los problemas abiertos, incluyendo evaluación, terminología, estilo y lenguajes de pocos recursos.
Estamos agradecidos a EAMT por crear el espacio para estas conversaciones, y a los investigadores y profesionales que compartieron su trabajo tan abiertamente. Nos vemos el año que viene.
¿Preguntas sobre nuestra investigación o cómo Smartling está afrontando estos desafíos? Póngase en contacto con nosotros.