English–French Parallel Translation Dataset
Importante corpus bilingüe inglés-francés alineado frase por oración, a partir del rastreo web, diseñado para la traducción automática y modelos lingüísticos multilingües.
~22.500.000 frases alineadas, formato de texto (TSV/CSV) en dos columnas (inglés/francés)
Licencia de base de datos abierta (ODbl) o equivalente
Descripción
Este conjunto de datos contiene aproximadamente 22 500 000 pares de oraciones paralelas en inglés y francés. Se creó utilizando la recopilación web y la heurística para alinear los documentos traducidos, y sirvió de base para el taller sobre traducción automática estadística de 2015.
¿Para qué sirve este conjunto de datos?
- Entrenamiento de modelos de traducción automática de alto rendimiento
- Optimice los LLM multilingües para tareas de traducción o generación bilingüe
- Estudie las alineaciones de los corpus y los métodos de traducción estadísticos/híbridos
¿Se puede enriquecer o mejorar?
Sí, puede filtrarse para mejorar su calidad, limpiarse para eliminar marcas no deseadas o enriquecerse con alineaciones de frases y documentos o metadatos contextuales.
🔎 En resumen
🧠 Recomendado para
- Investigadores de traducción automática
- Ingenieros de PNL
- Proyectos de LLM multilingües
🔧 Herramientas compatibles
- OpenNMT
- MarianMT
- Fairseq
- Hugging Face Transformers
💡 Consejo
Divida el corpus en subselecciones por dominio para lograr un ajuste más preciso o manejable.
Preguntas frecuentes
¿Este conjunto de datos está limpio y listo para usarse?
Está alineado, pero a menudo requiere eliminar los pares ruidosos y los errores de codificación.
¿Cuál es el idioma principal que se utiliza?
Principalmente en inglés y francés, de la web, con una probable orientación sobre el contenido en inglés.
¿Se puede usar para uso comercial?
Sí, la licencia ODbL permite el uso comercial, siempre que los derivados se atribuyan y compartan bajo la misma licencia.




