Tips & Tricks

Cómo extraer texto de un PDF escaneado en un solo idioma específico cuando hay varios idiomas presentes

Escaneas un menú bilingüe. Los nombres de los platos están en italiano. Las descripciones están en inglés. Los precios son números que dependen del idioma. Debe extraer solo el texto en italiano para crear una lista de palabras en italiano, o solo el texto en inglés para enviarlo a un traductor de otro par de idiomas. La ejecución de OCR en todo el documento produce una combinación de ambos idiomas, lo cual está bien para la capacidad de búsqueda, pero no para la extracción selectiva.

Extraer texto en un solo idioma de un documento OCR PDF multilingüe requiere un motor de OCR que pueda identificar en qué idioma está escrito cada bloque de texto y extraer solo los bloques que coincidan con su idioma de destino. Se trata de una operación más selectiva que el OCR estándar, que reconoce todo el texto independientemente del idioma.

How to Extract Text From a Scanned PDF in Only One Specific Language When Multiple Languages Are Present

Cómo funciona el OCR selectivo de idioma

Los motores de OCR con soporte multilingüe se pueden configurar para reconocer texto en varios idiomas simultáneamente. Cuando especifica "italiano e inglés" Al igual que los idiomas OCR, el motor reconoce texto en ambos. También etiqueta cada bloque de texto reconocido con el idioma en el que fue reconocido. Un bloque de texto italiano se etiqueta como italiano. Un bloque de texto en inglés está etiquetado como inglés. El etiquetado de idioma permite la extracción selectiva.

Después del OCR, puede filtrar el texto reconocido por etiqueta de idioma. Exporta sólo los bloques etiquetados como italianos. El resultado es un documento que contiene sólo el texto italiano del menú. Las descripciones en inglés, reconocidas pero filtradas, no aparecen en el resultado. Esta extracción selectiva es útil para flujos de trabajo de traducción, materiales de aprendizaje de idiomas y análisis de contenido donde necesita texto en un idioma específico aislado del texto circundante en otros idiomas.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →

Paso a paso: extraer texto en un idioma específico

Cargue el PDF escaneado en la herramienta OCR de WukongPDF. Seleccione los idiomas presentes en el documento. Para el menú italiano-inglés, seleccione italiano e inglés. Ejecute el OCR. La herramienta reconoce todo el texto y etiqueta cada bloque por idioma. Una vez que se complete el OCR, use el filtro de idioma para seleccionar italiano. Exporte el texto filtrado como un archivo de texto sin formato, un documento de Word o un nuevo PDF que contenga solo los bloques en italiano.

La precisión de la detección de idiomas depende del carácter distintivo de los idiomas. El italiano y el inglés usan el mismo alfabeto pero tienen patrones de palabras diferentes. El motor OCR los distingue analizando la frecuencia de las palabras. El italiano tiene muchas palabras que terminan en vocal. El inglés tiene muchas palabras que terminan en consonantes. Cuanto más distintos sean los idiomas, más precisa será la etiqueta del idioma. El motor puede confundir dos idiomas estrechamente relacionados, como el español y el portugués, en bloques de texto cortos.

Manejo de texto en varios idiomas en la misma línea

Algunos documentos mezclan idiomas en una sola línea, como un libro de texto de idiomas que combina una oración en francés con su traducción en inglés en la misma línea. El motor de OCR puede clasificar toda la línea como idioma dominante, etiquetando erróneamente las palabras del idioma minoritario. Para estos documentos, la extracción selectiva del idioma a nivel de bloque no es lo suficientemente precisa. Necesitas un enfoque diferente.

La alternativa es ejecutar OCR dos veces, una vez con cada idioma como único idioma de reconocimiento. El pase OCR exclusivo en italiano reconoce bien el texto en italiano pero destroza el texto en inglés. El pase sólo en inglés reconoce bien el inglés pero destroza el italiano. Compare las dos salidas y seleccione manualmente la versión correcta para cada segmento de texto. Este enfoque de doble paso lleva más tiempo pero produce la extracción específica del idioma más precisa para documentos donde los idiomas están intercalados a nivel de oración.

Verificación y limpieza del texto extraído

Después de extraer el texto en el idioma de destino, verifique que el filtrado de idioma sea preciso. Escanee el texto extraído en busca de palabras que estén claramente en el idioma incorrecto. Una extracción de texto italiano de un menú no debe contener palabras en inglés como "a la parrilla" o "a la parrilla". o "servido con" a menos que el menú use intencionalmente esas palabras en las descripciones italianas. El texto filtrado que contiene palabras extranjeras inesperadas indica errores de etiquetado de idioma que necesitan corrección manual.

Ejecute una revisión ortográfica en el idioma de destino. El corrector ortográfico italiano marcará las palabras en inglés que se incluyeron incorrectamente en la extracción italiana. Las banderas de revisión ortográfica son una forma eficaz de encontrar errores de etiquetado de idioma sin leer cada palabra extraída. El Extraer datos PDF que ha sido filtrado por idioma y revisado ortográfico está listo para traducción, análisis o archivo. El OCR PDF escaneado de WukongPDF con filtrado de idioma produce extractos en un solo idioma más limpios que el posprocesamiento de la salida OCR de idiomas mixtos para eliminar el idioma no deseado.

Una aplicación práctica para OCR selectivo de idioma: creación de glosarios bilingües a partir de documentos traducidos. Extraiga todos los términos del idioma de origen y todos los términos del idioma de destino por separado. Alinéelos según sus posiciones en la página, ya que cada término de origen tiene un término de destino correspondiente aproximadamente en la misma posición vertical en la página o en una columna adyacente. El resultado alineado se convierte en una lista de términos que los traductores pueden utilizar para garantizar la coherencia en futuras traducciones. Esta técnica de creación de glosarios se utiliza ampliamente en la traducción técnica, donde la coherencia de la terminología es fundamental.

Para documentos donde los idiomas están en columnas separadas, como un contrato bilingüe de dos columnas, la extracción selectiva de idiomas se convierte en una tarea de selección de columnas. La columna de la izquierda es un idioma, la columna de la derecha es otro. En lugar de depender de la detección de idioma, que puede confundir idiomas similares, recorte el PDF para extraer cada columna por separado. Ejecute OCR en un solo idioma en cada columna. Este enfoque de recorte de columnas es más confiable que el filtrado de idiomas para documentos con una clara separación de idiomas en columnas.

Para proyectos de archivo que involucran documentos históricos en varios idiomas, el OCR selectivo de idioma combinado con el etiquetado de metadatos crea un archivo con capacidad de búsqueda donde los investigadores pueden encontrar contenido en un idioma específico en miles de documentos. La salida de OCR de cada documento está etiquetada con los idiomas detectados. Un investigador que busque documentos franceses del siglo XVIII puede filtrar solo texto en francés en una colección multilingüe. Este enfoque selectivo transforma el OCR de archivos de una herramienta contundente que mezcla idiomas a un instrumento de precisión para la investigación lingüística.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →