
Por qué un PDF que parece texto puede no ser editable
Abres un PDF, ves palabras en la pantalla y asumes que puedes editarlas. Cuando haces clic en el texto y no sucede nada, o cuando intentas escribir y el cursor no aparece, descubres que el PDF que parece un documento de texto en realidad no es un documento editable en absoluto. Esta experiencia es frustrantemente común porque los archivos PDF pueden contener texto en formas fundamentalmente diferentes, de las cuales sólo algunas son editables.
La ejecución de OCR en un PDF escaneado agrega una capa de texto editable y con capacidad de búsqueda detrás de cada imagen de página del documento.
La conversión de PDF a un formato editable y viceversa es un recurso fiable cuando no es posible la edición directa.
Un editor de PDF puede modificar texto que existe como objetos de texto reales en el PDF, con cada carácter representado como un código de carácter modificable y seleccionable. Esto se llama texto nativo o en vivo. Un Formato PDF también puede contener texto que existe solo como imagen, como un documento escaneado donde el texto es parte de la fotografía de la página. El texto basado en imágenes no se puede seleccionar, buscar ni editar porque el PDF no contiene datos de caracteres, solo píxeles que forman letras. Antes de poder saber si un PDF es editable, necesita saber qué tipo de texto contiene.
La prueba más rápida es intentar seleccionar texto en el PDF. Haga clic y arrastre sobre una palabra. Si el texto se resalta mientras lo arrastra, es texto nativo y potencialmente se puede editar. Si no se resalta nada y el cursor no cambia, el texto está basado en imágenes y no se puede editar directamente. Si el texto resalta pero el resaltado es irregular, seleccionando algunas palabras pero omitiendo otras, el PDF tiene una mezcla de texto nativo y texto que existe solo como elementos visuales, una situación común en archivos PDF creados con software más antiguo o combinando múltiples documentos fuente.
Intente editar PDF
No se necesita instalación. Funciona directamente en su navegador.
Razones comunes por las que su texto PDF no se puede editar
La razón más común es que el PDF es un documento escaneado. Un PDF creado escaneando páginas en papel con un escáner de superficie plana o una aplicación de cámara de teléfono contiene imágenes de texto, no caracteres de texto reales. Aunque puede leer las palabras en la pantalla, el archivo PDF no contiene datos de texto editables. Para que un PDF escaneado sea editable, primero debe ejecutar OCR para reconocer el texto en las imágenes y crear una capa de texto invisible detrás de cada imagen de la página. Después del OCR, el texto se puede buscar y, en muchos editores de PDF, se puede editar como si fuera texto nativo.
Las restricciones de contraseñas o permisos son otra barrera común para la edición. Se puede abrir y ver un PDF protegido con una contraseña de permisos, pero los permisos pueden bloquear la edición, copia o impresión. Si puede abrir el PDF y ver el texto, pero las herramientas de edición están atenuadas o generan un mensaje de error, verifique la configuración de seguridad del documento. En la mayoría de los visores de PDF, el panel Propiedades del documento o Seguridad muestra qué permisos están restringidos. Si la edición está restringida y tiene la contraseña de permisos, puede eliminar las restricciones y habilitar la edición.
El PDF puede contener texto que se convirtió en contornos o curvas durante la creación. Los diseñadores gráficos a veces convierten texto en contornos en aplicaciones como Adobe Illustrator antes de crear un PDF para garantizar que las fuentes se muestren correctamente independientemente de si el destinatario las tiene instaladas. El texto convertido en contornos parece visualmente idéntico al texto nativo, pero consta de formas vectoriales en lugar de datos de caracteres. La herramienta No Edit PDF] puede editar texto delineado como texto porque la información del carácter se descartó durante la conversión a contornos.
Los problemas de codificación de fuentes pueden hacer que el texto no se pueda editar incluso cuando el PDF contiene caracteres de texto nativos. Algunos archivos PDF utilizan codificaciones de fuentes personalizadas que asignan códigos de caracteres a glifos de formas no estándar. La herramienta de edición ve los códigos de caracteres pero no puede determinar qué caracteres representan, por lo que se niega a editarlos para evitar dañar el texto. Este problema es más común en archivos PDF generados por software especializado, sistemas heredados o documentos que utilizan escrituras no latinas con manejo de fuentes personalizado. Reexportar el PDF desde la aplicación original con la incrustación de fuentes habilitada a menudo resuelve el problema de codificación.
Cómo hacer que un PDF escaneado sea editable usando OCR
El reconocimiento óptico de caracteres es el proceso que convierte imágenes de texto en texto editable real. La tecnología OCR moderna es muy precisa para escaneos limpios y bien iluminados de texto impreso en fuentes comunes y tamaños típicos. La ejecución de OCR en un PDF escaneado agrega una capa de texto oculta detrás de cada imagen de página que contiene los caracteres reconocidos. Una vez que se completa el OCR, puede buscar texto en el documento y, en la mayoría de los editores de PDF, editar el texto reconocido como si fuera originalmente nativo.
La calidad de la salida OCR depende de la calidad de las imágenes escaneadas. Un escaneo de alta resolución a 300 DPI con iluminación uniforme, páginas planas y enfoque nítido produce una precisión de OCR superior al 99 por ciento para texto impreso estándar. Un escaneo de baja resolución a 150 DPI con sombras, páginas curvas de un libro encuadernado o áreas desenfocadas produce una precisión menor y requiere más corrección manual después del OCR. Escanear documentos con OCR en mente, es decir, páginas planas, buena iluminación y resolución adecuada, hace que el proceso de edición sea mucho más fluido.
La mayoría de los editores de PDF que admiten OCR incluyen la selección de idioma como parte de la configuración de reconocimiento. Seleccionar el idioma correcto mejora la precisión porque el motor de OCR utiliza diccionarios específicos del idioma y datos de frecuencia de caracteres para resolver caracteres ambiguos. Un documento en francés reconocido con la configuración de idioma francés produce mejores resultados que el mismo documento reconocido con la configuración de inglés. Para documentos multilingües, seleccione el idioma principal y corrija manualmente cualquier error en los pasajes del idioma secundario.
La herramienta OCR PDF de WukongPDF procesa documentos escaneados en el navegador y devuelve un PDF con una capa de texto editable y con capacidad de búsqueda. El motor de OCR admite varios idiomas y maneja tipos de documentos comunes, incluidos cartas, formularios, recibos y artículos. Después del OCR, el PDF escaneado que antes no se podía editar se vuelve editable y el texto reconocido está disponible para selección, búsqueda y modificación.
Enfoques alternativos cuando no es posible la edición directa de PDF
Cuando un PDF no se puede editar directamente, ya sea porque es un documento escaneado sin acceso a OCR o porque tiene restricciones de seguridad que no se pueden eliminar, los flujos de trabajo alternativos le permiten lograr el mismo resultado a través de una ruta diferente. Convierta el PDF a un formato editable como Word o Google Docs, realice los cambios en ese formato y convierta el documento editado nuevamente a PDF. El viaje de ida y vuelta a través de un formato editable lleva más tiempo que la edición directa, pero funciona para cualquier PDF que se pueda abrir y ver.
Para documentos que sólo necesitan correcciones menores, como corregir un error tipográfico en un solo párrafo, usar las herramientas de anotación del PDF para cubrir el texto incorrecto con un rectángulo blanco y escribir el texto corregido encima es una solución pragmática. Este método no edita realmente el texto subyacente ni la estructura del documento, por lo que la corrección basada en anotaciones es invisible para las herramientas de búsqueda y accesibilidad, pero para correcciones visuales rápidas en un documento que se imprimirá o verá como una imagen, produce resultados aceptables.
Para documentos que requieren una edición exhaustiva y no se pueden editar directamente, el enfoque más confiable es volver al documento fuente original, si está disponible.
El documento de Word, Google Doc o el archivo de InDesign que se utilizó para crear el PDF contiene texto editable que se puede modificar y reexportar a un nuevo PDF. Comunicarse con el creador del documento para obtener el archivo fuente, o localizar el archivo fuente en sus propios registros, suele ser más rápido que luchar para editar un PDF que no coopera.
Algunos archivos PDF que parecen contener texto nativo en realidad tienen el texto almacenado de una manera que las herramientas de edición no pueden modificar, aunque el texto se puede buscar y seleccionar. Esta situación ocurre cuando un PDF tiene una capa de texto correcta, que permite la búsqueda y selección, pero la codificación de fuente subyacente impide que la herramienta de edición asigne los caracteres editados a los glifos visuales correctos. La herramienta de edición puede leer el texto pero no puede volver a escribir los cambios en el documento sin dañar potencialmente la asignación de caracteres. Esta defensa contra la edición es a veces intencionada por parte del creador del documento.
La proliferación de herramientas de edición de PDF ha hecho que editar archivos PDF sea más fácil que nunca, pero también ha creado confusión sobre lo que constituye edición. Agregar una anotación de texto encima de una página PDF no es lo mismo que editar el texto subyacente. Reemplazar una imagen en una página PDF no es lo mismo que editar el texto que describe la imagen. Comprender la diferencia entre los cambios basados en anotaciones, que superponen contenido nuevo sobre la página existente, y la edición de texto real, que modifica el contenido del texto real dentro de la estructura del PDF, le ayuda a elegir la herramienta adecuada y el enfoque adecuado para cada tarea de edición.
Para documentos que resisten todos los intentos de edición y contienen información que es fundamental actualizar, la opción nuclear es recrear el documento desde cero. Utilice el PDF como referencia visual y vuelva a escribir el contenido en un procesador de textos o aplicación de diseño, realizando las ediciones durante el proceso de recreación. Este enfoque requiere mucha mano de obra, pero produce un documento limpio y totalmente editable sin problemas residuales de formato, problemas de fuentes ni artefactos de conversión. Recrear un documento a partir de un PDF lleva un tiempo proporcional a la longitud y complejidad del documento, y para documentos cortos que necesitan una edición importante, en realidad puede ser más rápido que luchar con herramientas de edición de PDF que no cooperan.
Intente editar PDF
No se necesita instalación. Funciona directamente en su navegador.
