Cómo ocultar texto sensible en un PDF
Puedes ocultar una cadena concreta de un PDF proporcionando el documento en base64 y un texto de búsqueda no vacío. Si el procesamiento es correcto, recibirás otro PDF en base64 con redacciones aplicadas y los recuentos correspondientes.
Finalidad de la herramienta
Esta herramienta sirve para ocultar texto coincidente dentro de un PDF mediante redacciones aplicadas sobre las regiones donde aparece. Es útil cuando necesitas retirar una cadena concreta, como un número de identificación o un dato de contacto, siempre que ese contenido forme parte del texto seleccionable de la página y no esté presente únicamente como imagen.
La entrada debe ser un PDF codificado en base64. Cuando el procesamiento termina correctamente, se obtiene un PDF codificado en base64 en el que el contenido coincidente se ha eliminado mediante redacciones. La respuesta también informa del número de páginas procesadas y de las coincidencias encontradas, datos que ayudan a comprobar si la búsqueda se comportó como esperabas.
Procedimiento paso a paso
-
Prepara el archivo. Convierte el PDF a una cadena base64 y comprueba que, al decodificarse, sus bytes comienzan con la firma de un PDF. No envíes un archivo ausente, una cadena mal codificada ni un formato distinto de PDF, porque la entrada no superará la validación.
-
Introduce un texto de búsqueda no vacío. Escribe la cadena que quieres localizar respetando sus caracteres y espacios tal como aparecen en el texto extraíble del documento. Si dejas este valor vacío, la operación falla antes de iniciar el procesamiento del PDF.
-
Indica, si procede, un texto de sustitución ASCII. Cuando no proporcionas uno, se emplea el valor predeterminado, que es un carácter de bloque. Un valor que no sea ASCII no se suministra como texto de sustitución de la anotación de redacción; por eso, utiliza caracteres ASCII si necesitas que la sustitución sea visible.
-
Envía el PDF codificado junto con el texto de búsqueda al proceso. La herramienta examina el texto de cada página, localiza las coincidencias y aplica una redacción sobre las regiones correspondientes. La operación se basa en el contenido textual que el PDF permite extraer.
-
Revisa la respuesta recibida. Conserva el PDF resultante en base64 y consulta los recuentos de páginas procesadas y de coincidencias. Después, abre el documento generado y comprueba que la información que querías retirar ya no aparece en el resultado.
Lectura de la respuesta
Un procesamiento correcto indica que se ha generado un PDF en base64 con redacciones aplicadas sobre las coincidencias localizadas. El recuento de coincidencias permite contrastar si la cadena buscada apareció tantas veces como preveías; una cifra diferente puede deberse a que el texto se repite o a que alguna aparición está escrita de otra manera.
El PDF resultante contiene el contenido coincidente retirado mediante redacciones, y la respuesta incluye el número de páginas examinadas. Aun así, conviene revisar el documento obtenido, especialmente si esperabas encontrar una referencia en varias páginas o si el texto tenía separadores, espacios o caracteres distintos.
La función trabaja sobre el texto de las páginas del PDF. No cubre texto que solo exista dentro de una imagen ni contenido que requiera OCR, de modo que una palabra visible en pantalla no necesariamente podrá localizarse mediante esta búsqueda. Si falta el archivo o la entrada no es un PDF válido tras decodificarla, no se genera un resultado procesado.
Ejemplo práctico
Una persona necesita retirar una referencia de cliente que aparece como texto seleccionable en un informe PDF antes de compartir el documento.
Toma un PDF de tres páginas con una referencia de cliente seleccionable, conviértelo a base64, introduce esa referencia como texto de búsqueda y procesa el documento sin cambiar el texto de sustitución predeterminado.
La respuesta correcta contiene un PDF resultante codificado en base64, el número de páginas procesadas y el número de coincidencias encontradas.
Limitaciones
- La búsqueda se limita al texto de las páginas del PDF; no incluye texto integrado únicamente en imágenes ni contenido que requiera OCR.
Errores frecuentes
- Un fallo puede deberse a enviar una búsqueda vacía o una entrada que no decodifica como PDF. Corrígelo escribiendo una cadena de búsqueda con contenido y verificando que la entrada base64 produce bytes que comienzan con la firma de un PDF.
Preguntas frecuentes
¿Puede ocultar texto que aparece dentro de una imagen del PDF?
Solo cuando el PDF contiene texto de página seleccionable que coincide con la cadena buscada. El contenido que existe únicamente dentro de imágenes o requiere OCR no forma parte de la búsqueda.
¿Qué formato debe tener el archivo?
La entrada debe ser un PDF codificado en base64 y, una vez decodificada, sus bytes deben comenzar con la firma de un PDF. La ausencia del archivo o una entrada inválida provoca un fallo.
¿Puedo dejar vacío el texto que quiero buscar?
Debes proporcionar un texto de búsqueda con contenido. Un valor vacío hace que la operación falle antes de procesar el documento.