Eliminar páginas duplicadas v1.0

Encuentra y elimina las páginas repetidas

Eliminar páginas duplicadas de DocPivot es una herramienta gratuita que localiza las páginas repetidas dentro de un mismo PDF y conserva una sola copia de cada una. Todo el proceso ocurre en tu navegador, así que el documento no se sube a ningún servidor. Está pensada para el caso más habitual: el escáner que arrastró dos hojas a la vez. Ahí la copia casi nunca es idéntica, sino la misma página pasada dos veces, con distinto ruido, inclinación y exposición. Antes de borrar nada te muestra qué páginas ha marcado, y después te dice cuántas ha quitado.

Qué es Eliminar páginas duplicadas de DocPivot

Funcionalidad principal

La herramienta compara cada página del PDF con las anteriores y descarta las repeticiones, dejando el documento con una sola copia de cada hoja. Para hacerlo lee cada página dos veces: extrae su texto normalizado y genera una huella visual de 32×32 casillas de brillo medio, calculada sobre fondo blanco y centrada para que dos escaneos de la misma hoja encajen casilla por casilla. El resultado es un PDF nuevo con las páginas supervivientes en su orden original, que DocPivot reconstruye sin tocar el archivo de partida.

Usuarios objetivo y casos de uso

La usan sobre todo quienes digitalizan papel en volumen: asesorías, gestorías, departamentos administrativos, despachos y cualquier autónomo que escanee facturas o contratos con un alimentador automático. También aparece en flujos de trabajo donde se combinan archivos que se solapan, como informes montados a partir de varias fuentes. Si el problema son hojas vacías en lugar de repetidas, lo que necesitas es eliminar páginas en blanco.

Problema y solución

El problema de fondo es que buscar duplicados a ojo en un documento largo es lento y poco fiable. En un escaneo de 200 hojas nadie compara cada página con todas las anteriores, así que las repeticiones acaban en el archivo definitivo o se van quitando una a una a mano con una herramienta de eliminar páginas de un PDF. Aquí la comparación la hace el navegador en segundos y tú solo revisas lo que ha marcado.

Principales ventajas de Eliminar páginas duplicadas

  • El archivo no sale de tu equipo: el PDF se abre y se procesa en el navegador. No hay subida, ni cola de servidor, ni copia temporal en un tercero.
  • Detecta reescaneos, no solo copias exactas: la mayoría de herramientas compara bytes idénticos y se le escapa la hoja alimentada dos veces. Aquí ese caso es precisamente el que se busca.
  • Ves las páginas marcadas antes de borrar: las candidatas aparecen señaladas en la cuadrícula y numeradas en el panel, así que una acción destructiva se vuelve comprobable.
  • Puedes acotar el análisis: si limitas el rango, nada fuera de él se toca, pase lo que pase con el resto del documento.
  • Eliges qué copia se queda: conservar la última es útil cuando el segundo pase del escáner es el bueno y el primero salió movido o quemado.
  • Te dice qué ha hecho: el panel informa del número de páginas eliminadas y también de que no ha encontrado ninguna, que es justo el mensaje que otras herramientas se callan.
  • Velocidad estable en documentos largos: un PDF de 300 páginas se analiza en torno a 6,5 segundos, sin límite diario ni cuenta de usuario.
  • Encaja con el resto del flujo: limpiar el duplicado antes de unir varios PDF evita arrastrar la repetición al documento final, y después puedes organizar las páginas con calma.

Funciones clave de Eliminar páginas duplicadas

  • Doble firma por página: cada hoja genera dos señales independientes, el texto y la apariencia, en lugar de una sola comparación de píxeles.
  • El texto tiene derecho de veto: si las palabras difieren, aunque sea en un dato, las páginas no son duplicadas. Esa regla es la que protege los formularios y las facturas con la misma plantilla.
  • Huella visual de 32×32: la imagen se reduce a una rejilla de brillo medio, lo bastante tosca para ignorar ruido y grano, y lo bastante fina para distinguir dos maquetas distintas.
  • Normalización antes de comparar: el renderizado se hace sobre fondo blanco y centrado, de modo que una hoja ligeramente desplazada en el cristal sigue coincidiendo.
  • Soporte para páginas sin texto: cuando la página es un escaneo puro y no hay capa textual, decide la huella visual. Si quieres esa capa de texto, pasa antes el documento por el OCR para PDF.
  • Agrupación acumulativa: las copias se comparan contra las páginas ya conservadas, así que una tirada de tres repeticiones se reduce a una sola, no a dos.
  • Tres niveles de coincidencia: «Solo copias idénticas», «Misma página, reescaneada» y «Misma página, escaneo de baja calidad», con el nivel intermedio como opción por defecto.
  • Elección de copia superviviente: primera o última, según si el original o la repetición es la versión que quieres conservar.
  • Rango de páginas libre: admite formatos como 1-4, 8 o 15- y deja intacto todo lo que quede fuera. En vacío analiza el documento entero.
  • Marcado visual en la cuadrícula: las páginas candidatas se resaltan sobre las miniaturas, junto al recuento exacto en el panel lateral.
  • Orden original respetado: el PDF reconstruido mantiene la secuencia de las páginas conservadas, sin reordenar nada por su cuenta.
  • Descarga manual: el archivo resultante no se baja solo. Se genera, se te enseña el resultado y decides tú. Si necesitas extraer páginas concretas o girar las que salieron torcidas, puedes hacerlo después sobre el archivo limpio.

Cómo funciona Eliminar páginas duplicadas de DocPivot

  1. Abre el PDF. El archivo se lee en local y sus páginas aparecen como una cuadrícula de miniaturas. Nada se transmite fuera del navegador.
  2. Ajusta los controles. Elige el nivel de coincidencia, la copia que quieres conservar y, si te interesa, el rango de páginas que se va a analizar.
  3. Lanza el análisis. Cada página se firma por texto y por apariencia, y las dos señales tienen que coincidir para que una hoja se considere repetida.
  4. Revisa lo marcado. El panel te dice cuántas ha encontrado y cuáles saldrían, por ejemplo «2 duplicadas: se eliminarían las páginas 2 y 3 y quedaría 1».
  5. Genera y descarga. DocPivot escribe un PDF nuevo con las páginas supervivientes y te ofrece el archivo. Si al revisarlo prefieres trabajar por bloques, siempre puedes dividir el PDF y tratar cada parte por separado.

Cuándo usar Eliminar páginas duplicadas

Esta herramienta rinde cuando sospechas que hay repeticiones pero no sabes dónde están. Si ya tienes localizada la página sobrante, borrarla a mano es más rápido. El valor aparece en documentos largos, escaneados o montados a partir de varias fuentes, donde revisar hoja por hoja no es realista.

  • Escaneo con alimentador automático: el ADF arrastró dos hojas pegadas y la misma página entró dos veces en el lote.
  • Reescaneo de hojas fallidas: repetiste varias páginas que salieron movidas y el archivo conserva las dos versiones.
  • Informes montados por partes: los archivos combinados se solapan y repiten portadas, índices o secciones enteras.
  • Exportaciones automáticas: un sistema de gestión genera el mismo bloque dos veces por un error de configuración.
  • Separadores repetidos: las hojas de corte entre expedientes aparecen decenas de veces en el mismo archivo.
  • Archivo antes de compartir: quieres entregar un documento limpio a un cliente o a una administración y no sabes si arrastras repeticiones.
  • Recuperación de documentación antigua: lotes digitalizados hace años, sin control de calidad en su momento.
  • Preparación para conversión: quitar las repeticiones antes de convertir el PDF a Word evita arrastrar párrafos duplicados al documento editable.

Hay un caso en el que conviene no usarla a ciegas: cuando el documento repite páginas a propósito, como un anexo que se adjunta idéntico en varias secciones. Ahí lo sensato es acotar el rango y dejar fuera esa parte.

Casos de uso

Asesoría que digitaliza facturas

Contexto: una asesoría recibe cada trimestre cajas de facturas en papel de sus clientes autónomos y las escanea por lotes antes de liquidar el modelo 303.

  • El alimentador duplica entre cinco y quince hojas por lote de 300.
  • El análisis marca las repeticiones y el administrativo revisa la cuadrícula.
  • Se conserva la última copia, que suele ser el reescaneo corregido.

Resultado: el lote entra en el gestor documental sin facturas contabilizadas dos veces por error de digitalización.

Expediente para una sede electrónica

Contexto: un trámite en una sede electrónica exige un único PDF con toda la documentación y aplica un límite de tamaño estricto.

  • El expediente se monta uniendo varios escaneos que comparten anexos.
  • La deduplicación quita las repeticiones antes de comprimir el PDF.
  • Al quitar hojas reales, la compresión posterior tiene menos trabajo que hacer.

Resultado: el expediente cabe en el límite del formulario sin degradar la calidad de los escaneos que sí importan.

Material docente escaneado

Contexto: un profesor digitaliza capítulos sueltos de varios manuales para subirlos al aula virtual del campus.

  • Los escaneos de distintas sesiones repiten páginas de solape entre capítulos.
  • Se analiza el archivo completo y se conserva la primera copia de cada página.
  • Después se recorta el sobrante y se numera el documento resultante.

Resultado: los alumnos descargan un único PDF continuo, sin páginas repetidas entre bloques. Para dejarlo presentable ayuda recortar los márgenes y numerar las páginas.

Documentación laboral en recursos humanos

Contexto: el departamento de personal de una pyme archiva la documentación de cada nueva incorporación en un solo PDF por empleado.

  • Los candidatos envían el mismo documento por dos vías y se escanea dos veces.
  • El análisis identifica las repeticiones sin abrir el contenido en ningún servidor.
  • El archivo queda con una copia de cada justificante antes de guardarse.

Resultado: el expediente de cada persona pesa menos y no acumula copias redundantes de documentos con datos personales.

Cómo elegir el nivel de coincidencia

El nivel de coincidencia define cuánta diferencia visual se tolera antes de dejar de considerar dos páginas la misma. La regla del texto no cambia nunca: si las palabras difieren, no hay duplicado, con independencia del nivel elegido. Lo que se ajusta es el margen que se concede a la huella visual, y eso es lo que separa un escaneo limpio de uno hecho a mala luz.

  • Solo copias idénticas: para PDF generados por ordenador, donde una repetición es exacta píxel a píxel.
  • Misma página, reescaneada: el ajuste por defecto, pensado para papel pasado dos veces por el mismo escáner.
  • Misma página, escaneo de baja calidad: para lotes antiguos, fotocopias o digitalizaciones con mucho ruido y contraste irregular.

Si dudas, empieza por el nivel intermedio y revisa lo que marca. Subir la tolerancia sin mirar la cuadrícula es la única forma realista de perder una página que querías conservar.

Qué no cuenta como duplicado

«Duplicado» no es un concepto definido en el formato PDF, así que la herramienta emite un juicio, no un dato objetivo. Dos páginas de un mismo formulario con datos distintos se parecen muchísimo en apariencia y se diferencian en muy poco texto, y por eso el texto manda. En cambio, una repetición legítima, como un separador en blanco o una portada que aparece varias veces a propósito, es un duplicado con cualquier criterio: si la eliminas, la herramienta está haciendo exactamente su trabajo.

Tampoco puede decirte que dos páginas pertenecen a documentos diferentes. Esa decisión sigue siendo tuya, y para eso está la revisión previa. Un rango mal escrito, por cierto, no analiza nada en lugar de borrar de más, que es el fallo seguro en una operación destructiva.

Privacidad, RGPD y documentos con datos personales

Como el PDF nunca sale del navegador, no hay transferencia de datos a un tercero que tratar ni encargado del tratamiento al que exigir garantías. Esto importa cuando el documento contiene nóminas, historiales, DNI escaneados o expedientes con datos de carácter personal, donde subir el archivo a un servicio externo abre una cuestión de cumplimiento del RGPD y de la LOPDGDD que conviene evitar. La herramienta no usa ninguna clave de API ni contacta con servicios externos durante el análisis.

Dos matices honestos. Limpiar duplicados no equivale a la digitalización certificada de facturas que regula la Orden EHA/962/2007, que exige software homologado por la AEAT: si tu objetivo es destruir el papel, esta no es la vía. Y si además necesitas tapar datos concretos dentro de las páginas que conservas, eso se hace con la herramienta para censurar un PDF, no eliminando hojas.

Preguntas frecuentes

Informar de un error

CONTACTO

info@toolspivot.com

DIRECCIÓN

Ward No.1, Nehuta, P.O - Kusha, P.S - Dobhi, Gaya, Bihar, India, 824220

Nuestras herramientas más populares