Un conversor de PDF a Excel extrae las tablas de un documento PDF y las escribe en una hoja de cálculo con filas y columnas reales. El problema de la mayoría de conversores no es abrir el resultado, sino operar con él: devuelven cifras que Excel interpreta como texto, así que la función SUMA acaba dando cero. La herramienta de DocPivot escribe celdas numéricas de verdad, procesa el documento dentro de tu navegador y lee páginas escaneadas mediante OCR sin coste añadido.
Qué es el conversor de PDF a Excel de DocPivot
Funcionalidad principal
La herramienta lee cada página del PDF, reconstruye la rejilla de la tabla y genera un libro .xlsx auténtico, no un CSV con la extensión cambiada. La extracción se apoya en pdf.js, que devuelve cada fragmento de texto con sus coordenadas exactas; a partir de ahí, los fragmentos se agrupan en filas por línea base y en columnas por posición horizontal. Ese enfoque permite detectar tablas aunque el documento no tenga líneas de separación dibujadas. Si lo que necesitas es el texto corrido en lugar de la rejilla, el flujo natural es convertir el PDF a Word.
Usuarios objetivo y casos de uso
Los usuarios habituales son personas que reciben datos en PDF y necesitan calcular con ellos. Asesorías y gestorías que vacían extractos bancarios, autónomos que cuadran facturas antes del Modelo 303, analistas que rescatan cifras de informes anuales y responsables de compras que comparan tarifas de proveedores. Todos comparten la misma tarea: pasar una tabla impresa a una hoja donde se pueda sumar, filtrar y hacer tablas dinámicas.
Problema y solución
El escollo real de la conversión no es el formato, es el tipo de dato. Un valor como 1.240 que llega a Excel entrecomillado se queda como cadena de texto, y ninguna fórmula lo reconoce, por mucho que después cambies el formato de celda a «Número». El motor de esta herramienta decide el tipo celda a celda: lo que es numérico se escribe como número en el XML de la hoja, y el resto se escribe como cadena. La diferencia se nota en el primer =SUMA().
Principales ventajas del conversor de PDF a Excel
- Números que se pueden sumar: las cifras se escriben como celdas numéricas en el propio XML de la hoja, comprobado en LibreOffice, donde 1240 aparece como número frente al encabezado de texto de su misma fila.
- Sin límite de páginas ni de tamaño: como el análisis del documento ocurre en tu equipo, no hay cuota de servidor que repartir. Un PDF de 400 páginas se trata igual que uno de dos.
- OCR gratuito para escaneos: leer un PDF escaneado es la función que casi todo el sector cobra. Aquí está incluida, y si quieres devolver el escaneo con capa de texto puedes aplicar OCR al PDF directamente.
- El archivo no sale del navegador: la extracción de texto PDF no implica ninguna subida. La única excepción es el OCR, que es opcional y lo avisa antes de que pulses el botón.
- Salida en dos formatos: libro
.xlsxcuando quieras calcular, o.csvcuando el destino sea una importación a otro sistema. - Modo «Solo tablas»: descarta títulos, párrafos y notas al pie para que el encabezado real quede en la fila 1, sin limpieza manual previa.
- Sin registro ni marca de agua: no hay cuenta, ni correo, ni marca sobre el resultado. Interfaz disponible en 18 idiomas, y el peso del archivo original tampoco importa porque no se transfiere, a diferencia de lo que ocurre al comprimir un PDF en servicios que sí lo suben.
Funciones clave de la herramienta
- Detección de rejilla sin líneas: agrupa los fragmentos por línea base y por coordenada X, de modo que reconoce tablas maquetadas solo con espaciado.
- Tipado automático de celda: distingue valor numérico de cadena en el momento de escribir la hoja, no después mediante un formato aplicado por encima.
- Una hoja por página: cada página del PDF se convierte en una pestaña independiente del libro, útil cuando cada página es un periodo o un centro de coste distinto.
- Hoja única consolidada: la alternativa vuelca todas las páginas en una sola hoja continua, pensada para tablas que se prolongan a lo largo del documento.
- OCR con Tesseract: el reconocimiento de páginas escaneadas se ejecuta en servidor propio, sin API de terceros, sin modelos de IA y sin clave de acceso.
- Aviso cuando no hay resultado: si «Solo tablas» no encuentra ninguna rejilla, la herramienta lo dice y nombra el ajuste que hay que cambiar, en lugar de entregar un archivo vacío.
- Conservación de celdas multilínea: una fila de una sola celda se mantiene cuando cuelga de una columna en vez de estar pegada al margen izquierdo, para que los textos partidos en dos líneas no se pierdan.
- Exportación a CSV: genera el mismo contenido en texto plano separado por comas si necesitas extraer el texto del PDF para un proceso posterior o una carga masiva.
- Procesamiento por rango de páginas: combina bien con extraer páginas concretas del PDF cuando solo te interesan los anexos numéricos de un informe largo.
- Escritor de libro propio: la hoja se genera como XML dentro de un ZIP con unas doscientas líneas sobre el escritor ZIP ya existente, sin librería de hojas de cálculo de terceros, lo que reduce la superficie de dependencias.
- Funciona con documentos partidos: si has tenido que dividir el PDF por tamaño o por capítulos, cada trozo se convierte por separado y se consolida después en Excel.
Cómo funciona el conversor de PDF a Excel de DocPivot
- Abre la herramienta y selecciona el PDF. Si el documento está protegido, primero tendrás que quitar la contraseña del PDF.
- Elige el formato de salida: Excel (.xlsx) por defecto, o CSV si vas a importar los datos en otro sistema.
- Decide qué quieres conservar. «Todo» mantiene títulos y párrafos; «Solo tablas» los descarta y deja el encabezado en la primera fila.
- Marca «Leer el escaneo (OCR)» únicamente si el PDF no tiene capa de texto. Ese ajuste sí envía el archivo al servidor y lo advierte antes de continuar.
- Selecciona la disposición, una hoja por página o una hoja única, y descarga el libro resultante.
Cuándo usar el conversor de PDF a Excel
Esta herramienta encaja siempre que el dato que necesitas ya existe en forma de tabla, pero está atrapado en un formato pensado para imprimir. Es la opción indicada cuando vas a calcular con esas cifras y no solo a leerlas. Si únicamente quieres consultar el documento, convertirlo no aporta nada.
- Cierre contable trimestral: vaciar extractos bancarios en PDF para conciliar movimientos antes de presentar el Modelo 303.
- Comparativa de tarifas: pasar los precios de varios proveedores a una misma hoja para ordenarlos por importe.
- Informes anuales: rescatar los cuadros de las cuentas depositadas en el Registro Mercantil y analizarlos por ejercicio.
- Listados de inventario: convertir albaranes y notas de entrega en un listado filtrable por referencia.
- Datos públicos: extraer las tablas que el INE o los boletines oficiales publican en PDF sin versión abierta.
- Nóminas y costes de personal: reunir varios meses en una hoja para calcular medias y desviaciones.
- Archivo histórico escaneado: recuperar cifras de documentación antigua que solo existe en papel digitalizado.
Hay dos situaciones en las que conviene otra vía: cuando la tabla tiene celdas combinadas en varios niveles y necesitas reproducir la jerarquía exacta, y cuando el PDF es en realidad un formulario cuyos campos te interesan uno a uno. Para juntar antes varios documentos en uno solo, lo lógico es unir los PDF y convertir después.
Casos de uso
Gestoría que concilia extractos
Contexto: una asesoría en Valencia recibe cada mes extractos en PDF de cuatro bancos distintos para veinte clientes.
- Convierte cada extracto con la opción «Solo tablas» activada.
- Elige una hoja por página para separar los meses.
- Consolida los libros con una tabla dinámica por concepto.
Resultado: la conciliación deja de depender de la transcripción manual de importes, que era la fuente principal de errores.
Autónomo que cuadra el IVA
Contexto: un diseñador freelance acumula facturas emitidas en PDF desde su programa de facturación.
- Extrae las líneas de base imponible y cuota de cada factura.
- Suma la columna de cuotas repercutidas directamente en Excel.
- Contrasta el total con el borrador del modelo trimestral.
Resultado: el cuadre se resuelve con una fórmula en lugar de con una calculadora y una lista en papel.
Analista que compara ejercicios
Contexto: un equipo financiero necesita cinco años de cuentas de una empresa que solo publica PDF.
- Convierte cada memoria anual con disposición de hoja única.
- Alinea las partidas por concepto en una hoja maestra.
- Genera el gráfico de evolución sin retecleado.
Resultado: el análisis pasa de dos jornadas de transcripción a una revisión de encabezados. Para publicar el informe final de vuelta en PDF, el paso siguiente es convertir el Excel a PDF.
Comercio que vacía albaranes escaneados
Contexto: una tienda con almacén guarda albaranes en papel digitalizado sin capa de texto.
- Activa la lectura del escaneo antes de convertir.
- Revisa los encabezados, que es donde el OCR falla más.
- Repite el proceso mes a mes sobre lotes de documentos con el editor de PDF por lotes.
Resultado: el histórico de compras queda consultable, con las cifras correctas y algún encabezado corregido a mano.
Por qué tus números llegan a Excel como texto
La causa es el CSV intermedio que usan muchos conversores. Cuando un valor contiene un separador de miles, en un CSV hay que entrecomillarlo para que no rompa la estructura de columnas, y Excel lee entonces esa celda como texto. El síntoma es reconocible: el triángulo verde en la esquina de la celda, la alineación a la izquierda y una SUMA que devuelve cero.
Escribir directamente un .xlsx evita el paso por texto plano. En el XML de la hoja, cada celda lleva su propio tipo declarado, así que un importe entra como número desde el primer momento y no hay que rescatarlo después con la función VALOR ni con un pegado especial multiplicando por uno.
Separadores decimales y configuración regional
En España el separador decimal es la coma y el de miles es el punto, al contrario que en la convención anglosajona. Un PDF generado por un sistema configurado en inglés puede traer 1,240.50 donde tu Excel espera 1.240,50, y esa discrepancia se manifiesta como cifras multiplicadas por mil o como texto no reconocido.
Puntos clave:
- Comprueba una celda testigo: selecciona un importe y mira si aparece alineado a la derecha, señal de que Excel lo trata como número.
- Haz una suma de control: compara el total de una columna con el total impreso en el PDF antes de dar el dato por bueno.
- Revisa la configuración regional: en Excel, las opciones avanzadas permiten fijar qué carácter actúa como separador decimal al importar.
PDF a Excel, RGPD y datos personales
Convertir un documento con datos personales en un servicio que lo sube a su servidor implica una comunicación de datos a un tercero. Bajo el RGPD y la LOPDGDD, ese tercero actúa como encargado del tratamiento y la relación debe estar cubierta por un contrato conforme al artículo 28, con las garantías adicionales que exige el capítulo V si el servidor está fuera del Espacio Económico Europeo. La AEPD ha sancionado en repetidas ocasiones tratamientos sin base jurídica ni contrato de encargo.
El procesamiento en el navegador cambia el planteamiento: si el archivo nunca se transmite, no hay comunicación de datos que documentar para esa operación. La excepción es el OCR, que sí envía el documento, de modo que conviene reservarlo para escaneos sin información sensible o valorar antes el impacto. Cuando el documento contenga datos que no deban salir en la hoja resultante, lo prudente es censurar el PDF antes de convertirlo. Nada de esto sustituye al criterio de tu responsable de protección de datos.
Limitaciones que conviene conocer
El modo «Solo tablas» puede no encontrar nada, y lo dice. No todos los PDF tienen una rejilla que el extractor sepa detectar; por eso la opción por defecto es «Todo», porque una herramienta que devuelve un archivo vacío en silencio es indistinguible de una averiada.
El OCR acierta con las cifras, menos con los encabezados. En una prueba sobre un escaneo a 150 ppp sin capa de texto, los veinte valores numéricos se leyeron correctamente y una celda de encabezado devolvió Qi en lugar de Q1. Revisa siempre la fila de títulos después de un OCR.
Las celdas combinadas conservan la posición, no la combinación. Un encabezado que abarca dos columnas en el PDF aterriza sobre la primera de ellas, así que las cabeceras de varios niveles requieren un ajuste manual. Y si el PDF de partida está dañado o abre con errores, la extracción heredará el problema: en ese caso, primero toca reparar el PDF.
Preguntas frecuentes
Selecciona el PDF en la herramienta, elige Excel como formato de salida y descarga el libro. No hace falta registrarse ni instalar nada, y no hay límite de páginas porque la conversión ocurre en tu propio navegador.
Porque las cifras han llegado como texto, no como números. Ocurre cuando el conversor pasa por un CSV intermedio y entrecomilla los valores con separador de miles; este conversor escribe celdas numéricas directamente para evitarlo.
No, salvo que actives el OCR. La lectura del texto del PDF se hace íntegramente en el navegador; la opción de leer escaneos es la única que envía el documento y lo advierte antes de ejecutarse.
Sí, activando la opción de lectura del escaneo, que aplica OCR con Tesseract. Es gratuita, a diferencia de la mayoría de servicios equivalentes, que la reservan para sus planes de pago.
El .xlsx guarda el tipo de cada celda, así que los números siguen siendo números al abrirlo. El CSV es texto plano y delega esa interpretación en el programa que lo lea, con el riesgo de que convierta importes en cadenas.
Descarta el contenido que no forma parte de una rejilla, como títulos, párrafos y notas al pie. El resultado empieza directamente por la fila de encabezados de la tabla.
No hay ninguno de los dos. Como el documento no se transfiere a un servidor, no existe la cuota que suelen imponer los conversores en la nube.
Sí, la disposición por defecto crea una hoja por cada página del PDF. La alternativa vuelca todo en una hoja única, más práctica cuando una misma tabla continúa a lo largo de varias páginas.
Se mantiene la posición del contenido, pero no la combinación. Un encabezado que abarca dos columnas queda escrito sobre la primera, así que las cabeceras de varios niveles necesitan un retoque manual.
Sí con los números, con reservas en los encabezados. En una prueba a 150 ppp los veinte valores numéricos salieron correctos y un título de columna se leyó mal, de modo que la fila de encabezados merece una revisión.
Sí, y a veces compensa. Recortar páginas o reordenar el documento con el editor de PDF antes de la conversión reduce el trabajo de limpieza posterior en Excel.
Al procesarse en el navegador, esa operación no comunica datos a un tercero. Si activas el OCR el archivo sí se envía, así que valora antes el tipo de información que contiene y consulta con tu responsable de protección de datos.
Cambia de «Solo tablas» a «Todo» y vuelve a convertir. La herramienta avisa cuando no ha detectado ninguna rejilla e indica qué ajuste modificar en lugar de entregar un archivo sin contenido.
No con este conversor, que trabaja únicamente sobre el texto y su posición. Para quedarte con el contenido gráfico, lo indicado es convertir el PDF a JPG y trabajar con las páginas como imagen.
