PDF в Excel v1.0

Превратите таблицы из PDF в таблицу, которую откроет Excel

Конвертер PDF в Excel извлекает таблицы из PDF-документа и собирает настоящую книгу .xlsx, где числа записаны числовыми ячейками, а не строками текста. Инструмент работает прямо в браузере: файл не уходит на сервер, ограничения по количеству страниц нет. Отсканированные документы читаются бесплатно через распознавание текста, тогда как большинство сервисов Рунета отдаёт эту функцию только в платном тарифе. Готовая книга открывается в Excel, Р7-Офис и МойОфис без промежуточных настроек импорта.

Обзор конвертера PDF в Excel от DocPivot

Основная функциональность

Инструмент разбирает текстовый слой PDF и восстанавливает по нему табличную сетку. Библиотека pdf.js версии 6.2.108 возвращает каждый текстовый фрагмент вместе с координатами на странице, после чего фрагменты группируются в строки по базовой линии и в столбцы по горизонтальной позиции. Линии разметки таблице не нужны: сетка собирается по расположению самого текста, поэтому работают и таблицы без рамок. На выходе вы получаете книгу .xlsx с листом на каждую страницу, одним общим листом или файл CSV, если он действительно нужен для конкретной системы.

Целевые пользователи и сценарии использования

Чаще всего конвертер нужен бухгалтерам, которым банк выдал выписку по расчётному счёту только в PDF, и аналитикам, собирающим показатели из отраслевых отчётов и годовой отчётности. Отдельная большая группа — специалисты по закупкам, разбирающие сметы, спецификации и коммерческие предложения из тендерной документации по 44-ФЗ и 223-ФЗ. Реже, но регулярно инструмент используют кадровики и юристы, работающие с реестрами и приложениями к договорам.

Проблема и решение

Главная сложность при переносе таблицы из PDF — не расположение ячеек, а тип данных. Скопированный вручную или полученный через CSV столбец сумм выглядит как числа, но ведёт себя как текст: сортировка идёт по алфавиту, формула СУММ возвращает ноль, сводная таблица не строится. Конвертер решает эту задачу на уровне формата файла, записывая числовые значения в числовые ячейки сразу при сборке книги. Дальше данные можно объединять с другими выгрузками или, наоборот, сохранять таблицу обратно в PDF для отправки контрагенту.

Почему .xlsx, а не CSV: запятая в русской локали ломает выгрузку

CSV не хранит тип данных — только текст и разделители, и в русской локали это даёт сразу два конфликта. Запятая в Windows с российскими региональными настройками уже занята под десятичный разделитель, поэтому русский Excel в пункте «CSV (разделитель — запятая)» на самом деле записывает точку с запятой. Файл, выгруженный зарубежным сервисом с запятой в роли разделителя и точкой в дробной части, при открытии двойным щелчком сворачивается в один столбец, и разбирать его приходится через мастер импорта.

Вторая половина проблемы — разряды. В российских документах тысячи разделяются пробелом: 1 240,50 ₽. Пробел внутри значения вынуждает закавычить ячейку в CSV, а закавыченное значение Excel читает как текст. Внешне столбец выглядит нормально, но арифметика по нему не работает, а единственный визуальный признак — выравнивание по левому краю.

Книга .xlsx снимает обе проблемы на уровне формата. Тип ячейки записан прямо в XML листа, разделителя в файле нет вообще, региональные настройки на импорт не влияют. Проверка через LibreOffice на тестовом отчёте показала ожидаемый результат: ячейка B3 сохранена как числовая со значением 1240, соседняя A3 — как текстовая со значением «Север». Это и есть причина, по которой .xlsx выбран форматом по умолчанию, а не переименованным CSV, как у части бесплатных конвертеров.

Основные преимущества конвертера PDF в Excel

  • Числа остаются числами. Значения записываются числовыми ячейками, поэтому суммы, сортировка и сводные таблицы работают сразу после открытия файла, без ручной переброски формата.
  • Нет лимита страниц и размера. Разбор идёт на вашем устройстве, а не на арендованном сервере, поэтому отчёт на 400 страниц обрабатывается на тех же условиях, что и счёт на одной.
  • Файл не покидает браузер. Для документов с персональными данными это свойство архитектуры, а не обещание в политике конфиденциальности, и оно напрямую снимает вопрос трансграничной передачи по 152-ФЗ.
  • Распознавание сканов бесплатно. Отсканированную выписку или акт можно прочитать без подписки, хотя в этой категории распознавание почти везде относится к премиум-функциям.
  • Честное поведение при пустом результате. Если выбранный режим не нашёл ни одной таблицы, инструмент сообщает об этом и называет настройку, которую нужно поменять, вместо выдачи пустого файла.
  • Совместимость с российскими офисными пакетами. Формат OOXML открывается в Р7-Офис и МойОфис, которые входят в реестр отечественного ПО и сертифицированы ФСТЭК.

Если исходный документ защищён паролем на открытие, снимите его через инструмент снятия защиты с PDF, иначе текстовый слой прочитать не получится.

Ключевые функции инструмента

  • Сборка сетки по координатам. Строки определяются по базовой линии текста, столбцы — по позиции по оси X, что позволяет разобрать таблицу без единой линии разметки.
  • Режим «Только таблицы». Заголовок страницы, абзацы и сноски попадают в книгу как строки из одной ячейки; переключатель убирает их, и настоящая шапка таблицы становится первой строкой.
  • Режим «Всё» по умолчанию. Подписи под таблицами и примечания сохраняются, что важно, когда в сноске указан период или курс пересчёта.
  • Распознавание отсканированных страниц. Опция включается вручную и обрабатывает документы без текстового слоя через Tesseract.
  • Выбор раскладки листов. Лист на каждую страницу подходит для многостраничных отчётов, один общий лист — для таблицы, разорванной постраничным разбиением.
  • Сохранение переносов внутри ячейки. Строка из одной ячейки прикрепляется к предыдущей, если стоит под столбцом, а не у левого поля, поэтому вторая строка длинного примечания не теряется.
  • Обработка многоуровневых шапок. Заголовок, растянутый на два столбца, попадает над первым из них и не сдвигает остальные данные.
  • Работа с длинными документами. Объёмный файл удобно разделить на части, собрать нужные разделы через объединение PDF или уменьшить сжатием PDF.

Как работает конвертер PDF в Excel от DocPivot

  1. Откройте страницу инструмента и выберите PDF-файл. Загрузка на сервер не выполняется, файл читается локально.
  2. Укажите формат результата: книга .xlsx или CSV. По умолчанию выбран .xlsx.
  3. Выберите, что забирать со страницы: всё содержимое или только таблицы.
  4. Если в документе нет текстового слоя, включите чтение скана. Инструмент предупредит, что для этого шага файл будет отправлен на сервер распознавания.
  5. Задайте раскладку: лист на страницу или один общий лист.
  6. Нажмите кнопку конвертации и скачайте готовую книгу. Проверьте шапку и итоговые строки перед тем, как строить формулы.

Если исходный PDF открывается с ошибкой или страницы перевёрнуты, сначала помогут восстановление повреждённого PDF и поворот страниц.

Когда использовать конвертер PDF в Excel

Инструмент нужен там, где данные уже существуют в табличном виде, но заперты в формате, рассчитанном на печать. Ручной перенос добавляет опечатки в цифры, а копирование через буфер обмена разрушает разбивку на столбцы.

  • Выписка по расчётному счёту. Банк выдал движение средств за квартал в PDF, а сверка нужна в таблице с фильтрами по контрагентам.
  • Тендерная документация. Смета или спецификация из состава закупочной документации переносится в рабочий файл для расчёта итоговой цены.
  • Отчётность контрагента. Бухгалтерский баланс или отчёт о финансовых результатах разбирается на показатели для оценки надёжности поставщика.
  • Прайс-листы поставщиков. Прайс пришёл в PDF, а загрузить его нужно в учётную систему или карточки товаров маркетплейса.
  • Архивные документы. Отсканированные ведомости прошлых лет переводятся в машиночитаемый вид через распознавание.

Не подойдёт инструмент в одном случае: если в PDF таблицы нет вовсе, а есть сплошной текст. Тогда логичнее взять извлечение текста из PDF или конвертацию PDF в Word, где сохранится форматирование абзацев.

Примеры использования

Сверка банковской выписки в 1С

Контекст: бухгалтер ООО восстанавливает учёт за период, когда обмен с клиент-банком не работал, и получил выписку в PDF.

  • Выписка конвертируется в .xlsx с режимом «Только таблицы».
  • Столбцы приход и расход проверяются на числовой тип по выравниванию.
  • Файл подаётся на вход обработке загрузки выписки из Excel.

Результат: формирование файла обмена проходит без ручной правки типов, суммы попадают в проводки корректно.

Расчёт цены по смете закупки

Контекст: специалист по закупкам готовит заявку и должен посчитать итог по смете из документации заказчика.

  • Смета извлекается из общего пакета документов постранично.
  • Таблица конвертируется в один общий лист, чтобы разбивка по страницам не мешала.
  • По столбцу стоимости сразу применяется СУММ без предварительной чистки.

Результат: итоговая цена заявки считается за минуты, а не переносится вручную по строкам.

Обработка отсканированного акта

Контекст: подрядчик прислал подписанный акт выполненных работ в виде скана без текстового слоя.

  • Включается чтение скана, инструмент предупреждает об отправке файла.
  • Числовые значения переносятся в книгу, шапка проверяется вручную.
  • Данные сопоставляются с плановыми объёмами в рабочем файле.

Результат: позиции акта попадают в таблицу без ручного набора двадцати строк цифр.

Честные ограничения инструмента

Ни один конвертер PDF в Excel не работает безошибочно. Перечисленное ниже проверено на реальных документах, а не выведено теоретически.

Режим «Только таблицы» иногда не находит ничего. Не в каждом PDF есть сетка, которую алгоритм распознаёт как таблицу, и тогда инструмент выводит предупреждение с указанием настройки, которую следует переключить. Именно поэтому по умолчанию выбран режим «Всё»: сервис, молча отдающий пустой файл, неотличим от сломанного.

Распознавание точно читает цифры, но не идеально читает заголовки. На тестовом скане 150 DPI без текстового слоя все 20 числовых значений совпали с оригиналом, а в одной ячейке шапки Q1 было прочитано как Qi. Шапку после распознавания стоит просматривать глазами, числовые столбцы — выборочно.

Объединённые и многоуровневые заголовки сохраняют позицию, но не объединение: заголовок, охватывающий два столбца в исходнике, окажется над первым из них.

Наконец, распознавание сканов — единственная операция на этой странице, при которой файл уходит на сервер, и инструмент предупреждает об этом до нажатия кнопки. Остальные режимы работают полностью на устройстве. Для документов, где часть сведений вообще не должна покидать организацию, разумнее сначала скрыть конфиденциальные фрагменты, а уже потом запускать распознавание.

Совместимость с российскими офисными пакетами и учётными системами

Формат .xlsx открывается всеми офисными пакетами, применяемыми в рамках импортозамещения. Р7-Офис и МойОфис поддерживают DOCX, XLSX и PPTX и входят в реестр российского ПО, поэтому книга попадает в рабочий контур госорганизации без пересохранения.

Для учётных систем важнее не сам формат, а сохранённый тип данных. Обработки загрузки банковской выписки из Excel в 1С ожидают в столбцах сумм числа, а не строки; при подаче текстовых значений формирование файла обмена 1CClientBankExchange либо прерывается, либо переносит нули. По этой причине книга DocPivot подходит для таких сценариев лучше, чем CSV, полученный на любом другом сервисе. Если результат нужно передать во внешнюю систему в виде архивного документа, пригодится преобразование в PDF/A.

Как инструмент выглядит на фоне конкурентов

Сравнение касается бесплатных тарифов и составлено по публичным условиям сервисов на момент подготовки материала.

ПараметрDocPivotSejdaiLovePDF
Лимит бесплатного тарифанет10 страниц, 50 МБ, 3 файла в часне указан явно
Форматы результатаExcel и CSVExcel и CSVExcel
Нетабличное содержимоесохраняется, убирается одним переключателемпереключение режимаотбрасывается по умолчанию
Распознавание скановбесплатнонетплатный тариф
Загрузка файла на сервертолько для распознаваниявсегдавсегда

Главное отличие не в количестве функций: открыть файл может любой конвертер, а вернуть таблицу, по которой считается сумма, получается не у всех. Подготовку документа закрывают извлечение отдельных страниц и редактор PDF.

Часто задаваемые вопросы

Сообщить об ошибке

СВЯЗАТЬСЯ С НАМИ

info@toolspivot.com

АДРЕС

Ward No.1, Nehuta, P.O - Kusha, P.S - Dobhi, Gaya, Bihar, India, 824220

Наши самые популярные инструменты