Удалить дублирующиеся страницы v1.0

Найдите и удалите повторяющиеся страницы

Инструмент находит повторяющиеся страницы внутри одного PDF и оставляет по одной копии каждой. Дубликаты почти никогда не появляются из-за копирования файла: их делает сканер, когда автоподатчик захватывает два листа сразу, оператор прогоняет пачку дважды или страницу пересканируют из-за смазанного оттиска. Такие копии не совпадают побайтово, поэтому обычный поиск одинаковых файлов их не видит. Обработка идёт целиком в браузере, документ никуда не уходит, а перед удалением инструмент показывает, какие именно листы он собирается убрать.

Обзор инструмента удаления дубликатов страниц DocPivot

Основная функциональность

Инструмент сравнивает каждую страницу документа с теми, что уже оставлены, и помечает повторы. Для сравнения используются два независимых признака: текстовый слой страницы и её визуальный отпечаток размером 32×32 ячейки. Страница попадает под удаление только тогда, когда оба признака согласны между собой. Результатом становится новый PDF, в котором уцелевшие листы идут в исходном порядке.

Кому нужен такой инструмент

Инструмент рассчитан на тех, кто работает с большими сканами: бухгалтеров, юристов, кадровиков, сотрудников канцелярий и архивов. Речь идёт о пачках первичных документов, судебных приложениях, реестрах и делах на сотни листов, которые физически невозможно пролистать вручную. Полезен он и при подготовке отчётности, где рядом лежит задача на удаление пустых страниц после двустороннего сканирования.

Проблема и решение

Повторяющийся лист в скане ломает нумерацию, раздувает файл и вызывает вопросы у приёмной стороны. Найти его глазами в документе на 300 страниц нереально, а автоматические чистильщики обычно сравнивают файлы целиком, а не страницы внутри файла. Инструмент закрывает именно этот разрыв: он работает на уровне страниц одного документа и признаёт копией лист, отсканированный повторно, а не только точный клон.

Основные преимущества инструмента

  • Документ остаётся у вас. Файл открывается и пересобирается в браузере, на сервер он не передаётся. Для сканов паспортов, договоров и медицинских справок это принципиально.
  • Находит пересканы, а не только клоны. Два прохода одного листа различаются шумом, перекосом и экспозицией, и побайтовое сравнение их пропускает.
  • Видно, что будет удалено. Кандидаты помечаются в сетке миниатюр и перечисляются списком до того, как что-либо изменится.
  • Вы выбираете, какую копию сохранить. Первая копия годится для чистых пачек, последняя чаще оказывается исправленным пересканом.
  • Обработка ограничивается диапазоном. Страницы вне заданного диапазона не трогаются, как бы они ни выглядели.
  • Файл заметно худеет. Каждая убранная страница скана освобождает сотни килобайт, что особенно ощутимо перед сжатием PDF для отправки по почте.
  • Понятный отчёт о результате. После обработки видно, сколько страниц ушло и сколько осталось, включая случай, когда повторов не нашлось.
  • Ничего не удаляется само. Если нужен полный контроль над каждым листом, остаётся привычное удаление страниц из PDF вручную.

Ключевые функции

  • Две подписи для каждой страницы. Текст с нормализованными пробелами и отпечаток средней яркости 32×32, снятый на белом фоне с выравниванием по центру.
  • Приоритет текста. Разные слова означают разные страницы, даже если отличие в одной цифре, и это правило отменить нельзя.
  • Отпечаток для сканов без текстового слоя. Если слов на странице нет, решение принимает картинка, поэтому пачки без распознавания текста тоже обрабатываются.
  • Три уровня строгости. Только идентичные копии, повторное сканирование того же листа и повторное сканирование плохого качества.
  • Группировка серий. Три подряд идущие копии схлопываются до одной, а не до двух, потому что сравнение идёт с уже оставленными листами.
  • Выбор сохраняемой копии. Переключатель между первой и последней копией в группе.
  • Диапазон проверки. Запись вида 1-4, 8, 15- ограничивает область поиска; пустое поле означает проверку всего документа.
  • Сетка миниатюр с пометками. Каждая страница видна до обработки, отмеченные листы перечислены в панели по номерам.
  • Пересборка без изменения порядка. Уцелевшие страницы записываются в новый файл в том же порядке, в каком шли в оригинале, поэтому последующее упорядочивание страниц обычно не требуется.
  • Честное сообщение о пустом результате. Фраза о том, что дубликаты не найдены, выводится явно и не выглядит как сбой.

Как работает удаление дубликатов страниц в DocPivot

  1. Откройте PDF в инструменте. Файл читается библиотекой pdf.js прямо на вашем устройстве и показывается сеткой страниц.
  2. Задайте параметры: уровень строгости, какую копию оставлять и при необходимости диапазон страниц.
  3. Запустите анализ. Каждая страница получает текстовую и визуальную подпись, после чего сравнивается с уже отобранными.
  4. Проверьте пометки. Страницы, предложенные к удалению, подсвечены в сетке и названы по номерам в панели результата.
  5. Соберите итоговый файл и скачайте его. Если документ нужно ещё и разделить на части, делайте это уже после очистки.

Порядок шагов важен в одном месте. Сравнение идёт не всех страниц со всеми, а каждой очередной с теми, что уже отобраны как уникальные. Благодаря этому серия из трёх повторов подряд схлопывается до одной страницы, а не оставляет вторую копию в документе. Для пачек, отсканированных в несколько подходов, такой порядок даёт предсказуемый результат.

Когда стоит использовать инструмент

Инструмент нужен там, где документ собран из бумаги, а не сверстан в редакторе. Сканирование пачками неизбежно даёт двойные подачи, повторные прогоны и пересканы, и чем больше объём, тем выше вероятность, что повтор дойдёт до получателя. Ниже типичные ситуации.

  • Скан через автоподатчик. АПД захватил два слипшихся листа, и в файле оказалась лишняя копия.
  • Повторный прогон пачки. Оператор отсканировал стопку дважды, документ получился ровно вдвое длиннее.
  • Пересканы отдельных листов. Страницу переснимали из-за перекоса или тёмного оттиска, а старый вариант остался.
  • Сшивка из нескольких источников. После объединения PDF в общий пакет часть приложений попала в него дважды.
  • Подготовка к подаче в суд или в ведомство. Лишние листы сбивают нумерацию приложений и опись.
  • Архивирование дел. Перед долгим хранением из скана убирают повторы, чтобы не дублировать их во всех копиях архива.
  • Файлы после сбоя сканера. Иногда повторы соседствуют с битой структурой, и тогда сначала требуется восстановление повреждённого PDF.

Есть и обратная ситуация. Если документ по природе содержит одинаковые листы, например пустые разделители или повторяющуюся титульную обложку, инструмент сочтёт их дубликатами и будет прав по всем формальным признакам.

Отдельно стоит учитывать настройки сканирования. Пачки, снятые в градациях серого с разрешением 200 или 300 точек на дюйм, как того требуют регламенты подачи документов в суды и налоговую, дают ровный шум и хорошо ложатся на режим повторного сканирования. Цветные сканы с автоматической коррекцией экспозиции различаются сильнее, и для них разумнее самый терпимый режим.

Примеры использования

Пакет документов в «Мой арбитр»

Контекст: юрист готовит приложения к иску, отсканированные в градациях серого с разрешением 200 точек на дюйм.

  • Проверяется весь пакет целиком, строгость ставится на повторное сканирование.
  • Отмеченные листы сверяются с описью приложений.
  • Файл пересобирается, нумерация приложений сохраняет сплошной порядок.

Результат: пакет проходит проверку канцелярии без замечаний к составу, а его объём укладывается в лимит сервиса.

Архив первичных документов

Контекст: бухгалтер ИП сводит накладные и акты за квартал в один файл для хранения и ЭДО.

  • Диапазон ограничивается страницами текущего квартала.
  • Сохраняется последняя копия, поскольку пересканы делались после правок.
  • Очищенный файл переводится в формат PDF/A для долгосрочного хранения.

Результат: архив за квартал становится короче на десятки страниц, а поиск по нему перестаёт выдавать по два одинаковых акта.

Документы поставщика маркетплейса

Контекст: продавец на Wildberries собирает сертификаты и отказные письма для карточек товара.

  • Строгость выставляется на идентичные копии, чтобы не тронуть похожие бланки.
  • Удаляются повторы, попавшие из разных папок поставщиков.
  • Итоговый комплект отправляется на согласование и при необходимости получает подпись в PDF.

Результат: в комплекте остаётся по одному экземпляру каждого документа, и модерация не возвращает его на доработку.

Кадровые дела

Контекст: кадровик оцифровывает личные дела сотрудников, включая договоры ГПХ и заявления.

  • Каждое дело обрабатывается отдельно, диапазон не задаётся.
  • Проверяются пометки: одинаковые бланки заявлений с разными датами инструмент оставляет.
  • Перед передачей в общий доступ персональные данные закрываются через затемнение фрагментов PDF.

Результат: дела хранятся без повторов, при этом различающиеся по содержанию листы остаются на месте.

Как инструмент решает, что две страницы одинаковые

Слово «дубликат» не определено в спецификации PDF, поэтому любое решение здесь оценочное. Инструмент строит его на двух сигналах и на праве текста наложить запрет: если слова различаются, страницы считаются разными независимо от того, насколько похожи картинки. Визуальный отпечаток получает голос только тогда, когда текст совпал или текста нет вовсе.

  • Только идентичные копии. Совпадение должно быть практически полным, подходит для документов, собранных из электронных источников.
  • Повторное сканирование того же листа. Режим по умолчанию, допускает расхождения по шуму и перекосу.
  • Повторное сканирование плохого качества. Самый терпимый режим для тёмных, засвеченных и перекошенных сканов.

Смысл трёх режимов простой: перескан одного листа отличается понемногу везде, а две страницы одного бланка отличаются сильно, но в одном месте. Если нужно вытащить конкретные листы для отдельной проверки, помогает извлечение страниц из PDF.

Чем это отличается от обычных онлайн-сервисов

Большинство сервисов удаления страниц ждёт, что вы сами найдёте повторы и отметите их мышью. Разница между таким подходом и автоматическим поиском видна на нескольких пунктах.

  • Где выполняется обработка. Типовой сервис загружает файл на сервер, здесь он не покидает браузер.
  • Что считается совпадением. Обычно сравниваются точные байты, здесь сначала слова, затем внешний вид.
  • Пересканы одного листа. Побайтовое сравнение их не замечает, двухсигнальное находит.
  • Предварительный просмотр. Разрушающее действие показывается заранее, а не сообщается по факту.
  • Скорость. Документ на 300 страниц разбирается примерно за 6,5 секунды.

Стоит назвать и границы. Инструмент не определяет, относятся ли два похожих листа к разным документам, и не заменяет юридическую сверку комплекта. Это анализ формы, а не смысла, и последнее слово остаётся за человеком, который смотрит на пометки перед удалением.

Часто задаваемые вопросы

Сообщить об ошибке

СВЯЗАТЬСЯ С НАМИ

info@toolspivot.com

АДРЕС

Ward No.1, Nehuta, P.O - Kusha, P.S - Dobhi, Gaya, Bihar, India, 824220

Наши самые популярные инструменты