Инструмент находит повторяющиеся страницы внутри одного PDF и оставляет по одной копии каждой. Дубликаты почти никогда не появляются из-за копирования файла: их делает сканер, когда автоподатчик захватывает два листа сразу, оператор прогоняет пачку дважды или страницу пересканируют из-за смазанного оттиска. Такие копии не совпадают побайтово, поэтому обычный поиск одинаковых файлов их не видит. Обработка идёт целиком в браузере, документ никуда не уходит, а перед удалением инструмент показывает, какие именно листы он собирается убрать.
Обзор инструмента удаления дубликатов страниц DocPivot
Основная функциональность
Инструмент сравнивает каждую страницу документа с теми, что уже оставлены, и помечает повторы. Для сравнения используются два независимых признака: текстовый слой страницы и её визуальный отпечаток размером 32×32 ячейки. Страница попадает под удаление только тогда, когда оба признака согласны между собой. Результатом становится новый PDF, в котором уцелевшие листы идут в исходном порядке.
Кому нужен такой инструмент
Инструмент рассчитан на тех, кто работает с большими сканами: бухгалтеров, юристов, кадровиков, сотрудников канцелярий и архивов. Речь идёт о пачках первичных документов, судебных приложениях, реестрах и делах на сотни листов, которые физически невозможно пролистать вручную. Полезен он и при подготовке отчётности, где рядом лежит задача на удаление пустых страниц после двустороннего сканирования.
Проблема и решение
Повторяющийся лист в скане ломает нумерацию, раздувает файл и вызывает вопросы у приёмной стороны. Найти его глазами в документе на 300 страниц нереально, а автоматические чистильщики обычно сравнивают файлы целиком, а не страницы внутри файла. Инструмент закрывает именно этот разрыв: он работает на уровне страниц одного документа и признаёт копией лист, отсканированный повторно, а не только точный клон.
Основные преимущества инструмента
- Документ остаётся у вас. Файл открывается и пересобирается в браузере, на сервер он не передаётся. Для сканов паспортов, договоров и медицинских справок это принципиально.
- Находит пересканы, а не только клоны. Два прохода одного листа различаются шумом, перекосом и экспозицией, и побайтовое сравнение их пропускает.
- Видно, что будет удалено. Кандидаты помечаются в сетке миниатюр и перечисляются списком до того, как что-либо изменится.
- Вы выбираете, какую копию сохранить. Первая копия годится для чистых пачек, последняя чаще оказывается исправленным пересканом.
- Обработка ограничивается диапазоном. Страницы вне заданного диапазона не трогаются, как бы они ни выглядели.
- Файл заметно худеет. Каждая убранная страница скана освобождает сотни килобайт, что особенно ощутимо перед сжатием PDF для отправки по почте.
- Понятный отчёт о результате. После обработки видно, сколько страниц ушло и сколько осталось, включая случай, когда повторов не нашлось.
- Ничего не удаляется само. Если нужен полный контроль над каждым листом, остаётся привычное удаление страниц из PDF вручную.
Ключевые функции
- Две подписи для каждой страницы. Текст с нормализованными пробелами и отпечаток средней яркости 32×32, снятый на белом фоне с выравниванием по центру.
- Приоритет текста. Разные слова означают разные страницы, даже если отличие в одной цифре, и это правило отменить нельзя.
- Отпечаток для сканов без текстового слоя. Если слов на странице нет, решение принимает картинка, поэтому пачки без распознавания текста тоже обрабатываются.
- Три уровня строгости. Только идентичные копии, повторное сканирование того же листа и повторное сканирование плохого качества.
- Группировка серий. Три подряд идущие копии схлопываются до одной, а не до двух, потому что сравнение идёт с уже оставленными листами.
- Выбор сохраняемой копии. Переключатель между первой и последней копией в группе.
- Диапазон проверки. Запись вида 1-4, 8, 15- ограничивает область поиска; пустое поле означает проверку всего документа.
- Сетка миниатюр с пометками. Каждая страница видна до обработки, отмеченные листы перечислены в панели по номерам.
- Пересборка без изменения порядка. Уцелевшие страницы записываются в новый файл в том же порядке, в каком шли в оригинале, поэтому последующее упорядочивание страниц обычно не требуется.
- Честное сообщение о пустом результате. Фраза о том, что дубликаты не найдены, выводится явно и не выглядит как сбой.
Как работает удаление дубликатов страниц в DocPivot
- Откройте PDF в инструменте. Файл читается библиотекой pdf.js прямо на вашем устройстве и показывается сеткой страниц.
- Задайте параметры: уровень строгости, какую копию оставлять и при необходимости диапазон страниц.
- Запустите анализ. Каждая страница получает текстовую и визуальную подпись, после чего сравнивается с уже отобранными.
- Проверьте пометки. Страницы, предложенные к удалению, подсвечены в сетке и названы по номерам в панели результата.
- Соберите итоговый файл и скачайте его. Если документ нужно ещё и разделить на части, делайте это уже после очистки.
Порядок шагов важен в одном месте. Сравнение идёт не всех страниц со всеми, а каждой очередной с теми, что уже отобраны как уникальные. Благодаря этому серия из трёх повторов подряд схлопывается до одной страницы, а не оставляет вторую копию в документе. Для пачек, отсканированных в несколько подходов, такой порядок даёт предсказуемый результат.
Когда стоит использовать инструмент
Инструмент нужен там, где документ собран из бумаги, а не сверстан в редакторе. Сканирование пачками неизбежно даёт двойные подачи, повторные прогоны и пересканы, и чем больше объём, тем выше вероятность, что повтор дойдёт до получателя. Ниже типичные ситуации.
- Скан через автоподатчик. АПД захватил два слипшихся листа, и в файле оказалась лишняя копия.
- Повторный прогон пачки. Оператор отсканировал стопку дважды, документ получился ровно вдвое длиннее.
- Пересканы отдельных листов. Страницу переснимали из-за перекоса или тёмного оттиска, а старый вариант остался.
- Сшивка из нескольких источников. После объединения PDF в общий пакет часть приложений попала в него дважды.
- Подготовка к подаче в суд или в ведомство. Лишние листы сбивают нумерацию приложений и опись.
- Архивирование дел. Перед долгим хранением из скана убирают повторы, чтобы не дублировать их во всех копиях архива.
- Файлы после сбоя сканера. Иногда повторы соседствуют с битой структурой, и тогда сначала требуется восстановление повреждённого PDF.
Есть и обратная ситуация. Если документ по природе содержит одинаковые листы, например пустые разделители или повторяющуюся титульную обложку, инструмент сочтёт их дубликатами и будет прав по всем формальным признакам.
Отдельно стоит учитывать настройки сканирования. Пачки, снятые в градациях серого с разрешением 200 или 300 точек на дюйм, как того требуют регламенты подачи документов в суды и налоговую, дают ровный шум и хорошо ложатся на режим повторного сканирования. Цветные сканы с автоматической коррекцией экспозиции различаются сильнее, и для них разумнее самый терпимый режим.
Примеры использования
Пакет документов в «Мой арбитр»
Контекст: юрист готовит приложения к иску, отсканированные в градациях серого с разрешением 200 точек на дюйм.
- Проверяется весь пакет целиком, строгость ставится на повторное сканирование.
- Отмеченные листы сверяются с описью приложений.
- Файл пересобирается, нумерация приложений сохраняет сплошной порядок.
Результат: пакет проходит проверку канцелярии без замечаний к составу, а его объём укладывается в лимит сервиса.
Архив первичных документов
Контекст: бухгалтер ИП сводит накладные и акты за квартал в один файл для хранения и ЭДО.
- Диапазон ограничивается страницами текущего квартала.
- Сохраняется последняя копия, поскольку пересканы делались после правок.
- Очищенный файл переводится в формат PDF/A для долгосрочного хранения.
Результат: архив за квартал становится короче на десятки страниц, а поиск по нему перестаёт выдавать по два одинаковых акта.
Документы поставщика маркетплейса
Контекст: продавец на Wildberries собирает сертификаты и отказные письма для карточек товара.
- Строгость выставляется на идентичные копии, чтобы не тронуть похожие бланки.
- Удаляются повторы, попавшие из разных папок поставщиков.
- Итоговый комплект отправляется на согласование и при необходимости получает подпись в PDF.
Результат: в комплекте остаётся по одному экземпляру каждого документа, и модерация не возвращает его на доработку.
Кадровые дела
Контекст: кадровик оцифровывает личные дела сотрудников, включая договоры ГПХ и заявления.
- Каждое дело обрабатывается отдельно, диапазон не задаётся.
- Проверяются пометки: одинаковые бланки заявлений с разными датами инструмент оставляет.
- Перед передачей в общий доступ персональные данные закрываются через затемнение фрагментов PDF.
Результат: дела хранятся без повторов, при этом различающиеся по содержанию листы остаются на месте.
Как инструмент решает, что две страницы одинаковые
Слово «дубликат» не определено в спецификации PDF, поэтому любое решение здесь оценочное. Инструмент строит его на двух сигналах и на праве текста наложить запрет: если слова различаются, страницы считаются разными независимо от того, насколько похожи картинки. Визуальный отпечаток получает голос только тогда, когда текст совпал или текста нет вовсе.
- Только идентичные копии. Совпадение должно быть практически полным, подходит для документов, собранных из электронных источников.
- Повторное сканирование того же листа. Режим по умолчанию, допускает расхождения по шуму и перекосу.
- Повторное сканирование плохого качества. Самый терпимый режим для тёмных, засвеченных и перекошенных сканов.
Смысл трёх режимов простой: перескан одного листа отличается понемногу везде, а две страницы одного бланка отличаются сильно, но в одном месте. Если нужно вытащить конкретные листы для отдельной проверки, помогает извлечение страниц из PDF.
Чем это отличается от обычных онлайн-сервисов
Большинство сервисов удаления страниц ждёт, что вы сами найдёте повторы и отметите их мышью. Разница между таким подходом и автоматическим поиском видна на нескольких пунктах.
- Где выполняется обработка. Типовой сервис загружает файл на сервер, здесь он не покидает браузер.
- Что считается совпадением. Обычно сравниваются точные байты, здесь сначала слова, затем внешний вид.
- Пересканы одного листа. Побайтовое сравнение их не замечает, двухсигнальное находит.
- Предварительный просмотр. Разрушающее действие показывается заранее, а не сообщается по факту.
- Скорость. Документ на 300 страниц разбирается примерно за 6,5 секунды.
Стоит назвать и границы. Инструмент не определяет, относятся ли два похожих листа к разным документам, и не заменяет юридическую сверку комплекта. Это анализ формы, а не смысла, и последнее слово остаётся за человеком, который смотрит на пометки перед удалением.
Часто задаваемые вопросы
Откройте документ в инструменте DocPivot, выберите уровень строгости и запустите анализ, затем проверьте пометки и соберите новый файл. Регистрация не нужна, ограничений по количеству документов нет.
Нет, PDF обрабатывается только в браузере вашего устройства. Трансграничной передачи персональных данных при такой схеме не происходит, что снимает часть вопросов по 152-ФЗ при работе со сканами паспортов и договоров.
Да, для этого он и сделан. Два прохода одного листа различаются шумом и перекосом, поэтому вместе с текстом сравнивается визуальный отпечаток страницы.
Такие страницы останутся в документе. Текстовое различие имеет приоритет над визуальным сходством, и это правило работает всегда, независимо от выбранного режима.
Да, для страниц без текста решение принимает визуальный отпечаток. Если позже потребуется поиск по содержимому, документ можно пропустить через распознавание.
Начните с режима повторного сканирования, он подходит большинству пачек с автоподатчика. Для документов из электронных источников берите режим идентичных копий, для тёмных и перекошенных сканов самый терпимый вариант.
Первую, если пачка сканировалась за один проход без правок. Последнюю стоит выбрать, когда часть листов пересканировали, потому что исправленный вариант обычно идёт позже.
Документ на 300 страниц анализируется примерно за 6,5 секунды. Скорость зависит от устройства, поскольку вычисления идут на вашем процессоре, а не на сервере.
Да, задайте диапазон в поле проверки, например 1-4, 8, 15-. Страницы вне диапазона не анализируются и не удаляются ни при каких условиях.
Да, если они одинаковые, формально это повторы. Когда пустые листы нужно убрать целенаправленно, точнее сработает отдельный инструмент для их поиска.
Да, уцелевшие страницы записываются в исходном порядке. При необходимости отдельные листы затем разворачивают через поворот страниц PDF.
Он прямо сообщает, что дубликаты не найдены, и не создаёт новый файл. Это нормальный результат, а не ошибка обработки.
Нет, скачивание начинается только после нажатия кнопки. До этого исходный документ остаётся нетронутым.
Для визуальной сверки удобнее перевести листы в картинки через конвертацию PDF в JPG. Сам же поиск повторов быстрее делать в исходном PDF.
