Что это за инструмент?
Этот инструмент считывает текстовое содержимое каждой страницы PDF-файла и восстанавливает его в виде строк и столбцов в книге Excel — по одному листу на страницу. Он группирует текст в строки по вертикальному положению, а затем разбивает каждую строку на ячейки там, где между словами обнаружен широкий горизонтальный промежуток — это разумный признак того, что 'здесь начинается новый столбец', а не просто пробел.
Такая эвристика хорошо работает для PDF с простыми, равномерно расположенными таблицами или списками — счетами, прайс-листами, экспортированными отчётами. Она не может надёжно восстановить сложные макеты с объединёнными ячейками, многострочным содержимым внутри ячейки или таблицы без чёткого разделения между столбцами; в таких случаях после скачивания результат, скорее всего, придётся корректировать вручную.
Зачем его использовать?
- Превращает таблицы и списки из PDF в редактируемый и сортируемый файл Excel вместо ручного набора данных заново.
- Без регистрации, без водяных знаков, полностью бесплатно.
- Локально и приватно — ваш PDF-файл никогда не загружается на сервер.
- Один лист на страницу PDF, поэтому многостраничные документы остаются упорядоченными.
Как использовать
- Нажмите на область или перетащите в неё PDF-файл.
- Дождитесь, пока инструмент извлечёт текст и распределит его по строкам и столбцам.
- Скачайте файл .xlsx и откройте его в Excel, Google Таблицах или любом другом табличном приложении.
- Проверьте разбиение по столбцам — для сложных таблиц может потребоваться вручную скорректировать несколько ячеек.
Пример
Ввод
invoice.pdf — счёт на одной странице с таблицей позицийРезультат
invoice.xlsx — один лист, где каждая строка счёта представлена отдельной строкой, со столбцами для товара, количества и ценыТочность во многом зависит от того, как оформлен исходный PDF-файл — простые таблицы с чёткими промежутками между столбцами конвертируются аккуратно, тогда как плотные или неравномерно расположенные таблицы могут потребовать ручной доработки.
Часто задаваемые вопросы
Почему некоторые из моих столбцов объединены или разделены неправильно?
Этот инструмент определяет границы столбцов по горизонтальным промежуткам между словами в текстовом слое PDF-файла — у него нет доступа к исходной структуре таблицы PDF (большинство PDF-файлов её вообще не сохраняют). Если столбцы расположены близко друг к другу или таблица использует необычные промежутки, определение границ может быть ошибочным. Проверьте результат и при необходимости скорректируйте его вручную.
Работает ли это со сканированными PDF?
Нет. Этот инструмент считывает текстовый слой, встроенный в PDF; сканированные документы представляют собой просто изображения и не содержат извлекаемого текста. Сначала используйте инструмент OCR для PDF, чтобы добавить текстовый слой, а затем воспользуйтесь этим конвертером.
Загружается ли мой PDF на сервер?
Нет. Извлечение текста и создание файла Excel происходят локально в вашем браузере с помощью JavaScript. Ваш файл никогда не покидает ваше устройство.
Сохранятся ли форматирование ячеек, цвета или объединённые ячейки из исходной таблицы?
Нет. Результат представляет собой обычный текст, расположенный в виде сетки — шрифты, цвета, границы и объединённые ячейки из исходного PDF не переносятся.