Какво представлява този инструмент?
Този инструмент чете текстовото съдържание на всяка страница от PDF файл и го възстановява като редове и колони в Excel работна книга, по един лист на страница. Групира текста в редове по вертикална позиция, а после разделя всеки ред на клетки там, където има широка хоризонтална междина между думите — разумен признак, че 'тук започва нова колона', а не просто интервал.
Тази евристика работи добре за PDF файлове с прости, равномерно разположени таблици или списъци — фактури, ценови листи, експортирани отчети. Тя не възстановява надеждно сложни оформления с обединени клетки, многоредово съдържание на клетки или таблици без ясни разстояния между колоните; за тях очаквайте да коригирате резултата ръчно след изтеглянето.
Защо да го използвате?
- Превръща таблиците и списъците от PDF в редактируем и сортируем Excel файл, вместо да преписвате данните на ръка.
- Без регистрация, без воден знак, напълно безплатно.
- Локално и поверително — вашият PDF файл никога не се качва на сървър.
- По един лист за всяка страница от PDF файла, така че многостраничните документи остават подредени.
Как да го използвате
- Кликнете върху полето или плъзнете PDF файл в него.
- Изчакайте, докато инструментът извлече текста и го подреди в редове и колони.
- Изтеглете .xlsx файла и го отворете в Excel, Google Таблици или друго приложение за електронни таблици.
- Прегледайте разделянето на колоните — при сложни таблици може да се наложи ръчно да коригирате няколко клетки.
Пример
Вход
invoice.pdf — еднострочна фактура с таблица от редовеРезултат
invoice.xlsx — един лист, в който всеки ред от фактурата е отделен ред, с колони за артикул, количество и ценаТочността зависи силно от оформлението на оригиналния PDF файл — прости таблици с ясни междини между колоните се преобразуват безпроблемно, докато плътни или неравномерно разположени таблици може да изискват ръчно почистване.
Често задавани въпроси
Защо някои от колоните ми са слети или разделени неправилно?
Инструментът предполага границите на колоните въз основа на хоризонталните разстояния между думите в текстовия слой на PDF файла — той няма достъп до оригиналната структура на таблицата в PDF (повечето PDF файлове не съхраняват такава). Ако колоните са близо една до друга или таблицата използва необичайни разстояния, предположението може да е грешно. Прегледайте резултата и коригирайте ръчно при нужда.
Работи ли това със сканирани PDF файлове?
Не. Инструментът чете текстовия слой, вграден в PDF файла; сканираните документи са просто изображения и нямат текст, който може да се извлече. Първо използвайте инструмент за PDF OCR, за да добавите текстов слой, а после използвайте този конвертор.
Качва ли се моят PDF файл на сървър?
Не. Извличането на текст и генерирането на Excel файла се случват изцяло локално във вашия браузър чрез JavaScript. Файлът ви никога не напуска устройството ви.
Ще запази ли това форматирането на клетките, цветовете или обединените клетки от оригиналната таблица?
Не. Резултатът е обикновен текст, подреден в мрежа — шрифтовете, цветовете, рамките и обединените клетки от оригиналния PDF не се пренасят.