Czym jest to narzędzie?
To narzędzie odczytuje zawartość tekstową każdej strony pliku PDF i odtwarza ją jako wiersze i kolumny w skoroszycie Excel, z jednym arkuszem na stronę. Grupuje tekst w wiersze na podstawie pozycji pionowej, a następnie dzieli każdy wiersz na komórki tam, gdzie wykryje szeroki odstęp poziomy między słowami — to rozsądne przybliżenie sygnalizujące 'tutaj zaczyna się nowa kolumna', a nie zwykła spacja.
Ta heurystyka dobrze sprawdza się w przypadku plików PDF z prostymi, równomiernie rozmieszczonymi tabelami lub listami — fakturami, cennikami, eksportowanymi raportami. Nie odtwarza jednak niezawodnie złożonych układów z połączonymi komórkami, wielowierszową zawartością komórek ani tabel bez wyraźnych odstępów między kolumnami; w takich przypadkach po pobraniu wynik zwykle trzeba poprawić ręcznie.
Dlaczego warto go używać?
- Zamienia tabele i listy z PDF w edytowalny, sortowalny plik Excel, zamiast ręcznego przepisywania danych.
- Bez rejestracji, bez znaku wodnego, całkowicie za darmo.
- Lokalnie i prywatnie — Twój plik PDF nigdy nie jest przesyłany na żaden serwer.
- Jeden arkusz na stronę PDF, dzięki czemu wielostronicowe dokumenty pozostają uporządkowane.
Jak używać
- Kliknij pole lub przeciągnij na nie plik PDF.
- Poczekaj, aż narzędzie wyodrębni tekst i ułoży go w wiersze i kolumny.
- Pobierz plik .xlsx i otwórz go w Excelu, Arkuszach Google lub dowolnej innej aplikacji arkuszowej.
- Sprawdź podział na kolumny — w przypadku złożonych tabel może być konieczne ręczne poprawienie kilku komórek.
Przykład
Wejście
invoice.pdf — jednostronicowa faktura z tabelą pozycjiWynik
invoice.xlsx — jeden arkusz, w którym każda pozycja faktury to osobny wiersz, z kolumnami na towar, ilość i cenęDokładność w dużej mierze zależy od układu oryginalnego pliku PDF — proste tabele z wyraźnymi odstępami między kolumnami konwertują się bezbłędnie, natomiast gęste lub nieregularnie rozmieszczone tabele mogą wymagać ręcznego poprawienia.
Najczęściej zadawane pytania
Dlaczego niektóre moje kolumny są połączone lub niepoprawnie podzielone?
To narzędzie odgaduje granice kolumn na podstawie poziomych odstępów między słowami w warstwie tekstowej pliku PDF — nie ma dostępu do oryginalnej struktury tabeli w PDF (większość plików PDF jej nie zachowuje). Jeśli kolumny znajdują się blisko siebie lub tabela używa nietypowych odstępów, odgadnięcie może być błędne. Sprawdź wynik i w razie potrzeby popraw go ręcznie.
Czy to działa ze skanowanymi plikami PDF?
Nie. To narzędzie odczytuje warstwę tekstową osadzoną w pliku PDF; zeskanowane dokumenty to tylko obrazy i nie zawierają tekstu możliwego do wyodrębnienia. Najpierw użyj narzędzia OCR do PDF, aby dodać warstwę tekstową, a następnie skorzystaj z tego konwertera.
Czy mój plik PDF jest przesyłany na serwer?
Nie. Zarówno wyodrębnianie tekstu, jak i generowanie pliku Excel odbywa się lokalnie w Twojej przeglądarce za pomocą JavaScript. Twój plik nigdy nie opuszcza Twojego urządzenia.
Czy zostaną zachowane formatowanie komórek, kolory lub połączone komórki z oryginalnej tabeli?
Nie. Wynik to zwykły tekst ułożony w siatce — czcionki, kolory, obramowania i połączone komórki z oryginalnego PDF nie są przenoszone.