Čo je tento nástroj?
Tento nástroj načíta textový obsah každej stránky PDF a znovu ho zostaví ako riadky a stĺpce v zošite Excel, jeden hárok na stránku. Text zoskupuje do riadkov podľa zvislej polohy a potom každý riadok rozdelí na bunky tam, kde je medzi slovami širšia vodorovná medzera — čo je rozumný signál, že 'tu začína nový stĺpec', a nie iba obyčajná medzera.
Táto heuristika funguje dobre pri PDF s jednoduchými, pravidelne rozloženými tabuľkami alebo zoznamami — faktúry, cenníky, exportované reporty. Spoľahlivo nerekonštruuje zložité rozloženia so zlúčenými bunkami, viacriadkovým obsahom buniek alebo tabuľkami bez jasných medzier medzi stĺpcami; pri nich počítajte s tým, že výsledok po stiahnutí budete musieť ručne doladiť.
Prečo ho používať?
- Zmení tabuľky a zoznamy z PDF na upraviteľný a zoraditeľný súbor Excel namiesto ručného prepisovania dát.
- Žiadna registrácia, žiadny vodoznak, úplne zadarmo.
- Lokálne a súkromné — vaše PDF sa nikdy nenahráva na žiadny server.
- Jeden hárok na každú stránku PDF, takže viacstranové dokumenty zostávajú prehľadné.
Ako sa používa
- Kliknite na pole alebo naň presuňte súbor PDF.
- Počkajte, kým nástroj extrahuje text a rozloží ho do riadkov a stĺpcov.
- Stiahnite súbor .xlsx a otvorte ho v Exceli, Google Sheets alebo v inej tabuľkovej aplikácii.
- Skontrolujte rozdelenie stĺpcov — pri zložitejších tabuľkách bude možno potrebné ručne upraviť niekoľko buniek.
Príklad
Vstup
invoice.pdf — jednostránková faktúra s tabuľkou položiekVýstup
invoice.xlsx — jeden hárok, kde je každá položka faktúry samostatný riadok so stĺpcami pre položku, množstvo a cenuPresnosť silne závisí od rozloženia pôvodného PDF — jednoduché tabuľky s jasnými medzerami medzi stĺpcami sa prevedú bez problémov, zatiaľ čo husté alebo nepravidelne rozložené tabuľky môžu vyžadovať ručné dočistenie.
Časté otázky
Prečo sú niektoré moje stĺpce spojené alebo nesprávne rozdelené?
Tento nástroj odhaduje hranice stĺpcov podľa vodorovnej medzery medzi slovami v textovej vrstve PDF — nemá prístup k pôvodnej štruktúre tabuľky v PDF (väčšina PDF ju ani neuchováva). Ak sú stĺpce blízko seba alebo tabuľka používa neobvyklé medzery, odhad môže byť nesprávny. Skontrolujte výsledok a v prípade potreby ho ručne upravte.
Funguje to aj na naskenovaných PDF?
Nie. Tento nástroj číta textovú vrstvu vloženú v PDF; naskenované dokumenty sú len obrázky a neobsahujú žiadny text, ktorý by sa dal extrahovať. Najprv použite nástroj na OCR PDF na pridanie textovej vrstvy a potom použite tento prevodník.
Nahráva sa moje PDF na server?
Nie. Extrakcia textu aj generovanie súboru Excel prebiehajú lokálne vo vašom prehliadači pomocou JavaScriptu. Váš súbor nikdy neopustí vaše zariadenie.
Zachová toto formátovanie buniek, farby alebo zlúčené bunky z pôvodnej tabuľky?
Nie. Výstupom je obyčajný text usporiadaný do mriežky — písma, farby, orámovania a zlúčené bunky z pôvodného PDF sa neprenášajú.