Mis see tööriist on?
See tööriist loeb iga PDF-i lehekülje tekstisisu ja taastab selle ridade ja veergudena Exceli töövihikus, üks leht iga lehekülje kohta. See rühmitab teksti ridadeks vertikaalse asukoha järgi ning jagab seejärel iga rea lahtriteks kohtades, kus sõnade vahel on lai horisontaalne tühik — mõistlik viide sellele, et 'siit algab uus veerg', mitte lihtsalt tühik.
See heuristika töötab hästi lihtsate, ühtlaselt paigutatud tabelite või loenditega PDF-ide puhul — arved, hinnakirjad, eksporditud aruanded. See ei taasta usaldusväärselt keerukaid paigutusi ühendatud lahtrite, mitmerealise lahtrisisuga või selgete veergudevaheliste vahedeta tabelitega; sellistel juhtudel tuleb tulemust pärast allalaadimist tõenäoliselt käsitsi kohandada.
Miks seda kasutada?
- Muudab PDF-i tabelid ja loendid muudetavaks ja sorditavaks Exceli failiks, selle asemel et andmeid käsitsi uuesti sisestada.
- Registreerimist ega vesimärki pole, täiesti tasuta.
- Kohalik ja privaatne — teie PDF-i ei laadita kunagi ühtegi serverisse üles.
- Üks leht iga PDF-i lehekülje kohta, nii et mitmeleheküljelised dokumendid jäävad korrastatuks.
Kuidas kasutada
- Klõpsa kastil või lohista sinna PDF-fail.
- Oota, kuni tööriist eraldab teksti ja paigutab selle ridadesse ja veergudesse.
- Laadi alla .xlsx-fail ja ava see Excelis, Google'i Sheetsis või mõnes muus tabelirakenduses.
- Vaata üle veergude jagunemine — keerukamate tabelite puhul võib olla vaja mõnda lahtrit käsitsi kohandada.
Näide
Sisend
invoice.pdf — üheleheküljeline arve koos ridade tabeligaTulemus
invoice.xlsx — üks leht, kus iga arverida on omaette rida, veergudega toote, koguse ja hinna jaoksTäpsus sõltub suuresti algse PDF-i paigutusest — lihtsad selgete veeruvahedega tabelid teisenduvad puhtalt, samas kui tihedad või ebaregulaarse paigutusega tabelid võivad vajada käsitsi korrastamist.
Korduma kippuvad küsimused
Miks on mõned mu veerud omavahel ühendatud või valesti jagatud?
See tööriist arvab veeru piirid ära PDF-i teksti aluskihis sõnade vahel oleva horisontaalse tühiku põhjal — sellel puudub juurdepääs PDF-i algsele tabelistruktuurile (enamik PDF-e seda ei säilita). Kui veerud on üksteisele lähedal või tabelis kasutatakse ebatavalisi vahesid, võib oletus olla vale. Vaata tulemus üle ja kohanda vajadusel käsitsi.
Kas see töötab skaneeritud PDF-idega?
Ei. See tööriist loeb PDF-i sisse manustatud tekstikihti; skaneeritud dokumendid on lihtsalt pildid ja neil pole eraldatavat teksti. Käivita esmalt PDF-i OCR-tööriist, et lisada tekstikiht, ja kasuta seejärel seda konverterit.
Kas mu PDF laaditakse serverisse üles?
Ei. Nii teksti eraldamine kui ka Exceli faili loomine toimuvad kohalikult teie brauseris JavaScripti abil. Teie fail ei lahku kunagi teie seadmest.
Kas see säilitab algse tabeli lahtrivormingu, värvid või ühendatud lahtrid?
Ei. Väljund on lihtne tekst, mis on paigutatud võrgustikku — algse PDF-i kirjatüübid, värvid, äärised ja ühendatud lahtrid ei kandu üle.