Kas ir šis rīks?
Šis rīks nolasa katras PDF lapas teksta saturu un atjauno to kā rindas un kolonnas Excel darbgrāmatā, pa vienai lapai katrai PDF lapai. Tas sagrupē tekstu rindās pēc vertikālā novietojuma un pēc tam sadala katru rindu šūnās vietās, kur starp vārdiem ir plata horizontāla atstarpe — pamatota norāde, ka 'šeit sākas jauna kolonna', nevis vienkārši atstarpe.
Šī heiristika labi darbojas ar PDF failiem, kuros ir vienkāršas, vienmērīgi izvietotas tabulas vai saraksti — rēķini, cenrāži, eksportēti pārskati. Tā nepārliecinoši atjauno sarežģītus izkārtojumus ar apvienotām šūnām, vairākrindu šūnu saturu vai tabulām bez skaidras atstarpes starp kolonnām; šādos gadījumos varat sagaidīt, ka pēc lejupielādes rezultāts būs jāpielabo manuāli.
Kāpēc to izmantot?
- Pārvērš PDF tabulas un sarakstus rediģējamā, kārtojamā Excel failā, nevis liek datus manuāli pārrakstīt.
- Nav jāreģistrējas, nav ūdenszīmes, pilnīgi bez maksas.
- Lokāls un privāts — jūsu PDF fails nekad netiek augšupielādēts nevienā serverī.
- Viena lapa katrai PDF lapai, tāpēc daudzlapu dokumenti paliek pārskatāmi.
Kā to lietot
- Noklikšķiniet uz lauka vai ievelciet tajā PDF failu.
- Pagaidiet, kamēr rīks izvelk tekstu un sakārto to rindās un kolonnās.
- Lejupielādējiet .xlsx failu un atveriet to Excel, Google izklājlapās vai jebkurā citā izklājlapu lietotnē.
- Pārskatiet kolonnu sadalījumu — sarežģītām tabulām var būt nepieciešams manuāli pielāgot dažas šūnas.
Piemērs
Ievade
invoice.pdf — vienas lapas rēķins ar preču rindu tabuluIzvade
invoice.xlsx — viena lapa, kurā katra rēķina rinda ir atsevišķa rinda ar kolonnām precei, daudzumam un cenaiPrecizitāte lielā mērā ir atkarīga no tā, kā izkārtots oriģinālais PDF fails — vienkāršas tabulas ar skaidrām atstarpēm starp kolonnām konvertējas tīri, savukārt blīvas vai neregulāri izvietotas tabulas var prasīt manuālu sakārtošanu.
Biežāk uzdotie jautājumi
Kāpēc dažas manas kolonnas ir apvienotas vai nepareizi sadalītas?
Šis rīks min kolonnu robežas, pamatojoties uz horizontālo atstarpi starp vārdiem PDF faila pamatā esošajā teksta slānī — tam nav piekļuves oriģinālajai PDF tabulas struktūrai (lielākā daļa PDF failu to arī nesaglabā). Ja kolonnas atrodas tuvu viena otrai vai tabulā izmantotas neparastas atstarpes, minējums var būt kļūdains. Pārskatiet rezultātu un, ja nepieciešams, pielāgojiet to manuāli.
Vai tas darbojas ar skenētiem PDF failiem?
Nē. Šis rīks nolasa PDF failā iegulto teksta slāni; skenēti dokumenti ir tikai attēli, un tiem nav izgūstama teksta. Vispirms izmantojiet PDF OCR rīku, lai pievienotu teksta slāni, un tad izmantojiet šo pārveidotāju.
Vai mans PDF fails tiek augšupielādēts serverī?
Nē. Gan teksta izvilkšana, gan Excel faila ģenerēšana notiek lokāli jūsu pārlūkprogrammā, izmantojot JavaScript. Jūsu fails nekad neatstāj jūsu ierīci.
Vai tas saglabās šūnu formatējumu, krāsas vai apvienotās šūnas no oriģinālās tabulas?
Nē. Rezultāts ir vienkāršs teksts, kas izkārtots režģī — oriģinālā PDF fonti, krāsas, apmales un apvienotās šūnas netiek pārnestas.