CodeKitHub
PDF-työkalut

Muunna PDF Exceliksi

Viimeksi päivitetty:

Pudota PDF sisään ja saat takaisin Excel-taulukon. Tämä työkalu poimii tekstin jokaiselta sivulta ja järjestää sen riveiksi ja sarakkeiksi arvaamalla sarakerajat sanojen välisten välien perusteella — todella hyödyllinen lähtökohta tietojen poimimiseen PDF-tiedostoista, vaikka se ei korvaakaan kunnollista taulukontunnistusohjelmistoa monimutkaisissa asetteluissa. Kaikki tapahtuu paikallisesti selaimessasi; tiedostoa ei koskaan lähetetä palvelimelle.

Note: this tool guesses column boundaries from the whitespace gaps between text on each line, and lays out each page as rows and columns in Excel. It works well on regularly-structured tables; on merged cells or irregular layouts the split can be inaccurate — review and adjust the result after downloading.

Mikä tämä työkalu on?

Tämä työkalu lukee jokaisen PDF-sivun tekstisisällön ja rakentaa sen uudelleen riveiksi ja sarakkeiksi Excel-työkirjassa, yksi taulukko sivua kohden. Se ryhmittelee tekstin riveiksi pystysuuntaisen sijainnin perusteella ja jakaa sitten kunkin rivin soluiksi kohdista, joissa sanojen välissä on leveä vaakasuuntainen väli — kohtuullinen merkki siitä, että 'tästä alkaa uusi sarake', eikä pelkkä välilyönti.

Tämä heuristiikka toimii hyvin PDF-tiedostoissa, joissa on yksinkertaisia, tasavälisiä taulukoita tai listoja — laskuja, hinnastoja, vietyjä raportteja. Se ei luotettavasti rakenna uudelleen monimutkaisia asetteluja, joissa on yhdistettyjä soluja, monirivistä solusisältöä tai taulukoita ilman selkeitä sarakevälejä; näissä tapauksissa tulosta kannattaa odottaa joutuvansa muokkaamaan käsin lataamisen jälkeen.

Miksi käyttää sitä?

  • Muuttaa PDF-taulukot ja -listat muokattavaksi, lajiteltavaksi Excel-tiedostoksi sen sijaan, että kirjoittaisit tiedot uudelleen käsin.
  • Ei rekisteröitymistä, ei vesileimaa, täysin ilmainen.
  • Paikallinen ja yksityinen — PDF-tiedostoasi ei koskaan lähetetä millekään palvelimelle.
  • Yksi taulukko jokaista PDF-sivua kohden, jolloin monisivuiset asiakirjat pysyvät järjestyksessä.

Käyttöohje

  1. Napsauta laatikkoa tai vedä PDF-tiedosto sen päälle.
  2. Odota, kun työkalu poimii tekstin ja järjestää sen riveiksi ja sarakkeiksi.
  3. Lataa .xlsx-tiedosto ja avaa se Excelissä, Google Sheetsissä tai missä tahansa taulukkolaskentasovelluksessa.
  4. Tarkista sarakejako — monimutkaisissa taulukoissa saatat joutua säätämään joitakin soluja käsin.

Esimerkki

Syöte

invoice.pdf — yksisivuinen lasku, jossa on rivikohtainen taulukko

Tuloste

invoice.xlsx — yksi taulukko, jossa jokainen laskurivi on oma rivinsä sarakkeineen tuotteelle, määrälle ja hinnalle

Tarkkuus riippuu suuresti alkuperäisen PDF-tiedoston asettelusta — yksinkertaiset taulukot, joissa on selkeät sarakevälit, muuntuvat siististi, kun taas tiiviit tai epäsäännöllisesti aseteltuet taulukot saattavat vaatia manuaalista siistimistä.

Usein kysytyt kysymykset

Miksi jotkin sarakkeeni ovat yhdistyneet tai jakautuneet väärin?

Tämä työkalu arvaa sarakerajat PDF-tiedoston tekstikerroksen sanojen välisen vaakasuuntaisen välin perusteella — sillä ei ole pääsyä PDF:n alkuperäiseen taulukkorakenteeseen (useimmat PDF-tiedostot eivät säilytä sellaista). Jos sarakkeet ovat lähellä toisiaan tai taulukossa käytetään epätavallisia välejä, arvaus voi mennä väärin. Tarkista tulos ja säädä tarvittaessa käsin.

Toimiiko tämä skannatuille PDF-tiedostoille?

Ei. Tämä työkalu lukee PDF:ään upotetun tekstikerroksen; skannatut asiakirjat ovat pelkkiä kuvia, eikä niistä voi poimia tekstiä. Käytä ensin PDF OCR -työkalua tekstikerroksen lisäämiseksi ja käytä sitten tätä muunninta.

Lähetetäänkö PDF-tiedostoni palvelimelle?

Ei. Sekä tekstin poiminta että Excel-tiedoston luonti tapahtuvat paikallisesti selaimessasi JavaScriptin avulla. Tiedostosi ei koskaan poistu laitteeltasi.

Säilyykö alkuperäisen taulukon solumuotoilu, värit tai yhdistetyt solut?

Ei. Tulos on tavallista tekstiä ruudukkoon aseteltuna — alkuperäisen PDF:n fontit, värit, reunukset ja yhdistetyt solut eivät siirry mukana.

Liittyvät työkalut