CodeKitHub
Kép eszközök

Könyvoldal Szöveggé

Utolsó frissítés:

Alakíts egy könyvoldalról készült fotót szerkeszthető, kereshető szöveggé — kifejezetten valódi könyvekről készült valódi fotókhoz tervezve, nem sima dokumentumszkennelésekhez. A legtöbb OCR-eszköz tökéletesen igazított szkennelést feltételez; ez az eszköz automatikusan felismeri és korrigálja a kézzel tartott fotózásból eredő görbe szöget, majd felismeri a szöveget. Minden a böngésződben fut: a fotó és a szövegkinyerés soha nem hagyja el az eszközödet.

Használati útmutató

  1. Fotózd le a könyvoldalt — próbáld az egész oldalt belefoglalni a képbe, de ne aggódj amiatt, hogy tökéletesen vízszintesen tartod-e a kamerát.
  2. Kattints a fotóra, vagy húzd be a feltöltési területre.
  3. Hagyd bekapcsolva az "Automatikus ferdeségkorrekció" opciót (alapértelmezetten be van kapcsolva), és válaszd ki az oldal nyelvét.
  4. Kattints a "Szöveg kinyerése" gombra — az eszköz először kiegyenesíti a képet, majd felismeri a szöveget.
  5. Másold ki az eredményt, vagy töltsd le .txt fájlként.

Példa

Bemenet

Egy telefonos fotó egy nyitott zsebkönyv oldaláról, kb. 10°-os szögben tartva

Kimenet

Kimutatott ferdeség: -10,5° → a szöveg kinyerve, a bekezdésszerkezet teljesen megőrizve

A ferdeségkorrekció nélkül egy ilyen szögű fotó jellemzően a szavak egyharmadát veszíti el téves felismerés miatt; a szög előzetes korrekciója közel szkenner-pontosságú felismerést eredményez.

Mi ez az eszköz?

Ez az eszköz szöveget nyer ki egy könyv, tankönyv vagy nyomtatott oldal fotójából OCR-rel (optikai karakterfelismeréssel), amely teljes egészében a böngésződben fut. A szkenneralapú OCR-eszközökkel ellentétben a kézben tartott fotók specifikus problémája köré épül: a kissé ferdén fotózott oldalak köré, ami szinte elkerülhetetlen, amikor telefont tartasz egy nyitott könyv fölé, ahelyett hogy laposan egy szkenner üvegére nyomnád.

Még a felismerés megkezdése előtt az eszköz elemzi a képet, hogy pontosan hány fokkal van elforgatva a vízszinteshez képest, majd automatikusan kiegyenesíti. Ez az egyetlen lépés fontosabb szinte bármi másnál a fotóalapú OCR esetében: egy csupán 10-12 fokkal döntött oldal felismerési pontossága 95% fölülről akár 70% alá is eshet, olvasható szövegből érthetetlen zagyvaságot csinálva — a ferdeség első lépésben történő korrekciója közel szkenner-minőségű eredményeket állít vissza.

Miért számít a fotó szöge jobban, mint gondolnád

Az OCR-motorok pixelsorokat pásztázva olvassák a szöveget, konzisztens vízszintes tintasávokat keresve — így különböztetik meg egymástól a szövegsorokat. Ha egy oldal akár enyhén is dőlt, az, aminek egy tiszta vízszintes szövegsornak kellene lennie, sok pixelsoron átívelő átlós elkenődéssé válik, és a motor sorszegmentáló logikája elkezdi összeolvasztani a szomszédos sorok karaktereit, vagy szétválasztani az egyes karaktereket.

Ezért fordulhat elő, hogy egy a szemednek tökéletesen olvashatónak tűnő fotó mégis zagyva OCR-kimenetet ad: az agyad könnyedén kompenzálja az enyhe dőlést, egy naiv OCR-folyamat viszont nem. A megoldás nem egy okosabb felismerő modell — hanem a kép előzetes kiegyenesítése, amit pontosan ez az eszköz automatikus korrekciós lépése tesz meg a felismerés futtatása előtt.

Gyakori felhasználási esetek

  • Jegyzetek vagy részletek digitalizálása egy fizikai tankönyvből, kézi újragépelés nélkül.
  • Egy szövegrészlet kinyerése egy régi zsebkönyvből vagy könyvtári könyvből, hogy később idézhesd vagy kereshess benne.
  • Egy lefotózott kiosztott anyag, munkalap vagy nyomtatott cikk átalakítása kereshető, szerkeszthető szöveggé.
  • Egy szétesőben lévő vagy egy szkennerre laposan túl törékeny könyv oldalainak archiválása.

Kép ASCII Művészetté Alakító · Szószámláló

A legjobb eredmény elérése

  • A jó, egyenletes megvilágítás jobban számít, mint a tökéletesen stabil kéz — egy kissé görbe, de jól megvilágított fotó felülmúl egy vízszintes, de a szövegre erős árnyékot vető fotót.
  • Kerüld a közvetlen vakut fényes oldalakon; az ebből eredő fényvisszaverődés/fényfolt kiüresítheti az alatta lévő szöveget, a szögkorrekciótól függetlenül.
  • Foglald bele az egész oldalt a képbe egy kis margóval — a túl szoros vágás levághatja az első vagy utolsó sort.
  • Nagyon hosszú szövegrészeknél fotózz és dolgozz fel egyszerre egy oldalt, ahelyett hogy egy kétoldalas terítéket próbálnál rögzíteni, ami saját görbületi torzítást okoz a gerinc közelében.

Miért érdemes használni?

Automatikus ferdeségkorrekció: felismerés előtt kimutatja és kiegyenesíti a görbe fotószöget, ami a legnagyobb pontossági tényező kézben tartott könyvfotóknál.

Teljesen offline feldolgozás: a fotó és a kinyert szöveg soha nem hagyja el a böngésződet — semmi nem kerül feltöltésre egy szerverre.

Régi, megsárgult vagy kissé fakult könyvoldalakon éppúgy működik, mint éles, modern nyomtatáson.

Több felismerési nyelvet is támogat (angol, kínai, spanyol, francia, német, japán), így különböző nyelvű könyveket is beolvashatsz.

Nincs fiók, nincs feltöltési limit, nincs előfizetés — ingyenes akárhány oldalhoz.

Gyakori kérdések

Miért van szükség speciális kezelésre a könyvfotómhoz a szokásos OCR helyett?

A szokásos OCR-eszközöket általában lapos, tökéletesen igazított szkennelt képeken tesztelik és hangolják. Egy kézzel fotózott könyvoldal szinte soha nem vízszintes — akár egy kis 8-12 fokos dőlés, ami normális egy kézben tartott felvételnél, jelentősen 70% alá csökkentheti a felismerési pontosságot. Ez az eszköz méri ezt a dőlést, és automatikusan korrigálja a felismerés futtatása előtt, ami a különbséget jelenti a használható szöveg és a zagyva kimenet között.

Működik ez régi vagy megsárgult könyvoldalakon?

Igen — az öregedő papír elszíneződése és enyhe kontrasztvesztése önmagában nagyon kevés hatással van a felismerési pontosságra. A fotó szöge a domináns tényező, nem a papír színe, így a régi zsebkönyvek és a használt tankönyvek is nagyjából olyan jól működnek, mint az újak, miután a kép ki lett egyenesítve.

Feltöltődik valahova a fotóm?

Nem. Mind a ferdeség kimutatása, mind a szövegfelismerés teljes egészében a böngésződben fut WebAssembly segítségével — semmi a fotódról vagy annak tartalmáról nem kerül elküldésre semmilyen szerverre. Az oldal első betöltése után akár le is kapcsolhatod az internetet, és tovább fog működni (leszámítva a felismerő motor egyszeri letöltését).

Kikapcsolhatom az automatikus korrekciót, ha a fotóm már egyenes?

Igen, kapcsold ki az "Automatikus ferdeségkorrekció" opciót, ha egy lapos szkennelt képpel vagy egy már kiegyenesített fotóval dolgozol — ez kihagyja a kimutatási lépést, és kissé gyorsabban futtatja a felismerést.

Miért lassú az első kinyerés?

Amikor először kattintasz a "Szöveg kinyerése" gombra, az eszköz letölti az OCR felismerő motort (néhány megabájt, csak egyszer, ezután a böngésződ gyorsítótárazza). Minden ezt követő kinyerés sokkal gyorsabb lesz, mivel a motor már be van töltve.

Milyen nyelveket ismer fel?

Angol, egyszerűsített kínai, spanyol, francia, német és japán érhető el a nyelvválasztóban. A legjobb pontosság érdekében válaszd ki azt a nyelvet, amelyen az oldal ténylegesen nyomtatva van — a felismerési minőség jelentősen csökken, ha rossz nyelvet választasz.

Kapcsolódó eszközök