CodeKitHub
Nástroje pro obrázky

Fotka stránky knihy na text

Naposledy aktualizováno:

Proměňte fotku stránky knihy na editovatelný, prohledávatelný text — nástroj postavený speciálně pro skutečné fotky skutečných knih, ne pro rovné skeny dokumentů. Většina OCR nástrojů předpokládá dokonale zarovnaný sken; tento automaticky rozpozná a opraví nakřivo vyfocený úhel, který vzniká při focení stránky z ruky, a teprve poté rozpozná text. Vše probíhá ve vašem prohlížeči: fotka i extrahovaný text nikdy neopustí vaše zařízení.

Jak se používá

  1. Vyfoťte stránku knihy — snažte se dostat celou stránku do záběru, ale nemusíte se snažit držet fotoaparát dokonale rovně.
  2. Klikněte nebo přetáhněte fotku do nahrávací oblasti.
  3. Ponechte zaškrtnutou volbu „Automaticky opravit zkosení“ (je zapnutá standardně) a vyberte jazyk stránky.
  4. Klikněte na „Extrahovat text“ — nástroj nejdřív obrázek narovná a poté rozpozná text.
  5. Zkopírujte výsledek nebo si ho stáhněte jako soubor .txt.

Příklad

Vstup

Fotka z telefonu otevřené stránky brožované knihy, vyfocená pod úhlem přibližně 10°

Výstup

Detekované zkosení: -10,5° → text extrahován se zachovanou strukturou odstavců

Bez kroku narovnání by fotka pod tímto úhlem obvykle ztratila třetinu slov kvůli chybnému čtení; oprava úhlu jako první krok vrací rozpoznávání téměř na přesnost skeneru.

Co je tento nástroj?

Tento nástroj extrahuje text z fotografie knihy, učebnice nebo tištěné stránky pomocí OCR (optického rozpoznávání znaků), které běží kompletně ve vašem prohlížeči. Na rozdíl od OCR nástrojů založených na skenerech je postavený přímo na řešení specifického problému fotek z ruky: stránek vyfocených mírně pod úhlem, což je téměř nevyhnutelné, když držíte telefon nad otevřenou knihou místo přitisknutí na sklo skeneru.

Ještě než rozpoznávání vůbec začne, nástroj analyzuje obrázek, aby zjistil, o kolik stupňů je natočený od vodorovné roviny, a poté ho automaticky narovná. Tento jediný krok má na výsledek OCR z fotky větší dopad než téměř cokoli jiného: stránka vyfocená s odchylkou jen 10-12 stupňů od roviny může snížit přesnost rozpoznávání z přes 95 % na pod 70 %, čímž se jasně čitelný text změní na nesmyslnou změť — narovnání jako první krok obnoví výsledky téměř na kvalitu skeneru.

Proč záleží na úhlu fotky víc, než byste čekali

OCR enginy čtou text skenováním řádků pixelů a hledáním konzistentních vodorovných pásů inkoustu — takto oddělují jeden řádek textu od dalšího. Když je stránka byť jen mírně nakloněná, to, co by mělo být čistá vodorovná řada textu, se změní na diagonální šmouhu přes mnoho řádků pixelů, a logika segmentace řádků v enginu začne slučovat znaky ze sousedních řádků nebo rozdělovat jednotlivé znaky.

Proto může fotka, která vašim očím připadá dokonale čitelná, i tak vytvořit zmatený výstup OCR: váš mozek bezděčně kompenzuje mírné naklonění, ale naivní OCR pipeline ne. Řešením není chytřejší model rozpoznávání — je jím narovnání obrázku jako první krok, přesně to, co dělá krok automatické opravy v tomto nástroji ještě před spuštěním rozpoznávání.

Časté případy použití

  • Digitalizace poznámek nebo úryvků z tištěné učebnice bez ručního přepisování.
  • Extrakce pasáže ze staré brožované knihy nebo knihovní knihy pro pozdější citování nebo vyhledávání.
  • Převod vyfoceného pracovního listu, letáku nebo tištěného článku na prohledávatelný, editovatelný text.
  • Archivace stránek z rozpadající se nebo příliš křehké knihy, kterou nelze naplocho položit na sklo skeneru.

Převodník obrázku na ASCII Art · Počítadlo slov

Jak dosáhnout nejlepších výsledků

  • Dobré, rovnoměrné osvětlení je důležitější než dokonale klidná ruka — mírně nakřivo vyfocená, ale dobře osvětlená fotka funguje lépe než rovná fotka se silným stínem přes text.
  • Vyvarujte se přímého blesku na lesklých stránkách; výsledný odlesk může zcela zakrýt text pod sebou bez ohledu na opravu úhlu.
  • Dostaňte celou stránku do záběru s trochou okraje navíc — příliš těsné ořezání může uříznout první nebo poslední řádek.
  • U velmi dlouhých pasáží fotografujte a zpracovávejte jednu stránku po druhé místo pokusu zachytit dvoustránkový rozvor, který u hřbetu vnáší vlastní zakřivení a zkreslení.

Proč ho používat?

Automatická oprava zkosení: rozpozná a narovná nakřivo vyfocené úhly ještě před rozpoznáváním, což je jednoznačně nejvýznamnější faktor přesnosti u fotek knih z ruky.

Zpracování zcela offline: fotka i extrahovaný text nikdy neopustí váš prohlížeč — nic se nenahrává na server.

Funguje na starých, zažloutlých nebo mírně vybledlých stránkách knih stejně jako na ostrém moderním tisku.

Podporuje více jazyků rozpoznávání (angličtina, čínština, španělština, francouzština, němčina, japonština), takže můžete skenovat knihy v různých jazycích.

Bez účtu, bez limitu nahrávání, bez předplatného — zdarma pro tolik stránek, kolik potřebujete.

Časté dotazy

Proč moje fotka knihy potřebuje speciální zpracování místo běžného OCR?

Běžné OCR nástroje se obvykle testují a ladí na rovných, dokonale zarovnaných skenech. Stránka knihy vyfocená z ruky téměř nikdy není rovná — i malé naklonění 8-12 stupňů, které je u snímku z ruky normální, může srazit přesnost rozpoznávání hluboko pod 70 %. Tento nástroj toto naklonění změří a automaticky opraví ještě před spuštěním rozpoznávání, což je rozdíl mezi použitelným textem a nesrozumitelným výstupem.

Funguje to na starých nebo zažloutlých stránkách knih?

Ano — zabarvení stránky a mírná ztráta kontrastu stárnoucím papírem mají na přesnost rozpoznávání samy o sobě velmi malý vliv. Rozhodujícím faktorem je úhel fotky, ne barva papíru, takže staré brožované knihy a ošoupané učebnice fungují po narovnání obrázku přibližně stejně dobře jako nové.

Nahrává se moje fotka někam?

Ne. Detekce zkosení i rozpoznávání textu probíhá kompletně ve vašem prohlížeči pomocí WebAssembly — nic z vaší fotky ani jejího obsahu se neodesílá na žádný server. Po prvním načtení stránky se dokonce můžete odpojit od internetu a nástroj bude dál fungovat (kromě jednorázového stažení rozpoznávacího enginu).

Můžu vypnout automatickou opravu, pokud je moje fotka už rovná?

Ano, odškrtněte „Automaticky opravit zkosení“, pokud pracujete s rovným skenem nebo fotkou, kterou jste už narovnali sami — tím se přeskočí krok detekce a rozpoznávání proběhne o něco rychleji.

Proč je první extrakce pomalá?

Při prvním kliknutí na „Extrahovat text“ nástroj stáhne OCR rozpoznávací engine (několik megabajtů, jen jednou, poté ho prohlížeč uloží do mezipaměti). Každá další extrakce je pak mnohem rychlejší, protože engine je už načtený.

Jaké jazyky dokáže rozpoznat?

Ve výběru jazyka jsou dostupné angličtina, zjednodušená čínština, španělština, francouzština, němčina a japonština. Pro nejlepší přesnost vyberte jazyk, ve kterém je stránka skutečně vytištěná — kvalita rozpoznávání prudce klesá, pokud je vybraný nesprávný jazyk.

Související nástroje