CodeKitHub
Polski
Narzędzia do obrazów

Przekształcanie strony książki na tekst

Zamień zdjęcie strony książki w edytowalny tekst z możliwością wyszukiwania — narzędzie stworzone specjalnie z myślą o prawdziwych zdjęciach prawdziwych książek, a nie o płaskich skanach dokumentów. Większość narzędzi OCR zakłada idealnie wyrównany skan; to narzędzie automatycznie wykrywa i koryguje przekrzywienie wynikające z ręcznego fotografowania strony, a następnie rozpoznaje tekst. Wszystko odbywa się w przeglądarce: ani zdjęcie, ani wyodrębniony tekst nigdy nie opuszczają Twojego urządzenia.

Jak używać

  1. Zrób zdjęcie strony książki — postaraj się, aby cała strona zmieściła się w kadrze, ale nie przejmuj się tym, czy aparat jest idealnie wypoziomowany.
  2. Kliknij zdjęcie lub przeciągnij je do obszaru przesyłania.
  3. Pozostaw zaznaczoną opcję „Automatyczna korekta przekrzywienia” (jest domyślnie włączona) i wybierz język strony.
  4. Kliknij „Wyodrębnij tekst” — narzędzie najpierw wyprostuje obraz, a następnie rozpozna tekst.
  5. Skopiuj wynik lub pobierz go jako plik .txt.

Przykład

Wejście

A phone photo of an open paperback page, held at roughly a 10° angle

Wynik

Detected skew: -10.5° → text extracted with full paragraph structure preserved

Bez etapu korekcji przekrzywienia zdjęcie wykonane pod takim kątem zazwyczaj traci jedną trzecią słów z powodu błędnego odczytu; korekta kąta pozwala przywrócić dokładność rozpoznawania niemal do poziomu skanera.

Czym jest to narzędzie?

To narzędzie wyodrębnia tekst ze zdjęcia książki, podręcznika lub wydrukowanej strony za pomocą technologii OCR (optycznego rozpoznawania znaków), która działa w całości w przeglądarce. W odróżnieniu od narzędzi OCR opartych na skanerach, zostało ono stworzone z myślą o specyficznych problemach związanych ze zdjęciami robionymi z ręki: stronach sfotografowanych pod niewielkim kątem, co jest niemal nieuniknione, gdy trzyma się telefon nad otwartą książką zamiast przyłożyć go płasko do szyby skanera.

Jeszcze przed rozpoczęciem rozpoznawania narzędzie analizuje obraz, aby dokładnie określić, o ile stopni jest on obrócony względem poziomu, a następnie automatycznie go prostuje. Ten pojedynczy krok ma większe znaczenie niż prawie wszystko inne w przypadku OCR opartego na zdjęciach: strona sfotografowana pod kątem zaledwie 10–12 stopni od poziomu może spowodować spadek dokładności rozpoznawania z ponad 95% do poniżej 70%, zamieniając wyraźnie czytelny tekst w zniekształcony nonsens — wyprostowanie obrazu przywraca go do jakości zbliżonej do skanowanej.

Dlaczego kąt ujęcia ma większe znaczenie, niż mogłoby się wydawać

Silniki OCR odczytują tekst, skanując rzędy pikseli w poszukiwaniu spójnych poziomych pasm atramentu — w ten sposób oddzielają jedną linię tekstu od następnej. Gdy strona jest choćby nieznacznie przechylona, to co powinno być wyraźną poziomą linią tekstu, staje się ukośną smugą rozciągającą się na wiele rzędów pikseli, a logika segmentacji wierszy silnika OCR zaczyna łączyć znaki z sąsiednich wierszy lub rozdzielać pojedyncze znaki.

Właśnie dlatego zdjęcie, które dla ludzkiego oka wydaje się doskonale czytelne, może mimo to dać zniekształcony wynik OCR: mózg bez trudu kompensuje niewielkie przechylenie, ale prosty system OCR tego nie potrafi. Rozwiązaniem nie jest inteligentniejszy model rozpoznawania — chodzi o uprzednie wyprostowanie obrazu, co właśnie robi etap autokorekty w tym narzędziu, zanim rozpocznie się proces rozpoznawania.

Typowe zastosowania

  • Digitalizacja notatek lub fragmentów z tradycyjnego podręcznika bez konieczności przepisywania ich ręcznie.
  • Wyodrębnianie fragmentu ze starej książki w miękkiej oprawie lub z biblioteki w celu zacytowania go lub wyszukania w późniejszym czasie.
  • Przekształcanie sfotografowanej ulotki, arkusza ćwiczeń lub wydrukowanego artykułu w tekst, który można przeszukiwać i edytować.
  • Archiwizacja stron z książki, która się rozpada lub jest zbyt delikatna, by zeskanować ją na płaskim skanerze.

Konwerter obrazów na grafikę ASCII · Licznik słów

Jak osiągnąć najlepsze wyniki

  • Dobre, równomierne oświetlenie ma większe znaczenie niż idealnie pewna ręka — lekko krzywe, ale dobrze oświetlone zdjęcie prezentuje się lepiej niż idealnie wypoziomowane zdjęcie z głębokim cieniem na tekście.
  • Należy unikać bezpośredniego błysku lampy błyskowej na błyszczących stronach; powstałe odbicie lub jasna plama mogą całkowicie zasłonić tekst znajdujący się pod spodem, niezależnie od korekcji kąta.
  • Dopasuj całą stronę do ramki, pozostawiając niewielki margines — zbyt ciasne przycięcie może spowodować ucięcie pierwszego lub ostatniego wiersza.
  • W przypadku bardzo długich fragmentów należy fotografować i przetwarzać po jednej stronie na raz, zamiast próbować uchwycić rozkładówkę, co powoduje zniekształcenia wynikające z krzywizny w okolicy grzbietu książki.

Dlaczego warto go używać?

Automatyczna korekcja przekrzywienia: wykrywa i koryguje przekrzywione ujęcia zdjęć przed rozpoznaniem – jest to najważniejszy czynnik wpływający na dokładność w przypadku zdjęć książek wykonanych z ręki.

Przetwarzanie całkowicie w trybie offline: zdjęcie i wyodrębniony tekst nigdy nie opuszczają przeglądarki — żadne dane nie są przesyłane na serwer.

Sprawdza się zarówno w przypadku starych, pożółkłych lub lekko wyblakłych stron książkowych, jak i wyraźnych, współczesnych wydruków.

Obsługuje wiele języków rozpoznawania (angielski, chiński, hiszpański, francuski, niemiecki, japoński), dzięki czemu można skanować książki w różnych językach.

Bez konta, bez limitów przesyłania, bez abonamentu — za darmo, na dowolną liczbę stron.

Najczęściej zadawane pytania

Dlaczego zdjęcie mojej książki wymaga specjalnego postępowania, a nie zwykłego rozpoznawania optycznego (OCR)?

Standardowe narzędzia OCR są zazwyczaj testowane i dostrajane na płaskich, idealnie wyrównanych skanach. Strona książki sfotografowana ręcznie prawie nigdy nie jest wypoziomowana — nawet niewielkie przechylenie o 8–12 stopni, co jest normalne w przypadku zdjęć robionych z ręki, może spowodować spadek dokładności rozpoznawania znacznie poniżej 70%. To narzędzie mierzy to przechylenie i automatycznie je koryguje przed uruchomieniem rozpoznawania, co stanowi różnicę między tekstem nadającym się do użytku a zniekształconym wynikiem.

Czy to działa na starych lub pożółkłych stronach książek?

Tak — przebarwienia stron i niewielka utrata kontrastu spowodowana starzeniem się papieru same w sobie mają bardzo niewielki wpływ na dokładność rozpoznawania. Decydującym czynnikiem jest kąt nachylenia zdjęcia, a nie kolor papieru, więc stare książki w miękkiej oprawie i używane podręczniki sprawdzają się mniej więcej tak samo dobrze jak nowe, o ile zdjęcie zostanie wyprostowane.

Czy moje zdjęcie zostało gdzieś opublikowane?

Nie. Zarówno wykrywanie przekrzywienia, jak i rozpoznawanie tekstu odbywają się w całości w przeglądarce przy użyciu WebAssembly — żadne dane dotyczące zdjęcia ani jego treści nie są przesyłane na żaden serwer. Można nawet rozłączyć się z internetem po pierwszym załadowaniu strony, a aplikacja będzie nadal działać (z wyjątkiem jednorazowego pobrania silnika rozpoznawania).

Czy mogę wyłączyć funkcję automatycznej korekcji, jeśli moje zdjęcie jest już wyprostowane?

Tak, odznacz opcję „Automatyczna korekcja przekrzywienia”, jeśli pracujesz na płaskim skanie lub zdjęciu, które już wyprostowałeś — dzięki temu pominięty zostanie etap wykrywania, a rozpoznawanie przebiegnie nieco szybciej.

Dlaczego pierwsze wyodrębnianie przebiega powoli?

Przy pierwszym kliknięciu przycisku „Wyodrębnij tekst” narzędzie pobiera silnik rozpoznawania OCR (kilka megabajtów, tylko raz; następnie jest on przechowywany w pamięci podręcznej przeglądarki). Każde kolejne wyodrębnianie przebiega znacznie szybciej, ponieważ silnik jest już załadowany.

Jakie języki potrafi rozpoznać?

W menu wyboru języka dostępne są: angielski, chiński uproszczony, hiszpański, francuski, niemiecki i japoński. Aby uzyskać najlepszą dokładność, wybierz język, w którym strona została faktycznie wydrukowana — jakość rozpoznawania znacznie spada, jeśli wybrano niewłaściwy język.

Powiązane narzędzia