CodeKitHub
Vaizdų įrankiai

Knygos puslapis į tekstą

Paskutinį kartą atnaujinta:

Paverskite knygos puslapio nuotrauką redaguojamu, paieškos galinčiu tekstu — sukurta specialiai realioms tikrų knygų nuotraukoms, o ne plokštiems dokumentų skenavimams. Dauguma OCR įrankių daro prielaidą, kad skenavimas idealiai lygus; šis automatiškai aptinka ir ištaiso kreivą kampą, kurį gaunate fotografuodami puslapį ranka, o tada atpažįsta tekstą. Viskas vyksta jūsų naršyklėje: nuotrauka ir teksto išgavimas niekada nepalieka jūsų įrenginio.

Kaip naudoti

  1. Nufotografuokite knygos puslapį — pabandykite sutalpinti visą puslapį į kadrą, tačiau nesijaudinkite dėl visiškai lygiai laikomo fotoaparato.
  2. Spustelėkite arba nutempkite nuotrauką į įkėlimo sritį.
  3. Palikite pažymėtą "Automatiškai ištaisyti pasvirimą" (numatytai įjungta) ir pasirinkite puslapio kalbą.
  4. Spustelėkite "Išgauti tekstą" — įrankis pirmiausia ištiesina vaizdą, tada atpažįsta tekstą.
  5. Nukopijuokite rezultatą arba atsisiųskite kaip .txt failą.

Pavyzdys

Įvestis

Telefono nuotrauka atviro minkštos viršelio knygos puslapio, laikomo maždaug 10° kampu

Išvestis

Aptiktas pasvirimas: -10,5° → tekstas išgautas išlaikant pilną pastraipos struktūrą

Be pasvirimo ištaisymo žingsnio, tokio kampo nuotrauka paprastai praranda trečdalį žodžių dėl klaidingo perskaitymo; pirmiausia ištaisius kampą, atpažinimas grąžinamas arti skenerio tikslumo.

Kas yra šis įrankis?

Šis įrankis išgauna tekstą iš knygos, vadovėlio ar spausdinto puslapio nuotraukos, naudodamas OCR (optinį simbolių atpažinimą), veikiantį visiškai jūsų naršyklėje. Skirtingai nuo skeneriu pagrįstų OCR įrankių, jis sukurtas specialiai rankoje laikomų nuotraukų problemai spręsti: puslapiams, nufotografuotiems šiek tiek įstrižai, o tai beveik neišvengiama, kai telefoną laikote virš atviros knygos, o ne spaudžiate jį plokščiai prie skenerio stiklo.

Prieš prasidedant atpažinimui, įrankis analizuoja vaizdą, kad nustatytų, keliais laipsniais jis pasuktas nuo horizontalaus lygio, ir automatiškai jį ištiesina. Šis vienas žingsnis svarbesnis nei beveik bet kas kitas, kuomet OCR atliekamas iš nuotraukos: puslapis, nufotografuotas vos 10-12 laipsnių kampu nuo lygio, gali sumažinti atpažinimo tikslumą nuo daugiau nei 95% iki žemiau 70%, aiškiai skaitomą tekstą paversdamas iškraipyta nesąmone — pirmiausia ištaisius pasvirimą, rezultatai grąžinami arti skenerio kokybės.

Kodėl nuotraukos kampas svarbesnis, nei manytumėte

OCR varikliai skaito tekstą skenuodami pikselių eilutes, ieškodami nuoseklių horizontalių rašalo juostų — taip jie atskiria vieną teksto eilutę nuo kitos. Kai puslapis šiek tiek pasviręs, tai, kas turėtų būti švari horizontali teksto linija, virsta įstriža dryžuota juosta per daugybę pikselių eilučių, ir variklio eilučių segmentavimo logika pradeda sujungti simbolius iš gretimų eilučių arba atskirti pavienius simbolius.

Būtent todėl nuotrauka, kuri jūsų akims atrodo puikiai skaitoma, vis tiek gali sukurti iškraipytą OCR rezultatą: jūsų smegenys nesunkiai kompensuoja nedidelį pakrypimą, tačiau paprasta OCR sistema to nedaro. Sprendimas nėra protingesnis atpažinimo modelis — tai vaizdo ištiesinimas iš anksto, būtent tai, ką atlieka šio įrankio automatinio taisymo žingsnis prieš prasidedant atpažinimui.

Dažniausi naudojimo atvejai

  • Fizinio vadovėlio užrašų ar ištraukų skaitmeninimas neperrašant jų ranka.
  • Ištraukos iš senos minkšto viršelio knygos ar bibliotekos knygos išgavimas, kad vėliau būtų galima cituoti ar ieškoti.
  • Nufotografuoto informacinio lapo, darbalapio ar spausdinto straipsnio konvertavimas į paieškos galintį, redaguojamą tekstą.
  • Puslapių iš byrančios ar per trapios plokščiai skenuoti knygos archyvavimas.

Vaizdo į ASCII meną konverteris · Žodžių skaičiuoklė

Kaip pasiekti geriausius rezultatus

  • Geras, tolygus apšvietimas svarbesnis nei visiškai tvirta ranka — šiek tiek kreiva, bet gerai apšviesta nuotrauka pralenkia lygią nuotrauką su stipriu šešėliu ant teksto.
  • Venkite tiesioginio blykstės šviesos ant blizgių puslapių; dėl to atsiradęs atspindys/šviesos taškas gali paslėpti tekstą po juo, nepriklausomai nuo kampo ištaisymo.
  • Sutalpinkite visą puslapį į kadrą su nedideliu paraštės rezervu — per glaudus apkirpimas gali nukirpti pirmąją ar paskutinę eilutę.
  • Labai ilgoms ištraukoms fotografuokite ir apdorokite po vieną puslapį, o ne bandykite užfiksuoti abu puslapius kartu — tai sukelia savo iškraipymą dėl knygos lenktumo prie nugarėlės.

Kodėl jį naudoti?

Automatinis pasvirimo ištaisymas: aptinka ir ištiesina kreivus nuotraukų kampus prieš atpažinimą — svarbiausias tikslumo veiksnys rankoje laikomų knygų nuotraukoms.

Visiškas apdorojimas be interneto: nuotrauka ir išgautas tekstas niekada nepalieka jūsų naršyklės — niekas neįkeliama į serverį.

Veikia su senais, pagelsvusiais ar šiek tiek išblukusiais knygos puslapiais bei ryškiu modernaus spausdinimo tekstu.

Palaiko kelias atpažinimo kalbas (anglų, kinų, ispanų, prancūzų, vokiečių, japonų), todėl galite skenuoti knygas skirtingomis kalbomis.

Nėra paskyros, įkėlimo apribojimo ar prenumeratos — nemokama tiek puslapių, kiek reikia.

Dažniausiai užduodami klausimai

Kodėl mano knygos nuotraukai reikia specialaus apdorojimo, o ne įprasto OCR?

Įprasti OCR įrankiai paprastai testuojami ir pritaikyti plokštiems, idealiai sulygiuotiems skenavimams. Ranka nufotografuotas knygos puslapis beveik niekada nebūna lygus — net nedidelis 8-12 laipsnių pakrypimas, normalus rankoje laikomam kadrui, gali sumažinti atpažinimo tikslumą gerokai žemiau 70%. Šis įrankis išmatuoja tą pakrypimą ir automatiškai jį ištaiso prieš vykdant atpažinimą — tai skirtumas tarp naudojamo teksto ir iškraipytos išvesties.

Ar tai veikia su senais ar pagelsvusiais knygos puslapiais?

Taip — puslapio spalvos pakitimas ir nedidelis kontrasto praradimas dėl senstelėjusio popieriaus patys savaime turi labai mažą įtaką atpažinimo tikslumui. Nuotraukos kampas yra dominuojantis veiksnys, o ne popieriaus spalva, todėl senos minkšto viršelio knygos ir naudoti vadovėliai veikia beveik taip pat gerai, kaip ir naujos, kai vaizdas ištiesintas.

Ar mano nuotrauka kur nors įkeliama?

Ne. Tiek pasvirimo aptikimas, tiek teksto atpažinimas vyksta visiškai jūsų naršyklėje naudojant WebAssembly — jokia informacija apie jūsų nuotrauką ar jos turinį nesiunčiama į jokį serverį. Netgi galite atsijungti nuo interneto po pirmojo puslapio įkėlimo, ir viskas toliau veiks (išskyrus vienkartinį atpažinimo variklio atsisiuntimą).

Ar galiu išjungti automatinį taisymą, jei mano nuotrauka jau tiesi?

Taip, nuimkite žymėjimą nuo "Automatiškai ištaisyti pasvirimą", jei dirbate su plokščiu skenavimu ar jau ištiesinta nuotrauka — tai praleidžia aptikimo žingsnį ir atpažinimas vyksta šiek tiek greičiau.

Kodėl pirmasis išgavimas lėtas?

Pirmą kartą spustelėjus "Išgauti tekstą", įrankis atsisiunčia OCR atpažinimo variklį (kelis megabaitus, tik vieną kartą, vėliau saugoma jūsų naršyklės podėlyje). Kiekvienas kitas išgavimas vyksta daug greičiau, nes variklis jau įkeltas.

Kokias kalbas gali atpažinti?

Kalbos pasirinkimo sąraše yra anglų, supaprastinta kinų, ispanų, prancūzų, vokiečių ir japonų kalbos. Rinkitės kalbą, kuria puslapis iš tikrųjų spausdintas, kad gautumėte geriausią tikslumą — atpažinimo kokybė smarkiai krenta, jei pasirenkama neteisinga kalba.

Susiję įrankiai