Як користуватися
- Сфотографуйте сторінку книги — намагайтеся вмістити всю сторінку в кадр, але не переймайтеся тим, щоб тримати камеру ідеально рівно.
- Клацніть або перетягніть фото в область завантаження.
- Залиште "Автовиправлення перекосу" увімкненим (за замовчуванням увімкнено) і оберіть мову сторінки.
- Натисніть "Вилучити текст" — інструмент спершу вирівнює зображення, а потім розпізнає текст.
- Скопіюйте результат або завантажте його як файл .txt.
Приклад
Введення
Фото сторінки розкритої книги в м'якій палітурці з телефону, зроблене під кутом приблизно 10°Результат
Виявлений перекіс: -10,5° → текст вилучено зі збереженою повною структурою абзацівБез кроку вирівнювання перекосу фото під таким кутом зазвичай втрачає третину слів через помилки розпізнавання; спершу виправивши кут, точність розпізнавання повертається майже до рівня сканера.
Що це за інструмент?
Цей інструмент вилучає текст із фотографії книги, підручника чи друкованої сторінки за допомогою OCR (оптичного розпізнавання символів), що повністю виконується у вашому браузері. На відміну від інструментів OCR на основі сканера, він побудований навколо специфічної проблеми фотографій, зроблених з рук: сторінки, сфотографовані під незначним кутом, що майже неминуче, коли ви тримаєте телефон над відкритою книгою замість того, щоб притиснути її до скла сканера.
Перш ніж розпізнавання взагалі почнеться, інструмент аналізує зображення, щоб визначити, на скільки градусів воно повернуте від горизонталі, а потім автоматично вирівнює його. Цей єдиний крок має більше значення, ніж майже будь-що інше для фото-OCR: сторінка, сфотографована лише під кутом 10-12 градусів від рівня, може знизити точність розпізнавання з понад 95% до менш ніж 70%, перетворюючи чітко читабельний текст на беззмістовну мішанину — спершу вирівнявши перекіс, інструмент повертає результати майже до якості сканера.
Чому кут фото має більше значення, ніж здається
Движки OCR читають текст, скануючи рядки пікселів у пошуку узгоджених горизонтальних смуг чорнила — саме так вони відділяють один рядок тексту від наступного. Коли сторінка навіть трохи перекошена, те, що мало б бути чистою горизонтальною лінією тексту, стає діагональною розмазаною плямою через багато рядків пікселів, і логіка сегментації рядків движка починає зливати символи із сусідніх рядків чи розділяти окремі символи навпіл.
Саме тому фото, яке виглядає цілком читабельним для ваших очей, все одно може дати беззмістовний результат OCR: ваш мозок легко компенсує незначний нахил, а простий конвеєр OCR — ні. Вирішення проблеми полягає не в розумнішій моделі розпізнавання — а у вирівнюванні зображення заздалегідь, що і робить крок автовиправлення в цьому інструменті ще до запуску розпізнавання.
Типові сценарії використання
- Оцифрування нотаток чи уривків із фізичного підручника без ручного перенабору.
- Вилучення уривка зі старої книги в м'якій палітурці чи бібліотечної книги для цитування чи подальшого пошуку.
- Перетворення сфотографованого роздаткового матеріалу, робочого листа чи друкованої статті на текст, доступний для пошуку й редагування.
- Архівування сторінок із книги, що розсипається чи занадто крихка, щоб покласти пласко на скло сканера.
Як отримати найкращі результати
- Хороше рівномірне освітлення важливіше за ідеально стабільну руку — трохи перекошене, але добре освітлене фото дає кращий результат за рівне фото з густою тінню на тексті.
- Уникайте прямого спалаху на глянцевих сторінках; отримані відблиски/засвітлення можуть повністю приховати текст під ними незалежно від виправлення кута.
- Вмістіть усю сторінку в кадр із невеликим запасом — надто щільна обрізка може відрізати перший чи останній рядок.
- Для дуже довгих уривків фотографуйте й обробляйте по одній сторінці за раз, а не намагайтеся захопити розворот на дві сторінки, що вносить власне спотворення кривизни біля корінця книги.
Навіщо його використовувати?
Автоматичне виправлення перекосу: виявляє й вирівнює перекошені кути фото перед розпізнаванням — найважливіший фактор точності для фото книг, зроблених з рук.
Повністю офлайн-обробка: фото й вилучений текст ніколи не покидають ваш браузер — нічого не завантажується на сервер.
Працює зі старими, пожовклими чи трохи вицвілими сторінками книг так само добре, як із чітким сучасним друком.
Підтримує кілька мов розпізнавання (англійська, китайська, іспанська, французька, німецька, японська), тож можна сканувати книги різними мовами.
Без облікового запису, без обмежень на завантаження, без підписки — безкоштовно для скільки завгодно сторінок.
Часті запитання
Чому моєму фото книги потрібна особлива обробка замість звичайного OCR?
Звичайні інструменти OCR зазвичай тестуються й налаштовуються на пласкі, ідеально вирівняні скани. Сторінка книги, сфотографована з рук, майже ніколи не буває рівною — навіть невеликий нахил у 8-12 градусів, звичний для знімка з рук, може обвалити точність розпізнавання значно нижче 70%. Цей інструмент вимірює цей нахил і автоматично виправляє його перед запуском розпізнавання, що є різницею між придатним для використання текстом і беззмістовним результатом.
Чи працює це зі старими чи пожовклими сторінками книг?
Так — знебарвлення сторінки й незначна втрата контрасту через старіння паперу самі по собі майже не впливають на точність розпізнавання. Кут фото — домінантний фактор, а не колір паперу, тож старі книги в м'якій палітурці й вживані підручники працюють приблизно так само добре, як і нові, після вирівнювання зображення.
Чи завантажується моє фото кудись?
Ні. Як виявлення перекосу, так і розпізнавання тексту повністю виконуються у вашому браузері за допомогою WebAssembly — нічого про ваше фото чи його вміст не надсилається на жоден сервер. Ви навіть можете відключитися від інтернету після першого завантаження сторінки, і все продовжуватиме працювати (за винятком одноразового завантаження движка розпізнавання).
Чи можна вимкнути автовиправлення, якщо моє фото вже рівне?
Так, зніміть позначку "Автовиправлення перекосу", якщо ви працюєте з пласким сканом чи фото, яке вже вирівняли — це пропустить крок виявлення й запустить розпізнавання трохи швидше.
Чому перше вилучення повільне?
Під час першого натискання "Вилучити текст" інструмент завантажує движок розпізнавання OCR (кілька мегабайтів, лише один раз, потім кешується вашим браузером). Кожне наступне вилучення відбувається значно швидше, оскільки движок уже завантажено.
Які мови він може розпізнавати?
У селекторі мов доступні англійська, спрощена китайська, іспанська, французька, німецька та японська. Для найкращої точності оберіть мову, якою насправді надруковано сторінку — якість розпізнавання різко падає, якщо обрано неправильну мову.