Как использовать
- Сфотографируйте страницу книги — постарайтесь, чтобы в кадре поместилась вся страница, но не беспокойтесь о том, чтобы держать камеру идеально ровно.
- Щелкните по фотографии или перетащите её в область загрузки.
- Оставьте флажок «Автоматическая коррекция перекоса» установленным (по умолчанию он включен) и выберите язык страницы.
- Нажмите «Извлечь текст» — инструмент сначала выровняет изображение, а затем распознает текст.
- Скопируйте результат или скачайте его в виде файла с расширением .txt.
Пример
Ввод
A phone photo of an open paperback page, held at roughly a 10° angleРезультат
Detected skew: -10.5° → text extracted with full paragraph structure preservedБез этапа коррекции наклона при таком угле съемки, как правило, из-за ошибок распознавания теряется треть текста; коррекция угла позволяет вернуть точность распознавания почти до уровня сканера.
Что это за инструмент?
Этот инструмент извлекает текст с фотографии книги, учебника или печатной страницы с помощью технологии OCR (оптического распознавания символов), которая работает полностью в вашем браузере. В отличие от инструментов OCR, основанных на использовании сканера, он разработан с учётом специфики фотографий, сделанных с руки: страницы фотографируются под небольшим углом, что практически неизбежно, когда вы держите телефон над раскрытой книгой, а не прижимаете его плоско к стеклу сканера.
Еще до начала распознавания инструмент анализирует изображение, чтобы точно определить, на сколько градусов оно повернуто относительно горизонтали, а затем автоматически выравнивает его. Этот единственный шаг имеет большее значение, чем почти что-либо другое, для OCR на основе фотографий: страница, сфотографированная с отклонением от горизонтали всего на 10–12 градусов, может снизить точность распознавания с более чем 95 % до менее 70 %, превращая четко читаемый текст в бессмысленный набор символов — исправление наклона сначала восстанавливает качество результатов, приближая их к качеству сканирования.
Почему ракурс съемки имеет большее значение, чем можно было бы подумать
Механизмы OCR считывают текст, сканируя строки пикселей в поисках однородных горизонтальных полос чернил — именно так они отделяют одну строку текста от следующей. Когда страница даже слегка наклонена, то, что должно быть чёткими горизонтальными строками текста, превращается в диагональные разводы, простирающиеся через множество строк пикселей, и алгоритм сегментации строк начинает объединять символы из соседних строк или разделять отдельные символы.
Именно поэтому фотография, которая на первый взгляд кажется вполне читаемой, всё равно может дать искажённый результат OCR: ваш мозг без труда компенсирует небольшой наклон, а вот простая система OCR — нет. Решением проблемы является не более «умная» модель распознавания, а сначала выравнивание изображения — именно это и делает этап автокоррекции в данном инструменте ещё до начала процесса распознавания.
Типичные сценарии использования
- Оцифровка заметок или отрывков из печатного учебника без их перепечатывания вручную.
- Выделение отрывка из старой книги в мягкой обложке или библиотечной книги для цитирования или последующего поиска.
- Преобразование сфотографированного раздаточного материала, рабочего листа или напечатанной статьи в текст, доступный для поиска и редактирования.
- Архивирование страниц из книги, которая разваливается на части или слишком хрупкая, чтобы сканировать её, положив на сканер.
Как добиться наилучших результатов
- Хорошее, равномерное освещение важнее, чем абсолютно устойчивая рука — слегка перекошенная, но хорошо освещённая фотография выглядит лучше, чем ровная фотография с густой тенью на тексте.
- Не направляйте вспышку прямо на глянцевые страницы; возникающий в результате блик или яркие пятна могут сделать текст под ними неразборчивым, независимо от корректировки угла съемки.
- Поместите всю страницу в рамку, оставив небольшой зазор — слишком плотное кадрирование может привести к обрезанию первой или последней строки.
- Если речь идет об очень длинных отрывках, лучше сфотографировать и обработать по одной странице за раз, а не пытаться сфотографировать разворот, так как при этом возникает искажение из-за кривизны в районе корешка.
Зачем его использовать?
Автоматическая коррекция наклона: обнаруживает и выравнивает перекосы на фотографиях перед распознаванием — это главный фактор, определяющий точность распознавания фотографий книг, снятых с руки.
Полностью автономная обработка: фотография и извлеченный текст никогда не покидают ваш браузер — никакие данные не загружаются на сервер.
Подходит как для старых, пожелтевших или слегка выцветших страниц книг, так и для свежих современных печатных изданий.
Поддерживает несколько языков распознавания (английский, китайский, испанский, французский, немецкий, японский), что позволяет сканировать книги на разных языках.
Без регистрации, без ограничений на загрузку, без подписки — бесплатно, сколько страниц вам нужно.
Часто задаваемые вопросы
Почему для фотографии моей книги требуется специальная обработка, а не обычное распознавание текста (OCR)?
Обычные инструменты OCR, как правило, тестируются и настраиваются на ровных, идеально выровненных сканах. Страница книги, сфотографированная вручную, практически никогда не бывает ровной — даже небольшой наклон на 8–12 градусов, что является нормальным для съемки с руки, может снизить точность распознавания значительно ниже 70%. Этот инструмент измеряет этот наклон и автоматически корректирует его перед запуском распознавания, что и является разницей между пригодным для использования текстом и искажённым результатом.
Это сработает на старых или пожелтевших страницах книги?
Да — изменение цвета страниц и незначительная потеря контрастности из-за старения бумаги сами по себе практически не влияют на точность распознавания. Решающим фактором является угол наклона фотографии, а не цвет бумаги, поэтому старые книги в мягкой обложке и подержанные учебники работают примерно так же хорошо, как и новые, после выравнивания изображения.
Моя фотография где-нибудь загружена?
Нет. И определение наклона, и распознавание текста выполняются полностью в вашем браузере с помощью WebAssembly — никакая информация о вашей фотографии или её содержании не отправляется на какой-либо сервер. Вы даже можете отключить интернет после первоначальной загрузки страницы, и сервис продолжит работать (за исключением однократной загрузки модуля распознавания).
Можно ли отключить автокоррекцию, если моя фотография и так выровнена?
Да, снимите флажок «Автоматическая коррекция наклона», если вы работаете с плоским сканом или фотографией, которую вы уже выровняли — это позволит пропустить этап обнаружения и немного ускорит процесс распознавания.
Почему первая экстракция происходит медленно?
При первом нажатии кнопки «Извлечь текст» инструмент загружает модуль распознавания OCR (размер — несколько мегабайт, загрузка происходит только один раз, после чего модуль сохраняется в кэше вашего браузера). Каждое последующее извлечение текста происходит гораздо быстрее, так как модуль уже загружен.
Какие языки он может распознавать?
В меню выбора языка доступны следующие языки: английский, упрощённый китайский, испанский, французский, немецкий и японский. Для обеспечения максимальной точности выберите язык, на котором страница на самом деле напечатана — качество распознавания резко снижается при выборе неверного языка.