CodeKitHub
Русский
Инструменты для изображений

Преобразование страницы книги в текст

Превратите фотографию страницы книги в редактируемый текст с возможностью поиска — этот инструмент разработан специально для реальных фотографий настоящих книг, а не для плоских сканов документов. Большинство инструментов OCR предполагают идеально выровненный скан; этот инструмент автоматически определяет и корректирует наклон, возникающий при съемке страницы вручную, а затем распознает текст. Всё работает в вашем браузере: ни фотография, ни извлечённый текст не покидают ваше устройство.

Как использовать

  1. Сфотографируйте страницу книги — постарайтесь, чтобы в кадре поместилась вся страница, но не беспокойтесь о том, чтобы держать камеру идеально ровно.
  2. Щелкните по фотографии или перетащите её в область загрузки.
  3. Оставьте флажок «Автоматическая коррекция перекоса» установленным (по умолчанию он включен) и выберите язык страницы.
  4. Нажмите «Извлечь текст» — инструмент сначала выровняет изображение, а затем распознает текст.
  5. Скопируйте результат или скачайте его в виде файла с расширением .txt.

Пример

Ввод

A phone photo of an open paperback page, held at roughly a 10° angle

Результат

Detected skew: -10.5° → text extracted with full paragraph structure preserved

Без этапа коррекции наклона при таком угле съемки, как правило, из-за ошибок распознавания теряется треть текста; коррекция угла позволяет вернуть точность распознавания почти до уровня сканера.

Что это за инструмент?

Этот инструмент извлекает текст с фотографии книги, учебника или печатной страницы с помощью технологии OCR (оптического распознавания символов), которая работает полностью в вашем браузере. В отличие от инструментов OCR, основанных на использовании сканера, он разработан с учётом специфики фотографий, сделанных с руки: страницы фотографируются под небольшим углом, что практически неизбежно, когда вы держите телефон над раскрытой книгой, а не прижимаете его плоско к стеклу сканера.

Еще до начала распознавания инструмент анализирует изображение, чтобы точно определить, на сколько градусов оно повернуто относительно горизонтали, а затем автоматически выравнивает его. Этот единственный шаг имеет большее значение, чем почти что-либо другое, для OCR на основе фотографий: страница, сфотографированная с отклонением от горизонтали всего на 10–12 градусов, может снизить точность распознавания с более чем 95 % до менее 70 %, превращая четко читаемый текст в бессмысленный набор символов — исправление наклона сначала восстанавливает качество результатов, приближая их к качеству сканирования.

Почему ракурс съемки имеет большее значение, чем можно было бы подумать

Механизмы OCR считывают текст, сканируя строки пикселей в поисках однородных горизонтальных полос чернил — именно так они отделяют одну строку текста от следующей. Когда страница даже слегка наклонена, то, что должно быть чёткими горизонтальными строками текста, превращается в диагональные разводы, простирающиеся через множество строк пикселей, и алгоритм сегментации строк начинает объединять символы из соседних строк или разделять отдельные символы.

Именно поэтому фотография, которая на первый взгляд кажется вполне читаемой, всё равно может дать искажённый результат OCR: ваш мозг без труда компенсирует небольшой наклон, а вот простая система OCR — нет. Решением проблемы является не более «умная» модель распознавания, а сначала выравнивание изображения — именно это и делает этап автокоррекции в данном инструменте ещё до начала процесса распознавания.

Типичные сценарии использования

  • Оцифровка заметок или отрывков из печатного учебника без их перепечатывания вручную.
  • Выделение отрывка из старой книги в мягкой обложке или библиотечной книги для цитирования или последующего поиска.
  • Преобразование сфотографированного раздаточного материала, рабочего листа или напечатанной статьи в текст, доступный для поиска и редактирования.
  • Архивирование страниц из книги, которая разваливается на части или слишком хрупкая, чтобы сканировать её, положив на сканер.

Конвертер изображений в ASCII-арт · Счетчик слов

Как добиться наилучших результатов

  • Хорошее, равномерное освещение важнее, чем абсолютно устойчивая рука — слегка перекошенная, но хорошо освещённая фотография выглядит лучше, чем ровная фотография с густой тенью на тексте.
  • Не направляйте вспышку прямо на глянцевые страницы; возникающий в результате блик или яркие пятна могут сделать текст под ними неразборчивым, независимо от корректировки угла съемки.
  • Поместите всю страницу в рамку, оставив небольшой зазор — слишком плотное кадрирование может привести к обрезанию первой или последней строки.
  • Если речь идет об очень длинных отрывках, лучше сфотографировать и обработать по одной странице за раз, а не пытаться сфотографировать разворот, так как при этом возникает искажение из-за кривизны в районе корешка.

Зачем его использовать?

Автоматическая коррекция наклона: обнаруживает и выравнивает перекосы на фотографиях перед распознаванием — это главный фактор, определяющий точность распознавания фотографий книг, снятых с руки.

Полностью автономная обработка: фотография и извлеченный текст никогда не покидают ваш браузер — никакие данные не загружаются на сервер.

Подходит как для старых, пожелтевших или слегка выцветших страниц книг, так и для свежих современных печатных изданий.

Поддерживает несколько языков распознавания (английский, китайский, испанский, французский, немецкий, японский), что позволяет сканировать книги на разных языках.

Без регистрации, без ограничений на загрузку, без подписки — бесплатно, сколько страниц вам нужно.

Часто задаваемые вопросы

Почему для фотографии моей книги требуется специальная обработка, а не обычное распознавание текста (OCR)?

Обычные инструменты OCR, как правило, тестируются и настраиваются на ровных, идеально выровненных сканах. Страница книги, сфотографированная вручную, практически никогда не бывает ровной — даже небольшой наклон на 8–12 градусов, что является нормальным для съемки с руки, может снизить точность распознавания значительно ниже 70%. Этот инструмент измеряет этот наклон и автоматически корректирует его перед запуском распознавания, что и является разницей между пригодным для использования текстом и искажённым результатом.

Это сработает на старых или пожелтевших страницах книги?

Да — изменение цвета страниц и незначительная потеря контрастности из-за старения бумаги сами по себе практически не влияют на точность распознавания. Решающим фактором является угол наклона фотографии, а не цвет бумаги, поэтому старые книги в мягкой обложке и подержанные учебники работают примерно так же хорошо, как и новые, после выравнивания изображения.

Моя фотография где-нибудь загружена?

Нет. И определение наклона, и распознавание текста выполняются полностью в вашем браузере с помощью WebAssembly — никакая информация о вашей фотографии или её содержании не отправляется на какой-либо сервер. Вы даже можете отключить интернет после первоначальной загрузки страницы, и сервис продолжит работать (за исключением однократной загрузки модуля распознавания).

Можно ли отключить автокоррекцию, если моя фотография и так выровнена?

Да, снимите флажок «Автоматическая коррекция наклона», если вы работаете с плоским сканом или фотографией, которую вы уже выровняли — это позволит пропустить этап обнаружения и немного ускорит процесс распознавания.

Почему первая экстракция происходит медленно?

При первом нажатии кнопки «Извлечь текст» инструмент загружает модуль распознавания OCR (размер — несколько мегабайт, загрузка происходит только один раз, после чего модуль сохраняется в кэше вашего браузера). Каждое последующее извлечение текста происходит гораздо быстрее, так как модуль уже загружен.

Какие языки он может распознавать?

В меню выбора языка доступны следующие языки: английский, упрощённый китайский, испанский, французский, немецкий и японский. Для обеспечения максимальной точности выберите язык, на котором страница на самом деле напечатана — качество распознавания резко снижается при выборе неверного языка.

Похожие инструменты