CodeKitHub
日本語
画像ツール

本のページ写真をテキスト化

本のページの写真を、編集可能で検索可能なテキストに変換します——平らなドキュメントスキャンではなく、実際に撮影した本の写真専用に設計されています。ほとんどのOCRツールは完全に整列したスキャンを前提としていますが、このツールは手で本のページを撮影したときに生じる傾きを自動的に検出・補正してから文字を認識します。すべてブラウザ内で処理されるため、写真も抽出されたテキストもあなたの端末から一切外に出ません。

使い方

  1. 本のページの写真を撮ってください——ページ全体をフレームに収めるよう心がけてください。カメラを完全に水平に持つことにこだわる必要はありません。
  2. 写真をクリックまたはドラッグしてアップロード領域に入れてください。
  3. 「傾きを自動補正する」はチェックしたまま(デフォルトでオン)にして、ページの言語を選んでください。
  4. 「文字を抽出する」をクリックしてください——ツールはまず画像をまっすぐに補正し、それから文字を認識します。
  5. 結果をコピーするか、.txtファイルとしてダウンロードしてください。

入力

開いた文庫本のページを、約10度傾けて持ちながらスマートフォンで撮影した写真

出力

検出された傾き:-10.5° → 段落構造を完全に保ったままテキストが抽出された

傾き補正のステップがなければ、この角度の写真は通常、単語の3分の1程度が誤読される。先に角度を補正することで、認識精度はスキャナーに近い水準まで回復する。

このツールとは?

このツールは、本・教科書・印刷ページの写真から、ブラウザ内で完結するOCR(光学文字認識)を使ってテキストを抽出します。スキャナーベースのOCRツールとは違い、手持ち撮影特有の問題——スマートフォンを開いた本の上にかざして撮るため、スキャナーのガラス面に平らに押し当てるのとは違い、わずかな角度がついてしまうこと——を前提に設計されています。

認識処理が始まる前に、まず画像を解析して水平線から何度傾いているかを正確に検出し、自動的にまっすぐに補正します。この一手順が、写真ベースのOCRにおいてほぼ何よりも重要です。わずか10〜12度傾いて撮影されただけのページでも、認識精度は95%以上から70%未満まで落ち込み、はっきり読めるはずの文字が意味不明な文字列に変わってしまいます——先に傾きを補正することで、スキャナーに近い品質の結果に戻すことができます。

撮影角度が思っている以上に重要な理由

OCRエンジンは、連続した水平方向のインクの帯を探しながらピクセルの行をスキャンすることで文字を読み取ります——これが行と行を区別する仕組みです。ページがわずかでも傾いていると、本来はきれいな水平線であるはずの文字列が、多数のピクセル行にまたがる斜めの塗りつぶしのようになってしまい、エンジンの行分割ロジックは隣接する行の文字同士を混ぜてしまったり、1つの文字をいくつかに分割してしまったりし始めます。

これが、肉眼では完全に読める写真でも、OCRの結果が支離滅裂になり得る理由です。人間の脳はわずかな傾きを苦もなく補正しますが、単純なOCRの処理系はそうしません。解決策はより賢い認識モデルではなく、まず画像をまっすぐにすることです——これこそが、このツールが認識を実行する前に行う自動補正のステップです。

よくある利用シーン

  • 手で入力し直すことなく、紙の教科書のノートや抜粋をデジタル化する。
  • 古い文庫本や図書館の本から一節を抜き出し、後で引用したり検索したりできるようにする。
  • 撮影したプリント、ワークシート、印刷された記事を検索・編集可能なテキストに変換する。
  • ばらばらになりかけていて、スキャナーに平らに置いてスキャンできない本のページをアーカイブする。

画像からASCIIアートへの変換ツール · 文字数カウンター

より良い結果を得るために

  • 手をぴったり静止させることよりも、均一で十分な明るさのほうが重要です——多少傾いていても照明が均一な写真は、水平でも文字に濃い影がかかった写真より良い結果になります。
  • 光沢のあるページに直接フラッシュを当てるのは避けてください。生じる反射やハイライトは、角度補正とは関係なくその下の文字を消してしまいます。
  • 余白を少し残してページ全体をフレームに収めてください——きつくトリミングしすぎると最初や最後の行が切れてしまうことがあります。
  • 長い文章の場合は、見開き2ページを一度に撮ろうとせず、1ページずつ撮影・処理してください。見開きでは、のど(綴じ部分)付近で別の歪みが生じます。

なぜこれを使うのか?

自動傾き補正:認識前に撮影角度の傾きを検出して補正します。手持ちで撮影した本の写真において、精度に最も影響する単一の要因です。

完全にオフラインで処理:写真も抽出されたテキストもブラウザから一切出ません——サーバーには何もアップロードされません。

古く黄ばんだ書物のページにも、くっきりした現代の印刷物にも対応します。

複数の認識言語(英語、簡体字中国語、スペイン語、フランス語、ドイツ語、日本語)に対応しており、さまざまな言語の本をスキャンできます。

アカウント不要、アップロード数の制限なし、サブスクリプション不要——必要なだけ何ページでも無料で利用できます。

よくある質問

なぜ本の写真には通常のOCRではなく特別な処理が必要なのですか?

通常のOCRツールは、たいてい平らで完全に整列したスキャンを前提にテスト・調整されています。手で撮影した本のページはほとんど水平にはなりません——手持ち撮影では普通に起こる8〜12度程度のわずかな傾きでも、認識精度が70%を大きく下回ることがあります。このツールはその傾きを測定し、認識を実行する前に自動的に補正します。これが使える文字と意味不明な結果との分かれ道です。

古い本や黄ばんだページでも使えますか?

はい——紙の経年変化による変色や軽度のコントラスト低下は、それ自体では認識精度にほとんど影響しません。決定的な要因は紙の色ではなく撮影角度なので、画像がまっすぐに補正されていれば、古い文庫本や中古の教科書も新品とほぼ同じくらいの精度で認識できます。

私の写真はどこかにアップロードされますか?

いいえ。傾きの検出も文字認識も、すべてWebAssemblyを使ってあなたのブラウザ内で完結します——あなたの写真もその内容も、いかなるサーバーにも送信されません。ページを最初に読み込んだ後であれば、インターネットを切断しても動作し続けます(認識エンジンの一度きりのダウンロードを除く)。

写真がすでにまっすぐな場合、自動補正をオフにできますか?

はい。平らなスキャンデータや、すでに自分でまっすぐに補正した写真を使う場合は「傾きを自動補正する」のチェックを外してください——検出ステップが省略され、認識がわずかに速くなります。

なぜ最初の抽出は時間がかかるのですか?

「文字を抽出する」を最初にクリックしたとき、ツールはOCR認識エンジンをダウンロードします(数MB程度、一度きりで、その後はブラウザにキャッシュされます)。それ以降の抽出は、エンジンがすでに読み込まれているため、はるかに高速になります。

どの言語を認識できますか?

言語選択メニューには英語、簡体字中国語、スペイン語、フランス語、ドイツ語、日本語が用意されています。最良の精度を得るには、ページに実際に印刷されている言語を選んでください——言語の選択を誤ると、認識品質は大きく低下します。

関連ツール