使用方法
- 给书页拍一张照片——尽量把整页都框进画面,但不用刻意追求把相机端得完全水平。
- 点击或拖拽照片到上传区域。
- 保持"自动纠偏"勾选状态(默认开启),选择页面的语言。
- 点击"提取文字"——工具会先把图片摆正,再进行文字识别。
- 复制识别结果,或下载为.txt文件。
示例
输入
一张手机拍摄的摊开平装书页照片,倾斜大约10度输出
检测到倾斜角度:-10.5° → 提取出文字并保留了完整的段落结构如果没有纠偏这一步,这种角度的照片通常会有三分之一的文字被识别错误;先修正角度之后,识别准确率能恢复到接近扫描仪的水平。
工具介绍
这个工具用OCR(光学字符识别)技术从书本、教材或印刷页面的照片中提取文字,识别过程全部在浏览器本地完成。跟基于扫描仪的OCR工具不同,它专门针对手持拍照这个具体问题设计:手机悬空对着摊开的书拍照,几乎不可能像扫描仪那样完全贴平,页面轻微倾斜是常态。
在正式识别开始之前,工具会先分析图片,检测出它相对水平线偏转了多少度,然后自动摆正。这一步对基于照片的OCR来说,重要性超过几乎所有其他因素:一张只偏了10-12度的照片,识别准确率可能从95%以上跌到70%以下,把清晰可读的文字变成一堆乱码——先纠偏,就能把结果拉回接近扫描仪的水准。
为什么拍照角度比想象中更重要
OCR引擎读取文字的原理是逐行扫描像素,寻找连续的水平墨迹带——这是它区分上下两行文字的方式。当页面哪怕只是轻微倾斜,原本应该是一条干净水平线的文字,就会在很多行像素之间形成对角线状的涂抹,引擎的分行逻辑就会开始把相邻两行的字符搅在一起,或者把一个字符拆成好几块。
这就是为什么一张你肉眼看起来清晰可读的照片,OCR结果却可能是一团乱码:人脑能毫不费力地自动补偿轻微的倾斜,但简单粗暴的OCR流程做不到。解决办法不是换一个更聪明的识别模型,而是先把图片摆正——这正是这个工具在正式识别之前那一步自动纠偏所做的事。
常见使用场景
- 把实体教材里的笔记或段落数字化,不用手动重新打字。
- 从旧平装书或图书馆借的书里摘录一段文字,方便之后引用或搜索。
- 把拍下来的讲义、练习题或印刷文章转换成可搜索、可编辑的文字。
- 给已经散架、没法平整放到扫描仪上的旧书页做数字存档。
→ 图片转ASCII艺术字 · 字数统计
如何拍出效果更好的照片
- 均匀充足的光线比手持稳定更重要——一张略微歪斜但光线均匀的照片,效果会好过一张端得很平但文字上有明显阴影的照片。
- 避免对光面书页直接打闪光灯,反光会把照到的那块文字彻底盖掉,跟角度对不对没关系。
- 把整页都框进画面并留一点余量——裁得太紧可能会切掉第一行或最后一行。
- 长段落建议一页一页拍、一页一页处理,不要尝试一次拍下两页的跨页——书脊附近会产生额外的弯曲变形。
为什么使用它?
自动纠偏:识别前先检测并修正拍照产生的倾斜角度,这是手持拍书场景下影响准确率最大的单一因素。
全程本地处理:照片和提取出的文字都不会离开你的浏览器——不会上传到任何服务器。
适用于泛黄、褪色的旧书页,也适用于清晰的现代印刷品。
支持多种识别语言(英语、简体中文、西班牙语、法语、德语、日语),可以扫描不同语言的书籍。
无需账号、无上传数量限制、无需订阅——想识别多少页都免费。
常见问题
为什么书本照片需要特殊处理,而不是用普通OCR?
普通OCR工具通常是针对平整、对齐良好的扫描件测试和调优的。手持拍摄的书页几乎不可能完全水平——哪怕只有8-12度的轻微倾斜(手持拍照的正常水平),也可能让识别准确率跌到70%以下。这个工具会先测量这个倾斜角度并自动修正,再进行识别,这就是能不能得到可用文字的关键差别。
泛黄或旧的书页也能用吗?
可以——纸张老化导致的变色和轻微对比度下降,对识别准确率本身影响很小。真正起决定性作用的是拍照角度,而不是纸张的颜色,所以只要图片被摆正了,旧平装书和二手教材的识别效果和新书差不多。
我的照片会被上传到哪里吗?
不会。倾斜检测和文字识别全部使用WebAssembly在你的浏览器里完成——你的照片和照片里的内容不会被发送到任何服务器。页面首次加载完之后,你甚至可以断网继续使用(除了识别引擎需要一次性下载)。
如果我的照片已经是正的,可以关闭自动纠偏吗?
可以,如果你用的是平整的扫描件或者已经自己摆正过的照片,取消勾选"自动纠偏"即可——这样会跳过检测步骤,识别速度会稍快一些。
为什么第一次识别比较慢?
第一次点击"提取文字"时,工具需要下载OCR识别引擎(几MB,只需下载一次,之后由浏览器缓存)。之后的每一次识别都会快很多,因为引擎已经加载好了。
支持哪些语言的识别?
语言选择器里提供英语、简体中文、西班牙语、法语、德语、日语。请选择页面实际印刷所用的语言以获得最佳准确率——如果选错了语言,识别质量会明显下降。