CodeKitHub
Tiếng Việt
Công cụ Hình ảnh

Chuyển Ảnh Trang Sách Thành Văn Bản

Biến ảnh chụp một trang sách thành văn bản có thể chỉnh sửa và tìm kiếm — được thiết kế riêng cho ảnh chụp sách thực tế, không phải bản scan tài liệu phẳng. Hầu hết công cụ OCR giả định bản scan hoàn toàn thẳng; công cụ này tự động phát hiện và chỉnh sửa góc chụp bị lệch mà bạn thường gặp khi chụp trang sách bằng tay, sau đó mới nhận diện văn bản. Mọi thứ chạy trong trình duyệt của bạn: ảnh và văn bản trích xuất không bao giờ rời khỏi thiết bị.

Cách Sử Dụng

  1. Chụp ảnh trang sách — cố gắng đưa toàn bộ trang vào khung hình, nhưng không cần lo giữ máy ảnh hoàn toàn ngang bằng.
  2. Nhấn hoặc kéo ảnh vào khu vực tải lên.
  3. Để nguyên tùy chọn "Tự động chỉnh lệch" (mặc định được bật) và chọn ngôn ngữ của trang sách.
  4. Nhấn "Extract text" — công cụ sẽ làm thẳng hình ảnh trước, sau đó nhận diện văn bản.
  5. Sao chép kết quả hoặc tải xuống dưới dạng file .txt.

Ví dụ

Đầu vào

Ảnh chụp bằng điện thoại một trang sách bìa mềm đang mở, cầm nghiêng khoảng 10°

Đầu ra

Độ lệch phát hiện: -10,5° → văn bản được trích xuất với cấu trúc đoạn văn được giữ nguyên

Nếu không có bước chỉnh lệch, một bức ảnh với góc chụp như vậy thường mất khoảng một phần ba số từ do đọc sai; chỉnh góc trước sẽ đưa độ chính xác nhận diện về gần mức của máy scan.

Công Cụ Này Là Gì?

Công cụ này trích xuất văn bản từ ảnh chụp sách, sách giáo khoa, hoặc trang in bằng công nghệ OCR (nhận diện ký tự quang học) chạy hoàn toàn trong trình duyệt của bạn. Khác với các công cụ OCR dựa trên máy scan, công cụ này được xây dựng riêng cho vấn đề của ảnh chụp bằng tay: trang sách bị chụp hơi lệch góc, điều gần như không thể tránh khỏi khi bạn cầm điện thoại chụp phía trên một cuốn sách mở thay vì ép nó phẳng lên mặt kính máy scan.

Trước khi bắt đầu nhận diện, công cụ phân tích hình ảnh để xác định chính xác nó bị xoay bao nhiêu độ so với phương ngang, rồi tự động làm thẳng lại. Bước duy nhất này quan trọng hơn hầu hết mọi thứ khác đối với OCR dựa trên ảnh chụp: một trang sách bị chụp lệch chỉ 10-12 độ có thể làm giảm độ chính xác nhận diện từ trên 95% xuống dưới 70%, biến văn bản rõ ràng dễ đọc thành mớ ký tự vô nghĩa — chỉnh lệch trước sẽ khôi phục kết quả gần với chất lượng của máy scan.

Tại sao góc chụp quan trọng hơn bạn nghĩ

Các engine OCR đọc văn bản bằng cách quét từng hàng pixel để tìm các dải mực ngang nhất quán — đó là cách chúng phân tách dòng văn bản này với dòng kế tiếp. Khi một trang bị nghiêng dù chỉ một chút, thứ đáng lẽ là một dòng văn bản ngang gọn gàng lại trở thành một vệt chéo trải dài qua nhiều hàng pixel, và logic phân đoạn dòng của engine bắt đầu gộp các ký tự từ những dòng liền kề hoặc tách một ký tự đơn thành nhiều phần.

Đây là lý do vì sao một bức ảnh trông hoàn toàn dễ đọc với mắt thường của bạn vẫn có thể cho ra kết quả OCR lộn xộn: não bạn tự động bù trừ cho độ nghiêng nhỏ, nhưng một quy trình OCR đơn giản thì không. Giải pháp không phải là một mô hình nhận diện thông minh hơn — mà là làm thẳng hình ảnh trước, chính xác là điều bước tự động chỉnh sửa của công cụ này thực hiện trước khi nhận diện chạy.

Các trường hợp sử dụng phổ biến

  • Số hóa ghi chú hoặc trích đoạn từ sách giáo khoa thực mà không cần gõ lại thủ công.
  • Trích xuất một đoạn văn từ một cuốn sách bìa mềm cũ hoặc sách thư viện để trích dẫn hoặc tìm kiếm sau này.
  • Chuyển tài liệu phát tay, phiếu bài tập, hoặc bài báo in được chụp ảnh thành văn bản có thể tìm kiếm và chỉnh sửa.
  • Lưu trữ các trang từ một cuốn sách đang rã hoặc quá mỏng manh để scan phẳng trên mặt kính máy scan.

Bộ Chuyển Đổi Hình Ảnh Sang Nghệ Thuật ASCII · Bộ Đếm Từ

Để có kết quả tốt nhất

  • Ánh sáng tốt và đều quan trọng hơn việc giữ tay hoàn toàn ổn định — một bức ảnh hơi lệch nhưng đủ sáng cho kết quả tốt hơn một bức ảnh thẳng nhưng có bóng đổ nặng che văn bản.
  • Tránh chụp flash trực tiếp lên trang giấy bóng; vệt sáng/lóa gây ra có thể làm mất chữ bên dưới nó bất kể việc chỉnh góc.
  • Đưa toàn bộ trang vào khung hình với một chút lề — cắt quá sát có thể làm mất dòng đầu tiên hoặc cuối cùng.
  • Với các đoạn văn rất dài, hãy chụp và xử lý từng trang một thay vì cố chụp cả hai trang mở cùng lúc, điều này gây ra biến dạng cong riêng gần gáy sách.

Tại Sao Nên Dùng?

Tự động chỉnh lệch: phát hiện và làm thẳng góc chụp bị lệch trước khi nhận diện, yếu tố ảnh hưởng độ chính xác lớn nhất với ảnh chụp sách bằng tay.

Xử lý hoàn toàn ngoại tuyến: ảnh và văn bản trích xuất không bao giờ rời khỏi trình duyệt của bạn — không có gì được tải lên máy chủ.

Hoạt động tốt với trang sách cũ, ố vàng, hoặc hơi mờ cũng như bản in hiện đại sắc nét.

Hỗ trợ nhiều ngôn ngữ nhận diện (Anh, Trung, Tây Ban Nha, Pháp, Đức, Nhật) để bạn có thể quét sách bằng nhiều ngôn ngữ khác nhau.

Không cần tài khoản, không giới hạn tải lên, không cần đăng ký gói — miễn phí cho bất kỳ số trang nào bạn cần.

Câu Hỏi Thường Gặp

Tại sao ảnh sách của tôi cần xử lý đặc biệt thay vì OCR thông thường?

Các công cụ OCR thông thường thường được kiểm nghiệm và tinh chỉnh trên bản scan phẳng, hoàn toàn thẳng hàng. Một trang sách được chụp bằng tay gần như không bao giờ ngang bằng — thậm chí độ nghiêng nhỏ 8-12 độ, vốn là bình thường với ảnh chụp cầm tay, có thể khiến độ chính xác nhận diện tụt xuống dưới 70%. Công cụ này đo độ nghiêng đó và tự động chỉnh sửa trước khi chạy nhận diện, đó là sự khác biệt giữa văn bản có thể dùng được và kết quả lộn xộn.

Công cụ này có hoạt động với trang sách cũ hoặc ố vàng không?

Có — việc trang giấy đổi màu và giảm độ tương phản nhẹ do giấy cũ có rất ít ảnh hưởng đến độ chính xác nhận diện. Góc chụp mới là yếu tố chi phối chính, không phải màu giấy, nên sách bìa mềm cũ và sách giáo khoa đã qua sử dụng hoạt động tốt gần như sách mới sau khi hình ảnh được làm thẳng.

Ảnh của tôi có được tải lên đâu không?

Không. Cả việc phát hiện độ lệch lẫn nhận diện văn bản đều chạy hoàn toàn trong trình duyệt của bạn bằng WebAssembly — không có bất kỳ thông tin gì về ảnh hoặc nội dung của nó được gửi đến máy chủ nào. Bạn thậm chí có thể ngắt kết nối internet sau khi trang tải lần đầu và công cụ vẫn hoạt động (ngoại trừ lần tải một lần duy nhất của engine nhận diện).

Tôi có thể tắt tự động chỉnh sửa nếu ảnh đã thẳng sẵn không?

Có, bỏ chọn "Tự động chỉnh lệch" nếu bạn đang làm việc với bản scan phẳng hoặc ảnh đã được làm thẳng sẵn — điều này bỏ qua bước phát hiện và chạy nhận diện nhanh hơn một chút.

Tại sao lần trích xuất đầu tiên lại chậm?

Lần đầu tiên bạn nhấn "Extract text", công cụ sẽ tải engine nhận diện OCR (vài megabyte, chỉ một lần, sau đó được trình duyệt của bạn lưu cache). Mọi lần trích xuất sau đó sẽ nhanh hơn nhiều vì engine đã được tải sẵn.

Công cụ này nhận diện được những ngôn ngữ nào?

Tiếng Anh, tiếng Trung giản thể, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức và tiếng Nhật có sẵn trong bộ chọn ngôn ngữ. Hãy chọn đúng ngôn ngữ mà trang sách thực sự được in để có độ chính xác tốt nhất — chất lượng nhận diện giảm mạnh nếu chọn sai ngôn ngữ.

Công Cụ Liên Quan