Cara menggunakannya
- Ambil foto halaman buku — cuba masukkan keseluruhan halaman dalam bingkai, tetapi jangan risau tentang memegang kamera dengan rata sempurna.
- Klik atau seret foto ke dalam kawasan muat naik.
- Biarkan "Auto-correct skew" ditanda (ia dihidupkan secara lalai) dan pilih bahasa halaman tersebut.
- Klik "Extract text" — alat ini meluruskan imej dahulu, kemudian mengenal pasti teks.
- Salin hasilnya atau muat turun sebagai fail .txt.
Contoh
Input
Foto telefon halaman buku paperback terbuka, dipegang pada lebih kurang sudut 10°Hasil
Condongan dikesan: -10.5° → teks diekstrak dengan struktur perenggan penuh dikekalkanTanpa langkah meluruskan condongan, foto pada sudut ini biasanya kehilangan sepertiga perkataannya kepada bacaan salah; membetulkan sudut dahulu memulihkan pengecaman hampir kepada ketepatan pengimbas.
Apakah alat ini?
Alat ini mengekstrak teks daripada foto buku, buku teks, atau halaman bercetak menggunakan OCR (pengecaman aksara optik) yang berjalan sepenuhnya dalam pelayar anda. Berbeza dengan alat OCR berasaskan pengimbas, ia dibina di sekitar masalah khusus foto pegang tangan: halaman difoto pada sudut sedikit senget, yang hampir tidak dapat dielakkan apabila anda memegang telefon di atas buku terbuka dan bukannya menekannya rata pada kaca pengimbas.
Sebelum pengecaman bermula, alat ini menganalisis imej untuk mengesan tepat berapa darjah ia berpusing daripada mendatar, kemudian meluruskannya secara automatik. Satu langkah ini lebih penting berbanding hampir apa-apa lagi untuk OCR berasaskan foto: halaman difoto pada hanya 10-12 darjah tidak rata boleh menjatuhkan ketepatan pengecaman daripada lebih 95% kepada di bawah 70%, menjadikan teks yang jelas boleh dibaca menjadi karut yang tidak difahami — meluruskan condongan dahulu memulihkan ia kepada keputusan hampir kualiti-pengimbas.
Kenapa sudut foto lebih penting daripada yang anda sangka
Enjin OCR membaca teks dengan mengimbas baris piksel mencari jalur ink mendatar yang konsisten — itulah cara mereka memisahkan satu baris teks daripada yang seterusnya. Apabila halaman sedikit senget, apa yang sepatutnya menjadi garis teks mendatar yang bersih menjadi calaran pepenjuru merentasi banyak baris piksel, dan logik segmentasi baris enjin mula menggabungkan aksara daripada baris bersebelahan atau memisahkan aksara tunggal.
Itulah sebabnya foto yang kelihatan boleh dibaca sepenuhnya kepada mata anda masih boleh menghasilkan output OCR yang berkecamuk: otak anda dengan mudah menyesuaikan diri dengan senget kecil, tetapi saluran OCR yang naif tidak. Penyelesaiannya bukan model pengecaman yang lebih pintar — ia meluruskan imej dahulu, itulah tepat apa yang dilakukan langkah pembetulan automatik dalam alat ini sebelum pengecaman berjalan.
Kegunaan biasa
- Mendigitalkan nota atau petikan daripada buku teks fizikal tanpa menaip semula secara manual.
- Mengekstrak petikan daripada paperback lama atau buku perpustakaan untuk dipetik atau dicari kemudian.
- Menukar helaian, lembaran kerja, atau artikel bercetak yang difoto kepada teks yang boleh dicari dan disunting.
- Mengarkibkan halaman daripada buku yang mereput atau terlalu rapuh untuk diimbas rata pada dulang pengimbas.
→ Penukar Imej kepada Seni ASCII · Pengira Perkataan & Aksara
Mendapatkan hasil terbaik
- Pencahayaan yang baik dan sekata lebih penting daripada tangan yang stabil sempurna — foto sedikit senget tetapi bercahaya baik mengatasi foto rata dengan bayang berat merentasi teks.
- Elakkan lampu kilat terus pada halaman berkilat; silauan/titik panas yang terhasil boleh mengosongkan teks di bawahnya tanpa mengira pembetulan sudut.
- Muatkan keseluruhan halaman dalam bingkai dengan sedikit sisa ruang — memotong terlalu ketat boleh memotong baris pertama atau terakhir.
- Untuk petikan yang sangat panjang, foto dan proses satu halaman pada satu masa dan bukannya cuba menangkap dua muka halaman terbuka, yang memperkenalkan herotan lengkung tersendiri berhampiran jahitan buku.
Kenapa guna alat ini?
Pembetulan condongan automatik: mengesan dan meluruskan sudut foto senget sebelum pengecaman, faktor ketepatan paling besar untuk foto buku pegang tangan.
Pemprosesan luar talian sepenuhnya: foto dan teks yang diekstrak tidak pernah meninggalkan pelayar anda — tiada apa dimuat naik ke pelayan.
Berfungsi untuk halaman buku lama, menguning, atau sedikit pudar serta cetakan moden yang jelas.
Menyokong pelbagai bahasa pengecaman (Inggeris, Cina, Sepanyol, Perancis, Jerman, Jepun) supaya anda boleh mengimbas buku dalam bahasa berbeza.
Tiada akaun, tiada had muat naik, tiada langganan — percuma untuk seberapa banyak halaman yang anda perlukan.
Soalan lazim
Kenapa foto buku saya memerlukan pengendalian khas dan bukan OCR biasa?
Alat OCR biasa selalunya diuji dan ditala pada imbasan rata yang sejajar sempurna. Halaman buku difoto secara pegang tangan hampir tidak pernah rata — malah senget kecil 8-12 darjah, yang normal untuk gambar pegang tangan, boleh menjatuhkan ketepatan pengecaman jauh di bawah 70%. Alat ini mengukur condongan tersebut dan membetulkannya secara automatik sebelum menjalankan pengecaman, yang menjadi perbezaan antara teks yang boleh digunakan dan output yang berkecamuk.
Adakah ini berfungsi pada halaman buku lama atau menguning?
Ya — kelunturan warna halaman dan kehilangan kontras ringan daripada kertas lama hanya memberi kesan kecil terhadap ketepatan pengecaman dengan sendirinya. Sudut foto ialah faktor dominan, bukan warna kertas, jadi paperback lama dan buku teks terpakai berfungsi hampir sama baik seperti yang baru selepas imej diluruskan.
Adakah foto saya dimuat naik ke mana-mana?
Tidak. Kedua-dua pengesanan condongan dan pengecaman teks berjalan sepenuhnya dalam pelayar anda menggunakan WebAssembly — tiada apa tentang foto anda atau kandungannya dihantar ke mana-mana pelayan. Anda malah boleh memutuskan sambungan internet selepas halaman dimuatkan buat kali pertama dan ia akan terus berfungsi (kecuali muat turun sekali sahaja enjin pengecaman).
Bolehkah saya matikan pembetulan automatik jika foto saya sudah lurus?
Ya, nyahtanda "Auto-correct skew" jika anda bekerja daripada imbasan rata atau foto yang telah anda luruskan sendiri — ini melangkau langkah pengesanan dan menjalankan pengecaman sedikit lebih pantas.
Kenapa pengekstrakan pertama perlahan?
Kali pertama anda klik "Extract text", alat ini memuat turun enjin pengecaman OCR (beberapa megabait, sekali sahaja, disimpan cache oleh pelayar anda selepas itu). Setiap pengekstrakan selepas itu jauh lebih pantas kerana enjin sudah dimuatkan.
Bahasa apa yang boleh dikenal pasti?
Inggeris, Cina Ringkas, Sepanyol, Perancis, Jerman, dan Jepun tersedia dalam pemilih bahasa. Pilih bahasa yang sebenarnya dicetak pada halaman tersebut untuk ketepatan terbaik — kualiti pengecaman menurun dengan mendadak jika bahasa yang salah dipilih.