1Muatkan naik PDF documents yang diimbas; imbasan skala kelabu 300 DPI bersih memberikan pengiktirafan yang paling banyak untuk bekerja.
2Beritahu bahasa mana yang hendak diharapkan — nama bahasa melebihi biarkan ia meneka dengan margin yang luas.
3Jalankan laluan pengenalan; perkataan ditulis semula sebagai lapisan tak kelihatan duduk di atas imej halaman asal.
4Muat turun fail bolehcari PDF — ia kelihatan sama, tetapi anda boleh cari dan pilih teks didalamnya.
OCR PDF Soalan Lazim
Apa yang patut saya imbas untuk hasil yang terbaik?
+
300 DPI dalam skala kelabu adalah titik manis. Di bawah 200 DPI bentuk aksara mula rosak; di atas 400 DPI anda tidak mendapat apa-apa dan membayar untuknya dalam saiz fail dan masa pemprosesan.
Bagaimana OCR PDF menukar imbasan ke teks?
+
Secara khusus, setiap halaman dihasilkan, berjalan melalui laluan pengenalan teks Tesseract dalam lebih 100 bahasa, dan perkataan yang dikenali ditulis semula sebagai lapisan teks tak kelihatan diletakkan di atas imej asal — jadi halaman kelihatan tidak berubah tetapi boleh dicari dan dipilih. Halaman masih kelihatan seperti yang ia lakukan - teks yang dikenali duduk tidak kelihatan di belakang imej jadi carian dan pemilihan bekerja tanpa mengubah penampilan.
Sesuatu yang spesifik untuk PDF di sini?
+
Ya — PDF adalah graf objek, bukan imej halaman, jadi teks tetap boleh dipilih dan vektor tetap tajam tidak kira apa yang berlaku kepada kandungan raster di dalamnya. Ia mempengaruhi apa yang pengiktirafan boleh lihat.
Berapa tepatnya?
+
Pada imbasan 300 DPI bersih teks cetak, cukup tinggi untuk ralat jarang berlaku dan kebanyakannya dalam nama benda yang tidak biasa. Ketepatan jatuh dengan jelas dengan resolusi rendah, lengkung, bayang dari kamera telefon, font yang tidak biasa dan tulisan tangan — tulisan tangan khususnya bukanlah apa yang ini untuk.
Apa yang boleh saya muat naik ke OCR PDF?
+
Sebarang PDF piawai, termasuk yang dihasilkan oleh pengimbas, pemproses kata atau pemacu cetakan. Fail dengan kata laluan pemilik yang hanya membatasi penyuntingan diurus; fail yang memerlukan kata laluan pengguna untuk dibuka tidak, dan kami tidak cuba memecah penyulitan.
Adakah terdapat had saiz fail pada OCR PDF?
+
Ya: akaun bebas proses dokumen sehingga 5 MB setiap satu, yang meliputi kebanyakan laporan dan kontrak tetapi bukan dokumen mengimbas panjang pada 600 DPI; Ghostscript dan qpdf melakukan kerja. PDF yang diimbas adalah perkara biasa yang melebihinya, dan memampatkan dokumen pertama biasanya cukup untuk membawanya kembali ke bawah.
Adakah OCR PDF akan menurunkan kualiti PDF documents saya?
+
Teks dan karya seni vektor adalah objek bukan piksel, jadi mereka tetap tajam pada sebarang zum tanpa mengira apa yang berlaku. Hanya imej raster terbenam boleh diturunkan, dan hanya jika operasi yang anda pilih menguji semula mereka.
Bolehkah saya jalankan OCR PDF pada beberapa PDF documents sekaligus?
+
Ya — muat naik set dan mereka diproses secara serentak di bawah satu set tetapan, yang merupakan titik untuk melakukan aliran kerja dokumen di sini daripada mengklik melalui pembaca desktop.
Kenapa laman EPUB menghost OCR PDF?
+
EPUB.to dibina di sekeliling format eBook terbuka — XHTML dalam zip, boleh dialihkan oleh reka bentuk, dan boleh dibaca pada perkakasan yang tiada siapa yang berfikir tentang susunaturnya. Buku adalah zip penuh dengan penanda, imej dan font, jadi hampir setiap kerja yang orang bawa ke laman eBook adalah sebenarnya kerja pada salah satu daripada perkara-perkara itu. OCR PDF berjalan pada muat naik yang sama dan akaun yang sama seperti penukaran kerana di situ ia diperlukan.
Apa yang patut saya lakukan dengan hasil apabila OCR PDF selesai?
+
Penukar di laman ini memindahkan buku antara EPUB, MOBI, AZW3, PDF dan DOCX, jadi tajuk berakhir pada apa perkakasan yang sebenarnya akan membacanya. Melakukannya selepas OCR PDF bermakna penukaran dibuat dari versi yang anda tetapkan, bukan dari versi yang anda masih betulkan.
Adakah OCR PDF di sini alat yang sama yang dijalankan oleh laman saudara?
+
Enjinnya dikongsi - rantaian alat yang sama, pekerja yang sama, had yang sama. Apa yang tapak EPUB tambah adalah pandangan pada aliran semula: mana daripada operasi ini buku boleh aliran semula benar-benar menyokong, dan mana yang hanya masuk akal pada media susunatur tetap di dalamnya. Ia juga bermula dari satu fakta mengenai format yang nama tapak ini diambil daripada: buku ini adalah zip XHTML dengan manifesto, jadi teks hampir tidak berharga apa-apa dan setiap keputusan yang penting adalah mengenai imej terbenam dan subset font.
Adakah saya perlu akaun, dan apa-apa yang dijaga?
+
Tiada akaun, dan tiada apa yang disimpan: muat naik dipadam dari pekerja tidak lama selepas kerja selesai, tiada apa yang dibaca dan tiada apa yang diindeks. Akaun bebas wujud untuk sejarah dan saiz kumpulan, bukan untuk akses.