Pelan percuma: 1 penukaran/jam, 1 fail pada satu masa
Pergi Tanpa Had →

OCR PDF

Baca Perkataan Dalam PDF documents

Pilih fail anda

*Fail dipadam selepas 24 jam

Tukar sehingga 1 GB fail secara percuma, pengguna Pro boleh menukar sehingga 100 GB fail; Daftar sekarang

Memuat naik

0%

Bagaimana untuk OCR PDF

1 Muatkan naik PDF documents yang diimbas; imbasan skala kelabu 300 DPI bersih memberikan pengiktirafan yang paling banyak untuk bekerja.
2 Beritahu bahasa mana yang hendak diharapkan — nama bahasa melebihi biarkan ia meneka dengan margin yang luas.
3 Jalankan laluan pengenalan; perkataan ditulis semula sebagai lapisan tak kelihatan duduk di atas imej halaman asal.
4 Muat turun fail bolehcari PDF — ia kelihatan sama, tetapi anda boleh cari dan pilih teks didalamnya.

OCR PDF Soalan Lazim

Apa yang patut saya imbas untuk hasil yang terbaik?
+
300 DPI dalam skala kelabu adalah titik manis. Di bawah 200 DPI bentuk aksara mula rosak; di atas 400 DPI anda tidak mendapat apa-apa dan membayar untuknya dalam saiz fail dan masa pemprosesan.
Secara khusus, setiap halaman dihasilkan, berjalan melalui laluan pengenalan teks Tesseract dalam lebih 100 bahasa, dan perkataan yang dikenali ditulis semula sebagai lapisan teks tak kelihatan diletakkan di atas imej asal — jadi halaman kelihatan tidak berubah tetapi boleh dicari dan dipilih. Halaman masih kelihatan seperti yang ia lakukan - teks yang dikenali duduk tidak kelihatan di belakang imej jadi carian dan pemilihan bekerja tanpa mengubah penampilan.
Ya — PDF adalah graf objek, bukan imej halaman, jadi teks tetap boleh dipilih dan vektor tetap tajam tidak kira apa yang berlaku kepada kandungan raster di dalamnya. Ia mempengaruhi apa yang pengiktirafan boleh lihat.
Pada imbasan 300 DPI bersih teks cetak, cukup tinggi untuk ralat jarang berlaku dan kebanyakannya dalam nama benda yang tidak biasa. Ketepatan jatuh dengan jelas dengan resolusi rendah, lengkung, bayang dari kamera telefon, font yang tidak biasa dan tulisan tangan — tulisan tangan khususnya bukanlah apa yang ini untuk.
Sebarang PDF piawai, termasuk yang dihasilkan oleh pengimbas, pemproses kata atau pemacu cetakan. Fail dengan kata laluan pemilik yang hanya membatasi penyuntingan diurus; fail yang memerlukan kata laluan pengguna untuk dibuka tidak, dan kami tidak cuba memecah penyulitan.
Ya: akaun bebas proses dokumen sehingga 5 MB setiap satu, yang meliputi kebanyakan laporan dan kontrak tetapi bukan dokumen mengimbas panjang pada 600 DPI; Ghostscript dan qpdf melakukan kerja. PDF yang diimbas adalah perkara biasa yang melebihinya, dan memampatkan dokumen pertama biasanya cukup untuk membawanya kembali ke bawah.
Teks dan karya seni vektor adalah objek bukan piksel, jadi mereka tetap tajam pada sebarang zum tanpa mengira apa yang berlaku. Hanya imej raster terbenam boleh diturunkan, dan hanya jika operasi yang anda pilih menguji semula mereka.
Ya — muat naik set dan mereka diproses secara serentak di bawah satu set tetapan, yang merupakan titik untuk melakukan aliran kerja dokumen di sini daripada mengklik melalui pembaca desktop.
EPUB.to dibina di sekeliling format eBook terbuka — XHTML dalam zip, boleh dialihkan oleh reka bentuk, dan boleh dibaca pada perkakasan yang tiada siapa yang berfikir tentang susunaturnya. Buku adalah zip penuh dengan penanda, imej dan font, jadi hampir setiap kerja yang orang bawa ke laman eBook adalah sebenarnya kerja pada salah satu daripada perkara-perkara itu. OCR PDF berjalan pada muat naik yang sama dan akaun yang sama seperti penukaran kerana di situ ia diperlukan.
Penukar di laman ini memindahkan buku antara EPUB, MOBI, AZW3, PDF dan DOCX, jadi tajuk berakhir pada apa perkakasan yang sebenarnya akan membacanya. Melakukannya selepas OCR PDF bermakna penukaran dibuat dari versi yang anda tetapkan, bukan dari versi yang anda masih betulkan.
Enjinnya dikongsi - rantaian alat yang sama, pekerja yang sama, had yang sama. Apa yang tapak EPUB tambah adalah pandangan pada aliran semula: mana daripada operasi ini buku boleh aliran semula benar-benar menyokong, dan mana yang hanya masuk akal pada media susunatur tetap di dalamnya. Ia juga bermula dari satu fakta mengenai format yang nama tapak ini diambil daripada: buku ini adalah zip XHTML dengan manifesto, jadi teks hampir tidak berharga apa-apa dan setiap keputusan yang penting adalah mengenai imej terbenam dan subset font.
Tiada akaun, dan tiada apa yang disimpan: muat naik dipadam dari pekerja tidak lama selepas kerja selesai, tiada apa yang dibaca dan tiada apa yang diindeks. Akaun bebas wujud untuk sejarah dan saiz kumpulan, bukan untuk akses.

Nilaikan alat ini

5.0/5 - 0 undi
ns6.com - Beli domain anda dalam beberapa minit. Cari, daftar, lancarkan.
Atau letakkan fail anda di sini