1Nahrajte naskenovaný PDF documents; čistý 300 DPI šedý sken dává rozpoznávači nejvíce pracovat.
2Řekni mu, který jazyk očekávat? jméno jazyk beats nechat ho hádat o široké rozpětí.
3Spusťte rozpoznávací pas; slova jsou napsána zpět jako neviditelná vrstva, která sedí nad originálním obrazem stránky.
4Stáhněte si vyhledávací soubor PDF? vypadá stejně, ale nyní můžete hledat a vyberte text v něm.
OCR PDF Často kladené otázky
Na co bych měl skenovat nejlepší výsledek?
+
300 DPI v šedé škále je sladké místo. Pod 200 DPI znak tvary začínají rozpadat; nad 400 DPI získáte téměř nic a platit za něj ve velikosti souboru a zpracování času.
Jak se OCR PDF změní skenování na text?
+
Konkrétně každá stránka je překreslena, prochází textem rozpoznávacím průchodem Teseract ve více než 100 jazycích a uznávaná slova jsou napsána zpět jako neviditelná textová vrstva umístěná nad původním obrazem?? takže stránka vypadá nezměněně, ale je vyhledávatelná a volitelná. Stránka stále vypadá přesně tak, jak to udělal? uznávaný text sedí neviditelně za obrazem, takže hledání a výběr práce bez změny vzhledu.
Něco konkrétního pro PDF tady?
+
Ano, PDF je graf objektu, ne obrázek stránky, takže text zůstane volitelný a vektory zůstanou ostré bez ohledu na to, co se stane s rastrovým obsahem uvnitř. To ovlivňuje to, co rozpoznávač může vidět.
Jak je to přesné?
+
Na čistém 300 DPI skenování tištěného textu, dostatečně vysoké, že chyby jsou vzácné a většinou v neobvyklých řádných jmen. Přesnost padá prudce s nízkým rozlišením, zkosení, stíny z telefonní kamery, neobvyklé písma a rukopisu?
Co mohu nahrát do OCR PDF?
+
Jakýkoli standardní PDF, včetně těch, které jsou vyrobeny skenerem, textovým procesorem nebo tiskovým ovladačem. Soubory s heslem majitele, které omezují pouze editaci, jsou řešeny; soubory, které potřebují uživatelské heslo k otevření, nejsou, a my se nepokoušíme rozbít šifrování.
Existuje limit velikosti souboru na OCR PDF?
+
Ano: volné účty zpracovávají dokumenty až do 5 MB každý, který pokrývá většinu zpráv a smluv, ale ne dlouho skenované dokument na 600 DPI; Ghostscript a qpdf dělat práci. Skenované PDF jsou obvyklá věc, která ji přesahuje, a stlačování dokumentu první je obvykle dost na to, aby ho zpět pod.
Sníží OCR PDF kvalitu mé PDF documents?
+
Text a vektorové umění jsou spíše objekty než pixely, takže zůstávají perfektně ostré v každém zoomu bez ohledu na to, co se stane. Pouze vložené rastrové obrázky mohou degradovat, a pouze pokud operace, kterou jste si vybrali, je znovu ochutná.
Můžu běžet OCR PDF na několika PDF documents najednou?
+
Ano?Nahrát soubor a oni se zpracovávají paralelně pod jedním souborem nastavení, což je bod, kdy se dokument pracovní postup zde, spíše než kliknutí přes stolní čtečku.
Proč EPUB místo hostitele OCR PDF?
+
EPUB.to je postaven kolem otevřeného formátu eBook? XHTML v zip, reflowable design, a čitelný na hardware nikdo nepřemýšlel o rozvržení pro. Kniha je zip plný markoup, obrázků a písem, takže téměř každý úkol, který lidé přinášejí na eBook stránky je opravdu práce na jedné z těchto věcí. OCR PDF běží na stejném nahrávání a stejný účet jako konverze, protože je to tam, kde je potřeba.
Co mám dělat s výsledkem, až bude OCR PDF hotovo?
+
Převodník na této stránce pohybuje knihy mezi EPUB, MOBI, AZW3, PDF a DOCX, takže titul končí na jakémkoli hardwaru se ve skutečnosti bude číst. To znamená, že po OCR PDF se převod provádí z verze, kterou jste si usadili, ne z té, kterou jste ještě opravovali.
Je tady OCR PDF stejný nástroj, který vedou sourozenecké stránky?
+
Motory jsou sdíleny stejným nástrojovým řetězem, stejnými pracovníky, stejnými limity. Co EPUB web přidává je pohled na reflow: který z těchto operací reflowable kniha skutečně podporuje, a které mají smysl pouze na pevném-layout média uvnitř něj. To také začíná z jedné skutečnosti o formátu této stránky je pojmenován po: Kniha je zip XHTML s manifestem, takže text stojí téměř nic a každé rozhodnutí, které záleží na vložené obrazy a podmnožiny písma.
Potřebuju účet a je něco udržované?
+
Žádný účet, a nic není uchováno: nahrávky jsou vymazány z pracovníků krátce po dokončení práce, nic není přečteno a nic není indexováno. Volný účet existuje pro historii a velikost šarže, není pro přístup.