1Nahrajte naskenované PDF documents; čistý 300 DPI šedý sken poskytuje rozpoznávaču najviac práce.
2Povedzte mu, ktorý jazyk má očakávať – pomenovanie jazyka je oveľa lepšie ako nechať ho uhádnuť.
3Spustite priechod rozpoznávania; slová sa zapíšu späť ako neviditeľná vrstva, ktorá sa nachádza nad obrázkom pôvodnej stránky.
4Stiahnite si prehľadávateľný súbor PDF – vyzerá identicky, ale teraz môžete vyhľadávať a vyberať text v ňom.
OCR PDF Často kladené otázky
Na čo by som mal skenovať, aby som dosiahol najlepšie výsledky?
+
Pod 200 DPI sa tvary znakov začínajú rozpadávať, nad 400 DPI získate takmer nič a zaplatíte za to veľkosťou súboru a časom spracovania.Vytlačte si 3D modely v rozlíšení 1024x768.
Ako OCR PDF zmení naskenovaný obrázok na text?
+
Konkrétne Každá stránka je vykreslená, prechádza procesom rozpoznávania textu Tesseract vo viac ako 100 jazykoch a rozpoznané slová sú zapísané späť ako neviditeľná vrstva textu umiestnená na pôvodnom obrázku - takže stránka vyzerá nezmenená, ale je vyhľadateľná a vyberateľná.Stránka stále vyzerá presne tak, ako predtým – rozpoznaný text je neviditeľný za obrázkom, takže vyhľadávanie a výber fungujú bez zmeny vzhľadu.
Niečo špecifické pre PDF tu?
+
Áno — PDF je objektový graf, nie obrázok strany, takže text zostáva vybrateľný a vektory zostávajú ostré bez ohľadu na to, čo sa stane s rastrovým obsahom v ňom.. Ovplyvňuje to, čo rozpoznávač môže vidieť.
Ako presné je to?
+
Na čistom skenovi tlačeného textu s rozlíšením 300 DPI, ktoré je dostatočne vysoké na to, aby sa chyby vyskytli len zriedkavo a väčšinou v nezvyčajných vlastných menách, presnosť prudko klesá pri nízkom rozlíšení, skreslení, tieňoch z fotoaparátu telefónu, nezvyčajných písmach a rukopise – rukopis nie je tým, na čo je tento softvér určený.
Čo môžem nahrať do OCR PDF?
+
Každý štandardný PDF, vrátane tých, ktoré sú vytvorené skenerom, textovým procesorom alebo ovládačom tlačiarne. Súbory s heslom vlastníka, ktoré obmedzuje iba úpravy, sú spracované. Súbory, ktoré vyžadujú heslo používateľa na otvorenie, nie sú spracované a nepokúšame sa prelomiť šifrovanie.
Existuje obmedzenie veľkosti súboru na OCR PDF?
+
Áno: Bezplatné účty spracúvajú dokumenty až do 5 MB, čo pokrýva väčšinu správ a zmlúv, ale nie dlhý naskenovaný dokument pri 600 DPI; Ghostscript a qpdf robia prácu.Skenované PDF sú zvyčajne to, čo ho prekračuje, a kompresia dokumentu je zvyčajne dostatočná na to, aby sa vrátila pod.
Zníži OCR PDF kvalitu môjho PDF documents?
+
Text a vektorovú grafiku tvoria objekty, nie pixely. Zostávajú teda dokonale ostré pri každom priblížení bez ohľadu na to, čo sa stane. Degradovať sa môžu len vložené rastrové obrázky a len v prípade, že ich vybratá operácia prevzorkuje.
Môžem spustiť OCR PDF na viacerých PDF documents naraz?
+
Áno — nahrajte súbor a spracujú sa paralelne v rámci jednej množiny nastavení, čo je dôvod, prečo tu vykonávať pracovný postup dokumentu namiesto kliknutia cez počítačovú čítačku.
Prečo stránka EPUB hostí OCR PDF?
+
EPUB.to je postavený okolo otvoreného formátu eBooku — XHTML v zip-e, reflowable podľa dizajnu, a čitateľný na hardvéri, pre ktorý nikto nemyslel na rozloženie. Kniha je zip plný markup, obrázky a fonty, takže takmer každá práca ľudia prinášajú na stránky eBook je naozaj práca na jednej z týchto vecí. OCR PDF beží na rovnakom uploadu a rovnakom účte ako konverzie, pretože tam je to potrebné.
Čo mám robiť s výsledkom po dokončení OCR PDF?
+
Konvertor na tejto stránke presúva knihy medzi EPUB, MOBI, AZW3, PDF a DOCX, takže titul skončí na akomkoľvek hardvéri, ktorý ho bude skutočne čítať. Ak to urobíte po OCR PDF, znamená to, že konverzia sa vykoná z verzie, na ktorej ste sa usadili, nie z tej, ktorú ste stále opravovali.
Je OCR PDF tu rovnaký nástroj, ktorý bežia sesterské stránky?
+
Motory sú zdieľané – rovnaký reťazec nástrojov, rovnakí pracovníci, rovnaké obmedzenia. Čo EPUB stránka pridáva je pohľad na reflow: ktoré z týchto operácií reflowable kniha skutočne podporuje a ktoré z nich majú zmysel len na médiách s pevným rozložením vnútri nej. Vychádza tiež z jedného faktu o formáte, po ktorom je táto stránka pomenovaná: kniha je zip XHTML s manifestom, takže text stojí takmer nič a každé rozhodnutie, na ktorom záleží, je o vložených obrázkoch a podmnožinách písma.
Potrebujem účet a ponechávajú sa nejaké údaje?
+
Žiadne konto, nič sa neuchováva: nahrané súbory sú z robotov vymazané krátko po dokončení úlohy, nič sa nečíta a nič sa neindexuje.Bezplatné kontá existujú pre históriu a veľkosť dávky, nie pre prístup.