1Încărcaţi scanarea PDF documents; o scanare curăţată 300 DPI scară de gris devine cel mai bun recunoaştetor cu care să lucreze.
2Spune-i care limba de aşteptat — numirea limbii bate la un nivel larg.
3Executați pasul de recunoaștere; cuvintele sunt scrise înapoi ca un strat invizibil care stătea peste imaginea de pagina originală.
4Descarcă fișierul de căutare PDF — arată identic, dar acum puteți căuta și selecta textul din ea.
OCR PDF Întrebări
La ce ar trebui să scanez pentru cel mai bun rezultat?
+
300 DPI în scala de gris este spot dulce. Sub 200 DPI forme de caracter începe de rupere în jos; peste 400 DPI câștigi aproape nimic și plătește pentru el în dimensiunea fișierului și timpul de procesare.
Cum se transformă OCR PDF o scanare în text?
+
În mod concret, fiecare pagină este dezvoltată, rulați printr-un text-recogniție Teseract trece în peste 100 de limbi, iar cuvintele recunoscute sunt scrise înapoi ca un strat de text invizibile poziționat peste imaginea originală — astfel că pagina arata nemodificat, dar este în căutare și selectabil. Pagina arată exact cum a făcut - textul recunoscut se află în spatele imaginei, astfel încât să lucreze în căutare și selecție fără a schimba aspectul.
Ceva specific la PDF aici?
+
Da, un PDF este un grafic de obiect, nu o imagine de pagină, astfel încât textul rămâne selectabil și vectorii rămân ascuțiți indiferent ce se întâmplă cu conținutul raster din interiorul ei. Afectează ceea ce poate vedea recunoaştetorul.
Cât de corect este?
+
Pe o scanare curată 300 DPI de text tipărit, suficient de mare că erorile sunt rare și în principal în substanți neobișnuiți. Precizia cade brusc cu rezoluție scăzută, skew, umbre de la o cameră de telefon, tipefoane neobișnuite și scrisul de mână — în special scrisul de mână nu este pentru ce este acest lucru.
Ce pot încărca pe OCR PDF?
+
Orice PDF standard, inclusiv cele produse de un scaner, de un procesor de cuvinte sau de un driver de tipărire. Fișiere cu o parolă proprietară care restricționează ediția sunt gestionate; fișierele care au nevoie de o parolă de utilizator pentru a deschide nu sunt, și noi nu încercăm să rupe criptarea.
Există o limită de dimensiune a fișierului pe OCR PDF?
+
Da: documente de proces de conturi gratuite până la 5 MB fiecare, care acoperă majoritatea rapoartelor și contractelor, dar nu un document scanat lung la 600 DPI; Ghostscript și qpdf fac lucrarea. PDF-urile scanate sunt lucrul obișnuit care o depășește, și comprimarea documentului mai întâi este de obicei suficient pentru a-l aduce înapoi în jos.
OCR PDF va reduce calitatea PDF documents?
+
Text și artă vectorială sunt obiecte mai degrabă decât pixeli, astfel încât acestea rămân perfect ascuțite la orice zoom indiferent de ce se întâmplă. Doar imaginile încorporate pot degrada, și doar dacă operația alegeți le reeșanlonează.
Pot să conduc OCR PDF pe mai multe PDF documents de o dată?
+
Da — încărcă setul și procesează în paralel, sub un set de set de seturi, care este punctul de a face un flux de lucru document aici, în loc de a face clic pe un cititor de desktop.
De ce o gazdă EPUB a site-ului OCR PDF?
+
EPUB.to este construit în jurul formatului eBook deschis — XHTML într-un zip, refluxabil prin proiect, și legibil pe hardware pe care nimeni nu s-a gândit la la planul pentru. O carte este o zip plină de marcaj, imagini și fonturi, așa că aproape fiecare loc de muncă aduc la un site eBook este într-adevăr un loc de muncă pe una dintre aceste lucruri. OCR PDF rula pe același cont de încărcare și același cont ca conversiile pentru că acolo este necesar.
Ce ar trebui să fac cu rezultatul după ce OCR PDF este terminat?
+
Convertitorul de pe acest site mută cărți între EPUB, MOBI, AZW3, PDF și DOCX, astfel încât un titlu se termină pe orice hardware este de fapt de gând să-l citească. Făcând asta după OCR PDF înseamnă că conversia este făcută din versiunea pe care te-ai stabilit, nu din cea pe care încă erai reparată.
OCR PDF este aici aceeași instrumentă site-urile fratelui rulează?
+
Motoarele sunt împărtășite – aceeași căruță de instrumente, aceleași lucrători, aceleași limite. Cea pe site-ul EPUB adaugă o viziune asupra refluxului: care dintre aceste operațiuni o carte refluabilă suportă cu adevărat, și care au sens numai asupra mass-media fixe-layout în interiorul acestuia. De asemenea, începe dintr-un fapt despre formatul acestui site este numit după: cartea este un zip de XHTML cu un manifest, astfel încât textul costă aproape nimic și fiecare decizie care contează este despre imaginile încorporate și subconjujele fontului.
Am nevoie de un cont, şi ceva se păstrează?
+
Nu există cont, și nimic nu este păstrat: încărcările sunt eliminate de la lucrătorii la scurt timp după finalizarea slujbei, nimic nu este citit și nimic nu este indexat. Conturile gratuite există pentru istorie și mărimea loturilor, nu pentru acces.