1Alŝuti la skanitan PDF documents; pura 300 DPI grizkolora skanado donas al la rekonilo plej multe por labori.
2Laŭ la lingvo, kiun oni parolas, oni povas difini la lingvon kiel la lingvon, kiu estas la plej proksima al la lingvo de la parolanto.
3Lanĉi la rekonon; la vortoj estas reskribitaj kiel nevidebla tavolo super la originala paĝbildo.
4Elŝuti la serĉeblan dosieron PDF - ĝi aspektas identan, sed vi nun povas serĉi kaj elekti la tekston en ĝi.
OCR PDF Oftaj Demandoj
Kion mi skanu por la plej bona rezulto?
+
300 DPI en grizkoloro estas la plej bona. Sub 200 DPI signaj formoj komencas rompiĝi; super 400 DPI vi gajnas preskaŭ nenion kaj pagas por tio en dosiergrandeco kaj prilaboradotempo.
Kiel OCR PDF konvertas skanaĵon al teksto?
+
Konkrete, ĉiu paĝo estas renderigita, trapasas Tesseract-tekstrekonadon en pli ol 100 lingvoj, kaj la rekonitaj vortoj estas reskribitaj kiel nevidebla teksta tavolo poziciigita super la originala bildo - do la paĝo aspektas neŝanĝita sed estas serĉebla kaj elektebla. La paĝo ankoraŭ aspektas precize kiel ĝi estis - la rekonita teksto estas nevidebla malantaŭ la bildo, do serĉado kaj elekto funkcias sen ŝanĝi la aspekton.
Ĉu estas io specifa por PDF ĉi tie?
+
Jes — PDF estas objekta grafikaĵo, ne paĝa bildo, do teksto restas elektebla kaj vektoro restas akra sendepende de kio okazas al la rastra enhavo ene de ĝi. Ĝi influas tion, kion la rekonilo povas vidi.
Kiom preciza estas ĝi?
+
Sur pura 300 DPI skanado de presita teksto, sufiĉe alta ke eraroj estas maloftaj kaj ĉefe en nekutimaj propraj nomoj. Precizeco falas akre kun malalta rezolucio, deklivo, ombroj de telefono fotilo, nekutimaj tiparoj kaj manskribo - manskribo aparte ne estas kion tio estas por.
Kion mi povas alŝuti al OCR PDF?
+
Ĉiuj normaj PDF- dosieroj, inkluzive tiujn produktitajn de skanilo, tekstprilaborilo aŭ presilo. Dosieroj kun posedanto- pasvorto, kiu nur limigas redaktadon, estas traktitaj; dosieroj, kiuj bezonas uzanton- pasvorton por malfermi, ne estas traktitaj, kaj ni ne provas rompi la ĉifradon.
Ĉu ekzistas dosiergrandeca limigo por OCR PDF?
+
Jes: free accounts process documents up to 5 MB each, which covers most reports and contracts but not a long scanned document at 600 DPI; Ghostscript and qpdf do the work. Skanitaj PDF-oj estas la kutima afero kiu superas ĝin, kaj kunpremado de la dokumento unue estas normale sufiĉa por redoni ĝin sub.
Ĉu OCR PDF malpliigos la kvaliton de mia PDF documents?
+
Teksto kaj vektora grafikaĵo estas objektoj anstataŭ rastrumeroj, do ili restas perfekte akraj je ĉiu zoomo sendepende de kio okazas. Nur la enkorpigitaj rastrumeraj bildoj povas malkreski, kaj nur se la operacio kiun vi elektis reekzamenas ilin.
Ĉu mi povas ruli OCR PDF sur pluraj PDF documents samtempe?
+
Jes — alŝutu la aron kaj ili estos prilaboritaj paralele sub unu aro de agordoj, kio estas la celo de dokumenta laborfluo ĉi tie anstataŭ alklaki tra labortabla legilo.
Kial la retejo EPUB gastigas OCR PDF?
+
EPUB.to estas konstruita ĉirkaŭ la malfermita eBook formato - XHTML en zip, refluebla per dezajno, kaj legebla sur aparataro neniu pensis pri la aranĝo por. Libro estas zip-dosiero plena de marko, bildoj kaj tiparoj, do preskaŭ ĉiu laboro kiun homoj alportas al retpaĝo de e-libro estas vere laboro pri unu el tiuj aĵoj. OCR PDF ruliĝas sur la sama alŝuto kaj la sama konto kiel la konvertoj ĉar tie ĝi estas bezonata.
Kion mi faru kun la rezulto post kiam OCR PDF finiĝis?
+
La konvertilo en tiu retejo movas librojn inter EPUB, MOBI, AZW3, PDF kaj DOCX, tiel ke titolo finiĝas sur iu ajn aparato kiu vere legas ĝin. Se vi faras tion post OCR PDF, la konverto estas farita el la versio, kiun vi elektis, ne el tiu, kiun vi ankoraŭ fiksis.
Ĉu OCR PDF ĉi tie estas la sama ilo, kiun la fratinaj retejoj uzas?
+
La motoroj estas komunaj - la sama iloĉeno, la samaj laboristoj, la samaj limoj. Kion EPUB retejo aldonas estas rigardo pri refluo: kiu el tiuj operacioj refluebla libro vere subtenas, kaj kiuj nur havas sencon sur la fiks- aranĝita medio ene de ĝi. Ĝi ankaŭ komencas de unu fakto pri la formato tiu retejo estas nomita post: la libro estas kunpremita XHTML kun manifesto, do la teksto kostas preskaŭ nenion kaj ĉiu decido, kiu gravas, estas pri la enkorpigitaj bildoj kaj tiparaj subaroj.
Ĉu mi bezonas konton, kaj ĉu ion oni konservas?
+
Neniu konto, kaj nenio estas konservita: alŝutoj estas forigitaj de la laborantoj tuj post la taskofino, nenio estas legita kaj nenio estas indeksita. Liberaj kontoj ekzistas por historio kaj bataj grandecoj, ne por aliro.