1Ngarko PDF documents e skanuar; një skanim i pastër 300 DPI në gri-scale i jep njohësit më shumë për të punuar.
2Thuaj atij se cila gjuhë të presë - emërimi i gjuhës mund të lejojë atë të gjejë me një kufi të gjerë.
3Ekzekuto njohjen e fjalëve; fjalët shkruahen si një shtresë e padukshme mbi figurën origjinale të faqes.
4Shkarko file PDF të kërkueshëm - duket identik, por tani mund të kërkosh dhe të zgjedhësh tekstin në të.
OCR PDF Pyetje të shpeshta
Çfarë duhet të bëj për të marrë rezultatet më të mira?
+
300 DPI në gri është pika e mirë. Nën 200 DPI, format e karaktereve fillojnë të prishen; mbi 400 DPI, nuk fiton asgjë dhe paguan për këtë në madhësi të file dhe kohë përpunimi.
Si e kthen OCR PDF një skanim në tekst?
+
Konkretisht, çdo faqe është paraqitur, kryhet nëpërmjet një njohjeje teksti Tesseract në më shumë se 100 gjuhë, dhe fjalët e njohura janë shkruar si një shtresë e padukshme teksti e vendosur mbi imazhin origjinal — kështu që faqe duket e pandryshuar por është e kërkueshme dhe e zgjedhshme. Faqja ende duket tamam siç ishte — teksti i njohur qëndron i padukshëm pas figurës kështu që kërkimi dhe zgjedhja punojnë pa ndryshuar pamjen.
Diçka specifike për PDF këtu?
+
Po — PDF është një grafik objekti, jo një figurë faqeje, kështu që teksti mbetet i zgjedhshëm dhe vektori mbetet i mprehtë pavarësisht se çfarë ndodh me përmbajtjen raster brenda tij. Kjo ndikon në atë që njohësi mund të shohë.
Sa e saktë është?
+
Në një skanim të pastër 300 DPI të tekstit të shtypur, mjaft i lartë që gabimet janë të rralla dhe kryesisht në emra të pazakontë të vegjël. Saktësia bie mprehtë me rezolucion të ulët, të shtrembëruar, hije nga kamera e telefonit, tipare të pazakonta dhe shkrim me dorë — shkrimi me dorë në veçanti nuk është për këtë.
Çfarë mund të ngarkoj tek OCR PDF?
+
Çdo PDF standard, duke përfshirë ato të prodhuara nga një skaner, një program për përpunimin e tekstit apo një driver printeri. Filet me fjalëkalim pronari që vetëm kufizojnë modifikimin trajtohen; file që kërkojnë fjalëkalim përdoruesi për t'u hapur nuk trajtohen dhe nuk përpiqemi të thyem kriptimin.
A ka një kufizim të madhësisë së file në OCR PDF?
+
Po: llogaritë e lira përpunojnë dokumente deri në 5 MB secili, që mbulon shumicën e raporteve dhe kontratave por jo një dokument të gjatë të skanuar në 600 DPI; Ghostscript dhe qpdf bëjnë punën. PDF-të e skanuara janë gjëja e zakonshme që e tejkalojnë atë dhe kompresimi i dokumentit së pari është normalisht i mjaftueshëm për ta kthyer atë nën.
Do të zvogëlojë OCR PDF cilësinë e PDF documents?
+
Teksti dhe vektorët janë objekte dhe jo piksela, kështu që mbeten të mprehtë në çdo zmadhim, pavarësisht se ç'ndodh. Vetëm figurat raster të përfshira mund të degradohen dhe vetëm nëse operacioni që keni zgjedhur i ri-shembullon ato.
A mund të ekzekutojë OCR PDF në disa PDF documents njëkohësisht?
+
Po — ngarko koleksionin dhe ata do të përpunohen paralelisht nën një koleksion rregullimesh, që është qëllimi i kryrjes së një dokumenti të rrjedhës së punës këtu në vend të klikimit nëpërmjet një lexuesit desktop.
Pse një EPUB site pret OCR PDF?
+
EPUB.to është ndërtuar rreth formatit të hapur eBook - XHTML në një zip, reflowable nga dizajni, dhe të lexueshme në hardware askush nuk ka menduar për layout për. Një libër është një zip i mbushur me markup, imazhe dhe gërma, kështu që pothuajse çdo punë që njerëzit sjellin në një eBook site është me të vërtetë një punë në një nga këto gjëra. OCR PDF punon në të njëjtën ngarkim dhe të njëjtin llogari si konvertimet sepse atje është ku është i nevojshëm.
Çfarë duhet të bëj me rezultatin kur OCR PDF të përfundojë?
+
Konvertimi në këtë faqe lëviz librat midis EPUB, MOBI, AZW3, PDF dhe DOCX, kështu që një titull përfundon në çfarëdo hardware që do ta lexojë atë. Duke e bërë këtë pas OCR PDF do të thotë se konvertimi është bërë nga versioni që keni vendosur, jo nga ai që po korrigjoni.
A është OCR PDF këtu i njëjti instrument që sitet vëllazërore e kryejnë?
+
Motorët janë të përbashkët — e njëjta zinxhir instrumentesh, të njëjtat punëtorë, të njëjtat kufij. Çfarë një EPUB site shtohet është një pamje mbi reflow: cili nga këto operacione një libër i reflowable vërtet mbështet, dhe cili ka kuptim vetëm në mediat e fiksuara brenda tij. Gjithashtu fillon nga një fakt rreth formatit që ky site është emëruar pas: libri është një zip i XHTML me një manifest, kështu që teksti kushton pothuajse asgjë dhe çdo vendim që ka rëndësi është rreth figurave të ndërlidhura dhe nëngrupeve të gërmave.
A më duhet një llogari dhe a mbahet ndonjë gjë?
+
Asnjë llogari, dhe asgjë nuk ruhet: ngarkimet eleminohen nga punëtorët menjëherë pasi të përfundojë puna, asgjë nuk lexohet dhe asgjë nuk indeksohet. Llogaritë e lira ekzistojnë për historinë dhe masën e lotit, jo për hyrjen.