1Ladda upp den skannade PDF documents; en ren 300 DPI gråskala scan ger igenkänningen mest att arbeta med.
2Berätta vilket språk man kan förvänta sig — att namnge språket är bättre än att låta det gissa med bred marginal.
3Kör igenkänningspasset; orden skrivs tillbaka som ett osynligt lager som sitter över den ursprungliga sidbilden.
4Ladda ner filen PDF — den ser identisk ut, men du kan nu söka och välja texten i den.
OCR PDF Vanliga frågor
Vad ska jag skanna efter bästa resultat?
+
300 DPI i gråskala är den söta fläcken. Under 200 DPI tecken former börjar bryta ner; över 400 DPI du får nästan ingenting och betala för det i filstorlek och bearbetningstid.
Hur förvandlar OCR PDF en skanning till text?
+
Konkret, varje sida återges, körs genom en Tesseract text erkännande passera på över 100 språk, och de erkända orden skrivs tillbaka som en osynlig text lager placerad över den ursprungliga bilden - så sidan ser oförändrad men är sökbar och valbar. Sidan ser fortfarande exakt ut som den gjorde — den erkända texten sitter osynligt bakom bilden så sök och urval fungerar utan att ändra utseendet.
Något specifikt till PDF här?
+
Yes — en PDF är en objektgraf, inte en sidbild, så text förblir valbar och vektorer förblir skarpa oavsett vad som händer med rasterinnehållet inuti den. It affects what the recogniser can see.
Hur exakt är den?
+
På en ren 300 DPI scan av tryckt text, tillräckligt hög att fel är sällsynta och mestadels i ovanliga riktiga substantiv. Noggrannhet faller kraftigt med låg upplösning, skev, skuggor från en telefonkamera, ovanliga typsnitt och handstil — särskilt handstil är inte vad detta är till för.
Vad kan jag ladda upp till OCR PDF?
+
Alla standard PDF, inklusive sådana som produceras av en scanner, av en ordbehandlare eller av en skrivardrivrutin. Filer med ett lösenord som bara begränsar redigering hanteras; filer som behöver ett användarlösenord för att öppna är inte, och vi försöker inte att bryta kryptering.
Finns det en filstorleksgräns på OCR PDF?
+
Ja: gratis konton processa dokument upp till 5 MB varje, som täcker de flesta rapporter och kontrakt men inte en lång skannad dokument vid 600 DPI; Ghostscript och qpdf gör arbetet. Skannade PDF-filer är det vanliga som överskrider det, och komprimera dokumentet först är normalt nog att föra det tillbaka under.
Kommer OCR PDF sänka kvaliteten på min PDF documents?
+
Text- och vektorkonst är objekt snarare än bildpunkter, så de är helt skarpa vid alla zoombilder oavsett vad som händer. Endast de inbäddade rasterbilderna kan brytas ned, och endast om operationen du valde återprovger dem.
Kan jag köra OCR PDF på flera PDF documents samtidigt?
+
Ja — ladda upp uppsättningen och de behandlar parallellt under en uppsättning inställningar, vilket är poängen med att göra ett dokument arbetsflöde här snarare än att klicka genom en skrivbordsläsare.
Varför en EPUB webbplats värd OCR PDF?
+
EPUB.to är byggd runt det öppna eBook-formatet – XHTML i en zip, återflödesbar genom design, och läsbar på hårdvara ingen har tänkt på layouten för. En bok är en zip full av markeringar, bilder och teckensnitt, så nästan varje jobb människor tar till en eBook webbplats är verkligen ett jobb på en av dessa saker. OCR PDF körs på samma uppladdning och samma konto som omvandlingar eftersom det är där det behövs.
Vad ska jag göra med resultatet när OCR PDF är klar?
+
Omvandlaren på denna webbplats flyttar böcker mellan EPUB, MOBI, AZW3, PDF och DOCX, så en titel hamnar på vilken hårdvara som än kommer att läsa den. Att göra det efter OCR PDF betyder att konverteringen görs från den version du bestämde dig för, inte från den du fortfarande rättade.
Är OCR PDF här samma verktyg som syskonplatserna kör?
+
Motorerna delas – samma verktygskedja, samma arbetare, samma gränser. Vad en EPUB webbplats lägger till är en vy på återflöde: vilken av dessa operationer en återflödesbar bok verkligen stöder, och vilka de bara är vettigt på fast layout media inuti den. Det börjar också från ett faktum om formatet denna webbplats är uppkallad efter: boken är en zip av XHTML med ett manifest, så texten kostar nästan ingenting och varje beslut som betyder något handlar om inbäddade bilder och teckensnitt delmängder.
Behöver jag ett konto och får nåt behållas?
+
Inget konto, och ingenting sparas: uppladdningar raderas från arbetarna kort efter jobbets slut, ingenting läses och ingenting indexeras. Gratis konton finns för historik och batchstorlek, inte för åtkomst.