1Upload de gescande PDF documents; een schone 300 dpi grijswaardenscan geeft de herkenner het meest om mee te werken.
2Vertel het welke taal te verwachten.. Het benoemen van de taal beter dan het laten raden door een brede marge.
3Voer de herkenningspas uit; de woorden worden teruggeschreven als een onzichtbare laag die over de oorspronkelijke pagina-afbeelding zit.
4Download het doorzoekbare PDF bestand. Het ziet er identiek uit, maar je kunt nu zoeken en de tekst erin selecteren.
OCR PDF Veelgestelde vragen
Waar moet ik op scannen voor het beste resultaat?
+
300 dpi in grijswaarden is de zoete plek. Onder 200 dpi karaktervormen beginnen te breken; boven 400 dpi krijg je bijna niets en betaal je ervoor in bestandsgrootte en verwerkingstijd.
Hoe zet OCR PDF een scan om in tekst?
+
Concreet elke pagina wordt weergegeven, wordt uitgevoerd door een Tesseract tekstherkenningspas in meer dan 100 talen, en de herkende woorden worden teruggeschreven als een onzichtbare tekstlaag geplaatst over de oorspronkelijke afbeelding.. zodat de pagina er ongewijzigd uitziet, maar is doorzoekbaar en selecteerbaar. De pagina ziet er nog steeds precies uit zoals het deed.. De herkende tekst zit onzichtbaar achter de afbeelding dus zoeken en selectie werken zonder het uiterlijk te veranderen.
Iets specifieks voor PDF hier?
+
Ja. een PDF is een object grafiek, geen pagina afbeelding, dus tekst blijft selecteerbaar en vectoren blijven scherp, ongeacht wat er gebeurt met de raster inhoud erin. Het beïnvloedt wat de herkenner kan zien.
Hoe nauwkeurig is het?
+
Op een schone 300 DPI scan van gedrukte tekst, hoog genoeg dat fouten zeldzaam zijn en meestal in ongebruikelijke juiste zelfstandig naamwoorden. Nauwkeurigheid valt scherp af met lage resolutie, schuin, schaduwen van een telefooncamera, ongebruikelijke lettertypes en handschrift. handschrift in het bijzonder is niet waar dit voor is.
Wat kan ik uploaden naar OCR PDF?
+
Standaard PDF, inclusief die welke door een scanner, een tekstverwerker of een afdrukstuurprogramma worden geproduceerd. Bestanden met een eigenaarwachtwoord dat alleen het bewerken beperkt worden behandeld; bestanden die een gebruikerswachtwoord nodig hebben om te openen zijn niet, en we proberen niet om encryptie te breken.
Is er een bestandsgroottelimiet op OCR PDF?
+
Ja: gratis accounts verwerken documenten tot 5 MB elk, die betrekking heeft op de meeste rapporten en contracten, maar niet een lang gescand document op 600 DPI; Ghostscript en qpdf doen het werk. Gescande PDF's zijn het gebruikelijke ding dat het overtreft, en het comprimeren van het document is normaal gesproken voldoende om het terug te brengen.
Zal OCR PDF de kwaliteit van mijn PDF documents verlagen?
+
Tekst en vectorkunst zijn objecten in plaats van pixels, dus ze blijven perfect scherp bij elke zoom, ongeacht wat er gebeurt. Alleen de ingebedde rasterafbeeldingen kunnen afbreken, en alleen als de operatie die je koos ze opnieuw neemt.
Kan ik OCR PDF op meerdere PDF documents tegelijk uitvoeren?
+
Ja. Upload de set en ze proces parallel onder een set van instellingen, dat is het punt van het doen van een document workflow hier in plaats van te klikken door een desktop lezer.
Waarom host een EPUB site OCR PDF?
+
EPUB.to is gebouwd rond het open eBook formaat Een boek is een zip vol markup, afbeeldingen en lettertypen, dus bijna elke baan die mensen naar een eBook site brengen is echt een job op een van die dingen. OCR PDF draait op dezelfde upload en hetzelfde account als de conversies omdat dat is waar het nodig is.
Wat moet ik doen met het resultaat als OCR PDF klaar is?
+
De converter op deze site verplaatst boeken tussen EPUB, MOBI, AZW3, PDF en DOCX, dus een titel eindigt op welke hardware het ook gaat lezen. Dat doen betekent dat na OCR PDF de conversie wordt gemaakt van de versie die je hebt geregeld, niet van degene die je nog aan het repareren was.
Is OCR PDF hier hetzelfde gereedschap als de broers en zussen?
+
De motoren worden gedeeld.. dezelfde toolchain, dezelfde werknemers, dezelfde grenzen. Wat een EPUB site voegt is een kijk op reflow: welke van deze operaties een herstromend boek echt ondersteunt, en welke alleen zinvol zijn op de vaste-layout media binnenin. Het begint ook met een feit over het formaat van deze site is vernoemd naar: Het boek is een zip van XHTML met een manifest, dus de tekst kost bijna niets en elke beslissing die telt gaat over de embedded images en font subsets.
Heb ik een rekening nodig en wordt er iets gehouden?
+
Geen rekening, en er wordt niets bijgehouden: uploads worden verwijderd van de werknemers kort na het werk voltooid, niets wordt gelezen en niets is geïndexeerd. Gratis accounts bestaan voor geschiedenis en batch grootte, niet voor toegang.