1Lataa skannattu PDF documents; puhtaan 300 DPI-harmaaskaalaskannauksen avulla tunnistaja voi työskennellä eniten.
2Kerro, mitä kieltä voit odottaa: kielen nimeäminen voittaa sen arvaamisen suurella erolla.
3Suorita tunnustuskortti; sanat kirjoitetaan takaisin alkuperäisen sivun kuvan päälle istuvana näkymättömänä kerroksena.
4Lataa hakukelpoinen PDF tiedosto – se näyttää samalta, mutta voit nyt etsiä ja valita sen tekstin.
OCR PDF Usein kysytyt kysymykset
Mihin minun pitäisi skannata parhaat tulokset?
+
Harmaasävyinen 300 DPI on makea paikka. Alle 200 DPI-hahmon hahmoa alkaa hajota, yli 400 DPI:n kohdalla ei saada juuri mitään ja siitä maksetaan tiedostojen koko ja käsittelyaika.
Miten OCR PDF muuttaa skannauksen tekstiksi?
+
Käytännössä Jokainen sivu käännetään, käydään läpi Tesseractin tekstitunnistuskortti yli sadalla kielellä, ja tunnetut sanat kirjoitetaan takaisin alkuperäisen kuvan päälle sijoitettuna näkymättömänä tekstikerroksena – joten sivu näyttää muuttumattomalta, mutta on hakukelpoinen ja valittavissa. Sivu näyttää edelleen aivan samalta kuin se teki – tunnustettu teksti istuu kuvan takana näkymättömänä, joten etsi ja valitse työ ilman, että ulkonäkö muuttuu.
Mitään erityistä PDF tässä?
+
Kyllä – PDF on objektigraafi, ei sivukuva, joten teksti pysyy valittavissa ja vektorit pysyvät terävinä riippumatta siitä, mitä sen sisällä olevalle rasterisisällölle tapahtuu. Se vaikuttaa siihen, mitä tunnistaja näkee.
Kuinka tarkka se on?
+
Puhtaassa 300 DPI-kuvauksessa painetun tekstin kohdalla on tarpeeksi korkea virheiden määrä, joka on harvinainen ja useimmiten epätavallinen asiallinen substantiivi. Tarkkuus putoaa terävästi matalan resoluution, vinon, puhelimen kameran varjojen, epätavallisten tyyppien ja käsialan avulla – erityisesti käsiala ei ole sitä, mitä varten se on.
Mitä voin ladata OCR PDF-palveluun?
+
Kaikki vakiot PDF-muodossa, mukaan lukien skannerin, sanaprosessorin tai tulostusajurin tuottamat. Tiedostot, joissa on omistajan salasana, joka vain rajoittaa muokkausta, käsitellään; tiedostot, jotka tarvitsevat käyttäjän salasanan avataksemme, eivät ole, emmekä yritä murtaa salausta.
Onko tiedostokokoraja OCR PDF?
+
Kyllä: Ilmaistilit käsittelevät asiakirjoja aina 5 MB asti, mikä kattaa useimmat raportit ja sopimukset, mutta ei pitkää skannattua asiakirjaa 600 DPI:ssä; Ghostscript ja qpdf tekevät työn. Skannatut PDF-muodossa olevat ovat tavallista suurempi asia, ja asiakirjan pakkaaminen ensin riittää yleensä palauttamaan sen alle.
Alentaako OCR PDF minun PDF documents laatuani?
+
Teksti- ja vektoritaide ovat kohteita pikseleiden sijaan, joten ne pysyvät täysin terävinä missä tahansa zoomissa, tapahtui mitä tahansa. Vain sulautetut rasterikuvat voivat hajota, ja vain jos valitsemasi toiminto ottaa niistä uudelleen näytteen.
Voinko ajaa OCR PDF usealla PDF documents kerralla?
+
Kyllä – lataa setti ja ne prosessoidaan rinnakkain yhden asetuskokonaisuuden alla, mikä on tarkoitus tehdä dokumenttien työnkulku täällä sen sijaan, että klikkaisi työpöytälukijan kautta.
Miksi EPUB-sivuston isäntä OCR PDF?
+
EPUB.to on rakennettu avoimen eBook-formaatin ympärille – XHTML vetoketjussa, joka on rakenteeltaan palautuva ja luettavissa laitteistolla, jota kukaan ei ole ajatellut. Kirja on täynnä markkuja, kuvia ja fontteja, joten lähes jokainen työ, jonka ihmiset tuovat eBook-sivustolle, on todella työtä yhdellä näistä asioista. OCR PDF on samalla latauksella ja samalla tilillä kuin muunnos, koska se on tarpeen.
Mitä teen tuloksella, kun OCR PDF on valmis?
+
Sivuston muunnin siirtää kirjoja EPUB:n, MOBI:n, AZW3:n, PDF:n ja DOCX:n välillä, joten otsikko päätyy sille, mitä laitteistoa se todellisuudessa lukee. Kun OCR PDF on tehty, muuntaminen on tehty siitä versiosta, johon olet asettunut, ei siitä versiosta, jota vielä korjasit.
Onko OCR PDF tässä sama työkalu, jota sisarussivustot käyttävät?
+
Moottorit on jaettu – sama työkaluketju, samat työntekijät, samat rajat. Se, mitä EPUB sivusto lisää, on näkymä virrankulutukseen: mikä näistä toiminnoista on palautuva kirja, tukee aidosti ja mitkä niistä ovat järkeviä vain kiinteässä mediassa sen sisällä. Se alkaa myös yhdestä faktasta siitä, minkä formaatin mukaan sivusto on nimetty: kirja on XHTML:n zip-numero, jossa on manifesti, joten teksti ei maksa juuri mitään ja jokainen tärkeä päätös liittyy kuviin ja fonttien subsetteihin.
Tarvitsenko tilin, ja jääkö mitään kiinni?
+
Ei tiliä, eikä mitään säilytetä: lataukset poistetaan työn päätyttyä, mitään ei lueta eikä mitään indeksoida. Historiasta ja erän koosta on vapaat tilit, ei pääsylle.