Plan libre: 1 conversións/ hora, 1 ficheiro á vez
Ir sen límite →

OCR PDF

Ler as palabras dentro de PDF documents

Selecciona os teus ficheiros

*Ficheiros eliminados despois de 24 horas

Converte ficheiros de ata 1 GB de balde. Os usuarios de Pro poden converter ficheiros de ata 100 GB. Rexístrate agora.

Cargando

0%

Como facer OCR PDF

1 Enviar o escaneado PDF documents; unha escaneación limpa en escala de grises de 300 PPP dálle ao recoñecidor máis para traballar.
2 Dígalle que lingua esperar - nomear a linguaxe é mellor que deixar que a adivine por unha marxe ampla.
3 Executar a pasada de recoñecemento; as palabras son escritas de novo como unha capa invisíbel sobre a imaxe da páxina orixinal.
4 Obteña o ficheiro PDF pescudábel, parece idéntico, pero agora pode procurar e escoller o texto nel.

OCR PDF Preguntas frecuentes

En que punto debo escanear para obter o mellor resultado?
+
300 PPP en escala de grises é o punto ideal. Por baixo de 200 PPP as formas dos caracteres comezan a descompoñerse; por riba de 400 PPP non se gaña case nada e pagáselle en tamaño de ficheiro e tempo de procesamento.
Concretamente, cada páxina é representada, executada a través dun recoñecemento de texto Tesseract en máis de 100 linguas, e as palabras recoñecidas son escritas de novo como unha capa de texto invisible colocada sobre a imaxe orixinal, de xeito que a páxina non se ve alterada pero é buscable e seleccionábel. A páxina segue a ter o mesmo aspecto que antes: o texto recoñecido está invisíbel detrás da imaxe, polo que as procuras e a selección funcionan sen mudar a aparencia.
Si — un PDF é un gráfico de obxectos, non unha imaxe de páxina, polo que o texto permanece seleccionábel e os vectores permanecen nítidos independentemente do que suceda co contido rasterizado dentro del. Afecta o que o recoñecidor pode ver.
Nunha dixitalización limpa de 300 PPP de texto impreso, abondo alta para que os erros sexan raros e sobre todo en nomes propios inusuais. A precisión cae bruscamente con baixa resolución, distorsión, sombras da cámara do teléfono, tipos de letra inusuais e escrita a man - a escrita a man en particular non é para o que isto é.
Calquera PDF estándar, incluíndo os producidos por un escáner, por un procesador de textos ou por un controlador de impresión. Os ficheiros cun contrasinal de propietario que só restrinxe a edición son xestionados; os ficheiros que precisan dun contrasinal de usuario para abrir non o son, e non tentamos romper o cifrado.
Si: as contas libres procesan documentos de ata 5 MB cada un, o que cobre a maioría dos informes e contratos, pero non un documento longo escaneado a 600 PPP; Ghostscript e qpdf fan o traballo. Os PDF escaneados son o que normalmente excede este límite, e comprimir o documento primeiro é normalmente suficiente para o volver a baixar.
O texto e as ilustracións vectoriais son obxectos en vez de píxeles, polo que permanecen perfectamente nítidos en calquera zoom, non importa o que suceda. Só as imaxes raster incorporadas poden degradarse, e só se a operación que escolla as remuestra.
Si, envíe o conxunto e procesáranse en paralelo baixo un conxunto de opcións, o que é o punto de facer un fluxo de traballo de documentos aquí en vez de premer nun lector de escritorio.
EPUB.to está construído arredor do formato aberto de eBook - XHTML nun zip, reflowable por deseño, e lexíbel en hardware para o que ninguén pensou na disposición. Un libro é un ficheiro zip cheo de marcas, imaxes e fontes tipográficas, polo que case todos os traballos que a xente trae a un sitio de libros electrónicos son realmente traballos sobre unha desas cousas. OCR PDF executase no mesmo envío e na mesma conta que as conversións porque aí é onde se precisa.
O conversor deste sitio move libros entre EPUB, MOBI, AZW3, PDF e DOCX, de xeito que un título acaba no hardware que realmente vai lelos. Se o fai despois de OCR PDF significa que a conversión se fai desde a versión na que se asentou, non desde a que aínda estaba a corrixir.
Os motores son compartidos: a mesma cadea de ferramentas, os mesmos traballadores, os mesmos límites. O que un sitio EPUB engade é unha vista sobre o refluxo: que destas operacións un libro refluxo soporta realmente, e que só teñen sentido nos medios de disposición fixa dentro del. Tamén comeza por un feito acerca do formato que dá nome a este sitio: o libro é un zip de XHTML cun manifesto, polo que o texto custa case nada e todas as decisións que importan son sobre as imaxes incorporadas e os subconxuntos de fontes tipográficas.
Non hai conta e non se garda nada: os envíos son eliminados dos traballadores pouco despois de que remate a tarefa, non se le nada e non se indexa nada. Existen contas libres para o historial e o tamaño do lote, non para o acceso.

Valora esta ferramenta

5.0/5 - 0 votos
ns6. com - Compre o seu dominio por 2 dólares ao ano. En liña en minutos.
Ou solta os teus ficheiros aquí