1Sube el PDF documents escaneado; un escaneo de escala de grises limpio de 300 DPI le da al reconocidor el máximo con el que trabajar.
2Dile qué idioma esperar — nombrar el idioma late dejando que adivine por un amplio margen.
3Ejecute el pase de reconocimiento; las palabras se escriben de nuevo como una capa invisible sentada sobre la imagen original de la página.
4Descargue el archivo PDF que puede buscarse, pero ahora puede buscar y seleccionar el texto que contiene.
OCR PDF Preguntas frecuentes
¿En qué debería buscar el mejor resultado?
+
300 DPI en escala de grises es el punto dulce. Por debajo de 200 DPI de caracteres de formas comienzan a descomponerse; por encima de 400 DPI usted gana casi nada y paga por él en tamaño de archivo y tiempo de procesamiento.
¿Cómo OCR PDF convierte un escaneo en texto?
+
Concretamente, cada página se representa, se ejecuta a través de un pase de reconocimiento de texto Tesseract en más de 100 idiomas, y las palabras reconocidas se escriben de nuevo como una capa de texto invisible posicionada sobre la imagen original — por lo que la página parece sin cambios pero es buscable y seleccionable. La página todavía se ve exactamente como lo hizo — el texto reconocido se encuentra invisiblemente detrás de la imagen así que la búsqueda y selección de trabajo sin cambiar la apariencia.
¿Algo específico para PDF aquí?
+
Sí — un PDF es un gráfico de objetos, no una imagen de página, por lo que el texto permanece seleccionable y los vectores permanecen en forma aguda sin importar lo que pase con el contenido de raster dentro de él. Afecta lo que el reconocidor puede ver.
¿Qué tan exacto es?
+
En un escaneo limpio de 300 DPI de texto impreso, lo suficientemente alto como para que los errores sean raros y sobre todo en sustantivos apropiados inusuales. La precisión se desconecta bruscamente con baja resolución, sesgo, sombras de una cámara telefónica, tipografías inusuales y escritura a mano — la escritura a mano en particular no es para lo que esto es.
¿Qué puedo subir a OCR PDF?
+
Cualquier PDF estándar, incluyendo los producidos por un escáner, por un procesador de textos o por un controlador de impresión. Los archivos con una contraseña de propietario que sólo restringe la edición se manejan; los archivos que necesitan una contraseña de usuario para abrir no lo son, y no intentamos romper el cifrado.
¿Hay un límite de tamaño de archivo en OCR PDF?
+
Sí: cuentas libres procesan documentos hasta 5 MB cada uno, que cubre la mayoría de los informes y contratos, pero no un documento escaneado largo en 600 DPI; Ghostscript y qpdf hacen el trabajo. Los PDF escaneados son lo habitual que lo supera, y comprimir el documento primero es normalmente suficiente para traerlo de vuelta debajo.
¿Bajará OCR PDF la calidad de mi PDF documents?
+
Texto y vector de arte son objetos en lugar de píxeles, por lo que permanecen perfectamente nítidos en cualquier zoom no importa lo que suceda. Sólo las imágenes de raster incrustadas pueden degradarse, y sólo si la operación que usted eligió los vuelve a muestrear.
¿Puedo ejecutar OCR PDF en varios PDF documents a la vez?
+
Sí — subir el conjunto y procesar en paralelo bajo un conjunto de ajustes, que es el punto de hacer un flujo de trabajo de documentos aquí en lugar de hacer clic a través de un lector de escritorio.
¿Por qué un EPUB sitio host OCR PDF?
+
EPUB.to está construido en torno al formato abierto del eBook — XHTML en un zip, refluible por diseño, y legible en hardware nadie ha pensado en el diseño para. Un libro es un zip lleno de marcas, imágenes y fuentes, por lo que casi todos los trabajos que la gente trae a un sitio de eBook es realmente un trabajo en una de esas cosas. OCR PDF se ejecuta en la misma carga y la misma cuenta que las conversiones porque es ahí donde se necesita.
¿Qué debo hacer con el resultado una vez que OCR PDF esté terminado?
+
El convertidor en este sitio mueve libros entre EPUB, MOBI, AZW3, PDF y DOCX, así que un título termina en cualquier hardware que realmente va a leer. Hacer eso después de OCR PDF significa que la conversión se hace a partir de la versión en la que se estableció, no de la que todavía se fija.
¿Es aquí OCR PDF la misma herramienta que los sitios hermanos corren?
+
Los motores son compartidos — la misma cadena de herramientas, los mismos trabajadores, los mismos límites. Lo que un sitio EPUB añade es una vista sobre el reflujo: ¿cuál de estas operaciones un libro refluible apoya genuinamente, y que sólo tienen sentido en los medios de fijación fija dentro de él. También comienza de un hecho sobre el formato que este sitio lleva el nombre de: el libro es una zip de XHTML con un manifiesto, por lo que el texto no cuesta casi nada y cada decisión que importa es sobre las imágenes incrustadas y subconjuntos de fuentes.
¿Necesito una cuenta, y se guarda algo?
+
No hay cuenta, y nada se guarda: las cargas se eliminan de los trabajadores poco después de que el trabajo termina, nada se lee y nada se indexa. Existen cuentas gratuitas para el historial y el tamaño de lote, no para el acceso.