1Subir o digitalizado PDF documents; uma digitalização limpa 300 DPI escala de cinzas dá ao reconhecedor mais para trabalhar.
2Diga-lhe que linguagem esperar — nomear a língua bate deixando-a adivinhar por uma ampla margem.
3Execute o passe de reconhecimento; as palavras são escritas de volta como uma camada invisível sentado sobre a imagem da página original.
4Baixe o arquivo PDF pesquisado — parece idêntico, mas agora você pode pesquisar e selecionar o texto nele.
OCR PDF Perguntas frequentes
Em que devo examinar o melhor resultado?
+
300 PPP em escala de cinzas é o spot doce. Abaixo 200 DPI formas de caracteres começam a descompor; acima 400 DPI você ganha quase nada e paga por ele no tamanho de arquivo e tempo de processamento.
Como OCR PDF transforma uma varredura em texto?
+
Concretamente, cada página é renderizada, passa por um texto de reconhecimento de Teseract em mais de 100 idiomas, e as palavras reconhecidas são escritas de volta como uma camada de texto invisível posicionada sobre a imagem original — assim a página parece inalterada, mas é pesquisable e selecionável. A página ainda parece exatamente como fez — o texto reconhecido fica visívelmente atrás da imagem, então a pesquisa e seleção funcionam sem alterar a aparência.
Alguma coisa específica para PDF aqui?
+
Sim — um PDF é um gráfico de objetos, não uma imagem de página, por isso o texto permanece selecionável e os vetores permanecem nítidos independentemente do que acontece com o conteúdo de raster dentro dele. Afecta o que o reconhecedor pode ver.
Quão precisa é?
+
Em uma digitalização limpa 300 PPP de texto impresso, o suficiente de alto que erros são raros e principalmente em nomes incomum adequados. A precisão cai bruscamente com baixa resolução, esmaga, sombras de uma câmera de telefone, caras incomum e escrita — em particular, a escrita de mão não é para isso.
O que posso fazer para OCR PDF?
+
Qualquer PDF padrão, incluindo os produzidos por um scanner, por um processador de texto ou por um driver de impressão. Arquivos com uma senha do proprietário que apenas restringe a edição são manuseados; arquivos que precisam de uma senha do usuário para abrir não são, e não tentamos quebrar a criptografia.
Existe um limite de tamanho do arquivo em OCR PDF?
+
Sim: documentos de processo de contas livres até 5 MB cada, que abrange a maioria dos relatórios e contratos, mas não um documento escaneado longo no 600 DPI; Ghostscript e qpdf fazem o trabalho. PDF escaneados são a coisa habitual que o excede, e comprimir o documento primeiro é normalmente suficiente para trazê-lo de volta.
OCR PDF diminuirá a qualidade do meu PDF documents?
+
Texto e arte vetorial são objetos em vez de pixels, por isso eles permanecem perfeitamente afiados em qualquer zoom não importa o que acontecer. Somente as imagens de raster incorporadas podem degradar, e apenas se a operação que você escolheu reamostrá-las.
Posso correr OCR PDF em vários PDF documents de uma vez?
+
Sim — upload o set e eles processam em paralelo sob um conjunto de configurações, que é o ponto de fazer aqui um fluxo de trabalho de documento em vez de clicar através de um leitor de desktop.
Por que um EPUB host do site OCR PDF?
+
EPUB.to é construído em torno do formato eBook aberto — XHTML em um zip, refluxável pelo design e legível no hardware para o qual ninguém pensou sobre o layout. Um livro é um zip cheio de marcação, imagens e fontes, então quase todas as pessoas de trabalho trazem para um site do eBook é realmente um trabalho em uma dessas coisas. OCR PDF funciona no mesmo upload e a mesma conta que as conversões porque é onde é necessário.
O que devo fazer com o resultado uma vez OCR PDF terminado?
+
O conversor neste site move livros entre EPUB, MOBI, AZW3, PDF e DOCX, então um título acaba em qualquer hardware que realmente vai le-lo. Fazendo isso depois OCR PDF significa que a conversão é feita a partir da versão em que você se estabeleceu, não a partir da que você ainda estava fixando.
OCR PDF é aqui a mesma ferramenta que os sites de irmãos funcionam?
+
Os motores são compartilhados — a mesma cadeira de ferramentas, os mesmos trabalhadores, os mesmos limites. O que um site EPUB adiciona é uma visão sobre o refluxo: qual destas operações um livro refluxável suporta genuinamente, e que só faz sentido sobre a mídia fixa-layout dentro dele. Ele também começa de um fato sobre o formato este site é nomeado depois: o livro é um zip do XHTML com um manifesto, de modo que o texto custa quase nada e cada decisão que importa é sobre as imagens e subconjuntos de fontes incorporadas.
Preciso de uma conta e alguma coisa fica guardada?
+
Sem conta, e nada é mantido: os uploads são excluídos dos trabalhadores pouco depois do trabalho terminado, nada é lido e nada é indexado. Contas gratuitas existem para história e tamanho do lote, não para acesso.