Plano livre: 1 conversão/hora, 1 arquivo de cada vez
Ir Ilimitado →

OCR PDF

Leia as Palavras dentro PDF documents

Selecione seus arquivos

*Arquivos excluídos após 24 horas

Converta arquivos de até 1 GB gratuitamente. Usuários Pro podem converter arquivos de até 100 GB. Cadastre-se agora!

Carregando

0%

Como OCR PDF

1 Subir o digitalizado PDF documents; uma digitalização limpa 300 DPI escala de cinzas dá ao reconhecedor mais para trabalhar.
2 Diga-lhe que linguagem esperar — nomear a língua bate deixando-a adivinhar por uma ampla margem.
3 Execute o passe de reconhecimento; as palavras são escritas de volta como uma camada invisível sentado sobre a imagem da página original.
4 Baixe o arquivo PDF pesquisado — parece idêntico, mas agora você pode pesquisar e selecionar o texto nele.

OCR PDF Perguntas frequentes

Em que devo examinar o melhor resultado?
+
300 PPP em escala de cinzas é o spot doce. Abaixo 200 DPI formas de caracteres começam a descompor; acima 400 DPI você ganha quase nada e paga por ele no tamanho de arquivo e tempo de processamento.
Concretamente, cada página é renderizada, passa por um texto de reconhecimento de Teseract em mais de 100 idiomas, e as palavras reconhecidas são escritas de volta como uma camada de texto invisível posicionada sobre a imagem original — assim a página parece inalterada, mas é pesquisable e selecionável. A página ainda parece exatamente como fez — o texto reconhecido fica visívelmente atrás da imagem, então a pesquisa e seleção funcionam sem alterar a aparência.
Sim — um PDF é um gráfico de objetos, não uma imagem de página, por isso o texto permanece selecionável e os vetores permanecem nítidos independentemente do que acontece com o conteúdo de raster dentro dele. Afecta o que o reconhecedor pode ver.
Em uma digitalização limpa 300 PPP de texto impresso, o suficiente de alto que erros são raros e principalmente em nomes incomum adequados. A precisão cai bruscamente com baixa resolução, esmaga, sombras de uma câmera de telefone, caras incomum e escrita — em particular, a escrita de mão não é para isso.
Qualquer PDF padrão, incluindo os produzidos por um scanner, por um processador de texto ou por um driver de impressão. Arquivos com uma senha do proprietário que apenas restringe a edição são manuseados; arquivos que precisam de uma senha do usuário para abrir não são, e não tentamos quebrar a criptografia.
Sim: documentos de processo de contas livres até 5 MB cada, que abrange a maioria dos relatórios e contratos, mas não um documento escaneado longo no 600 DPI; Ghostscript e qpdf fazem o trabalho. PDF escaneados são a coisa habitual que o excede, e comprimir o documento primeiro é normalmente suficiente para trazê-lo de volta.
Texto e arte vetorial são objetos em vez de pixels, por isso eles permanecem perfeitamente afiados em qualquer zoom não importa o que acontecer. Somente as imagens de raster incorporadas podem degradar, e apenas se a operação que você escolheu reamostrá-las.
Sim — upload o set e eles processam em paralelo sob um conjunto de configurações, que é o ponto de fazer aqui um fluxo de trabalho de documento em vez de clicar através de um leitor de desktop.
EPUB.to é construído em torno do formato eBook aberto — XHTML em um zip, refluxável pelo design e legível no hardware para o qual ninguém pensou sobre o layout. Um livro é um zip cheio de marcação, imagens e fontes, então quase todas as pessoas de trabalho trazem para um site do eBook é realmente um trabalho em uma dessas coisas. OCR PDF funciona no mesmo upload e a mesma conta que as conversões porque é onde é necessário.
O conversor neste site move livros entre EPUB, MOBI, AZW3, PDF e DOCX, então um título acaba em qualquer hardware que realmente vai le-lo. Fazendo isso depois OCR PDF significa que a conversão é feita a partir da versão em que você se estabeleceu, não a partir da que você ainda estava fixando.
Os motores são compartilhados — a mesma cadeira de ferramentas, os mesmos trabalhadores, os mesmos limites. O que um site EPUB adiciona é uma visão sobre o refluxo: qual destas operações um livro refluxável suporta genuinamente, e que só faz sentido sobre a mídia fixa-layout dentro dele. Ele também começa de um fato sobre o formato este site é nomeado depois: o livro é um zip do XHTML com um manifesto, de modo que o texto custa quase nada e cada decisão que importa é sobre as imagens e subconjuntos de fontes incorporadas.
Sem conta, e nada é mantido: os uploads são excluídos dos trabalhadores pouco depois do trabalho terminado, nada é lido e nada é indexado. Contas gratuitas existem para história e tamanho do lote, não para acesso.

Avalie esta ferramenta

5.0/5 - 0 votos
ns6.com — Compra o seu domínio em minutos. Procurar, registrar, lançar.
Ou arraste seus arquivos para cá.