1Tải lên PDF documents đã quét; một bản quét màu xám 300 DPI sạch sẽ cho phép người nhận diện làm việc nhiều nhất.
2Nói cho nó biết ngôn ngữ nào để mong đợi — đặt tên ngôn ngữ đánh bại để nó đoán trước một khoảng cách rộng.
3Chạy quá trình nhận dạng; các từ được viết lại như một lớp vô hình nằm trên hình ảnh trang gốc.
4Tải về tập tin PDF có thể tìm kiếm — nó trông giống nhau, nhưng bây giờ bạn có thể tìm kiếm và chọn văn bản trong nó.
OCR PDF Câu hỏi thường gặp
Tôi nên quét ở đâu để có kết quả tốt nhất?
+
300 DPI trong độ xám là điểm tốt nhất. Dưới 200 DPI, hình dạng ký tự bắt đầu bị phá vỡ; trên 400 DPI, bạn hầu như không có gì cả và phải trả giá bằng kích thước tập tin và thời gian xử lý.
Làm thế nào OCR PDF chuyển đổi một bản scan thành văn bản?
+
Concretely, mỗi trang được hiển thị, chạy qua một Tesseract văn bản nhận dạng đi qua hơn 100 ngôn ngữ, và các từ được nhận ra được viết lại như một lớp văn bản vô hình đặt trên hình ảnh gốc — vì vậy trang trông không thay đổi nhưng có thể tìm kiếm và chọn. The page still looks exactly as it did — the recognised text sits invisibly behind the image so search and selection work without changing the appearance.
Có gì đặc biệt về PDF ở đây không?
+
Đúng — PDF là đồ thị đối tượng, không phải là hình ảnh trang, vì vậy văn bản vẫn có thể chọn và vector vẫn sắc nét dù có gì xảy ra với nội dung raster bên trong nó. Nó ảnh hưởng đến những gì người nhận dạng có thể thấy.
Nó chính xác đến mức nào?
+
Trong một bản scan văn bản in sạch 300 DPI, độ cao đủ cao để lỗi hiếm và hầu hết là trong các danh từ chính bất thường. Độ chính xác giảm mạnh với độ phân giải thấp, lệch, bóng tối từ máy ảnh điện thoại, phông chữ bất thường và chữ viết tay — đặc biệt là chữ viết tay không phải là mục đích của nó.
Tôi có thể tải lên OCR PDF những gì?
+
Mọi PDF tiêu chuẩn, bao gồm những tập tin được tạo bởi máy quét, trình xử lý văn bản hay trình điều khiển in. Tập tin có mật khẩu chủ chỉ hạn chế sửa đổi sẽ được xử lý; tập tin cần mật khẩu người dùng để mở không được xử lý, và chúng tôi không cố gắng phá mã hóa.
Có giới hạn kích thước tập tin trên OCR PDF không?
+
Có: free accounts process documents up to 5 MB each, which covers most reports and contracts but not a long scanned document at 600 DPI; Ghostscript and qpdf do the work. PDF quét là thứ thường xuyên vượt quá nó, và nén tài liệu trước thường là đủ để mang nó trở lại dưới.
OCR PDF sẽ làm giảm chất lượng PDF documents của tôi không?
+
Văn bản và tranh vectơ là các đối tượng chứ không phải điểm ảnh, vì vậy chúng vẫn giữ được độ sắc nét hoàn hảo khi phóng to bất kỳ dù có chuyện gì xảy ra. Chỉ có hình ảnh raster nhúng có thể bị giảm chất lượng, và chỉ khi thao tác bạn chọn lấy mẫu lại chúng.
Tôi có thể chạy OCR PDF trên nhiều PDF documents cùng một lúc không?
+
Có — tải lên tập tin và chúng sẽ xử lý song song dưới một tập hợp các cài đặt, đó là điểm của việc làm một luồng tài liệu ở đây thay vì click qua một trình đọc desktop.
Tại sao một trang EPUB lại có OCR PDF?
+
EPUB.to được xây dựng xung quanh định dạng eBook mở - XHTML trong một zip, có thể được thiết kế lại, và có thể đọc trên phần cứng mà không ai nghĩ về bảng bố trí cho nó. Một cuốn sách là một tập tin zip đầy các dấu đánh dấu, hình ảnh và phông chữ, vì vậy hầu hết mọi công việc mà người ta mang đến một trang web eBook thực sự là một công việc trên một trong những thứ đó. OCR PDF chạy trên cùng một tải lên và cùng một tài khoản như các chuyển đổi vì đó là nơi nó cần thiết.
Tôi nên làm gì với kết quả khi OCR PDF hoàn thành?
+
Phần mềm chuyển đổi trên trang này chuyển sách giữa EPUB, MOBI, AZW3, PDF và DOCX, vì vậy một tựa đề kết thúc trên bất kỳ phần cứng nào thực sự sẽ đọc nó. Nếu làm như vậy sau OCR PDF thì có nghĩa là việc chuyển đổi được thực hiện từ phiên bản bạn đã chọn, chứ không phải từ phiên bản bạn đang sửa.
Có phải OCR PDF ở đây là công cụ giống như các trang web chị em chạy?
+
Các động cơ được chia sẻ — cùng một chuỗi công cụ, cùng một người làm việc, cùng một giới hạn. Điều mà một trang EPUB thêm vào là một quan điểm về reflow: trong số các hoạt động này, một cuốn sách có thể reflow được thực sự hỗ trợ, và những gì chỉ có ý nghĩa trên phương tiện định dạng cố định bên trong nó. Nó cũng bắt đầu từ một thực tế về định dạng mà trang này được đặt tên sau: cuốn sách là một tập tin zip của XHTML với một bản tuyên bố, vì vậy văn bản hầu như không tốn chi phí và mọi quyết định quan trọng là về hình ảnh và phông chữ được nhúng..
Tôi có cần một tài khoản không, và có gì được giữ không?
+
Không có tài khoản, và không gì được giữ: các tải lên sẽ bị xóa khỏi người làm việc ngay sau khi công việc kết thúc, không có gì được đọc và không có gì được chỉ mục. Các tài khoản miễn phí tồn tại cho lịch sử và kích thước gói, không cho truy cập.