Không tải lên

PDF sang Word

Tệp PDF không chứa đoạn văn, chỉ chứa từng ký tự cùng vị trí của nó trên trang. Trang này đọc lại các vị trí đó rồi suy ra lại đâu là đoạn văn, đâu là tiêu đề và thứ tự đọc. Với một tài liệu một cột bình thường thì kết quả tốt, với thứ gì được dàn theo kiểu ô lưới thì kém. Sau mỗi lần chạy, công cụ cho bạn biết tài liệu của bạn thuộc loại nào.

  • Không tài khoản
  • Không hình mờ
  • Không giới hạn tệp
Thả tệp của bạn vào đâyhoặc bấm để chọnKhông giới hạn dung lượng hay số lượng, ngoài mức máy tính của bạn chịu được.There is no upload bar here, because there is no upload. The file is opened by this page, on your machine.

Tệp của bạn

Tốt nhất với tài liệu một cột thông thường. Bảng biểu, trang nhiều cột và mọi thứ vẽ dưới dạng sơ đồ đều không còn nguyên vẹn. Phần ghi chú sau khi chạy sẽ nói tài liệu của bạn ra sao.

Chỉ những trang không có chữ nào mới được đưa qua OCR. Lần chạy đầu tiên sẽ tải bộ máy nhận dạng và đúng một gói ngôn ngữ bạn chọn, cộng lại khoảng 3,5 MB. Sau đó mỗi trang mất vài giây và trả về chữ trơn, không tiêu đề, không in đậm. Chỉ đọc chữ in: chữ viết tay sẽ ra chữ vô nghĩa, dù bạn chọn thứ tiếng nào.

Mặc định tắt, nên một đoạn bị cắt qua hai trang PDF sẽ được nối lại. Hãy bật nếu tệp Word phải ngắt trang giống hệt tệp PDF.

    Chưa chọn gì cả.

    A sample PDF page on the left; on the right, the editable text of the .docx it produced.
    A sample file run through this tool. The file is generated by a script — nothing in it is real.

    Công cụ này làm gì cho bạn

    Những chỗ đáng biết trước khi bắt đầu.

    Đoạn văn, chứ không phải mỗi dòng một đoạn

    Tệp PDF ghi lại các dòng đã in, không phải đoạn văn. Công cụ này nối các dòng lại, kể cả những từ bị dấu gạch nối cắt ngang cuối dòng, và chỉ mở đoạn mới ở chỗ khoảng cách dòng, mức thụt đầu dòng, cỡ chữ hoặc độ đậm thực sự thay đổi.

    Tiêu đề trở thành tiêu đề của Word

    Chữ đặt lớn hơn phần thân được xếp hạng theo cỡ rồi gán vào Heading 1, 2 và 3, nhờ vậy khung điều hướng hiện đủ mục và Tham chiếu → Mục lục dùng được. Chữ đậm và chữ nghiêng lấy từ phông chữ đã vẽ ra từng cụm ký tự.

    Tiêu đề chạy trang và số trang bị bỏ đi

    Những dòng nằm ở lề trên hoặc lề dưới và lặp lại trên nửa số trang, cùng các số trang đứng một mình, đều bị loại. Số dòng bị loại sẽ được báo lại.

    Nó nói rõ chỗ nào nó làm hỏng

    Trang nhiều cột, dòng trông giống hàng của bảng, ảnh không cắt ra được, chữ nằm ngang, và trang không có chữ nào, mỗi loại đều được đếm và giải thích ngay dưới nút tải về.

    Cách dùng

    Chọn một hoặc nhiều tệp PDF. Nếu trong đó có bản quét, hãy tích ô OCR và chọn thứ tiếng của bản quét trước khi bắt đầu.

    Bấm Bắt đầu. Mỗi trang được đọc hai lượt, nên tài liệu dài sẽ lâu.

    Tải tệp .docx về, rồi đọc phần ghi chú dưới nút. Ở đó nói rõ thứ gì đã không giữ được.

    Khi nào người ta dùng

    Bạn cần sửa hai đoạn trong tệp PDF của người khác

    Dùng lại điều khoản của nhà cung cấp, một điều trong hợp đồng, một mục trong báo cáo.

    Lấy chữ ra mà không phải gõ lại

    Một bản đề xuất, một bài viết hay một cuốn hướng dẫn chỉ tồn tại ở dạng PDF, và phần nội dung phải đưa được sang chỗ bạn chỉnh sửa được.

    Tệp này không thể gửi lên máy chủ của người lạ

    Hợp đồng, giấy tờ bệnh viện, phiếu lương, mọi thứ nằm trong thỏa thuận bảo mật. Tệp PDF được đọc ngay trên máy của bạn và không có gì được gửi đi.

    Câu hỏi

    Tệp Word có trông giống tệp PDF không?

    Không. Công cụ đặt chữ lại theo thứ tự đọc bằng chính các kiểu dáng của Word, trên trang có khổ đúng bằng bản gốc, lề lấy theo chỗ chữ thực sự nằm. Chỗ ngắt dòng, đúng phông chữ ban đầu, khoảng cách giữa các chữ cái, việc chia cột và mọi thứ vẽ bằng đồ họa vector đều không được dựng lại.

    Bảng biểu thì sao?

    Chúng không ra thành bảng của Word. Khi trong một dòng có những khoảng trống rộng, các khoảng trống đó biến thành ký tự Tab và dòng đó thành một đoạn riêng, nên dữ liệu còn đủ và đúng thứ tự. Muốn có bảng thật, hãy chọn những dòng đó trong Word rồi dùng Chèn → Bảng → Chuyển văn bản thành bảng, với dấu phân cách là Tab. Phần báo cáo cho biết có bao nhiêu dòng ra theo kiểu này.

    Còn trang hai cột thì sao?

    Mỗi cột được đọc lần lượt từ trên xuống, và điều đó được báo lại để bạn tự kiểm. Ba cột cũng làm y như vậy. Thứ làm hỏng là trang mà các cột bắt đầu và kết thúc ở lưng chừng, hoặc có khung bên cạnh đè lên phần nội dung chính; những trang đó ra thành chữ xen lẫn nhau.

    Tệp PDF của tôi là bản quét và tệp Word ra trống trơn.

    Trang đã quét không có ký tự nào bên trong để đọc. Hãy tích “Đọc trang đã quét bằng OCR”, cho biết bản quét của bạn là tiếng gì, những trang đó sẽ được nhận dạng chữ. Công cụ đọc được tiếng Anh, tiếng Trung giản thể và phồn thể, tiếng Tây Ban Nha, tiếng Bồ Đào Nha và tiếng Nga, mỗi lần một thứ tiếng, nên chọn sai thì kết quả trả về là chữ vô nghĩa. Mỗi trang mất vài giây, và thứ nhận về là chữ trơn, không tiêu đề, không in đậm.

    Chữ đậm và chữ nghiêng có đáng tin không?

    Chúng lấy từ phông chữ đã vẽ ra từng cụm ký tự, nên luôn đúng khi tài liệu dùng phông đậm hoặc phông nghiêng thật. Chúng sai khi tệp PDF giả chữ đậm bằng cách vẽ viền mỗi chữ hai lần, và có thể sai với một phông thường bị kéo nghiêng. Gạch chân, màu chữ và tô sáng thì không được mang sang.

    Tôi chuyển nhiều tệp cùng lúc được không?

    Được. Mỗi tệp PDF ra một tệp .docx riêng. Quá ba tệp thì chúng về trong một tệp zip duy nhất. Tệp PDF lớn hơn 2 GB thì không mở được chút nào; đó là giới hạn của trình duyệt.

    Tệp của tôi có bị tải lên không?

    Không. Tệp PDF được chính trang này đọc từ ổ đĩa của bạn, tệp Word được ráp lại ngay trong thẻ này, và việc tải về đi ra từ chính trình duyệt của bạn. Bạn có thể mở thẻ mạng xem trong lúc nó chạy. Bộ đọc PDF và bộ máy OCR được tải từ trang này trong lần đầu; tài liệu của bạn không nằm trong số đó.

    Công cụ khác