PDF sang TXT

Trích xuất văn bản từ PDF. Ngay trong trình duyệt. Miễn phí 100%, bảo vệ quyền riêng tư.

PDF sang TXT trích xuất nội dung văn bản của một tệp PDF thành một tệp văn bản thuần túy, loại bỏ bố cục, phông chữ và hình ảnh để bạn chỉ còn lại các từ. Đây chính xác là điều bạn muốn khi văn bản cần được đưa vào một tập lệnh, công cụ phân tích, quy trình dịch thuật hoặc chỉ mục tìm kiếm, nơi cấu trúc PDF chỉ là một trở ngại. Việc trích xuất bảo toàn thứ tự đọc và ngắt đoạn trong phạm vi tài liệu gốc cho phép. Công cụ này chạy trong trình duyệt của bạn mà không cần tải lên.

  1. Tải file — Kéo và thả tệp của bạn vào khu vực tải lên, hoặc nhấp để duyệt và chọn tệp từ thiết bị của bạn.
  2. Cài đặt — Trích xuất văn bản từ PDF
  3. Tải xuống — Nhấp vào nút tải xuống để lưu tệp đã xử lý của bạn. Tệp đã sẵn sàng ngay lập tức!

Câu hỏi thường gặp

Công cụ này có hoạt động trên các tệp PDF được quét không?

Không. Một bản quét chứa hình ảnh văn bản, không phải văn bản. Hãy chạy qua OCR trước, công cụ này sẽ nhận diện các ký tự và thêm một lớp văn bản thực sự.

Bố cục có được giữ nguyên không?

Không, và điều này là có chủ đích — văn bản thuần túy không có cột hay vị trí. Đặc biệt, các bố cục nhiều cột được làm phẳng thành một thứ tự đọc duy nhất.

Đầu ra sử dụng mã hóa gì?

UTF-8, vì vậy các ký tự có dấu và các tập lệnh không phải tiếng Latinh được bảo toàn nguyên vẹn.

Tại sao một số văn bản bị thiếu?

Thường là do các phần của trang là hình ảnh chứ không phải văn bản, hoặc tệp PDF sử dụng phông chữ có bản đồ ký tự bị lỗi. OCR xử lý trường hợp đầu tiên.

Chuyển đổi