PDF → TXT

PDFからテキストを抽出. ブラウザで直接。100%無料、プライバシー保護。

PDF → TXTは、PDFのテキストコンテンツをプレーンテキストファイルとして抽出し、レイアウト、フォント、画像を排除して文字のみの状態にします。これは、テキストをスクリプト、分析ツール、翻訳ワークフロー、検索インデックスなどに投入する際、PDFの構造が妨げとなる場合に最適なツールです。抽出は、元のドキュメントが許す限り、読み順と段落区切りを保持します。アップロードなしでブラウザ内で実行されます。

  1. ファイルアップロード — ファイルをアップロードエリアにドラッグ&ドロップしてください。またはクリックしてデバイスからファイルを選択してください。
  2. オプション設定 — PDFからテキストを抽出
  3. ダウンロード — ダウンロードボタンをクリックして、処理されたファイルを保存します。すぐに完了します!

よくある質問

スキャンされたPDFでも動作しますか?

いいえ。スキャンされたPDFには、テキストの画像が含まれており、テキストそのものではありません。まずOCRで処理して、文字を認識させ、実際のテキストレイヤーを追加してください。

レイアウトは保持されますか?

いいえ、これは意図的な動作です。プレーンテキストには列や位置情報がないためです。特に複数列のレイアウトは、単一の読み順にフラット化されます。

出力のエンコーディングは何ですか?

UTF-8です。そのため、アクセント付き文字や非ラテン文字スクリプトもそのまま保持されます。

一部のテキストが欠落しているのはなぜですか?

通常、ページの一部がテキストではなく画像であるか、PDFが破損した文字マップを持つフォントを使用しているためです。OCRが前者のケースを処理します。

変換