高度OCR

全ページOCR · 検索可能PDF · 複数出力 · バッチ処理. ブラウザで直接。100%無料、プライバシー保護。

OCRは、スキャンされたページや写真のテキストを読み取り、実際の選択可能なテキストに変換します。スキャンされた契約書や撮影されたページに適用すると、見た目は同じですが下にテキストレイヤーがある検索可能なPDFが返されます。これにより、Ctrl+Fが機能し、テキストをコピーしたり、他のツールで抽出したりできるようになります。出力はプレーンテキストまたは構造化されたドキュメントにすることも可能です。認識にはWebAssemblyにコンパイルされたTesseractが使用され、すべてブラウザ内で実行されます。これはOCRとしては珍しく(ほとんどのサービスではドキュメントのアップロードが必要です)、ラテン語以外の文字を含む幅広い言語をサポートしています。

  1. ファイルアップロード — ファイルをアップロードエリアにドラッグ&ドロップしてください。またはクリックしてデバイスからファイルを選択してください。
  2. オプション設定 — 全ページOCR · 検索可能PDF · 複数出力 · バッチ処理
  3. ダウンロード — ダウンロードボタンをクリックして、処理されたファイルを保存します。すぐに完了します!

よくある質問

どの言語がサポートされていますか?

英語、韓国語、日本語、中国語、主要なヨーロッパ言語、およびラテン語以外の文字を含む幅広い言語セットです。実行前に正しい言語を選択することが、精度に大きく影響します。

どれくらいの精度ですか?

印刷されたテキストのきれいな300 DPIスキャンでは、精度は高くなります。低解像度、傾き、影、コントラストの低さ、手書き文字によって精度は低下します。特に手書き文字は確実に認識されません。

ドキュメントはOCRサーバーにアップロードされますか?

いいえ。認識はWebAssemblyを通じてブラウザ内で実行されます。ファイルがお客様のデバイスから離れることはなく、これが機密文書に対してクラウドOCRサービスではなくこちらを使用する主な理由です。

最良の結果を得るにはどうすればよいですか?

300 DPIでスキャンし、ページをまっすぐに保ち、影を避け、正しい言語を選択してください。認識前の傾き補正やコントラスト調整も顕著に役立ちます。

最適化

  • PDF圧縮 — PDFファイルサイズを縮小
  • 画像抽出 — PDFから埋め込み画像を抽出
  • PDF分析 — PDF文書情報を詳細に分析