PDFからテキストを抽出

PDFを選ぶと、埋め込まれた文字を取り出します。スキャン画像や画像化された文字をOCRで認識する機能はありません。

ファイルのデータはLutrakitに送信されません。

読み込み中

PDFに保存されているテキストを取り出す

PDF内のテキストを、検索や引用、編集に使えるプレーンテキストファイルに変換します。スキャン画像の文字を認識するOCRとは異なります。

使い方

  1. テキスト層のあるPDFを選択します。
  2. 文章の元ページを確認したい場合は、初期状態ではオフのページ区切りを有効にします。出力ファイル名も指定します。
  3. 抽出したTXTをダウンロードし、段落、段組み、特殊文字を元のPDFと比較します。

使用例

入力・設定
1ページ目に抽出可能な「こんにちは」、2ページ目に「世界」があるPDFで、ページ区切りをオフにします。
結果の目安
「こんにちは」、空行、「世界」の順に入ったTXTになります。ページ区切りを有効にすると、番号付きのページ見出しが追加されます。

利用前に確認すること

  • 入力は100 MiBまでです。画像だけのスキャンは、別のOCRツールで文字を認識してから使用してください。
  • TXTではフォント、画像、表のレイアウトは保持されません。文字の順序はPDFの構造に左右されるため、段組みや文字化けを確認してから再利用してください。