PDFからテキストを抽出
PDFを選ぶと、埋め込まれた文字を取り出します。スキャン画像や画像化された文字をOCRで認識する機能はありません。
ファイルのデータはLutrakitに送信されません。
読み込み中
読み込み中
PDFに保存されているテキストを取り出す
PDF内のテキストを、検索や引用、編集に使えるプレーンテキストファイルに変換します。スキャン画像の文字を認識するOCRとは異なります。
使い方
- テキスト層のあるPDFを選択します。
- 文章の元ページを確認したい場合は、初期状態ではオフのページ区切りを有効にします。出力ファイル名も指定します。
- 抽出したTXTをダウンロードし、段落、段組み、特殊文字を元のPDFと比較します。
使用例
- 入力・設定
- 1ページ目に抽出可能な「こんにちは」、2ページ目に「世界」があるPDFで、ページ区切りをオフにします。
- 結果の目安
- 「こんにちは」、空行、「世界」の順に入ったTXTになります。ページ区切りを有効にすると、番号付きのページ見出しが追加されます。
利用前に確認すること
- 入力は100 MiBまでです。画像だけのスキャンは、別のOCRツールで文字を認識してから使用してください。
- TXTではフォント、画像、表のレイアウトは保持されません。文字の順序はPDFの構造に左右されるため、段組みや文字化けを確認してから再利用してください。