PDFからテキストを抽出
PDFからすべてのテキストを抜き出し、プレビュー、コピー、または.txtファイルとして ダウンロードできます。何もアップロードされません、すべてお使いの端末内で処理されます。
クリックしてPDFファイルを選択するか、ここにドラッグ&ドロップしてください
端末内に留まり、何もアップロードされません。
PDFファイルはどこかにアップロードされますか?
いいえ。テキストの抽出はすべてブラウザ内でJavaScriptを使って行われます。ファイルが端末の外に出たり、サーバーに触れたりすることはありません。
スキャンしたPDFでも使えますか?
それだけでは使えません。このツールはPDFにすでに埋め込まれているテキストを読み取るもので、スキャンしたページは単なる画像なので、あらかじめOCR処理がされていない限り抽出できるテキストはありません。
段組みや表のようなレイアウトはきれいに抽出されますか?
多くの場合はうまくいきますが、複雑なレイアウト(複数段組みのページや表)は予期しない読み順で出力されることがあります。PDFはテキストを厳密な上から下への構造で保存しているわけではないためです。
パスワード保護されたPDFからテキストを抽出できますか?
現在は非対応です。パスワード保護や暗号化されたPDFはツールで読み込めず、エラーが表示されます。先にPDFリーダーでパスワードを解除してください。
ブログから: PDF圧縮がスキャン画像には効くのに、レポートにはほとんど効かない理由
仕組み
PDFは段落や文、単語すら保存していません。決まった位置にある文字グリフの並びを保存しています。「このフォントでこの座標にこの形を配置する」という具合です。このツールはFirefoxのPDFエンジンであるpdf.jsを使って各ページのコンテンツストリームを走査し、getTextContent()を通じてすべてのテキスト描画操作を収集します。これらの断片はスペースで結合され、余分な空白は折りたたまれ、ページごとに、あなたが目にするプレーンテキストが形成されます。
この保存モデルは、抽出時に驚くかもしれない2つのことを説明します。1つ目は読み取り順序です。pdf.jsはファイル内に配置されているのとほぼ同じ順序で断片を返しますが、これは必ずしも人間が複数列のページや表を読む順序とは限りません。2つ目、そしてより重要なこと。スキャンされたPDFにはそもそもテキストが存在しません。スキャナーはページの写真画像を作成するため、誰かがOCRを実行しない限り、抽出すべき文字グリフはそこに存在せず、ツールは何も見つからなかったと正直に報告します。
抽出はファイルをドロップした瞬間に、完全にローカルのワーカー内で行われます。開発者ツールを開き、ネットワークタブを見てください。契約書であれ医療報告書であれ、どのリクエストもドキュメントやそのテキストをどこかに運ぶことはありません。