PDFからテキストへ — 無料のオンラインテキスト抽出ツール
デジタルまたはスキャンされたPDFからテキストをブラウザ内で直接抽出します。無料で、サインアップ不要、PDFは決してあなたのデバイスを離れません。
私たちに感謝したいですか?友達にLeanImgについて教えてください!
PDFをテキストに変換する方法
PDFを選択する
ファイルをボックスにドロップするか、デバイスから選択します。デジタルPDF、スキャンされたPDF、および両者を混合したファイルがすべて機能します。
言語を選択して抽出する
文書の言語を選択し、抽出を開始します。テキストレイヤーのあるページはすぐに読み取られます。OCRが必要なページは、各ページが到着するたびに進行状況が表示されながら、一つずつ認識されます。
テキストをコピーまたはダウンロードする
結果を読み取り、クリップボードにコピーするか、ページにラベルを付けて.txtファイルとして保存します。
PDFからテキスト抽出がどのように機能するか
PDFはコンテナであり、その内部にあるものがテキストの出力方法を決定します。ワードプロセッサ、ブラウザ、または会計アプリからエクスポートされたファイルにはテキストレイヤーが含まれています。文字は文字として保存され、そのページ上の位置と共に格納されます。そのレイヤーを読み取ることで、ファイルが保存している通りのテキストが得られます。認識ステップは実行されないため、間違えることはありません。
スキャンされたPDFは、同じファイル拡張子を持つ異なるものです。スキャナーや電話のカメラが各ページの画像を生成し、その画像がPDFに包まれました。ファイル内には文字はなく、人間の目には文字のように見えるピクセルだけがあります。それから単語を抽出するにはOCRが必要で、ページをレンダリングし、選択した言語のトレーニングされたモデルに対して形状を一致させます。
抽出ツールは、決定を下す前に各ページをチェックします。ページに使用可能なテキストレイヤーがある場合、そのレイヤーが読み取られ、結果は正確です。ない場合、ページは画像としてレンダリングされ、画像抽出ツールを動かすのと同じOCRエンジンを通過します。両方を混合したファイルは、1ページずつ両方の処理を受け、結果の要約には各ページが使用した方法が示されます。すべてのファイルは、PDFごとに最大25ページまで読み取られます。
銀行明細書、ID、契約書はあなたのデバイスに留まります
人々が最もテキストを抽出したい文書は、アップロードすることに最も抵抗があるべきものです。銀行明細書、給与明細、税務書類、署名された契約書、医療書類、パスポートやIDカードのスキャン。これらのすべては、見知らぬ人にメールすることはないファイルであり、検索結果で見つけたウェブサイトに渡すことは、手順が少なくとも同じ行為です。
この抽出ツールにはアップロードエンドポイントはありません。あなたのPDFはディスクからページに読み取られ、ブラウザで実行されているPDFリーダーによって開かれ、メモリ内でテキストに変換されます。ページが行うリクエストは、自身の機械のためのものであり、リーダー自体と、ページがOCRを必要とする場合には認識エンジンとその言語モデルです。すべてはこのサイトから提供され、あなたの方にのみ移動します。
それを信じる必要はありません。実行を開始する前にブラウザのネットワークタブを開き、テキストが表示される間にそれを監視してください。機械が到着するのが見え、あなたの文書を持ち去るものは何もありません。それは1分以内に確認できる主張であり、プライバシーポリシーが提供するものよりも多いです。
このツールができないこと
このページは一方向のみです。PDFを読み取り、プレーンテキストを提供します。PDFを書き込むことはありません。テキストレイヤーを追加した検索可能なPDFを返すことはありません。元のレイアウトを保持したワードプロセッサファイルとして文書を再構築することはありません。得られるのは言葉だけです。
マージ、分割、回転、圧縮、パスワード保護も行いません。それらすべてのためのサイトがあり、そのほとんどは作業を行うためにサーバー上にファイルが必要です。それがこのページが回避するために構築された取引です。
逆に行って写真やスキャンを単一のPDFに変換したい場合、このサイトのJPGからPDFへの変換ツールがそれを行います。このページと同じようにブラウザで実行されます。ソースがPDFではなくスクリーンショットや写真である場合、画像抽出ツールが必要なページです。
なぜLeanImgなのか?
PDFはあなたのデバイスでページごとに読み取られ、テキストはそのまま残ります。私たちのすべての無料画像ツールを探索して、ブラウザ内でワークフローの残りを維持してください。
アップロードなし
銀行明細書、ID、契約書は、他人のサーバーに送信すべきではないファイルです。このツールにはそれらを送信するサーバーはありません。
可能な限り正確
デジタルPDFはそのテキストレイヤーからそのまま読み取られます。スキャンされたページのみがOCRを通過し、各結果はどの方法が使用されたかを示します。
無料で無制限
サインアップ不要、クレジットなし、ウォーターマークなし、有料プランなし。PDFごとに最大25ページ、必要なだけのPDF。
数字の見た目
4つのPDFが事前に知られているテキストでこのエクストラクターを通過しました。スコアは出力とそのテキストの文字ごとの比較です。3つのファイルはデジタルで生まれ、ブラウザから直接エクスポートされたため、文字はすでに内部に存在していました。スキャンされたものは、このサイトのJPGからPDFへのコンバーターを通してスクリーンショットを押し込むことで作成され、ページの画像と文字は全く含まれていません。最後の行は28ページのファイルです。ページの上限を超えるように構築されているため、正確性のスコアはありません。
| フィクスチャ | ページ | 方法 | 類似性 |
|---|---|---|---|
| デジタルPDF | 1 of 1 | テキストレイヤー | 100.0% |
| スキャンPDF | 1 of 1 | OCR | 100.0% |
| 3ページのデジタルPDF | 3 of 3 | テキストレイヤー | 100.0% |
| オーバーサイズPDF | 25 of 28 | テキストレイヤー | スコアなし |
2つの方法がこれらの行を生成し、ファイルがどちらの方法を実行するかを決定します。各ページは最初にテキストレイヤーがあるかどうかがチェックされ、文字が存在する場合は認識ステップなしでそのまま読み取られます。これが「正確」という言葉が属する場所であり、このページの他の場所にはありません。使用可能なテキストレイヤーがないページは画像としてレンダリングされ、スクリーンショットを読み取る同じOCRエンジンに渡されるため、そのエンジンの精度と失敗モードを持ちます。2つを混ぜたファイルは、1ページずつ両方の処理を受けます。
結果は、どちらが発生したかを示します。テキストレイヤーから完全に読み取られたPDFは「正確」とラベル付けされ、そのカードには信頼度スコアはありません。OCRページを含むドキュメントはスコアを示します。1ページ以上のドキュメントは、テキストレイヤーから読み取られたページの数とOCRを通過したページの数をカウントする行も持ちます。そのスコアは文書全体にわたる文字加重平均であり、テキストレイヤーページは100で参加します。混合ファイルでは、テキストの信頼性がどれだけあるかとして読み取るべきであり、OCRがどれだけうまくいったかとして読み取るべきではありません。ページごとの要約行は、どれだけのページが認識されたかを示します。
初回使用時にダウンロードされるもの
両方のエンジンはあなたのマシンで実行されるため、最初にそこに到達する必要があります。PDFを開くと、pdf.jsワーカーが取得されます。これは約1.3 MBです。OCRエンジンと1つの言語モデルがそれと共にダウンロードされ、合計約6 MBで、すべてのページがデジタルであり、認識が実行されない場合でもダウンロードされます。それは生まれたデジタルファイルに対する無駄なダウンロードです。これは現在の制限であり、それを修正することがリストにあります。
すべてはこのサイトから提供され、サードパーティのCDNからは提供されません。あなたのブラウザはすべてをキャッシュするため、その言語の次のPDFは取得するものがなく始まります。珍しいフォントで構築された文書は、文字マップのためにもう1つの小さなファイルを引き出し、そうした文書だけがそれを行います。何も逆方向には移動しません。あなたのPDFはディスクからページに読み込まれ、メモリ内で開かれ、リクエストはそれを外に持ち出しません。
制限がある場所
1つのPDFは25ページです。オーバーサイズフィクスチャは28ページを保持し、実行は最初の25ページを取り、結果カードにその旨を示しました。長い文書でも何かを提供しますが、方法はPDFリーダーでファイルを分割し、残りのページを2回目の実行として送信することです。
パスワード保護されたPDFは拒否されます。パスワードなしでは開けず、このページはパスワードを要求しません。エクストラクターは正確にそれを示し、停止します。すでに使用しているリーダーでファイルを開き、パスワードを削除したコピーを保存し、そのコピーを実行してください。
読み取り順序は静かな制限です。テキストレイヤーは、各文字のランがページ上のどこにあるかを記録し、それが何を意味するかについては何も記録しないため、カラム、サイドバー、脚注は、目が決して取らない順序で戻ってくることがあります。テーブルはグリッドを失い、セルの内容として順番に到着します。ストレートな散文はほぼ常に問題ありません。記入済みのフォームや2カラムのページは、信頼する前に読む価値があります。
スキャン内の手書きはこのエンジンの範囲外です。印刷された文字に基づいて訓練されており、手書きの行はテキストの形をしたノイズとして戻ってきます。印刷と手書きが混在するスキャンは、印刷された部分と書き込みの部分においてナンセンスを提供します。
もう1つ知っておくべき境界:他のソフトウェアによってすでにOCRされたスキャンは、そのソフトウェアの目に見えないテキストレイヤーを持ち、このツールはそれをそのまま読み取ります。結果はファイルに正確であり、必ずしもスキャンされた紙に正確ではありません。
よくある質問
デジタルPDFとスキャンPDFの違いは何ですか?
デジタルPDFはソフトウェアによって生成されたもので、文字そのものを持っています。スキャンPDFはスキャナーやカメラによって生成されたページ画像のスタックで、文字は全く含まれていません。その違いが結果に関するすべてを決定します。デジタルファイルは正確なテキストを提供します。スキャンファイルは認識される必要があり、認識はクリーンスキャンでは非常に良好ですが、曲がったりぼやけたり照明が悪いものではあまり良くありません。通常、PDFリーダーでファイルを開き、マウスでテキストの行を選択しようとすることで、どちらの種類かを判断できます。選択が単語をハイライトする場合、テキストレイヤーがあります。
デジタルPDFの抽出されたテキストは正確ですか?
実際のテキストレイヤーがあるページについては、はい。文字はファイルから読み取られ、画像から認識されるのではないため、OCRは実行されず、誤読されることはありません。読み取り順序は驚くことがある唯一の要素です。テキストレイヤーは各文字のランがどこにあるかを保存しており、それが何を意味するかは保存していないため、カラムやサイドバーのあるページは目の動きと一致しない順序で出力されることがあります。単語自体はファイル内の単語です。テキストレイヤーがないページはOCRを通過し、通常の認識精度を持ちます。
一度に何ページ抽出できますか?
PDFごとに最大25ページです。長いファイルも受け付けられます:最初の25ページが抽出され、結果にどれだけのページが省略されたかの通知が表示されます。この制限は、作業が自分のハードウェア上で実行されるためにあります。長いスキャン文書は、ブラウザタブ内の各ページごとに1回のOCRパスを意味します。残りが必要な場合は、PDFリーダーでファイルを分割し、残りのページを2番目のファイルとして実行してください。
パスワード保護されたPDFからテキストを抽出できますか?
いいえ。暗号化されたPDFはパスワードなしでは開けず、このページはパスワードを要求したり、保護を回避しようとしたりしません。空の結果の代わりに明確なエラーが表示されます。通常使用しているリーダーでファイルを開き、通常の方法で認証し、パスワードを削除したコピーを保存し、そのコピーをここで実行してください。
私のPDFはサーバーにアップロードされますか?
いいえ。ファイルはディスクからページに読み込まれ、ブラウザ内で実行されるPDFリーダーによって開かれます。このサイトには受け取るためのアップロードエンドポイントはありません。これは、実際にこのようなツールに持ち込まれる文書の全体的なポイントです:銀行明細書、給与明細書、税務書類、署名された契約書、およびIDのスキャン。実行中にネットワークタブを監視すると、リーダーとOCRモデルが到着し、あなたの文書と共に何も出て行かないのがわかります。
どの言語を読み取れますか?
OCR側は英語、スペイン語、ルーマニア語、アラビア語、ギリシャ語、トルコ語、インドネシア語、ロシア語、日本語を読み取ります。抽出する前に言語を選択してください。エンジンは選択したモデルに対して形状を一致させるため、間違ったモデルは悪い読み取りをします。すでにテキストレイヤーを持つページは設定を完全に無視します。なぜなら、その文字は書かれたスクリプトに関係なく、そのままファイルから読み取られるからです。
複数のPDFから一度にテキストを抽出できますか?
はい。バッチを選択すると、ファイルは並行ではなく順次処理されます。各結果はファイルが完了するたびに表示されるため、他のファイルがまだ実行中の間に読み始めることができます。ドロップゾーンには単一の実行の制限が表示されます。順次処理はメモリ使用量を予測可能に保つため、特に電話では重要です。
テーブルとレイアウトは保持されますか?
いいえ。出力はプレーンテキストであり、テーブルはグリッドではなくセルの内容として戻され、ヘッダー、脚注、キャプションは何もマークされません。読み取り順序は視覚的なレイアウトと異なる場合もあります。なぜなら、位置がファイルに保存され、意味は保存されないからです。ストレートな散文はほぼ常に正しい順序で出力されます。サイドバー、複数のカラム、または記入済みのフォームのあるページは、信頼する前に出力を読むべきです。
スキャンPDFの手書きを読み取れますか?
いいえ、そして私たちは重要なファイルであなたがそれを発見するよりも、ここでそう言いたいと思います。OCRエンジンは印刷された文字に基づいて訓練されています。手書き、署名、手書きのフォームフィールドはその能力の範囲外であり、それから戻ってくるものはテキストの形をしたノイズです。印刷と手書きが混在するスキャンページは、印刷された部分と書き込みの部分においてナンセンスを提供します。
抽出されたテキストの形式は何ですか?
プレーンテキストです。1つのボタンでクリップボードにコピーするか、ページが分けられラベル付けされた.txtファイルとしてダウンロードできますので、長い文書の中で自分の位置を見つけることができます。ワードプロセッサファイル、検索可能なPDF、フォーマットは持ち越されません。他の場所で単語が必要な場合は、ドキュメント、スプレッドシート、または翻訳者に貼り付けてください。
画像をPDFに変換するにはどうすればよいですか?
それは逆の方向であり、このサイトにはそれ専用のページがあります。JPGからPDFへのコンバーターは、写真やスキャンを受け取り、それらを単一のPDFに書き込みます。ブラウザ内で、何もアップロードされずに行われます。画像があり、文書が必要な場合はそれを使用してください。このページは、文書があり、その中から単語を取り出す必要がある場合に使用します。
PDFからテキストへのコンバーターは本当に無料ですか?
はい、アカウントなし、使用カウンターなしで無料です。サインアップは不要で、テキストにウォーターマークはなく、クレジットもなく、より良いバージョンを制限する有料プランもありません。抽出は自分のハードウェアで実行されるため、ファイルごとのサーバーコストは私たちがあなたに転嫁することはありません。
画像で作業していますか? 画像からテキストを抽出するは、スクリーンショット、スキャン、および文書の写真を読み取ります。逆に行きますか? 画像をPDFに変換するは、JPGからPDFへの変換ツールです。