PDFからアップロードせずにテキストを抽出するにはどうすればよいですか?
デジタルPDFはそのテキストを正確に提供し、スキャンは認識される必要があります。どちらを持っているか、6つの測定されたフィクスチャが何をしたか、25ページの上限、そしてどちらにしても支払うダウンロードについて。
· Updated
2つのファイルはどちらも.pdfで終わることができますが、テキストを抽出するためには全く異なる作業が必要です。1つはワードプロセッサによってPDFに印刷され、すでに文字を保持しています。もう1つはPDFラッパーに包まれた紙の写真です。私たちのPDFからテキストページはブラウザタブでファイルを開き、すべてのページをチェックして、そのページに必要なものを選択します。あなたの文書はディスクを離れません。
2つのエンジンがタブを共有します。pdf.js、MozillaのPDFリーダーは文書を解析し、保存されたテキストまたはページのレンダリングされた画像を渡します。WebAssemblyにコンパイルされたTesseractは、ページが画像であることが判明したときにそれを認識します。両方ともこのドメインから提供され、最初の実行後にキャッシュされます。
なぜ1つのPDFは正確で、もう1つは認識されるのですか?
PDFはコンテナであり、ISO 32000-1仕様はページ上の位置とともにテキストオペレーターを保存する場所を提供します。PDFを生成するソフトウェアは、そこに実際の文字を書き込むため、取り出すのは読み取りです。何も推測されません。それが「正確」という言葉が存在する唯一の場所です。
スキャンには文字が全く含まれていません。各ページを何かが撮影し、その画像がPDFに包まれたため、これらのページはレンダリングされ、1回ずつOCRを通過します。それらはそのエンジンの精度と失敗モードを引き継ぎ、スクリーンショットからテキストを抽出する記事で測定しました。同じエンジン、同じモデルです。
どのようにしてページがスキャンであると判断しますか?
ページごとにカウントします。最初にテキストレイヤーを読み取り、ホワイトスペースでない文字をカウントします。20文字を超えると、そのページは逐語的に取得され、正確とラベル付けされます。20文字以下の場合、そのページはレンダリングされ、OCRに送信されます。デジタルで生まれたページは、そのラインを大きくクリアします:私たちがテストする密なフィクスチャは426文字を保持しています。
そのラインは、まだ余分なテキストオブジェクト、ページ番号、またはヘッダースタンプを保持しているスキャンを捕まえるために存在します。そうでなければ、全ページが返されることになります。これはしきい値であり、テストではないため、エッジがあります。余分なテキストが20文字を超えるスキャンはそのラインをクリアし、あなたはレターヘッドを正確とラベル付けされ、本文は画像の中にロックされたままになります。そのページの要約がそこに表示されます:スキャンされたことがわかっている文書がテキストレイヤーから読み取られたページを報告するのが注目すべきケースです。
スキャンされたページはどの解像度で読み取られますか?
200 DPIです。PDFはページを72分の1インチの単位で測定するため、スケール1でレンダリングすると、本文のテキストは約10ピクセルの高さになり、認識精度が低下する約20ピクセルの下になります。200 DPIでレンダリングすると、そのテキストは約28ピクセルになり、USレターサイズのページは1700x2200になります。これはこのツールが従うスキャンの慣例です。
その背後には第2の上限があります:最長辺4096ピクセル、DPIスケールの後に適用されます。通常のページはそれに近くありません。約20インチを超えるページは、フィットするように縮小され、200 DPI未満で読み取られます。どれだけ超えたかに比例します。プランセットやポスターがそれに該当し、カード上には警告がありません。
測定された実行結果は何を示しましたか?
6つのフィクスチャが2026-08-12にデスクトップハードウェア上でエンジンを通過しました。類似性は出力を文書内に知っていたテキストと比較し、文字ごとに行われます。
| フィクスチャ | 読み取られたページ | 方法 | 類似性 |
|---|---|---|---|
| デジタルPDF | 1 of 1 | テキストレイヤー | 100.0% |
| スキャンされたページ | 1 of 1 | OCR | 100.0% |
| 3ページのデジタルPDF | 3 of 3 | テキストレイヤー | 100.0% |
| 28ページの文書 | 25 of 28 | テキストレイヤー | スコアなし |
| 破損したファイル | なし | 拒否されました | スコアなし |
| パスワード保護されたファイル | なし | 拒否されました | スコアなし |

スキャンされたフィクスチャも100.0%で戻ってきましたが、その行にはアスタリスクが必要です。私たちはこのサイトの独自のJPGからPDFへの変換ツールを通じて画像を押し込むことでそれを構築したため、レンズや歪みのない鮮明なレンダリングタイプです。あなたの銀行のスキャナーはより難しいケースです。25ページの文書を含む4ファイルのバッチは、デスクトップで3.0秒の壁時計を要しました。
信頼度スコアは実際に何を測定していますか?
それはOCRパスを測定し、OCRが実行されたページのみで測定されます。テキストレイヤーページは定義上100の平均に入るため、デジタルページのスタックに埋もれた1つの悪いスキャンを持つファイルでも、快適な数を報告します。混合文書では、その平均がテキストのどれだけが信頼できるかを示します。ページの要約行がOCRの質問に答えます。「3ページ:テキストレイヤーから3ページが正確に読み取られ、OCRを通過したものは0」ということは、何も認識されなかったことを意味します。テキストレイヤーから完全に読み取られたPDFはスコアを持ちません。
ページ26では何が起こりますか?
1つのPDFは25ページを取得します。オーバーサイズのフィクスチャは28ページを保持しており、実行は最初の25ページを読み取り、そのことを示す通知をカードに印刷しました。何も静かに失敗しません。より長いものについては、持っているPDFリーダーで分割し、残りを2回目の実行として送信する必要があります。
2種類のファイルは完全に拒否されます。破損したPDFはpdf.jsの独自の表現で拒否され、「無効なPDF構造」となり、これはリーダーから来るため、すべてのロケールで英語で届きます。このページはパスワード保護されたPDFも拒否し、パスワードを要求しません。すでに使用しているリーダーで保護を解除し、そのコピーを実行してください。
銀行の明細書をこれで実行するのは安全ですか?
それがこのツールが構築されたケースです。給与明細、契約書、IDのスキャンは、人々が最もテキストを抽出したい文書であり、他人の機械に置いておきたくない最後のものです。このコードベースには、受信できるアップロードエンドポイントはありません。実行中にネットワークタブを開いてください:エンジンのチャンクはこのドメインから到着し、あなたの文書を持ち去るものはありません。
大手PDFサービスは逆の方法で動作します。あなたのファイルは最初に彼らの機械に到達し、プライバシーの質問に対する彼らの答えは保持の約束です:コピーは数時間後に削除されます。この文言はこのシリーズの最初の記事で引用しました。それはあなたの給与明細が他の誰かのディスクにどれくらいの時間置かれるかを教えてくれます。そこに到達するかどうかは別の質問です。私たちのプライバシーページには、私たちが収集するものがリストされています。
これは間違ったツールですか?
手書きです。Tesseractプロジェクトはそれを明確に述べています:手書きに向けることができ、うまく機能しません。エンジンは印刷された文字のために構築されているからです。タイプされたラベルと手書きの回答を持つスキャンされたフォームは、ラベルと回答があった場所のノイズを提供します。実行する価値はほとんどありません。
レイアウトももう1つです。テキストレイヤーは各文字のランがどこにあるかを記録し、それが何を意味するかについては何も記録しないため、2列のページや脚注のブロックは、目が決して取らない順序で戻ってくることがあります。テーブルはグリッドを失い、セルの内容が順番に到着します。ストレートな散文はほぼ常に問題ありません。元のレイアウトを持つ再構築された文書は、このページが生成するものではありません。
スキャンされた半分については、Tesseractの品質ノートは私たちのフィクスチャが示したものと一致します:大きくてシャープな文字はより良く読み取られます。紙をスキャンするのではなく撮影している場合、画像抽出ツールとテキストブロックまでのクロップが、最初にその写真をPDFに包むよりも優れています。
なぜデジタルPDFはまだOCRエンジンをダウンロードするのですか?
そのパスはまだ分割されていないからです。PDFの実行は、私たちが提供する6.2.108ビルドで1,262,398バイトのpdf.jsワーカーを引っ張り、約6 MBのOCRエンジンと1つの言語モデルを追加します。そのOCRの半分は、すべてのページがデジタルで生まれ、何も認識する必要がない場合でも読み込まれますので、そのようなファイルではダウンロードが無駄になります。これは既知の制限です。リーダーの残りは怠惰です:文字マップと画像コーデックは、文書がそれらを必要とする場合にのみ到着します。
その後、テキストで何をしますか?
プレーンテキストを取得します。ボタンでコピーするか、ページが分けられラベル付けされた.txtをダウンロードします。ソースがスクリーンショットである場合、画像からテキストツールがそのページです。また、私たちがスコアを付けた6つのスクリーンショットフィクスチャは、書き込みのない写真からOCRが発明した515文字をカバーしています。逆に、JPGからPDFへの変換ツールは画像から文書を構築し、圧縮ツールは重い場合に最初にそれらを減らします。
最悪のPDFで試してみてください。PDFからテキストページにドロップし、テキストを読む前にページ要約行を読んでください。