スクリーンショットからテキストをアップロードせずに抽出するにはどうすればよいですか?
実際にブラウザOCRが読み取るもの:6つのフィクスチャの測定された類似性、テキストのない写真から発明された515文字、および一度支払うモデルダウンロード。
ほとんどのOCRサイトは、スクリーンショットを取得し、サーバーに投稿してそこで読み取ります。これはレストランのメニューの写真には問題ありませんが、給与明細、パスポートのページ、またはプライベートチャットのスクリーンショットには異なる判断が必要です。私たちの画像からテキストツールは、ブラウザタブ内で認識を実行するため、ファイルはディスク上に残り、テキストはその横に表示されます。
エンジンはTesseractで、WebAssemblyにコンパイルされ、ページと共に配信されます。最初の実行では、ワーカースクリプト、WebAssemblyコア、および1つの言語モデルがダウンロードされます。ブラウザはこれら3つをキャッシュします。その後は、取得するものはありません。
私のスクリーンショットはアップロードされますか?
いいえ。このコードベースには、受け取ることができるアップロードエンドポイントはありません。このツールが行う唯一のネットワークトラフィックは同一オリジンで、英語の場合は合計約6 MBの3つのリクエストであり、すべてこのドメインから提供されます。あなたのファイルはページ内でデコードされ、ピクセルとしてエンジンに渡され、そこでテキストに変換されます。実行中にネットワークタブを開くと、モデルのチャンクが到着し、あなたの画像を持ち去るものは何もないことがわかります。私たちのプライバシーページには、収集する唯一のもの、すなわちページビューと匿名のツールカウントが記載されています。
競合他社は逆の方法で動作します。SmallpdfとiLovePDFはどちらも、自分のマシンで認識を行うため、ファイルは何かが起こる前に彼らに到達する必要があります。プライバシーに関する彼らの回答は保持の約束です:コピーはしばらく後に削除されます。私たちは JPGからPDFへの手順で彼らの保持文言を引用しました。保持の約束は、あなたのパスポートスキャンが他の誰かのディスクにどれくらいの期間保存されるかを教えてくれますが、そこに到達するかどうかについては何も言いません。ここではその質問は出てきません。
実際のスクリーンショットでの精度はどのくらいですか?
私たちはそれを測定しました。既知のテキストを持つ6つのフィクスチャが2026-08-11にエンジンを通過し、以下のスコアは出力と私たちが知っていた画像内のテキストとの文字ごとの比較です。フィクスチャは合成されたもので、ブラウザでレンダリングされたHTMLページであり、実際のスクリーンショットとしてキャプチャされ、劣化したものはCSSでぼかされ回転されており、悪い電話キャプチャを模倣しています。
| フィクスチャ | 言語 | 類似性 | 信頼度 |
|---|---|---|---|
| クリーンスクリーンショット | 英語 | 100.0% | 95 |
| 密な段落 | 英語 | 100.0% | 95 |
| シミュレーションされた劣化キャプチャ | 英語 | 92.4% | 65 |
| ロシア語サンプル | ロシア語 | 100.0% | 96 |
| 日本語サンプル | 日本語 | 100.0% | 93 |
| テキストのない写真 | 英語 | 515文字の発明されたテキスト | 32 |

2つの英語のフィクスチャは、文字ごとに100.0%、信頼度95で戻ってきました。同じ段落のぼやけた回転コピーは92.4%で信頼度65でした。これは7.6ポイントの類似性が失われたことを示し、上の数字はそれがどこに行ったかを示しています:最初の単語が乱れ、中間の段落は生き残ります。信頼度65はカード上の低信頼度警告も引き起こすため、コピーする前に警告されます。
画像にテキストがない場合はどうなりますか?
これは他のOCRページがスキップする部分です。私たちはエンジンに、苔むした丸太の上にいる蝶の暗い写真を渡しましたが、そこにはどこにも文字はありませんでした。それは存在しなかった515文字のテキストを返しました。これがOCRエンジンの動作です。文字の形を見つけるために構築されているため、粒子やテクスチャが文字として報告され、パイプラインのどの段階でも画像が空白であると判断されることはありません。
私たちは空の画像を検出できるとは主張していません。なぜなら、それができないからです。すべての結果には信頼度スコアが付随し、平均が60未満に下がると警告が発生します。その写真は32のスコアを持っていました。クリーンスクリーンショットは95のスコアを持っています。これら2つの数字の間の距離が信号であり、テキストに触れる前にカードに印刷されています。
ロシア語と日本語は読めますか?
9つの言語:英語、スペイン語、ルーマニア語、アラビア語、ギリシャ語、トルコ語、インドネシア語、ロシア語、日本語。抽出する前に1つを選んでください。エンジンは選択したモデルに対して形状を一致させるため、間違ったモデルはうまく読み取れません。自動検出はまだありません。両方の非ラテンフィクスチャはクリーンで戻ってきました。ロシア語は100.0%で信頼度96、日本語はスペーシングが正規化された後に100.0%で信頼度93です。エンジンは日本語の文字間にスペースを挿入します。

各言語は別々のモデルファイルで、Tesseractプロジェクトのtessdata_fastであり、他のすべてと同様にこのドメインから提供されます。1つを追加するには、最初に選択するときに約0.6 MBから2 MBのコストがかかり、9つすべてで約11 MBです。ブラウザはそれらを保持するため、言語ごとの一度きりのコストであり、任意の言語での2回目の実行はすぐに開始されます。
いつこれを使用しないべきですか?
手書き。Tesseractプロジェクトは明確に言っています:手書きに向けることができ、うまく機能しません。なぜなら、エンジンは印刷されたテキストのために設計されているからです。シーンで撮影されたテキストはもう一つの弱いケースであり、店の看板や棚のラベルです。あなたの電話の内蔵テキスト選択はそれらをより良く処理し、手書きにトレーニングされたサービスは、あなたの祖母からの手紙で私たちを上回ります。私たちは、実行を行って乱れた段落を渡すよりも、そう言いたいです。
他のすべてについては、Tesseractの品質ノートがフィクスチャで見たものと一致します:大きくて鮮明な文字はより良く読み取られ、明るい背景に暗いテキストは簡単なケースです。ソースをスクリーンショットで取得できる場合はそこから行ってください。できない場合は、均一な光で真っ直ぐに撮影し、フレームをテキストで埋めてください。
画像の後はどうすればよいですか?
出力はプレーンテキストです。ボタンを使用してコピーします。これはブラウザのクリップボードAPIを使用します。画像ごとに.txtをダウンロードするか、全バッチを1つのファイルとして取得します。あなたの画像はそのどれにも影響を受けません。送信する前に小さくする必要がある場合は、コンプレッサーが同じタブでそれを行い、リサイズツールがピクセル寸法を変更します。抽出後にどちらかを行ってください。スクリーンショットを最初に縮小すると、文字が作られているピクセルが失われます。
知っておくべき2つのチェーン。iPhoneからのHEIC写真は、そのままエンジンが見る前にブラウザによってデコードされるため、最初にフォーマット変換ステップを行う必要はありません。そして、長いスクリーンショットから1つのテキストブロックだけを取得したい場合は、最初にクロッパーを通して実行し、出力は要求した部分だけで他のものはありません。このサイトでローカルに実行される他のモデルは、どのピクセルが主題であるかを決定するものです。
持っている最悪のスクリーンショットで試してみてください。画像からテキストツールにドロップし、言語を選択し、テキストの前に信頼度の数字を読み取ってください。
PDFはどうですか?
PDFは、これが適用される前に2つに分かれます。ワードプロセッサやブラウザからエクスポートされたファイルはテキストレイヤーを持っているため、文字はすでにそこにあり、取り出すことは全く認識を必要としません。スキャナーや電話から取得したファイルは、PDFにラップされた画像であり、画像と同じOCRパスが必要です。私たちのPDFからテキストページはすべてのページをチェックし、選択し、どのページが正確に読み取られ、どのページが認識されたかを決定するかは長い説明です。フィクスチャでは、デジタルファイルと3ページのデジタルファイルはどちらもテキストレイヤーから100.0%で戻ってきました。このサイトの独自のJPGからPDFへのコンバーターを使用して構築されたスキャンされたページは、OCRを通じて100.0%で戻ってきました。

ファイルごとのページ数は25ページの上限があります。オーバーサイズのフィクスチャは28ページで、実行は最初の25ページを読み取り、そうであることを示す通知を印刷しました。PDFリーダーでそれより長いものを分割し、残りを2回目の実行として送信してください。開始する前に知っておくべきもう1つのこと:PDFはOCRエンジンとモデルの上に約1.3 MBを引き出し、すべてのページがデジタルで認識が必要ない場合でもそのOCRダウンロードはまだ発生します。
プライバシーの問題は、スクリーンショットよりもここで強くなります。銀行明細書、給与明細、IDのスキャンは、テキストを抽出したい最も一般的な文書であり、他人のサーバーに渡したくない文書です。PDFページは、画像からテキストツールと同じように機能し、ファイルはディスクからタブに読み取られ、どこにも送信されません。ソースがPDFの場合は、各ページをスクリーンショットするのではなく、そこから始めてください。