画像からテキストへ — 無料のオンラインOCR
ブラウザ内で、スクリーンショット、スキャン、文書の写真からテキストを抽出します。無料、サインアップ不要、何もアップロードされません。
私たちに感謝したいですか?友達にLeanImgについて教えてください!
画像からテキストを抽出する方法
画像を選択
ファイルを選択するか、抽出器にドラッグ&ドロップします。JPG、PNG、WebP、GIF、BMP、AVIF、HEICがすべて動作します。
言語を選択して抽出
テキストの言語を選択し、次に抽出をクリックします。言語での最初の実行は、そのモデルをブラウザにダウンロードします。
テキストをコピーまたはダウンロード
結果を読み取り、クリップボードにコピーするか、.txtファイルとして保存します。
なぜLeanImgなのか?
ほとんどのオンラインOCRサイトは、最初に画像をアップロードするように求めます。これはIDカード、給与明細、または署名された契約書に対して受け入れるには奇妙なことです。そして、現代のブラウザは自分自身で認識を行うことができるため、もはや必要ありません。LeanImgは、デバイス上で完全に画像からテキストを抽出するため、何もどこにも送信されません。サインアップ不要、ウォーターマークなし、画像ごとのクレジットも購入する必要がなく、ラテン文字、キリル文字、ギリシャ文字、アラビア文字、日本語のテキストを読み取ります。スクリーンショットとクリーンスキャンが最も得意であり、すべての写真で完璧な精度を約束するのではなく、明確にそう言います。私たちのすべての無料画像ツールを探索して、ブラウザ内で他の作業も行ってください。
あなたのデバイスで実行
画像はこのページ内で読み取られ、認識され、テキストに変換されます。何もアップロードされないため、プライベートな文書はプライベートなままです。
無料で無制限
サインアップ不要、クレジットなし、ウォーターマークなし、有料プランなし。コストなしで好きなだけバッチを実行できます。
複数のスクリプトを読み取る
ラテン文字、キリル文字、ギリシャ文字、アラビア文字、日本語のテキストがすべてサポートされています。言語を選択すると、エンジンが一致するモデルを読み込みます。
数字の見た目
精度の主張は安価なので、ここに測定値があります。このエンジンを通過した6つのフィクスチャがあり、それぞれのテキストは事前に知られています。スコアは、出力とその既知のテキストとの文字ごとの比較です。フィクスチャは合成です。これらはブラウザでレンダリングされたHTMLページであり、実際のスクリーンショットとしてキャプチャされています。劣化した行は、CSSのぼかしと回転の下にある同じテキストであり、悪い電話キャプチャを模倣しています。
| フィクスチャ | 言語 | 類似性 | 信頼度 |
|---|---|---|---|
| クリーンスクリーンショット | 英語 | 100.0% | 95 |
| 密な段落 | 英語 | 100.0% | 95 |
| シミュレートされた劣化キャプチャ | 英語 | 92.4% | 65 |
| ロシア語サンプル | ロシア語 | 100.0% | 96 |
| 日本語サンプル | 日本語 | 100.0% | 93 |
| テキストのない写真 | 英語 | 515文字の発明されたテキスト | 32 |
最後の行は二度読むべきものです。そのフィクスチャは、苔むした丸太の上にいる蝶の暗い写真であり、どこにも文字はありません。エンジンは、そこに存在しなかった515文字のテキストを返しました。OCRエンジンはこれを行います。文字の形を見つけるように構築されているため、粒子やテクスチャが文字として報告され、画像が空白であると判断する段階はパイプラインに存在しません。空の画像を検出することはできないため、そう主張することはありません。すべての結果には信頼度スコアが付随し、平均が60未満に下がると警告が発生します。その写真は32点を獲得し、クリーンスクリーンショットは95点でした。この数字は、テキストを信頼する前に読むべきものです。
初回使用時にダウンロードされるもの
認識はあなたの機械で実行されるため、機械が最初にそこに到達する必要があります。英語でのコールドスタートは3リクエストと約6MBで、これはワーカー、WebAssemblyコア、英語モデルです。これらの3つはすべてこのサイトから提供され、いずれもサードパーティのCDNではありません。ブラウザはそれらをキャッシュするため、その言語での2回目の実行は何も取得することから始まりません。各追加の言語は、そのスクリプトに応じて約0.6MBから2MBの独自のモデルを追加し、9つすべてを合わせると約11MBになります。何も逆方向には移動しません:あなたの画像はページに読み込まれ、メモリ内のエンジンに渡され、リクエストがそれを持ち出すことはありません。
どこで機能し、どこで失敗するか
スクリーンショットとクリーンスキャンは良いケースであり、テーブルはその良さを示しています:3つのフィクスチャが100.0%、文字ごとに戻ってきました。劣化した行は有用なものです。同じテキストに対するぼかしと小さな回転は、類似性を7.6ポイント減少させ、信頼度を95から65に下げました。これは結果カードの警告を引き起こすには十分低いです。これは、ページの急いだ電話写真が行うことに大体相当します。手書きやシーン内のテキスト(例えば、店の看板や棚のラベル)は、このエンジンが構築された範囲外にあり、私たちはどちらについても主張しません。あなたが持っている最大で最も鮮明なコピーを提供してください。スクリーンショットを最初に縮小すると、文字が作られているピクセルが捨てられるため、ファイルを小さくする必要がある場合は、テキストが出た後にコンプレッサーまたはリサイズツールに送ってください。
よくある質問
画像からテキスト抽出はどのように機能しますか?
OCRは光学文字認識を意味します。エンジンは画像内の形状を見つけ、選択した言語のトレーニングされたモデルに対して一致させ、認識した文字を書き出します。これらすべてはこのページ内で行われます。LeanImgは、オープンソースのOCRエンジンであるTesseractを使用しており、WebAssemblyにコンパイルされているため、サーバーではなく自分のハードウェア上で実行されます。
私の画像はサーバーにアップロードされますか?
いいえ。抽出器が行う唯一のリクエストはOCRエンジンと言語モデルのものであり、どちらもこのサイトから提供され、片方向に移動します。画像はディスクからページに読み込まれ、メモリ内のエンジンに渡され、そこでテキストに変換されます。受け取るためのアップロードエンドポイントはコードベースにありません。これは、画像がIDカード、給与明細、または署名された契約書である場合に重要です。実行中にネットワークタブを開くと、モデルファイルが到着し、画像を持ち去るものは何もないことがわかります。
どの画像フォーマットからテキストを抽出できますか?
JPG、PNG、WebP、GIF、BMPはエンジンに直接送られます。AVIFとHEICは、エンジンがそれらを見る前にページ内でデコードされるため、iPhoneからの写真は最初に変換する必要はありません。何が入っても、プレーンテキストが出てきます。
OCRはどの言語をサポートしていますか?
英語、スペイン語、ルーマニア語、アラビア語、ギリシャ語、トルコ語、インドネシア語、ロシア語、日本語です。抽出する前に言語を選択してください。エンジンは選択したモデルに対して形状を一致させるため、間違ったモデルはうまく読み取れません。ピッカーは、あなたがいるページの言語から始まります。ここでは自動言語検出はまだありません。
なぜ最初の実行でモデルがダウンロードされるのですか?
認識があなたのデバイスで行われるため、モデルが最初にそこに到達する必要があります。言語を初めて使用する際、そのデータファイルがブラウザにダウンロードされ、ブラウザがキャッシュし、その後の実行はすぐに始まります。これはプライバシーのためのトレードオフです。ホスティングされたOCRサービスは画像をアップロードし、モデルを自分のマシンに保持します。このサービスはあなたの画像を保持し、代わりにモデルを取得します。まだ使用していない言語に切り替えると、そのモデルもダウンロードされます。
画像からテキスト変換は本当に無料ですか?
はい、アカウントなしで無料で、使用カウンターもありません。サインアップ不要、テキストにウォーターマークなし、クレジットもなく、良いバージョンを妨げる有料プランもありません。作業はあなたのハードウェア上で実行されるため、私たちがあなたに転嫁する画像ごとのサーバーコストはありません。
テキスト抽出の精度はどのくらいですか?
入力によって異なり、その差は大きいです。スクリーンショットやクリーンスキャンは非常に良く読み取られます。なぜなら、文字がシャープで、均等に照らされ、まっすぐに配置されているからです。紙の写真は予測が難しく、ぼやけ、グレア、影、または傾いた角度で悪化します。私たちが扱えないケースもあります:手書きや、店の看板や棚のラベルなどのシーン内のテキスト。このエンジンは印刷された文字用に作られています。他のサイトはすべてのケースで完璧な精度を宣伝していますが、その主張はどのOCRエンジンにも当てはまらないため、信頼する前に出力を確認してください。
一度に処理できる画像の数は?
バッチを選択でき、ドロップゾーンには単一の実行の制限が表示されます。画像は並行してではなく、順番に処理され、各結果は完了次第表示されるため、他の処理が進行中でも読み取りやコピーを開始できます。順次処理は、電話でのメモリ使用量を予測可能に保ちます。
低信頼度警告とは何ですか?
エンジンは読み取る各単語に対する信頼度を報告し、結果カードは画像の平均を表示します。その平均が設定したしきい値を下回ると、クリーンな結果の代わりに警告が表示されます。これはテキストが間違っているという判決ではありません。確認するための信号です。実際には、ぼやけたキャプチャ、低コントラスト、非常に小さなテキスト、間違った言語選択で発生します。
より良いOCR結果を得るにはどうすればよいですか?
エンジンにより大きく、シャープな文字を提供してください。可能な限り、写真を撮るのではなくソースのスクリーンショットを取ってください。カメラを使用する必要がある場合は、角度をつけずに真っ直ぐに撮影し、テキストでフレームを埋め、照明を均等に保ち、グレアや影がページを横切らないようにします。明るい背景に暗いテキストが最もよく読み取られます。抽出する前に正しい言語を選択してください。この選択は、このリストの他の何よりも結果を変えます。
スクリーンショットからテキストを抽出できますか?
はい、スクリーンショットはこのツールの最適なケースです。これはレンダリングされたテキストです:鮮明なエッジ、フラットな背景、レンズや照明の影響がありません。これはまさに印刷されたテキストのOCRエンジンが読み取るために構築されたものです。エラーメッセージ、チャットスレッド、アプリのダイアログ、端末出力のスクリーンショットはすべてうまく処理されます。テーブルレイアウトは再構築されないため、グリッドではなく言葉が得られます。
抽出されたテキストで何ができますか?
クリップボードにコピーするか、.txtファイルとしてダウンロードします。バッチを処理する際には、すべてを単一の.txtとしてダウンロードすることもできます。ここには検索可能なPDF出力はなく、それを暗示するよりも明確に言いたいです:このツールはプレーンテキストを提供し、元のレイアウトで再構築された文書ではありません。スプレッドシート、文書、翻訳者に単語が必要な場合は、そこに貼り付けてください。
さらに質問がありますか? LeanImgについて詳しく学ぶことができます。
ファイルサイズを小さくしたいですか? 画像を圧縮してファイルサイズを減らします。異なるフォーマットが必要ですか? フォーマット間で変換します(JPG、PNG、WebP、AVIFなど)。異なる寸法が必要ですか? 画像をリサイズします。