Skip to content
Image to Text (OCR)
Tools

Image to Text (OCR)

新着

Extract text from any image, screenshot or photo — free online OCR that runs entirely in your browser, no upload required.

Drop an image here or click to upload JPG, PNG, WebP, GIF, BMP — processed locally, never uploaded

Tips for best results

  • • Use high-resolution images (300 DPI+ for scanned docs, HD screenshots)
  • • Enable "Auto-enhance" for dark backgrounds or low-contrast images
  • • Keep text horizontal — rotated images reduce accuracy
  • • PNG preserves quality better than JPEG for text-heavy images
  • • First use downloads the OCR engine (~4 MB, cached by your browser)

Runs entirely in your browser. Nothing is uploaded.

画像からテキストへの変換(OCR)とは何か、どう役立つのか

画像からテキストへの変換——正式には光学文字認識(OCR)と呼ばれる——は、視覚的なコンテンツ(写真・スキャン・スクリーンショット)と、編集・検索可能なデジタルテキストの橋渡しをする技術です。メニューを撮影したり、書類のスクリーンショットを撮ったり、レシートをスキャンしたりするとき、そのピクセルパターンをコピー・編集・検索・共有できるテキストに変換するのがOCRです。

従来のOCRはABBYY FineReaderAdobe Acrobat Proのような高価なソフトウェアが必要でした。今日では、強力なOCRがWebブラウザ上で直接動作します——ソフトウェアのインストール不要、サブスクリプション不要、画像を外部サーバーにアップロード不要。この無料OCRツールは、GoogleのオープンソースTesseractエンジンのWebAssemblyポートであるTesseract.jsを使用しており、クリーンな印刷テキストで95%以上の精度を実現します。OnlineOCR.neti2OCRなどのアップロードベースの代替品と異なり、ファイルは一切デバイスの外に出ません。

画像からテキストへのコンバーターの使い方

この無料OCRツールの使い方は3ステップです。画像をアップロードゾーンにドラッグ&ドロップするか(クリックしてファイルを選択、またはCtrl+Vでクリップボードから貼り付け)、Tesseractが画像を処理するまで数秒待つと、抽出されたテキストが出力ボックスに表示されます——ワンクリックでコピーできます。

JPG・PNG・WebP・GIF・BMPに対応しています。最良の結果を得るには、コントラストの良い高解像度の画像を使用してください——現代のディスプレイのスクリーンショット(1920×1080以上)は優れた結果を出し、スキャンした書類は300DPI以上が望ましいです。すべての処理はブラウザ内でローカルに行われます:画像はデバイスの外に出ません。初回ロード後、エンジンはキャッシュされ、完全オフラインで動作します。

無料オンラインOCRの一般的な活用例

文書のデジタル化が最も多い用途です:紙の書類・画像のみのPDF・物理的な書籍を検索可能なテキストに変換する。良い照明のもと机の上に平らに置いて撮影した印刷ページのスマートフォン写真でも、クリーンなフォントであれば95%以上の精度が期待できます。手打ちより格段に速く、ほとんどの業務目的に十分です。

スクリーンショットと画面キャプチャこそ、このツールが真価を発揮する場面です——テキスト選択ができないアプリからテキストをコピーする:ロックされたPDF・ゲームのテキスト・エラーメッセージ・動画の字幕。名刺スキャンはカード写真から連絡先情報を抽出して連絡先アプリにインポート。レシートや請求書の処理は経費報告のための合計・日付・業者名の抽出。調査・引用では本や雑誌の抜粋を一字一字打ち直すことなくデジタル化できます。これらすべての用途で、OnlineOCR.netのようなアップロードベースのツールに対するプライバシー上の優位性は決定的です——書類の内容は一切ブラウザの外に出ません。

最高のOCR精度を得るためのヒント

OCR精度に最も影響するのは画像品質です。解像度が最重要:300DPIスキャンのテキストは、72DPIのウェブ画像の同じテキストよりはるかに正確に認識されます。書類を撮影する際は、カメラを真上から(斜めではなく)向け、影なく均一な照明を確保し、鋭くフォーカスします。12メガピクセル以上の最新スマートフォンは、条件が良ければ優秀なOCR用画像を撮影できます。

スクリーンショットには、画面をスマートフォンで撮影するのではなく、OSネイティブのキャプチャツールを使用してください——スマートフォン写真はOCRを劣化させるモアレ干渉パターンが生じます。複雑なレイアウト(複数列・表・背景画像)を処理する場合は、テキスト部分を個別に抽出するとより良い結果が得られます。出力は必ず校正してください——500文字の書類で99%の精度であっても、特に法的・医療・金融の文脈では数か所の誤りが生じる可能性があります。

UtiloKit OCRと他のサービスの比較

OnlineOCR.neti2OCRはアップロードベースのウェブツールです——使いやすいですが画像ファイルがサーバーに送信され、無料枠には制限があります(OnlineOCR.netは無料ユーザーを1時間に15ページに制限)。Adobe Acrobatは優れたOCR品質を提供しますが、月13〜23ドルの有料サブスクリプションが必要です。Google Docs OCRは無料で強力ですが、Googleアカウントが必要でファイルがGoogleのサーバーにアップロードされます。

ABBYY FineReaderは複雑な商業文書OCRのゴールドスタンダードです——表・フォーム・混合レイアウトのスキャンをTesseractより上手く処理しますが、99〜199ドルかかりローカルインストールかクラウドアップロードが必要です。最も一般的なOCR作業(スクリーンショット・スキャンページ・書類写真)においては、UtiloKitのブラウザTesseract OCRはこれらのサービスと精度面で互角であり、さらに誰も提供できないものを提供します:ゼロアップロード・ゼロコスト・完全なプライバシー。画像は完全に自分のデバイスで処理され、どこにも送信されません。

Tesseract.jsを理解する——このツールを支えるエンジン

Tesseractは世界で最も広く使われているオープンソースOCRエンジンで、1980年代にHP Labsで開発され、後にGoogleがオープンソース化して維持管理しています。Tesseract.jsはそのWebAssemblyポートで、ネイティブC++エンジンをコンパイルして、あらゆるモダンブラウザでネイティブに近い速度で動作させます。バージョン4+ではLSTM(長短期記憶)ニューラルネットワークバックエンドが導入され、以前のルールベースのアプローチに比べて精度が大幅に向上しました——特に多様なフォント・劣化したテキスト・ノイズのある書類において顕著です。

WebAssembly経由でブラウザ上でTesseractを実行することで、サーバーインフラ不要でネイティブデスクトップアプリケーションと同等の精度を実現します。初回ロード時にエンジンと言語モデルファイル(約7MB)をダウンロードし、以降のロードはブラウザキャッシュから即座に提供されます。このアーキテクチャこそがこのツールを真にプライベートなものにしています:アップロード先のサーバーが存在しない——すべての計算はブラウザタブ内で行われます。

プライバシー・セキュリティ・機密書類のOCR

機密書類のOCR——契約書・給与明細・医療記録・パスポート写真・財務書類——は、画像がどこに行くかを慎重に考える必要があります。OnlineOCR.neti2OCRAdobe AcrobatのウェブOCRのようなアップロードベースのサービスは、サーバー上で画像を受け取ります。数時間以内にファイルを削除すると主張していても、書類はすでに管理外に出て、インターネットを経由し、自分が制御できないハードウェアで処理されています。

このツールはアーキテクチャ上、あなたの画像を見ることができません——自分のブラウザタブでTesseract.jsを実行する静的ウェブページです。ブラウザの開発者ツール(F12)を開いて、ネットワークタブに移動し、OCRジョブを実行することで確認できます:送信ファイル転送がゼロであることが確認できます。これにより、見知らぬ人にメールで送ることのない書類のOCRに安全に使用できます——機能的に、見知らぬ人は関与していないのです。

Frequently asked questions

OCRとは何ですか?どのように機能しますか?

OCRとは光学文字認識の略で、テキストの画像(タイプ打ち・印刷・手書き)を機械が読めるテキストに変換する技術です。変換後のテキストはコピー・検索・編集が可能です。エンジンはピクセルパターンを分析し、文字に似た領域を既知の文字形状と照合し、パターン認識と言語モデルを使って曖昧さを解消します。このツールを動かすTesseract 4+のような最新の深層学習OCRは、数百万の書類画像で訓練されたLSTMニューラルネットワークを使用し、クリーンな印刷テキストで98%以上の精度を達成します。処理はすべてブラウザ内でローカルに行われ、サーバーはファイルを一切見ません。

このツールは画像をどこかにアップロードしますか?

しません——これはUtiloKitとほぼすべての他のオンラインOCRサービスとの最も重要な違いです。このツールはTesseract.js(Tesseract OCRエンジンのWebAssemblyポート)を使用して完全にブラウザ内で動作します。画像はデバイス上でローカルに処理され、インターネット経由で送信されることは一切ありません。これにより完全にプライベートでGDPR準拠となり、エンジンファイルがキャッシュされた後はオフラインで動作します。

スマートフォン(iPhoneやAndroid)でも使えますか?

はい——OCRツールはiPhoneとiPadのSafari、AndroidのChromeを含む、あらゆるモダンモバイルブラウザで動作します。カメラロールから写真を選択したり、ブラウザのファイルピッカーから直接新しい写真を撮影したりできます。Tesseractエンジンはデバイスのブラウザタブ内で完全に動作します——アップロードもサーバーも不要です。処理速度はデバイスのCPUによりますが、最新のスマートフォンやタブレットは問題なくエンジンを動かせます。

どんな種類の画像が最も良い結果を出しますか?

以下の条件の画像でOCR精度が最も高くなります:高解像度(スキャン書類は300DPI以上、スクリーンショットは2倍ズーム以上)、テキストと背景の高いコントラスト(白い紙に黒いテキストが理想)、ブレやノイズのない鮮明なフォーカス、水平方向の向き、整ったクリーンなフォント。悪い照明・JPEGアーティファクト・小さいテキスト・装飾的なフォント・複雑な背景上のテキストは精度を低下させます。

手書き文字を認識できますか?

Tesseractの手書き認識能力は印刷テキストと比べて限定的です。非常に明確で整った大文字印刷体の手書きはある程度認識できますが、筆記体はたいてい結果が悪くなります。より良い手書きOCRには、Google Cloud Vision APIやMicrosoft Azure Computer Visionのような専用サービスがより正確ですが、インターネット接続が必要でコストが発生する場合があります。このツールは印刷テキスト向けに最適化されています。

OCRはどの言語に対応していますか?

このツールはデフォルトでTesseractの英語言語パックを使用しています。Tesseract自体は100以上の言語をサポートしています——スペイン語・フランス語・ドイツ語・イタリア語・ポルトガル語・中国語(簡体字・繁体字)・日本語・韓国語・アラビア語・ロシア語・ヒンディー語など——それぞれ5〜20MBの異なる学習済みモデルファイルが必要です。多言語サポートは将来のアップデートで追加される可能性があります。現在他の言語でOCRを行うには、Google Docs OCRまたはABBYY FineReaderが良い選択肢です。

低品質な画像でOCR精度を向上させるにはどうすればいいですか?

OCR精度を高めるには:(1) 解像度を上げる——デバイスのアクセシビリティズームを使うか、より高いDPIでスクリーンショットを撮る。(2) コントラストを上げる——任意の画像編集ソフトでコントラストを上げ、明るさを下げてテキストが背景から際立つようにする。(3) グレースケールまたは白黒に変換する。(4) ノイズを除去する——軽くシャープフィルターをかける。(5) 傾きを補正する——テキスト行が水平になるよう画像を回転させる。(6) テキスト領域にタイトにトリミングする。簡単な前処理だけでも精度を70%から95%以上に引き上げることが多いです。