画像文字起こし(OCR)とは?
この画像文字起こしツールは、OCR(光学文字認識)で画像内の印刷文字を読み取り、テキストに変換します。紙の書類やスクリーンショットの文章を手入力する代わりに、画像を選ぶだけで結果をコピーできます。
オープンソースのOCRエンジンTesseractをブラウザ内で動かしているため、画像がサーバーにアップロードされることはありません。初回のみエンジンと言語データ(1言語あたり1〜3MB)をダウンロードし、以降はブラウザに保存されたデータを使います。
使い方
- 画像を選択をクリックして写真やスキャン画像を選ぶか、スクリーンショットをCtrl+Vで貼り付けます。
- 画像内の文字の言語を選びます。実際に含まれる言語だけを選ぶと、速く正確に認識できます。
- 進行バーが100%になると、下の欄にテキストが表示されます。誤認識はその場で直せます。
- テキストをコピーまたは.txtで保存で結果を持ち出します。
認識精度を上げるコツ
- 書類は真正面から明るい場所で撮影しましょう。傾きや影があると精度が大きく下がります。
- 文字の高さが20ピクセル以上あると読み取りやすくなります。小さな文字は拡大してその部分だけを撮影してください(小さい画像は自動で拡大されます)。
- 色付き背景やぼやけた写真ではグレースケール+コントラスト補正をオンのままにしてください。
- 書類に含まれる言語だけを選びましょう。余分な言語を選ぶと、形の似た別の文字に誤認識されることがあります。
- 表・手書き・縦書き・装飾的なフォントは精度が下がります。
言語別のダウンロードサイズ
| 言語 | サイズ |
|---|---|
| OCRエンジン(共通・初回のみ) | 約1.4MB |
| 日本語 | 約2.0MB |
| 英語 | 約3.0MB |
| スペイン語 | 約2.1MB |
| 中国語(繁体字) | 約1.7MB |
| 韓国語・ドイツ語・フランス語・ポルトガル語・イタリア語 | 各0.7〜1.7MB |
ダウンロードしたデータはブラウザに保存されるため、次回からはすぐに認識が始まります。モバイルデータ通信の場合は、初回だけWi-Fiで使うのがおすすめです。
よくある質問
画像はサーバーにアップロードされますか?
いいえ。文字認識はすべてお使いの端末のブラウザ内で行われます。ダウンロードするのはOCRエンジンと言語データだけで、画像や抽出したテキストがどこかに送信されることはありません。
手書き文字も読み取れますか?
丁寧な楷書なら認識できることもありますが、エンジンは印刷文字向けに学習されているため、手書きの精度は低めです。
PDFから文字を抽出できますか?
対応しているのは画像ファイルのみです。スキャンしたPDFは、まずPDF 画像変換でページをJPGに変換してください。PDFに選択できるテキストがある場合は、PDFビューアで直接コピーするほうが正確です。
初回だけ時間がかかるのはなぜですか?
初回はOCRエンジンと言語データのダウンロードが必要なためです。2回目以降は保存済みのデータを使うので、通常は数秒で認識が終わります。非常に大きな写真は時間がかかります。
縦書きの日本語にも対応していますか?
横書き向けに調整されているため、縦書きの認識精度は低くなります。横書きの部分で使うのがおすすめです。