Cookie の使用について.本サイトでは、基本機能の提供に必要な必須 Cookie を使用しています。さらに、同意いただいた場合に限り、アクセス解析 Cookie を利用して利用状況を把握し、サービス改善に役立てます。詳しくは .
このツールは使いやすかったですか?
フィードバックは改善に役立ちます
スキャンしたPDFに検索・コピー可能なテキストレイヤーを追加します。簡体字・繁体字中国語、英語、日本語に対応し、傾き補正やページ回転も自動で行えます。
ファイルを選択PDFファイルをアップロード
PDF(対応形式: .pdf)
最大 2.5 MB • 最大 5 ファイル
文書で主に使われている言語を選択します。
スキャンページのわずかな傾きを補正します。
文字方向を検出して正しい向きに回転します。
テキスト層があるPDFでもOCRを再実行します。
ファイルをアップロードし、オプションを設定後、「処理開始」をクリックしてください
概要
解決できる課題、処理の仕組み、データの範囲を確認できます。
スキャナーやスマートフォンで作成したPDFは、ページが画像になっているため、文字を選択したり、PDFビューアーでキーワードを検索したりできないことがあります。PDF OCRはページ画像を解析し、元の見た目を保ったまま非表示のテキストレイヤーを追加します。これにより、氏名、番号、契約条項、書名などを検索・コピーでき、スクリーンリーダーで文字を取得しやすくなります。出力形式はPDFのままで、Wordへの変換やレイアウトの自動変更は行いません。
認識言語は「簡体字中国語+英語」「繁体字中国語+英語」「英語」「日本語+英語」の4種類から選べます。本文に合った言語を選ぶと、似た形の文字や句読点の誤認識を抑えられます。自動傾き補正はわずかに傾いたページを修正し、自動回転は文字の向きに合わせて上下逆や横向きのページを調整します。「強制的に再認識」は、誤ったテキストレイヤーがすでに含まれているPDFに適していますが、処理時間が長くなります。
使い方
手順に沿って操作し、例を使って入力と結果を確認します。
すべての言語を選ぶのではなく、まず文書の主な言語を確認してください。簡体字中国語の資料には「簡体字中国語+英語」、繁体字中国語の契約書には「繁体字中国語+英語」、日本語の資料には「日本語+英語」が適しています。スキャンしたページが傾いている場合は傾き補正を有効にし、ページの向きが統一されていない場合は自動回転をオンにします。通常の画像PDFでは強制OCRは不要です。文字を選択できても検索結果が明らかに誤っている場合や、テキストレイヤーが画像とずれている場合にのみ使用してください。
アップロード後は認識が完了するまで待ち、PDFビューアーで文書内にはっきり表示されている単語を検索してください。さらに、数字、日付、句読点を含む文章をコピーして結果を確認します。OCRの精度は、解像度、圧縮、汚れ、手書き文字、縦書き、複雑な表、印影による文字の重なりなどに左右されます。重要な情報は必ず目視で確認してください。
活用例
仕事や日常の流れの中での活用方法を紹介します。
紙の契約書をスキャンしてテキストレイヤーを追加すれば、顧客名や契約条項で検索できます。書籍や講義資料は、文章をコピーしてノート作成に利用できます。請求書、領収書、配送伝票は、OCR処理後に内容を確認しながら入力したり、必要な情報を抽出したりできます。日本語の説明書には「日本語+英語」を選ぶと、カタカナ、漢字、型番をまとめて認識しやすくなります。大量の古い文書を処理する場合は、最初に一部をサンプルとして試し、設定を確認してから一括処理することで、言語選択の誤りによるやり直しを防げます。
OCR PDFは、元のページを検索できるようにするもので、完全に編集可能な文書へ変換する機能ではありません。段落、表、画像の位置を編集する場合はPDFからWordへの変換を、テキストだけが必要な場合はPDFからテキストへの変換をご利用ください。低画質の写真より、鮮明なスキャン画像のほうが高い精度を期待できます。小さな文字も判読でき、十分なコントラストがある状態での取り込みをおすすめします。
Q&A
よくある疑問や迷いやすい点をまとめて確認できます。
画像のぼやけ、傾き、複数フォントの混在、背景ノイズなどは認識精度を低下させます。元のスキャンデータを使用し、傾き補正を有効にしてください。重要な項目は一つずつ目視で確認する必要があります。
元のページ画像を維持する仕組みで、追加されるテキストレイヤーは通常表示されません。ただし、複雑なページは元のファイルと見比べて確認することをおすすめします。
現在の処理は主に印刷文字を対象としており、手書き文字の精度は保証されません。続け字、薄い筆跡、書き直しがある場合は、さらに認識しにくくなります。
OCRではページごとに画像化と文字認識を行うため、ページ数が多いほど、また解像度が高いほど時間がかかります。初回起動時は準備処理により待ち時間が長くなる場合もあります。
初期設定では、既存のテキストを含むページは処理されません。テキストレイヤーに誤りがあることを確認してから強制OCRを有効にしてください。重複したテキストレイヤーが追加されると、コピー結果に影響する場合があります。
注意
利用範囲、結果の制限、必要な注意点を事前に確認します。
OCRの結果だけを、財務、医療、法律、本人確認における唯一の判断材料として使用しないでください。金額、小数点、日付、証明書番号、否定表現は、元の画像と一つずつ照合する必要があります。テキストレイヤーを追加すると検索やコピーはしやすくなりますが、見出し構造、読み上げ順序、代替テキストが自動で完全に設定されるわけではありません。そのため、アクセシビリティ基準を満たす完全な修復とは異なります。
個人情報を含むスキャン文書を処理する場合は、ダウンロードリンクや出力ファイルを共有する範囲を制限してください。認識結果に疑問が生じた際に確認できるよう、処理後も元のスキャンデータを保管することをおすすめします。パスワード付きファイルは、正当な権限のもとで事前に解除する必要があります。ページの大きな破損、欠損、白飛びなどによって元の文字情報が失われている場合、ソフトウェアで復元することはできません。
関連
関連ツール、特集、利用可能なAPIを探せます。