PDF / TEXT LAYER · ファイル・PDF・Office

PDF検索・コピー/OCRテキストレイヤーチェッカー

PDFでは文字が見えるのに検索・コピーできない、一部ページだけ文字を選べない。そんなときに、PDF内の文字レイヤーとページ構造から原因の手がかりを確認します。

  • ✓ 登録不要
  • ✓ ブラウザ内処理
  • ✓ Tool入力の外部送信なし

PDFを確認する

PDF · 最大50MB · 500ページ · テキスト項目50万件まで

PDFや抽出文字・画像・結果を外部へ送信しません。OCRの追加・PDF修復はしません。

サンプルで試してみる

文字中心・画像だけ・画像+不可視文字・重複文字の4ページを比較できます。

PDFで文字が見えるのに検索できない理由

ページの見た目と検索・コピー用テキストは別です。画像の中に文字が描かれていても、PDF内に抽出できる文字がない場合があります。図形だけのPDFもあるため、文字・画像がないページを空白とは判断しません。

OCRテキストレイヤーとは

画像の上に検索・選択用文字を重ねる構造です。このToolではraster画像・抽出文字・Text Rendering Mode 3の不可視描画が同じページにある場合をOCRテキストレイヤー候補とします。OCR済みの証明や使用ソフトの特定はしません。画像+普通の文字だけではOCR候補にしません。画像描画の回数は画像ファイルの枚数ではありません。

一部ページだけ検索できない場合

抽出文字のないページをページ範囲で確認できます。抽出文字が存在していても、Unicodeや読み順、viewerの扱いによって検索・コピー結果は異なります。

重複・ページ外・Unicodeの候補

2文字以上の同じ文字列を正規化して比べ、推定矩形のIoU(重なりの割合)が0.80以上のものを1グループにまとめます。同じ文字列でも別位置なら候補にしません。1文字・空白だけは重複検査の対象外です。

ページ外は、2pt相当の余裕を加えた表示領域から矩形の50%以上が外れる場合を候補にします。回転とcropの表示領域を使います。正常な裁ち落とし等もあるため、異常とは断定しません。矩形はフォント情報からの推定で、文字の輪郭そのものではありません。

置換文字・Private Use・Zero-width・方向制御・BOM・制御文字をcode pointで集計します。言語や絵文字で必要な表示補助文字もあるため、候補は意図とコピー結果を確認してください。文字列そのものは表示・出力しません。

このToolで分からないこと

画像の文字をOCRしません。OCRの内容と画像が一致するか、意味・読み順・OCR精度、Acrobat等すべてのviewer挙動、PDF/UAやアクセシビリティ完全性、マルウェア・PDF全体の安全性、修復方法は判定しません。opacity 0・白文字等、透明化のすべての方法も検出しません。clipping mode 4〜7はmode 3と分けます。

PDF.jsの抽出時点で除外されたページ外文字やUnicodeは検出できません。初版はページcontentの文字が対象で、注釈・フォームの表示は対象外です。縦書き・斜め文字・複雑なフォントでは矩形が実際の見た目と異なる場合があります。XFAの完全診断は対象外です。パスワード付きPDFには対応していません。

プライバシーと上限

PDF・抽出テキスト・画像・解析結果はブラウザ内だけで扱います。Tool入力の外部送信なし。結果のコピー・CSVにPDF本文は含めません。永続保存はせず、リセットすると文書とcanvasを解放します。PDF内のJavaScriptは実行せず、リンクへアクセスせず、添付ファイルも開きません。

50MB・500ページ・テキスト項目50万件まで。重複比較は1ページ200万組までで、上限超過は解析を停止します。大きなPDFはページごとに処理し、中止できます。プレビューは選択した1ページだけです。