処理範囲と入力データの取り扱い
PDFとページ画像はブラウザ内だけで解析します。Tool本体からPDF・OCR画像・認識結果を外部へ送信・保存しません。
ファイル・PDF・Office
紙面に印刷されたページ番号を読み、PDF上のページ進行との違いから要確認箇所を探します。
ここへPDFをドロップすることもできます。500MB・1,000ページまで。パスワード付きPDFは対象外です。
サンプル時だけ、同一サイト内の4ページPDFを取得します。
代表ページで番号を囲むようにドラッグできます。ドラッグが難しい場合はプリセットを使ってください。交互位置はPDFページ1=A、2=Bを基準にします。
選択領域の拡大
OCRは数字を誤読する場合があります。候補があれば周辺ページの画像とOCR結果を確認してください。紙の誤植、意図した無番号・欠番、スキャン忘れを自動では区別できません。
| PDFページ | OCR番号 | confidence | 手動番号 | 番号なし | 有効番号 | 状態 | 備考 |
|---|
PDFとページ画像はブラウザ内だけで解析します。Tool本体からPDF・OCR画像・認識結果を外部へ送信・保存しません。
信頼できる2つの印刷番号の差と、その間のPDFページ進行を比較します。中間ページのOCRが失敗しただけなら、そのPDFページも進行数に含めるため、ただちに欠落扱いしません。手動で「番号なし」としたページだけ進行数から外します。
対象は1以上のアラビア数字です。ローマ数字、漢数字、章番号などは初版の自動解析対象外です。大きな番号変化はOCR誤読の可能性を優先表示します。ページ抜け候補は確定結果ではありません。
元PDFは変更せず、保存できるのは解析結果CSVだけです。認識結果・手動修正はブラウザを閉じると失われ、永続保存しません。
TOOLPIPO LAB
12条件を現行OCRで実測。読取失敗と実際の欠落、ROI・無番号除外・期待番号の変更前後を記録しました。
検証結果と再現用PDFを見る →