PDF OCR|スキャンしたPDFを文字認識して、検索できるPDFに
スキャンしたPDFを検索可能にするには?
PDFのOCR化とは、各ページの画像にOCR(光学文字認識)をかけ、文字を検索・選択・コピーできるテキストに変えることです。スキャンしたPDFはページを写した画像にすぎないため、Ctrl+F で検索しても何も見つからず、1行もコピーできません。Linnk の PDF OCR ツールは、AIモデル(Linnk は ChatGPT、Claude、Gemini のモデルを使用しています)で全ページを読み取り、構造化されたテキストとしてページを組み直したうえで、テキストベースの新しいPDFを書き出します。写真、ロゴ、印影、署名はスキャンから切り出し、元の位置に配置し直します。あらかじめはっきりお伝えすると、これは元の画像の上に透明なテキスト層を重ねる方式ではありません。PDFを作り直すため、見た目は原本に近いものの、ピクセル単位で同一にはなりません。色あせたり、汚れたり、傾いたりしたスキャンでは、ぼやけをそのまま引き継がず、くっきりとまっすぐなテキストになるため、かえって良い結果になることが少なくありません。数字、日付、ID は1桁ずつそのまま写し取り、OCRで読めない箇所は推測せずに印を付けます。それでも、薄いページや紙が反ったページには、ざっと目を通していただくことをおすすめします。
Last updated: 2026年9月
スキャンしたPDFをOCR化して検索できるようにする方法
ページの画像から、本物のテキストを持つPDFまで3ステップです。
スキャンをアップロード
スキャンしたPDF、またはページを撮影した JPG、PNG、WEBP、HEIC、HEIF の写真をドロップします。写真は1ページ分のスキャンとして扱われます。出力形式にはあらかじめ「検索可能なPDF」が選ばれており、テキストは元の言語のまま残ります。
OCRが各ページを読み取ります
AIモデルが各ページの画像を読み取り、テキストとして組み直します。通常は1ページあたり1分未満です。処理中は所要時間の目安が分単位で表示され、最初のページはアカウントなしで無料プレビューできます。
検索可能なPDFをダウンロード
無料登録で検索可能なPDFをダウンロードできます。Markdown、プレーンテキスト、レイアウト再現のスプレッドシートも同じ変換から作られ、Word ファイルはご依頼に応じて、数分ほど追加で作成します。
このPDF OCRツールでできること
もともとテキストを持たないスキャン、FAX、スマートフォンの写真のために作られています。
文字の画像ではなく、本物のテキスト
新しいPDFの文字はすべて実際のテキストデータです。Ctrl+F で見つかり、段落を選択してコピーでき、文書管理システムの全文検索の対象にもなります。
写真・印影・署名は元の位置に
ページ上の画像はスキャンから切り出して元の位置に戻すため、署名済みの契約書なら署名が、証明書なら公印が、通常はそのまま残ります。
状態の悪いスキャンも読みやすいテキストに
ページをなぞるのではなく組み直すため、傾いたり、薄かったり、コーヒーの染みがあったりするスキャンも、たいていはまっすぐで読みやすいテキストになります。ひどくぼやけたページは、念のため確認をおすすめします。
数字は1桁ずつそのまま
金額、日付、ID、参照番号は1桁ずつ写し取ります。OCRで判別できない数字は「?」で、読めない箇所は [illegible] で示すため、黙って推測で埋められることはありません。
同じ処理からほかの形式も
1回の変換で、Markdown、プレーンテキスト、1ページ1シートのレイアウト再現スプレッドシートも手に入ります。Word が必要な場合はご依頼に応じて作成し、通常は数分で完了します。
言語はそのまま、翻訳も可能
出力は既定で文書の元の言語のままです。「元の言語のまま」を翻訳に切り替えて言語を選べば、同じ処理で別の言語の検索可能なPDFを受け取れます。
PDF OCRの概要
スキャンをアップロードする前に知っておきたいこと。
入力
- スキャンしたPDF
- 1ページずつ読み取り
- スマートフォンの写真
- JPG, PNG, WEBP, HEIC, HEIF
- デジタルPDF
- こちらも対応
- Word、PowerPoint、Excel
- このツールでは非対応
出力
- 検索可能なPDF
- 本物のテキストとして再構成
- 写真・印影・署名
- 元の位置に配置
- 同じ処理から
- Markdown、テキスト、レイアウト再現スプレッドシート
- Word ファイル
- ご依頼に応じて作成
精度
- 数字・日付
- 1桁ずつそのまま写し取り
- 判別しにくい数字
- 「?」で表示
- 読めない箇所
- [illegible] で表示
- 薄いページ・反ったページ
- 軽い確認をおすすめ
速度と利用条件
- 処理速度の目安
- 通常1ページあたり1分未満
- プレビュー
- 無料・アカウント不要
- ダウンロード
- 無料アカウントで可能
- 長い文書
- 有料プラン
スキャンしたPDFをOCRする方法の比較
検索可能なPDFを作る一般的な方法と Linnk の違いを、ほかの方法のほうが優れている点も含めてまとめました。
| Feature | Linnk PDF OCR | デスクトップ版PDFソフト | 無料のオンラインOCRサイト | スキャナーアプリのOCR |
|---|---|---|---|---|
| PDFにテキストを入れる方法 | ページを本物のテキストとして再構成 | 通常はスキャン画像の下に透明テキスト層 | 通常は透明テキスト層(サイトによる) | テキスト層、または別途テキスト書き出し |
| 変換後のページの見た目 | 原本に近いが、ピクセル単位で同一ではない | 元のスキャン画像をそのまま保持 | 元のスキャン画像をそのまま保持 | 元の写真を保持(トリミングや台形補正されることが多い) |
| 薄い・傾いたスキャン | くっきりまっすぐなテキストになる | 見た目はスキャンのまま | 見た目はスキャンのまま | 写真の傾きを補正するアプリもある |
| 読めない文字 | [illegible] や「?」で表示 | 製品による | サイトによる | アプリによる |
| その他の出力形式 | Word、Markdown、プレーンテキスト、レイアウト再現スプレッドシート | Word などへの書き出しに対応していることが多い | さまざま(Word やテキストが多い) | 通常はPDFまたはテキスト |
| 利用環境 | ブラウザ(インストール不要) | インストール型ソフト(通常は有料) | ブラウザ | スマートフォンアプリ |
2026年9月時点の比較です。機能は製品やプランによって異なります。各カテゴリの一般的な動作を記載しています。
スキャンしたPDFを検索可能にしている方々
入力ではなくスキャンで作られた文書の中から、何かを探し出す必要があるすべての方に。
弁護士・パラリーガル
スキャンした契約書、訴訟書類、証拠書類をOCR化すれば、条項や日付、当事者名を、1ページずつめくらずに検索で見つけられます。
総務・文書管理の担当者
スキャンした書簡、請求書、申込書のフォルダを、共有ドライブや文書管理システムで実際に検索できるPDFに変えられます。
研究者・学生
スキャンした書籍の章、史料、古い学位論文から、打ち直さずに引用をコピーできます。ページの画像もそのまま残ります。
経理・会計の担当者
スキャンした取引明細や領収書から、金額や参照番号を検索できます。数字はページから1桁ずつ写し取られます。
人事・労務の担当者
署名済みの内定通知書や入社手続きの書類を、署名が見える状態のまま、検索可能なPDFとして保管できます。
スマートフォンでスキャンする方
手紙、お知らせ、申込書をスマートフォンで撮影すれば、ただの写真ではなく、検索もコピーもできるPDFが手に入ります。