PDFからマークダウンに変換 ― スキャンしたPDFもきれいなMarkdownに
スキャンしたPDFも含め、PDFからマークダウンに変換するには?
PDFからマークダウンに変換するには、文書の構造(どの行が見出しで、どの行が箇条書きを成し、表の行と列がどこにあるか)を把握し、それをMarkdownの記法で書き出す必要があります。多くのPDF Markdown変換ツールは、ファイル内に保存されたテキストレイヤーを読み取ってこれを行います。デジタルPDFならそれで機能しますが、スキャンしたPDFには各ページの画像しか入っていないため、テキストレイヤーに頼るツールでは空のファイルか、わずかな文字の断片しか得られません。Linnkはページの画像そのものを読み取ります。AIモデル(LinnkはChatGPT、Claude、Geminiのモデルを使用)が各ページを確認して構造化テキストとして再構成し、そこからMarkdownファイルを書き出すため、スキャン、スマートフォンの写真、デジタルPDFのいずれも同じように変換できます。見出し、箇条書き、表が引き継がれ、表はMarkdownの表になります。数値、ID、日付、金額は1桁ずつそのまま書き写し、読み取れない数字は「?」、読めない箇所は [illegible] と示して、推測で埋めることはしません。文書は初期設定で元の言語のままです。同じ処理でプレーンテキストと検索可能なPDFも作成でき、Wordファイルはご希望に応じて作成します。きれいでまっすぐな、明るいページほど通常はきれいに変換されます。薄いスキャンや反ったページは、簡単な確認をおすすめします。
Last updated: 2026年9月
PDFからマークダウンに変換する手順
スキャンでもデジタルでも、PDFから.mdファイルまで3ステップです。
PDFまたは写真をアップロード
スキャンPDFやデジタルPDF、またはページを撮影したJPG・PNG・WEBP・HEICの写真をドロップします。写真は1ページのスキャンとして読み取ります。Markdownはあらかじめ選択されており、出力言語は「元の言語のまま」に設定されています。
プレビューを確認
変換は通常1ページあたり1分未満、一般的なスキャンなら30秒ほどで、処理中は目安の時間が表示されます。認識したテキストのコピーは無料です。「?」や [illegible] は、ページ上で明確に読み取れなかった箇所を示していますので、確認の目安にしてください。
Markdownファイルをダウンロード
.mdファイルのダウンロードには無料アカウントでのログインが必要です。プレーンテキストと検索可能なPDFも同じ処理で作成されます。Wordファイルもご依頼いただけますが、作成には数分余分にかかります。
このPDF Markdown変換ツールでできること
プロンプト、ノート、ドキュメント、Webサイトで再利用するテキストのために。
デジタルPDFだけでなくスキャンも変換
テキストレイヤー型の変換ツールは、PDF内に保存されたテキストを必要とします。スキャンした契約書、コピーした書籍の章、印刷された配布資料の写真にはそれがないため、そうしたツールでは空の結果になります。Linnkはページ画像を読み取るので、スキャンや写真もデジタルファイルと同じように処理できます。
見出し・箇条書き・表を構造として保持
セクションのタイトルはMarkdownの見出しに、箇条書きや番号付きの項目はリストに、表はREADMEやノートに貼り付けられるMarkdownの表になります。構造は、PDFがたまたまテキストを保存していた順序ではなく、ページに見えている内容から再構成します。
数値は推測せず、そのまま書き写す
バージョン番号、日付、金額、IDは1桁ずつそのまま書き写します。薄くて読めない数字は「?」、読めない箇所は [illegible] と示すため、読み手にも後段のモデルにも、もっともらしい推測が紛れ込みません。
LLMやRAGに向いたMarkdown
Markdownはコンパクトで、見出しがチャンク分割の自然な区切りになるため、LLMのプロンプトや検索(RAG)パイプラインの入力としてよく使われます。PDFからマークダウンに変換する作業を一度済ませれば、結果をチャットに貼り付けたり、見出しごとに分割したり、インデックス化したりできます。
元の言語のまま、または翻訳も
初期設定は元の言語のままで、同じ処理で翻訳することもできます。英語の仕様書は英語のまま出力され、アラビア語、ヘブライ語、中国語、韓国語の文書も読み取れるので、引用元と一致するMarkdownが得られます。
1回のアップロードで複数の形式
同じ変換から、プレーンテキストと、実際のテキストとして再構成した検索可能なPDFが得られ、Wordファイルもご希望に応じて作成できます。文書に表があれば、スプレッドシートやCSVファイルも同じ処理から取得できます。
PDFからマークダウンへの変換:基本情報
PDF、スキャン、写真をアップロードする前に知っておきたいこと。
入力
- スキャンしたPDF
- ページ画像から読み取り
- デジタルPDF
- 同じ方法で読み取り
- 写真
- JPG, PNG, WEBP, HEIC, HEIF
- 写真1枚
- 1ページのスキャンとして読み取り
出力
- Markdown(.md)
- 見出し、箇条書き、本文
- 表
- Markdownの表として出力
- プレーンテキスト、検索可能なPDF
- 同じ処理で作成
- Word(DOCX)
- ご希望に応じて作成
精度
- 数値と日付
- 1桁ずつそのまま書き写し
- 読み取れない数字
- 「?」で表示
- 読めない箇所
- [illegible] で表示
- 複数ページにまたがる表
- 結合せず、ページごとに1つの表
利用条件
- プレビュー
- 無料、アカウント不要
- テキストのコピー
- 常に無料
- ダウンロード
- 無料アカウントが必要
- 長い文書
- 有料プラン(linnk.ai/pricing を参照)
PDF Markdown変換の方法を比較
PDFからMarkdownを取り出す一般的な方法と、Linnkを比べました。
| Feature | Linnk PDF→Markdown変換 | オープンソースのPDF→Markdownライブラリ | コピー&ペースト | オンラインPDF変換サービス |
|---|---|---|---|---|
| 導入 | ブラウザでアップロード、インストール不要 | ローカルにインストールして実行。一括処理のスクリプト化が容易 | 不要 | ブラウザでアップロード |
| スキャンPDFと写真 | AIモデルがページ画像から読み取り | OCRモードを備えるものもあるが、結果は設定次第 | スキャンにはコピーできるテキストがない | サービスによる。テキストレイヤーのみ読み取るものが多い |
| 見出しと箇条書き | Markdownの見出しとリストとして再構成 | ライブラリによる | ただの行として貼り付けられる | サービスによる |
| 表 | Markdownの表 | ライブラリによる | たいていはばらばらのテキストとして貼り付けられる | サービスによる |
| 読めない数字・箇所 | 「?」または [illegible] で表示 | ツールによる | 該当なし(保存されたテキストをそのままコピー) | サービスによる |
| ファイルの扱い | アップロード。変換後のファイルは72時間後に削除 | 手元のPCに残る | 手元のPCに残る | サイトによりアップロード、またはブラウザ内で処理 |
| 同じアップロードからのその他の出力 | プレーンテキスト、検索可能なPDF。Wordはご希望に応じて | ライブラリによる | なし | 他の形式に対応する場合もある |
2026年9月時点の比較です。他のツールの機能は製品ごとに異なり、頻繁に変わるため、最新の内容は各ツールでご確認ください。
PDFのマークダウン変換を活用している方々
文書のテキストを、編集・検索でき、他のツールに渡せる形で使いたい方に。
LLM・RAGアプリの開発者
スキャンしたマニュアルやベンダーのPDFを、チャンク分割や埋め込みの前にMarkdownへ変換。仕様表が単語の寄せ集めではなく、行と列のまま届きます。
研究者・学生
論文、書籍の章、コピーした資料をObsidianやLogseq用のMarkdownノートに変換。セクション見出しが残るので、リンクやアウトライン作成にそのまま使えます。
テクニカルライター
古いPDFマニュアルをGitベースのドキュメントリポジトリや、MkDocs、Hugoなどの静的サイトジェネレーターに移し、他のページと同じように編集・レビューできます。
書き手・編集者
昔の記事、原稿、スキャンしたタイプ原稿を、1ページずつ打ち直すことなく、執筆アプリで編集できるMarkdownとして取り戻せます。
社内Wikiを運用するチーム
スキャンした社内規程やサプライヤーのPDFハンドブックをMarkdownとしてNotionや社内Wikiに取り込み、見出しや表を添付ファイルに埋もれさせず、編集できる状態にします。
多言語の資料を扱うアナリスト
中国語、アラビア語、ドイツ語のレポートを元の言語のままMarkdownに変換。引用や数値が原文と一致するので、全文検索やdiffでの版比較に使えます。