SimplePDFでPDFをAI向けMarkdownに変換する方法

Profile picture of Benjamin André-Micolon
Benjamin André-Micolon

PDFを言語モデルに渡すとき、たいていは生のテキストの塊をコピー&ペーストすることになります。文書の構造は失われ、トークン数は膨れ上がり、モデルは見出しがどこで終わり表がどこで始まるのかを推測しなければなりません。先にPDFをMarkdownに変換しておけばその構造が保たれ、モデルは平坦な文字列ではなくきれいな文書を読み取れます。

SimplePDFは、どんなPDFの内容もエディター内で直接Markdownとして抽出します。このガイドでは、その方法と、読み手がLLMである場合になぜMarkdownが適した形式なのかを説明します。

PDF文書が、見出し、リスト、コードブロックを備えたクリーンで構造化されたMarkdownに変換される様子

#生のテキストではなくMarkdownを使う理由

  • 多くの場合、トークンが少なくて済みます。 Markdownはわずかな記号(#-|)で構造を表現し、生のテキストのダンプが保持する空白の多いレイアウトを避けられます。ページあたりのノイズが少なければ、通常はリクエストあたりのトークンも少なくなります。トークンは料金の対象であり、コンテキストウィンドウを埋めるものです。正確な削減量は文書とトークナイザーによって異なります。
  • モデルにとって明確な構造。 見出し、リスト、表は、文書がどのように構成されているかをモデルに伝えます。## 請求合計 の後に表が続くのを読むモデルは、ラベルのない数字の塊を解析するモデルよりも手がかりが多く、レイアウトに依存する質問で役立つ傾向があります。
  • 移植性が高い。 Markdownは、追加のクリーンアップなしにRAGパイプライン、プロンプト、チャンカー、メモアプリへそのまま取り込めます。

#PDFをMarkdownとして抽出する

  1. SimplePDFエディターで文書を開きます(ファイルをドラッグするか、デバイスから開きます)
  2. サイドバーで、Download ボタンの隣にあるメニューを開きます
  3. コンテンツを抽出 を選びます
  4. Markdownをモデルに直接貼り付けるには Copy to clipboard を、.md ファイルとして保存するには Download as file を選びます

抽出には、文書にすでに入力されている値(入力済みのテキスト、チェック済みのボックス、署名マーカー)が含まれます。そのため、Markdownは空のテンプレートではなく、PDFに実際に書かれている内容を反映します。

#すべてブラウザ内で実行されます

抽出はお使いのデバイス上でローカルに行われます。PDFはサーバーにアップロードされません。これは、文書が契約書、医療記録、その他サードパーティのコンバーターに貼り付けたくないものである場合に重要です。文書がマシンから出ることなくMarkdownを得られます。

#ダウンロードした.mdファイルを開く

ダウンロードされるのは正しいMarkdown形式の .md ファイルで、Markdownを扱うあらゆるツールですぐに使えます。macOSではTextEditで開きます。Windowsでは、.md の既定のハンドラーがないため、初回のダブルクリック時にアプリを選ぶよう求められます。好みのエディター(VS Code、Notepad、Obsidian)を一度選べば、Windowsがそれを記憶します。プロンプトにテキストを入れるだけでよい場合は、Copy to clipboard を使ってファイルを省略できます。

これで完了です! あなたのPDFはクリーンなMarkdownになり、より少ないトークンとより良い構造でLLMに渡せる状態になりました。

ご不明な点があれば、お気軽に support@simplepdf.com までお問い合わせください

SimplePDFとは?

SimplePDFエディターはカスタマイズできますか?

SimplePDFはHIPAAに準拠していますか?

SimplePDFが最も役立つ業界は?

SimplePDFは自分に合っていますか?

始める準備はできましたか?

無駄なし。透かしなし(必要な場合を除く)。ただ賢く、安全で、スケーラブルなツールでPDFをプロのように扱います。

無料トライアルを始める