SimplePDFでPDFをAI向けMarkdownに変換する方法

PDFを言語モデルに渡すとき、たいていは生のテキストの塊をコピー&ペーストすることになります。文書の構造は失われ、トークン数は膨れ上がり、モデルは見出しがどこで終わり表がどこで始まるのかを推測しなければなりません。先にPDFをMarkdownに変換しておけばその構造が保たれ、モデルは平坦な文字列ではなくきれいな文書を読み取れます。
SimplePDFは、どんなPDFの内容もエディター内で直接Markdownとして抽出します。このガイドでは、その方法と、読み手がLLMである場合になぜMarkdownが適した形式なのかを説明します。
#生のテキストではなくMarkdownを使う理由
- 多くの場合、トークンが少なくて済みます。 Markdownはわずかな記号(
#、-、|)で構造を表現し、生のテキストのダンプが保持する空白の多いレイアウトを避けられます。ページあたりのノイズが少なければ、通常はリクエストあたりのトークンも少なくなります。トークンは料金の対象であり、コンテキストウィンドウを埋めるものです。正確な削減量は文書とトークナイザーによって異なります。 - モデルにとって明確な構造。 見出し、リスト、表は、文書がどのように構成されているかをモデルに伝えます。
## 請求合計の後に表が続くのを読むモデルは、ラベルのない数字の塊を解析するモデルよりも手がかりが多く、レイアウトに依存する質問で役立つ傾向があります。 - 移植性が高い。 Markdownは、追加のクリーンアップなしにRAGパイプライン、プロンプト、チャンカー、メモアプリへそのまま取り込めます。
#PDFをMarkdownとして抽出する
- SimplePDFエディターで文書を開きます(ファイルをドラッグするか、デバイスから開きます)
- サイドバーで、Download ボタンの隣にあるメニューを開きます
- コンテンツを抽出 を選びます
- Markdownをモデルに直接貼り付けるには Copy to clipboard を、
.mdファイルとして保存するには Download as file を選びます
抽出には、文書にすでに入力されている値(入力済みのテキスト、チェック済みのボックス、署名マーカー)が含まれます。そのため、Markdownは空のテンプレートではなく、PDFに実際に書かれている内容を反映します。
#すべてブラウザ内で実行されます
抽出はお使いのデバイス上でローカルに行われます。PDFはサーバーにアップロードされません。これは、文書が契約書、医療記録、その他サードパーティのコンバーターに貼り付けたくないものである場合に重要です。文書がマシンから出ることなくMarkdownを得られます。
#ダウンロードした.mdファイルを開く
ダウンロードされるのは正しいMarkdown形式の .md ファイルで、Markdownを扱うあらゆるツールですぐに使えます。macOSではTextEditで開きます。Windowsでは、.md の既定のハンドラーがないため、初回のダブルクリック時にアプリを選ぶよう求められます。好みのエディター(VS Code、Notepad、Obsidian)を一度選べば、Windowsがそれを記憶します。プロンプトにテキストを入れるだけでよい場合は、Copy to clipboard を使ってファイルを省略できます。
これで完了です! あなたのPDFはクリーンなMarkdownになり、より少ないトークンとより良い構造でLLMに渡せる状態になりました。
ご不明な点があれば、お気軽に support@simplepdf.com までお問い合わせください