PDFIntact

Extraire les tableaux et le texte d'un PDF, tels quels

スキャンしたPDFの文字がコピーできない

複合機で読み取った資料や、受け取ったPDFの文字を選択しようとしてもできない。 検索しても引っかからない。ドラッグすると文字ではなく四角い範囲が選ばれる——という症状です。

原因は、そのPDFが紙を撮影した画像を貼っただけのファイルだからです。 スキャナは紙の見た目をそのまま画像として保存します。 人間の目には文字に見えますが、ファイルの中では写真と変わりません。 文字のデータが最初から存在しないので、選択もコピーも検索もできません。

取り出すには画像から文字を読み取る処理が要ります。 印字がかすれている、傾いている、解像度が低いといった条件では読み取れない箇所が出ます。 PDFIntact は読み取れなかった箇所を空欄にせず、読み取り不可として明示します。黙って埋めると、間違いに気づけないまま使われるためです。

いま試す

お手元のPDFで確認できます

診断はブラウザの中だけで行います。ファイルはどこにも送信されません。登録も不要です。何ページ・いくつの表や図が取り出せるかを、買う前に確認できます。

実例

まず見分けてください

同じ「PDF」でも、原因によって対処が変わります。次のどれに当てはまるかで判断できます。

文字を選択できない・検索しても出てこない
スキャンPDF(画像)です。このページの対象です。
選択もコピーもできるが、貼り付けると読めない文字になる
画像ではなく、フォントの対応表が欠けている状態です。PDFをコピーすると文字化けする をご覧ください。
文字は取り出せるが、表の行と列がずれる
PDFが表の構造を持っていないためです。PDFの表をExcelに貼り付けるとずれる をご覧ください。

よくある質問

スキャンしたPDFの文字がコピーできないのはなぜですか
スキャンで作られたPDFは、紙を撮影した画像がページに貼られているだけで、文字のデータを持っていないためです。人間の目には文字に見えますが、ファイルの中では写真と同じ扱いなので、選択もコピーもできません。
コピーできるようにするにはどうすればよいですか
画像から文字を読み取る処理(文字認識)が必要です。PDFIntactはページを解析して本文・表・グラフを読み取り、Excel・Word・Markdown・JSONに書き出します。買う前にブラウザの中だけで診断できるので、読み取れるかを先に確認できます。
手書きの文書も読み取れますか
手書きのみで構成された文書は対象外です。印刷された文字が中心の文書をご利用ください。診断の画面で、変換できないものは購入前にお知らせします。
スキャンした資料の表も取り出せますか
取り出せます。罫線と結合セルを再現してExcelに書き出します。ただし印字がかすれている、傾いている、解像度が低いといった条件では読み取れない箇所が出ます。読み取れなかった箇所は空欄にせず、読み取り不可として明示します。
アップロードした資料はどう扱われますか
診断はブラウザの中だけで完結し、原本は送信しません。変換のために送信したPDFは24時間以内に削除します。決済が完了するまでPDF本体をサーバーに置かない設計です。

ほかの症状もまとめて診断する書き出し形式の違い