アップロードなし

PDF を Word に

PDF に段落はありません。あるのはページ上の位置を持った文字だけです。このページはその位置を読み返して、段落と見出しと読む順序をもう一度割り出します。普通の一段組みの文書ではうまくいき、表組みのように並べられたものではうまくいきません。実行のたびに、どちらだったかをお伝えします。

  • アカウント不要
  • 透かしなし
  • ファイル数の制限なし
ここにファイルをドロップまたはクリックして選択サイズも数も制限なし。上限は自分のパソコンが扱える範囲だけです。There is no upload bar here, because there is no upload. The file is opened by this page, on your machine.

あなたのファイル

普通の一段組みの文書で最もうまくいきます。表、多段組みのページ、図として描かれたものは元のままでは残りません。実行後の注記で、あなたの文書がどうなったかをお伝えします。

OCR に回すのは、文字がまったくないページだけです。初回は認識エンジンと、選んだ 1 つの言語パックを取得します。合わせて約 3.5 MB です。その後は 1 ページに数秒かかり、見出しも太字もない素のテキストが返ります。印刷された文字だけが対象で、手書きはどの言語を選んでも意味のない文字列になります。

既定はオフで、PDF の 2 ページにまたがって切れた段落はつなぎ直します。Word ファイルを PDF と同じところで改ページさせたいときにオンにしてください。

    まだ何も選ばれていません。

    A sample PDF page on the left; on the right, the editable text of the .docx it produced.
    A sample file run through this tool. The file is generated by a script — nothing in it is real.

    このツールができること

    始める前に知っておくとよい点。

    1 行ずつではなく段落として

    PDF が記録しているのは印刷された行であって段落ではありません。このツールは行をつなぎ直します。行末のハイフンで分かれた語も戻します。新しい段落を始めるのは、行間、字下げ、文字の大きさ、太さのどれかが変わったところだけです。

    見出しは Word の見出しになる

    本文より大きい文字は大きさの順に並べ、見出し 1、2、3 に割り当てます。そのためナビゲーションウィンドウが埋まり、参考資料 → 目次が使えます。太字と斜体は、その文字のかたまりを描いたフォントから取ります。

    柱とページ番号は落とす

    上下の余白にあって文書の半分以上で繰り返される行と、数字だけのページ番号は取り除きます。取り除いた数はお知らせします。

    失敗した箇所を報告する

    多段組みのページ、表の行のように見える行、切り出せなかった画像、横倒しの文字、文字がまったくないページを、それぞれ数えてダウンロードボタンの下で説明します。

    使い方

    PDF を 1 つ以上選びます。スキャンが混じっているなら、始める前に OCR にチェックを入れ、その言語を選んでください。

    開始を押します。各ページを 2 回読むので、長い文書は時間がかかります。

    .docx をダウンロードし、ボタンの下の注記を読んでください。何が残らなかったかが書いてあります。

    どんなときに使うか

    他人の PDF の 2 段落だけ直したい

    取引先の条件の流用、契約書の一条項、報告書の一節。

    打ち直さずに文字を取り出す

    PDF でしか存在しない提案書、記事、マニュアル。その本文を、手を入れられる場所へ移したいとき。

    そのファイルを見知らぬサーバーに渡せない

    契約書、診断書、給与明細、秘密保持契約の対象になるもの。PDF はあなた自身のマシンで読み、何も送信しません。

    よくある質問

    Word ファイルは PDF と同じ見た目になりますか。

    なりません。Word 自身のスタイルを使って読む順に文字を並べ直し、ページの大きさは元と同じ、余白は実際に文字がある位置から取ります。改行位置、正確なフォント、字間、段組み、ベクター画像として描かれたものは再現しません。

    表はどうなりますか。

    Word の表としては出てきません。1 行の中に広い空きがある場合、その空きはタブ文字になり、その行が 1 つの段落になります。データはすべて正しい順序で残ります。本物の表に戻すには、Word でその行を選び、挿入 → 表 → 文字列を表にする で区切り文字にタブを指定してください。何行がこの形で出たかは報告に書いてあります。

    2 段組みのページはどうですか。

    各段を順番に上から下へ読み、確認できるように報告します。3 段でも同じです。うまくいかないのは、段がページの途中で始まったり終わったりするページや、本文に重なる囲み記事があるページです。そういうページは順序が入り混じって出てきます。

    PDF がスキャンで、Word ファイルが空です。

    スキャンしたページの中には、読み取れる文字がありません。「スキャンしたページを OCR で読む」にチェックを入れ、スキャンの言語を指定してください。そのページは代わりに文字認識されます。読めるのは英語、簡体字中国語、繁体字中国語、スペイン語、ポルトガル語、ロシア語で、一度に 1 言語だけです。選び間違えると意味のない文字列が返ります。1 ページに数秒かかり、返ってくるのは見出しも太字もない素のテキストです。

    太字と斜体は当てになりますか。

    その文字のかたまりを描いたフォントから取っているので、文書が本物の太字や斜体のフォントを使っていれば正しく出ます。輪郭を二度描いて太字に見せかけた PDF では外れますし、斜めに傾けただけの通常フォントでも外れることがあります。下線、文字色、蛍光ペンは引き継ぎません。

    複数のファイルをまとめて変換できますか。

    できます。PDF ごとに .docx が 1 つできます。3 つを超えると 1 つの zip にまとめて届きます。2 GB を超える PDF はそもそも開けません。これはブラウザーの制限です。

    ファイルはアップロードされますか。

    されません。PDF はこのページがあなたのディスクから読み、Word ファイルはこのタブの中で組み立て、ダウンロードはあなた自身のブラウザーから出てきます。動いている間、ネットワークタブを開いて見ていてかまいません。PDF の読み取り部品と OCR エンジンは初回にこのサイトから取得しますが、あなたの文書はその通信には含まれません。

    ほかのツール