PDF в Word
В PDF нет абзацев. В нём есть символы, у каждого своё место на странице. Эта страница читает координаты обратно и заново выводит абзацы, заголовки и порядок чтения. На обычном одноколоночном документе это работает хорошо, на всём, что свёрстано сеткой, плохо. После каждого запуска он говорит, что из двух было у вас.
- Без регистрации
- Без водяных знаков
- Без ограничений на файлы
Ваши файлы
Лучше всего выходит на обычных одноколоночных документах. Таблицы, страницы в несколько колонок и всё, что нарисовано как схема, целыми не уцелеют. Примечания после запуска расскажут, что случилось с вашим файлом.
В OCR попадают только страницы, где текста нет совсем. При первом запуске скачивается движок распознавания и один выбранный вами языковой пакет (вместе около 3,5 МБ), уходит по несколько секунд на страницу, а возвращается простой текст без заголовков и без полужирного. Читается только печатный текст: почерк вернётся бессмыслицей, какой язык ни выбери.
По умолчанию выключено, поэтому абзац, разрезанный между двумя страницами PDF, склеивается обратно. Включите, если файл Word должен разбиваться на страницы так же, как PDF.
Пока ничего не выбрано.

Что этот инструмент делает для вас
Что стоит знать перед началом.
Абзацы, а не по строке на абзац
PDF хранит напечатанные строки, а не абзацы. Здесь строки склеиваются обратно, включая слова, разорванные переносом, и новый абзац начинается только там, где действительно меняется межстрочный интервал, отступ, кегль или насыщенность.
Заголовки становятся заголовками Word
Текст крупнее основного ранжируется по размеру и раскладывается по стилям «Заголовок 1», «Заголовок 2» и «Заголовок 3», поэтому область навигации заполняется, а Ссылки → Оглавление срабатывает. Полужирный и курсив берутся из шрифта, которым нарисован каждый отрезок символов.
Колонтитулы и номера страниц выбрасываются
Строки, которые стоят в верхнем или нижнем поле и повторяются на половине документа, и одиночные номера страниц удаляются, а число удалённых выводится.
Он сообщает, где не справился
Страницы в несколько колонок, строки, похожие на строки таблицы, картинки, которые не удалось вырезать, повёрнутый текст и страницы совсем без текста подсчитываются и объясняются под кнопкой скачивания.
Как пользоваться
Выберите один или несколько PDF. Если среди них есть сканы, поставьте галочку OCR и выберите их язык до запуска.
Нажмите «Начать». Каждая страница читается дважды, поэтому длинный документ идёт долго.
Скачайте .docx, потом прочитайте примечания под кнопкой. Там написано, что не уцелело.
Когда это нужно
Нужно поправить два абзаца в чужом PDF
Взять условия поставщика, пункт договора, раздел отчёта.
Достать текст, не набирая его заново
Коммерческое предложение, статья или инструкция существуют только в PDF, а основной текст должен оказаться там, где с ним можно работать.
Файл нельзя отдавать на чужой сервер
Договоры, медицинские заключения, расчётные листки, всё под соглашением о неразглашении. PDF читается на вашей собственной машине, и ничего не отправляется.
Вопросы
Будет ли файл Word выглядеть как PDF?
Нет. Он ставит текст обратно в порядке чтения собственными стилями Word, на странице того же размера, что и оригинал, с полями, взятыми оттуда, где текст стоит на самом деле. Переносы строк, точные шрифты, межбуквенный интервал, колонки и всё, что нарисовано векторной графикой, не воспроизводятся.
Что происходит с таблицами?
Таблицами Word они не выходят. Когда внутри строки есть широкие абонементи, эти абонементи становятся знаками табуляции, а сама строка отдельным абзацем, так что данные все на месте и в правильном порядке. Чтобы вернуть настоящую таблицу, выделите эти строки в Word и выберите Вставка → Таблица → Преобразовать в таблицу, указав знак табуляции как разделитель. В отчёте написано, сколько строк вышло таким образом.
А страницы в две колонки?
Каждую колонку читают сверху вниз по очереди, и об этом сообщается, чтобы вы могли проверить. Три колонки работают так же. Ломается это на странице, где колонки начинаются и заканчиваются на середине, или где боковая врезка наезжает на основной текст: такое выходит вперемешку.
Мой PDF отсканирован, а файл Word пустой.
В отсканированной странице нет символов, которые можно прочитать. Поставьте галочку «Читать отсканированные страницы через OCR», укажите язык вашего скана, и такие страницы будут распознаны. Движок читает английский, китайский упрощённый и традиционный, испанский, португальский и русский, по одному языку за раз, так что при неверном выборе вернётся бессмыслица. Уходит по несколько секунд на страницу, а возвращается простой текст без заголовков и без полужирного.
Насколько надёжны полужирный и курсив?
Они берутся из шрифта, которым нарисован каждый отрезок символов, поэтому они верны всегда, когда в документе использован настоящий полужирный или курсивный шрифт. Они врут, когда PDF подделал полужирный, обведя каждый контур дважды, и могут соврать на наклонённом обычном шрифте. Подчёркивание, цвет текста и выделение маркером не переносятся.
Можно конвертировать несколько файлов сразу?
Да. Каждый PDF становится своим .docx. Больше трёх файлов приходят одним zip-архивом. PDF больше 2 ГБ не открыть вовсе: это предел браузера.
Мой файл куда-нибудь отправляется?
Нет. PDF читается с вашего диска этой страницей, файл Word собирается в этой же вкладке, а скачивание выходит из вашего собственного браузера. Можете смотреть на вкладку сети, пока он работает. Читалка PDF и движок OCR скачиваются с этого сайта при первом запуске; вашего документа в этом нет.
Другие инструменты
Сжать изображение
Уменьшить фотографии, не отправляя их на сервер
Сжать PDF
Уменьшить PDF, не отправляя его на сервер
Сжатие видео
Уменьшить размер видеофайла
Обрезать видео
Растяните рамку поверх картинки и оставьте только её содержимое
Видео в GIF
Превратите кусок видео в анимированный GIF
Объединить PDF
Соединить несколько PDF в один
Разделить PDF
Вытащить страницы из PDF
PDF в JPG
Каждая страница PDF становится изображением
Обрезка аудио
Обрезать аудиофайл
Обрезка видео
Обрезать видео без перекодирования
Обрезать изображение
Растяните рамку поверх, а если надо — сначала поверните
Объединить изображения
Несколько картинок в одном файле
HEIC в JPG
Перевести фотографии с iPhone в JPG
JPG в PDF
Собрать изображения JPG и PNG в один PDF
Видео в MP3
Вытащить звук из видео
Word в PDF
Превратите .docx в PDF: целиком или по одному файлу на страницу
Markdown в Word
Превратите файл .md в .docx
Markdown в PowerPoint
Превратите план в Markdown в слайды
Изображение в текст
Распознать текст на картинке
Разделить листы Excel
Один лист — один файл
Разделить строки Excel
Одна строка — один файл