PDF para Word

Um PDF não contém parágrafos. Ele contém caracteres, cada um com uma posição na página — os parágrafos, os títulos e a ordem de leitura foram jogados fora quando o arquivo foi escrito. Esta página lê essas posições de volta e reconstrói a estrutura: caracteres que compartilham a mesma linha de base viram uma linha, linhas próximas umas das outras viram um parágrafo, texto visivelmente maior vira um título. Isso funciona bem em um documento comum de uma coluna e mal em qualquer coisa diagramada como uma grade. Depois de cada execução ele diz qual dos dois você tinha.

  • Sem envio
  • Sem cadastro
  • Sem marca d'água
  • Sem limite de arquivo
Arraste os seus arquivos para cáou clique para escolherSem limite de tamanho e sem limite de quantidade — só o que o seu próprio computador aguentar.

Seus arquivos

Melhor em documentos comuns de uma coluna. Tabelas, páginas em várias colunas e qualquer coisa desenhada como diagrama não sobrevivem inteiras — as observações depois da execução dizem o que aconteceu com o seu.

Só as páginas sem texto nenhum vão para o OCR. Ele baixa um motor de reconhecimento na primeira vez (cerca de 15 MB), leva vários segundos por página e devolve texto simples — sem títulos, sem negrito.

Desligado por padrão, então um parágrafo dividido entre duas páginas do PDF é juntado de novo. Ligue se o arquivo do Word tiver que paginar igual ao PDF.

    Nada escolhido ainda.

    Para onde vai o seu arquivo

    Para lugar nenhum. Esta página baixa um pequeno programa para o seu navegador, e esse programa lê o arquivo direto do seu disco. O programa vem deste site como qualquer imagem ou folha de estilo — mas o seu arquivo só viaja do seu disco para a sua própria aba.

    Por que esta

    O que você ganha aqui e os grandes conversores não têm como oferecer.

    Parágrafos, e não uma linha cada

    O conversor gratuito de sempre devolve um parágrafo do Word por linha impressa, então cada frase fica picada onde o PDF por acaso quebrou a linha e você não consegue reajustar nada. Este aqui junta as linhas de novo — inclusive palavras partidas com hífen no fim da linha — e só começa um parágrafo novo onde o espaçamento, o recuo, o tamanho da fonte ou o negrito de fato mudam.

    Títulos viram títulos do Word

    O texto maior que o corpo é ordenado por tamanho e mapeado para Título 1, 2 e 3, então o painel de navegação se preenche e Inserir → Sumário funciona. Negrito e itálico vêm da fonte com que cada trecho de caracteres foi desenhado, e não de um palpite pelo desenho das letras.

    Cabeçalhos repetidos e números de página são descartados

    A mesma linha no topo de quarenta páginas não são quarenta parágrafos de conteúdo. Linhas que ficam na margem de cima ou de baixo e se repetem em metade do documento, e números de página soltos, são removidos — e a quantidade removida é informada, para você ver se ele levou algo que não devia.

    Ele avisa onde falhou

    Páginas em várias colunas, linhas parecidas com tabela, imagens que ele não conseguiu recortar, texto deitado e páginas sem texto nenhum são contados e explicados embaixo do botão de download. Você julga se o resultado está bom o bastante antes de mandar para alguém.

    Como usar

    Escolha um ou mais PDFs. Se algum for escaneado, marque a caixa de OCR antes de começar.

    Clique em Iniciar. Cada página é lida duas vezes — uma pelo texto, outra para descobrir o layout — então um documento longo demora.

    Baixe o .docx e depois leia as observações embaixo do botão. Elas dizem o que não sobreviveu.

    Quando as pessoas usam

    Você precisa editar dois parágrafos do PDF de outra pessoa

    Reaproveitar as condições de um fornecedor, uma cláusula de um contrato, uma seção de um relatório. Você quer texto que dá para mudar, não a foto de uma página.

    Tirar as palavras de lá sem redigitar

    Uma proposta, um artigo ou um manual que só existe em PDF, e o texto do corpo precisa ir parar em algum lugar onde dê para trabalhar nele.

    O arquivo não pode ir para o servidor de um estranho

    Contratos, laudos médicos, holerites, qualquer coisa sob NDA. Todos os outros conversores querem o arquivo enviado antes de fazer o que quer que seja.

    Perguntas

    O arquivo do Word vai ficar igual ao PDF?

    Não, e nem é essa a intenção. Isto não copia layout. Ele recoloca o texto na ordem de leitura usando os estilos do próprio Word, em uma página do mesmo tamanho da original e com as margens tiradas de onde o texto de fato está. Quebras de linha, fontes exatas, espaçamento entre letras, colunas e tudo que foi desenhado como arte vetorial não são reproduzidos. Se você precisa de algo idêntico, o que você precisa é do PDF.

    O que acontece com as tabelas?

    Elas não saem como tabelas do Word. Um PDF não registra uma tabela — só células de texto que por acaso estão alinhadas. Quando uma linha tem espaços largos dentro dela, esses espaços viram tabulações e a linha vira um parágrafo próprio, então os dados estão todos lá e na ordem certa. Para ter uma tabela de verdade de volta, selecione essas linhas no Word e use Inserir → Tabela → Converter Texto em Tabela, com Tabulações como separador. O relatório diz quantas linhas saíram assim.

    E as páginas de duas colunas?

    Elas são encontradas procurando uma faixa vertical descendo a página que nenhuma linha atravessa, e então cada coluna é lida de cima para baixo, uma de cada vez — que é a ordem de leitura correta, e isso é informado para você conferir. Três colunas funcionam do mesmo jeito. O que quebra é uma página em que as colunas começam e terminam no meio dela, ou uma barra lateral que invade o texto principal; essas saem intercaladas e você percebe na hora.

    Meu PDF é um escaneamento e o arquivo do Word veio vazio.

    Uma página escaneada é uma fotografia de papel. Não há caracteres nela para ler, então não há nada para converter. Marque “Ler páginas escaneadas com OCR” e essas páginas passam a ser reconhecidas — mas o OCR daqui só tem inglês, leva vários segundos por página, e o que volta é texto simples, sem títulos e sem negrito. Se o seu escaneamento não estiver em inglês, esta ferramenta não tem como ajudar, e nenhum ajuste muda isso.

    Negrito e itálico são confiáveis?

    Eles vêm da fonte com que cada trecho de caracteres foi desenhado, então acertam sempre que o documento usou uma fonte negrito ou itálico de verdade — que é a maior parte das vezes. Erram quando um PDF fingiu negrito desenhando cada contorno duas vezes, e podem errar com uma fonte comum inclinada. Sublinhado, cor do texto e realce não são levados de jeito nenhum.

    Dá para converter vários arquivos de uma vez?

    Dá. Cada PDF vira o seu próprio .docx. Acima de três arquivos eles chegam em um único zip, porque os navegadores bloqueiam uma sequência de downloads em seguida e você perderia alguns sem perceber. Um PDF acima de 2 GB não abre de jeito nenhum — um navegador não consegue ler um arquivo desse tamanho de uma vez só, e esse limite é do navegador, não nosso.

    Meu arquivo é enviado?

    Não. O PDF é lido do seu disco por esta página, o arquivo do Word é montado nesta aba, e o download sai do seu próprio navegador. Você pode ficar de olho na aba de rede enquanto ele roda. O leitor de PDF e o motor de OCR são baixados deste site na primeira vez, como qualquer script — o seu documento não faz parte disso.

    Outras ferramentas