Bez odesílání

PDF do Wordu

PDF neobsahuje odstavce, jen znaky s pozicí na stránce. Tahle stránka ty pozice čte zpátky a znovu z nich odvodí odstavce, nadpisy a pořadí čtení. Na běžném jednosloupcovém dokumentu to funguje dobře, na čemkoli vysázeném do mřížky špatně. Po každém běhu vám nástroj řekne, který z těch dvou případů jste měli.

  • Bez účtu
  • Bez vodoznaku
  • Bez limitu na soubory
Přetáhněte sem své souborynebo klikněte a vyberte jeŽádný limit na velikost ani počet kromě toho, co unese váš vlastní počítač.There is no upload bar here, because there is no upload. The file is opened by this page, on your machine.

Vaše soubory

Nejlépe dopadnou běžné jednosloupcové dokumenty. Tabulky, stránky o více sloupcích a všechno nakreslené jako schéma celé nepřežijí. Poznámky po běhu řeknou, jak dopadl ten váš.

Do OCR jdou jen stránky, na kterých není vůbec žádný text. Při prvním běhu se stáhne rozpoznávací nástroj a jeden jazykový balík, který vyberete, dohromady asi 3,5 MB. Pak to trvá několik sekund na stránku a vrací se prostý text, bez nadpisů a bez tučného písma. Jen tištěné písmo: rukopis se vrátí jako nesmysl, ať vyberete jakýkoli jazyk.

Ve výchozím stavu vypnuto, takže odstavec rozdělený mezi dvě stránky PDF se spojí zpátky. Zapněte, má-li se soubor Wordu stránkovat stejně jako PDF.

    Zatím není nic vybráno.

    A sample PDF page on the left; on the right, the editable text of the .docx it produced.
    A sample file run through this tool. The file is generated by a script — nothing in it is real.

    Co pro vás tenhle nástroj dělá

    Věci, které stojí za to vědět před začátkem.

    Odstavce, ne řádek jako odstavec

    PDF zaznamenává vytištěné řádky, ne odstavce. Tenhle nástroj řádky spojí zpátky, včetně slov rozdělených spojovníkem na konci řádku, a nový odstavec začne jen tam, kde se skutečně mění řádkování, odsazení, velikost písma nebo jeho tučnost.

    Z nadpisů se stanou nadpisy Wordu

    Text větší než základní se seřadí podle velikosti a přiřadí ke stylům Nadpis 1, 2 a 3, takže navigační podokno se naplní a Reference → Obsah funguje. Tučné a kurzivní písmo pochází z písma, kterým byl každý úsek znaků vykreslen.

    Opakující se záhlaví, zápatí a čísla stránek se vyhazují

    Řádky, které stojí v horním nebo dolním okraji a opakují se na polovině dokumentu, a osamocená čísla stránek se odstraní. Kolik jich bylo odstraněno, se vypíše.

    Hlásí, kde selhal

    Stránky o více sloupcích, řádky připomínající řádky tabulky, obrázky, které nešlo vyříznout, otočený text a stránky úplně bez textu se každý zvlášť spočítají a vysvětlí pod tlačítkem stahování.

    Jak ho použít

    Vyberte jedno nebo více PDF. Pokud je mezi nimi sken, zaškrtněte políčko OCR a ještě před spuštěním vyberte jeho jazyk.

    Stiskněte Spustit. Každá stránka se čte dvakrát, takže dlouhý dokument chvíli trvá.

    Stáhněte si .docx a pak si přečtěte poznámky pod tlačítkem. Je v nich, co nepřežilo.

    Kdy se hodí

    Potřebujete upravit dva odstavce z cizího PDF

    Převzít podmínky dodavatele, jedno ustanovení smlouvy, jednu část zprávy.

    Dostat text ven, aniž byste ho přepisovali

    Nabídka, článek nebo příručka existují jen jako PDF a hlavní text musí skončit někde, kde se s ním dá pracovat.

    Ten soubor nesmí na cizí server

    Smlouvy, lékařské zprávy, výplatní pásky, cokoli pod dohodou o mlčenlivosti. PDF se čte na vašem vlastním počítači a nic se neodesílá.

    Otázky

    Bude soubor Wordu vypadat jako PDF?

    Ne. Text se vrátí v pořadí čtení pomocí vlastních stylů Wordu, na stránku stejné velikosti jako originál a s okraji odvozenými z toho, kde text doopravdy stojí. Místa zalomení řádků, přesná písma, prostrkání, sloupce a všechno nakreslené jako vektorová grafika se nereprodukují.

    Co se stane s tabulkami?

    Jako tabulky Wordu nevyjdou. Když jsou uvnitř řádku široké mezery, ty mezery se změní ve znaky tabulátoru a samotný řádek se stane vlastním odstavcem, takže data jsou celá a ve správném pořadí. Chcete-li zpátky opravdovou tabulku, vyberte ty řádky ve Wordu a použijte Vložení → Tabulka → Převést text na tabulku s tabulátory jako oddělovačem. Ve zprávě je napsáno, kolik řádků takhle vyšlo.

    A co stránky o dvou sloupcích?

    Každý sloupec se čte odshora dolů po řadě a hlásí se to, abyste si to mohli zkontrolovat. Tři sloupce fungují stejně. Rozbije to stránka, kde sloupce začínají a končí v půli, nebo postranní sloupek, který zasahuje do hlavního textu; takové stránky vyjdou promíchané.

    Moje PDF je sken a soubor Wordu je prázdný.

    Naskenovaná stránka v sobě nemá žádné znaky ke čtení. Zaškrtněte „Číst naskenované stránky pomocí OCR“, řekněte, v jakém jazyce váš sken je, a tyhle stránky se místo čtení rozpoznají. Nástroj čte angličtinu, zjednodušenou i tradiční čínštinu, španělštinu, portugalštinu a ruštinu, jeden jazyk naráz, takže špatná volba se vrátí jako nesmysl. Trvá to několik sekund na stránku a vrací se prostý text bez nadpisů a bez tučného písma.

    Jsou tučné písmo a kurziva spolehlivé?

    Pocházejí z písma, kterým byl každý úsek znaků vykreslen, takže sedí vždycky, když dokument použil skutečné tučné nebo kurzivní písmo. Sedět nebudou, když PDF tučné písmo předstíralo tak, že každý obrys nakreslilo dvakrát, a mýlit se mohou u nakloněného obyčejného písma. Podtržení, barva textu a zvýraznění se nepřenášejí.

    Můžu převést několik souborů najednou?

    Ano. Z každého PDF vznikne vlastní .docx. Nad tři soubory přijdou v jednom zipu. PDF nad 2 GB se vůbec nedá otevřít; to je limit prohlížeče.

    Nahrává se můj soubor někam?

    Ne. PDF čte z vašeho disku tahle stránka, soubor Wordu vzniká v této kartě a stahování vychází z vašeho vlastního prohlížeče. Můžete si u toho nechat otevřenou kartu sítě. Čtečka PDF a nástroj OCR se při prvním běhu stáhnou z tohoto webu; váš dokument v tom provozu není.

    Další nástroje