Konwerter PDF na HTML

Konwertuj na HTML
Dalej

Ten konwerter odczytuje tekst Twojego pliku PDF i umieszcza go w czystym, minimalnym pliku HTML: jedna <section> na stronę, nagłówek strony <h2> i akapity <p>. Działa w całości w Twojej przeglądarce dzięki PDF.js, więc plik nigdy nie jest przesyłany. Wynikiem jest prosty HTML zawierający tylko tekst, który możesz otworzyć, edytować lub wkleić do systemu CMS, a następnie ostylować własnym CSS. Powstał po to, by przenieść tekst z PDF do sieci, a nie by odtworzyć zaprojektowaną stronę.

Jak przekonwertować PDF na HTML

  1. 1

    Wybierz swój PDF

    Przeciągnij tekstowy plik PDF do pola lub kliknij, aby go wyszukać. Wszystko pozostaje w Twojej przeglądarce.

  2. 2

    Przekonwertuj na HTML

    PDF.js odczytuje każdą stronę i wyodrębnia jej tekst, grupując wiersze w akapity.

  3. 3

    Sprawdź kod HTML

    Wygenerowany kod pojawia się w polu podglądu, dzięki czemu możesz sprawdzić wynik.

  4. 4

    Pobierz plik

    Zapisz pojedynczy plik `.html` z jedną sekcją na stronę, gotowy do edycji lub ponownego ostylowania.

Jak wygląda wynik

Konwerter tworzy jeden prawidłowy plik HTML5 o minimalnej strukturze:

Element Skąd pochodzi
Szkielet <!DOCTYPE html> Standardowa otoczka HTML5 z zestawem znaków UTF-8
<title> Nazwa pliku Twojego PDF
<section data-page> Jeden blok na każdą stronę PDF
<h2>Strona N</h2> Nagłówek oznaczający początek każdej strony
<p> Wiersze tekstu pogrupowane w akapity według odstępu w pionie

Czego nie robi

To narzędzie do wyodrębniania tekstu, a nie silnik układu strony. Celowo wynik nie zawiera:

  • Obrazów, logotypów ani rysunków z pliku PDF.
  • Tabel, list wypunktowanych ani numerowanych w postaci <table>/<ul>/<ol> HTML.
  • Pierwotnych czcionek, kolorów, kolumn ani rozmieszczenia.
  • Żadnego CSS ani stylów wpisanych bezpośrednio.

Otrzymujesz słowa w kolejności czytania, ujęte w semantyczne akapity, i nic więcej. Własny CSS dodaj później.

Najlepsze wyniki

  • Użyj tekstowego pliku PDF (takiego, w którym w czytniku można zaznaczyć tekst). Zeskanowane lub czysto obrazowe pliki PDF nie mają warstwy tekstowej; nie ma tu OCR, więc dla takich stron wynik będzie pusty.
  • Przepuść plik przez prettier --parser html lub inny formater, aby uporządkować spacje przed zatwierdzeniem w repozytorium.
  • Przenosisz go do WordPressa? Wklej HTML do bloku kodu/HTML, a nie do edytora wizualnego, który ponownie by go opakował.

To nie jest narzędzie do układu strony

Nie oczekuj, że HTML będzie wyglądać jak PDF. Sieć jest płynna, a strona PDF ma stały układ. Użyj tego narzędzia, gdy chcesz umieścić treść w sieci, a potem ostyluj ją ponownie za pomocą CSS własnej witryny.

Najczęściej zadawane pytania

Nie. Narzędzie wyodrębnia tekst i umieszcza go w prostych akapitach. Czcionki, kolory, kolumny i rozmieszczenie nie są odtwarzane. Ostyluj wynik własnym CSS.

Nie. Wyodrębniany jest tylko tekst. Obrazy, logotypy i rysunki nie są przenoszone do HTML.

Tylko jeśli PDF ma prawdziwą warstwę tekstową. Zeskanowane lub sfotografowane strony to obrazy bez tekstu do zaznaczenia, a tutaj nie ma OCR, więc takie strony nie dają żadnego tekstu.

Nie. Cała konwersja odbywa się w Twojej przeglądarce za pomocą PDF.js. PDF nigdy nie opuszcza Twojego urządzenia, więc jest bezpieczny dla dokumentów poufnych.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach