Konwerter PDF na tekst

Dalej: przegląd

Najszybszy sposób, by wydobyć słowa z pliku PDF. To narzędzie odczytuje warstwę tekstową już zapisaną w pliku PDF, strona po stronie, i zwraca zwykły tekst, który możesz skopiować lub zapisać jako plik .txt. Wszystko działa w Twojej przeglądarce, więc dokument nigdy nie jest nigdzie wysyłany. Jedna rzecz na wstępie: narzędzie odczytuje tekst, który już jest w pliku, więc dokument zeskanowany lub sfotografowany (obraz bez warstwy tekstowej) wyjdzie pusty. W takich przypadkach użyj zamiast tego narzędzia OCR.

Jak wyodrębnić tekst z pliku PDF

  1. 1

    Prześlij plik PDF

    Przeciągnij go lub kliknij, aby wybrać. Plik zostaje na Twoim urządzeniu i nigdy nie jest wysyłany na serwer.

  2. 2

    Wyodrębnij tekst

    Narzędzie odczytuje warstwę tekstową każdej strony i łączy je razem, umieszczając znacznik przed każdą stroną.

  3. 3

    Sprawdź wynik

    Wyodrębniony tekst pojawia się w polu, strona po stronie, gotowy do sprawdzenia.

  4. 4

    Skopiuj lub pobierz

    Skopiuj go do schowka lub zapisz jako plik .txt, aby użyć go ponownie gdzie indziej.

Co to narzędzie odczytuje, a czego nie potrafi

Rodzaj pliku PDF Wynik
Wyeksportowany z Worda, Google Docs, przeglądarki lub narzędzia graficznego Pełny tekst, czysty i kompletny
Cyfrowy plik PDF z prawdziwą warstwą tekstową Tekst wyodrębniony strona po stronie
Skan lub zdjęcie zapisane jako PDF (tylko obraz) Pusto lub prawie pusto: nie ma tekstu do odczytu
Plik PDF chroniony hasłem Nie da się odczytać, dopóki go najpierw nie odblokujesz

Tu nie ma OCR: użyj właściwego narzędzia do skanów

Ten ekstraktor nie uruchamia OCR (optycznego rozpoznawania znaków). Kopiuje tekst, który już jest wewnątrz pliku PDF, nie odczytuje pikseli. Jeśli Twój plik to skan i nic nie otrzymujesz, przepuść go najpierw przez narzędzie OCR, które zamienia obraz w prawdziwą warstwę tekstową, a tę możesz potem wyodrębnić.

Jak ułożony jest tekst

Każdą stronę oddziela znacznik --- Page N ---, więc widzisz, gdzie kończy się jedna strona, a zaczyna następna. Tekst jest pobierany w kolejności, w jakiej zapisano go w pliku PDF. Większość dokumentów czyta się naturalnie; kilka z nietypowymi układami wielokolumnowymi może przeplatać kolumny, ponieważ narzędzie trzyma się kolejności zapisanej w pliku PDF, zamiast zgadywać ścieżkę czytania.

Typowe zastosowania

  • Zasilanie modelu AI. Modele językowe przyjmują zwykły tekst, a nie pliki PDF. Wcześniejsze wyodrębnienie sprawia, że wszystko jest szybsze i przewidywalne.
  • Cytowanie i wyszukiwanie. Skopiuj fragment bez walki z zaznaczaniem w przeglądarce PDF.
  • Ponowne wykorzystanie treści. Przenieś tekst do dokumentu, e-maila lub notatki bez przepisywania go od nowa.

Najczęściej zadawane pytania

Nie. Odczytuje osadzoną warstwę tekstową, a skan to po prostu obraz bez warstwy tekstowej, więc wychodzi pusty. Do zeskanowanych lub sfotografowanych dokumentów użyj narzędzia OCR, a potem wyodrębnij tekst.

Nie. Wyodrębnianie odbywa się w całości w Twojej przeglądarce, na Twoim własnym urządzeniu. Plik PDF nigdy nie jest wysyłany na serwer i nic nie jest przechowywane.

Kilka plików PDF, zwłaszcza układy wielokolumnowe, przechowuje tekst w innej kolejności niż go czytasz. Narzędzie trzyma się kolejności zapisanej w pliku PDF, więc kolumny mogą się przeplatać. Dokumenty wyeksportowane z edytorów tekstu prawie zawsze wychodzą poprawnie.

Nie, dopóki są zablokowane. Najpierw usuń hasło narzędziem do odblokowywania PDF, a potem wyodrębnij tekst.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach