OCR plików PDF

Wybierz zeskanowany PDF

Tylko PDF · 20 MB · 40 stron

lub upuść tutaj jeden PDF

Użyj tego narzędzia, gdy plik PDF zawiera obrazy zeskanowanych stron zamiast tekstu, który można zaznaczyć. Narzędzie renderuje strony i wykonuje optyczne rozpoznawanie znaków (OCR) w przeglądarce, a następnie wyświetla rozpoznany zwykły tekst do sprawdzenia, skopiowania lub zapisania jako plik .txt. Źródłowy PDF pozostaje na Twoim urządzeniu. Narzędzie nie tworzy przeszukiwalnego PDF-u ani nie zachowuje układu stron, a wynik OCR może zawierać błędy.

Jak wyodrębnić tekst ze zeskanowanego PDF-u

  1. 1

    Wybierz język dokumentu

    Wskaż główny język drukowanego tekstu. Od tego wyboru zależy model OCR używany przez przeglądarkę.

  2. 2

    Otwórz PDF

    Wybierz PDF o rozmiarze do 20 MB i maksymalnie 40 stronach. Plik źródłowy pozostaje w przeglądarce i nie trafia na nasz serwer.

  3. 3

    Poczekaj na rozpoznanie

    Przeglądarka renderuje każdą stronę i odczytuje ją wybranym modelem OCR. Przed rozpoczęciem może być konieczne pobranie plików modelu.

  4. 4

    Sprawdź wynik

    Porównaj nazwiska, liczby i ważne fragmenty z oryginalnymi stronami. OCR jest pomocą, a nie wiarygodną transkrypcją do zastosowań krytycznych.

  5. 5

    Skopiuj lub pobierz tekst

    Kopiowanie i lokalne pobranie TXT pozostawiają wynik w przeglądarce. Tylko opcjonalne utworzenie strony pobierania wysyła pochodny plik tekstowy do chronionego łącza.

Co otrzymasz

Wynikiem jest zwykły tekst z oznaczeniem przed treścią rozpoznaną na każdej stronie. Narzędzie nie:

  • dodaje do PDF-u ukrytej warstwy tekstowej
  • odtwarza kolumn, tabel, formularzy ani oryginalnej typografii
  • zachowuje wizualnego układu strony
  • tłumaczy dokumentu
  • sprawdza poprawności rozpoznanego tekstu

Jeśli chcesz zachować zeskanowane strony i dodać za nimi przeszukiwalny tekst, użyj specjalnego programu do przeszukiwalnych PDF-ów lub aplikacji OCR na komputer.

Dokumenty, które sprawdzają się najlepiej

OCR jest przeznaczony do tekstu drukowanego. Prosty i wyraźny skan o czytelnym kontraście jest łatwiejszy do rozpoznania niż rozmazane zdjęcie, wyblakły faks lub uszkodzona strona. Ozdobne kroje pisma, pismo odręczne, zapis matematyczny, ciasno rozmieszczone kolumny i złożone tabele mogą dać słaby albo nieuporządkowany tekst.

Narzędzie przyjmuje PDF-y do 20 MB i 40 stron. Rozpoznawanie odbywa się strona po stronie i może zużywać dużo pamięci, zwłaszcza przy dużych stronach lub wysokiej rozdzielczości. Jeśli w przeglądarce zabraknie pamięci, podziel PDF na mniejsze pliki i przetwórz je osobno.

Obsługiwane języki OCR

Możesz wybrać angielski, hiszpański, francuski, niemiecki, włoski, portugalski, niderlandzki, rosyjski, japoński, chiński uproszczony, koreański lub arabski.

Przed otwarciem pliku wybierz główny język dokumentu. Strona łącząca kilka języków lub systemów pisma może wymagać osobnych przebiegów, a podobne znaki nadal mogą zostać pomylone.

Sprawdź rozpoznany tekst

Przed użyciem wyniku zawsze porównaj go z oryginalnym PDF-em. Zwróć szczególną uwagę na:

  • nazwiska, adresy i numery identyfikacyjne
  • daty, kwoty, separatory dziesiętne i znaki minus
  • instrukcje prawne, medyczne, finansowe i dotyczące bezpieczeństwa
  • podziały stron oraz kolejność czytania w dokumentach wielokolumnowych

Nie traktuj wyniku OCR jako urzędowej kopii ważnego dokumentu.

Obsługa pliku i pobieranie

Źródłowy PDF jest odczytywany lokalnie w przeglądarce. Nie trafia do adresu URL lejka ani na nasz serwer. Przeglądarka może pobrać od skonfigurowanego dostawcy biblioteki do renderowania PDF i OCR oraz wybrany model językowy.

Kopiowanie pozostawia rozpoznany tekst w przeglądarce i zapisuje go w schowku. Pobierz TXT lokalnie tworzy i zapisuje plik .txt bez wysyłania. Tylko po wybraniu Utwórz stronę pobierania pochodny TXT jest wysyłany w celu utworzenia chronionego łącza i może być tam przechowywany do 7 dni. Lokalne pobieranie pozostaje dostępne, jeśli opcjonalne wysyłanie się nie powiedzie.

Najczęściej zadawane pytania

Nie. Źródłowy PDF pozostaje w przeglądarce podczas renderowania i rozpoznawania stron. Przeglądarka może pobrać potrzebne biblioteki oraz wybrany model językowy. Lokalne pobranie także nie wysyła tekstu; tylko opcjonalna strona pobierania wysyła pochodny TXT.

Nie. Wynikiem jest zwykły tekst podzielony według stron. Narzędzie nie modyfikuje oryginalnego PDF-u, nie dodaje ukrytej warstwy tekstowej i nie zachowuje układu.

Porównaj go z oryginalnymi stronami. OCR może pomylić znaki, pominąć tekst i zmienić kolejność czytania. Sprawdź każdy szczegół przed wykorzystaniem wyniku w pracy prawnej, medycznej, finansowej, związanej z bezpieczeństwem lub innej pracy krytycznej.

Zostało zaprojektowane do tekstu drukowanego. Pismo odręczne, równania i ozdobne kroje mogą być rozpoznawane niewiarygodnie. Znaki w tabeli mogą zostać odczytane, ale struktura wierszy i kolumn nie zostanie zachowana w zwykłym tekście.

Angielski, hiszpański, francuski, niemiecki, włoski, portugalski, niderlandzki, rosyjski, japoński, chiński uproszczony, koreański i arabski. Wybierz główny język przed otwarciem PDF-u.

PDF może mieć do 20 MB i 40 stron. Duże lub bardzo szczegółowe strony mogą mimo to przekroczyć pamięć dostępną w przeglądarce; wtedy podziel dokument na mniejsze pliki.

Pobierz TXT lokalnie tworzy plik .txt i zapisuje go bezpośrednio na urządzeniu bez wysyłania. Jeśli utworzysz stronę pobierania, tylko ten pochodny TXT zostanie wysłany do chronionego łącza i może być przechowywany do 7 dni.

Powiązane narzędzia