OCR plików PDF
Ta sesja OCR nie jest już dostępna
Wybierz zeskanowany PDF
Tylko PDF · 20 MB · 40 stron
lub upuść tutaj jeden PDF
Użyj tego narzędzia, gdy plik PDF zawiera obrazy zeskanowanych stron zamiast tekstu, który można zaznaczyć. Narzędzie renderuje strony i wykonuje optyczne rozpoznawanie znaków (OCR) w przeglądarce, a następnie wyświetla rozpoznany zwykły tekst do sprawdzenia, skopiowania lub zapisania jako plik .txt. Źródłowy PDF pozostaje na Twoim urządzeniu. Narzędzie nie tworzy przeszukiwalnego PDF-u ani nie zachowuje układu stron, a wynik OCR może zawierać błędy.
Jak wyodrębnić tekst ze zeskanowanego PDF-u
-
1
Wybierz język dokumentu
Wskaż główny język drukowanego tekstu. Od tego wyboru zależy model OCR używany przez przeglądarkę.
-
2
Otwórz PDF
Wybierz PDF o rozmiarze do 20 MB i maksymalnie 40 stronach. Plik źródłowy pozostaje w przeglądarce i nie trafia na nasz serwer.
-
3
Poczekaj na rozpoznanie
Przeglądarka renderuje każdą stronę i odczytuje ją wybranym modelem OCR. Przed rozpoczęciem może być konieczne pobranie plików modelu.
-
4
Sprawdź wynik
Porównaj nazwiska, liczby i ważne fragmenty z oryginalnymi stronami. OCR jest pomocą, a nie wiarygodną transkrypcją do zastosowań krytycznych.
-
5
Skopiuj lub pobierz tekst
Kopiowanie i lokalne pobranie TXT pozostawiają wynik w przeglądarce. Tylko opcjonalne utworzenie strony pobierania wysyła pochodny plik tekstowy do chronionego łącza.
Co otrzymasz
Wynikiem jest zwykły tekst z oznaczeniem przed treścią rozpoznaną na każdej stronie. Narzędzie nie:
- dodaje do PDF-u ukrytej warstwy tekstowej
- odtwarza kolumn, tabel, formularzy ani oryginalnej typografii
- zachowuje wizualnego układu strony
- tłumaczy dokumentu
- sprawdza poprawności rozpoznanego tekstu
Jeśli chcesz zachować zeskanowane strony i dodać za nimi przeszukiwalny tekst, użyj specjalnego programu do przeszukiwalnych PDF-ów lub aplikacji OCR na komputer.
Dokumenty, które sprawdzają się najlepiej
OCR jest przeznaczony do tekstu drukowanego. Prosty i wyraźny skan o czytelnym kontraście jest łatwiejszy do rozpoznania niż rozmazane zdjęcie, wyblakły faks lub uszkodzona strona. Ozdobne kroje pisma, pismo odręczne, zapis matematyczny, ciasno rozmieszczone kolumny i złożone tabele mogą dać słaby albo nieuporządkowany tekst.
Narzędzie przyjmuje PDF-y do 20 MB i 40 stron. Rozpoznawanie odbywa się strona po stronie i może zużywać dużo pamięci, zwłaszcza przy dużych stronach lub wysokiej rozdzielczości. Jeśli w przeglądarce zabraknie pamięci, podziel PDF na mniejsze pliki i przetwórz je osobno.
Obsługiwane języki OCR
Możesz wybrać angielski, hiszpański, francuski, niemiecki, włoski, portugalski, niderlandzki, rosyjski, japoński, chiński uproszczony, koreański lub arabski.
Przed otwarciem pliku wybierz główny język dokumentu. Strona łącząca kilka języków lub systemów pisma może wymagać osobnych przebiegów, a podobne znaki nadal mogą zostać pomylone.
Sprawdź rozpoznany tekst
Przed użyciem wyniku zawsze porównaj go z oryginalnym PDF-em. Zwróć szczególną uwagę na:
- nazwiska, adresy i numery identyfikacyjne
- daty, kwoty, separatory dziesiętne i znaki minus
- instrukcje prawne, medyczne, finansowe i dotyczące bezpieczeństwa
- podziały stron oraz kolejność czytania w dokumentach wielokolumnowych
Nie traktuj wyniku OCR jako urzędowej kopii ważnego dokumentu.
Obsługa pliku i pobieranie
Źródłowy PDF jest odczytywany lokalnie w przeglądarce. Nie trafia do adresu URL lejka ani na nasz serwer. Przeglądarka może pobrać od skonfigurowanego dostawcy biblioteki do renderowania PDF i OCR oraz wybrany model językowy.
Kopiowanie pozostawia rozpoznany tekst w przeglądarce i zapisuje go w schowku. Pobierz TXT lokalnie tworzy i zapisuje plik .txt bez wysyłania. Tylko po wybraniu Utwórz stronę pobierania pochodny TXT jest wysyłany w celu utworzenia chronionego łącza i może być tam przechowywany do 7 dni. Lokalne pobieranie pozostaje dostępne, jeśli opcjonalne wysyłanie się nie powiedzie.
Najczęściej zadawane pytania
Nie. Źródłowy PDF pozostaje w przeglądarce podczas renderowania i rozpoznawania stron. Przeglądarka może pobrać potrzebne biblioteki oraz wybrany model językowy. Lokalne pobranie także nie wysyła tekstu; tylko opcjonalna strona pobierania wysyła pochodny TXT.
Nie. Wynikiem jest zwykły tekst podzielony według stron. Narzędzie nie modyfikuje oryginalnego PDF-u, nie dodaje ukrytej warstwy tekstowej i nie zachowuje układu.
Porównaj go z oryginalnymi stronami. OCR może pomylić znaki, pominąć tekst i zmienić kolejność czytania. Sprawdź każdy szczegół przed wykorzystaniem wyniku w pracy prawnej, medycznej, finansowej, związanej z bezpieczeństwem lub innej pracy krytycznej.
Zostało zaprojektowane do tekstu drukowanego. Pismo odręczne, równania i ozdobne kroje mogą być rozpoznawane niewiarygodnie. Znaki w tabeli mogą zostać odczytane, ale struktura wierszy i kolumn nie zostanie zachowana w zwykłym tekście.
Angielski, hiszpański, francuski, niemiecki, włoski, portugalski, niderlandzki, rosyjski, japoński, chiński uproszczony, koreański i arabski. Wybierz główny język przed otwarciem PDF-u.
PDF może mieć do 20 MB i 40 stron. Duże lub bardzo szczegółowe strony mogą mimo to przekroczyć pamięć dostępną w przeglądarce; wtedy podziel dokument na mniejsze pliki.
Pobierz TXT lokalnie tworzy plik .txt i zapisuje go bezpośrednio na urządzeniu bez wysyłania. Jeśli utworzysz stronę pobierania, tylko ten pochodny TXT zostanie wysłany do chronionego łącza i może być przechowywany do 7 dni.
Powiązane narzędzia
Edytuj PDF
Dodaj tekst, podświetlenia, prostokąty i białe pola do PDF w przeglądarce. Wyeksportuj nowy PDF bez instalowania oprogramowania.
Word na PDF
Konwertuj dokumenty Word .doc i .docx do PDF z zachowaniem układu strony, obrazów, tabel i nagłówków. Bezpieczne przesyłanie, automatyczne usunięcie po 2 godzinach.
Konwerter PDF na PNG
Zamień strony PDF na pliki PNG z ostrym tekstem, obsługą przezroczystości i wybraną wartością DPI. Dobre do dokumentacji i miniatur.
Dodaj widoczny podpis do pliku PDF
Narysuj, wpisz lub prześlij podpis PNG, umieść widoczny znak na jednej stronie PDF i pobierz plik lokalnie. Bez podpisu cyfrowego.
Konwerter Excel do PDF
Konwertuj pliki XLSX, XLS lub CSV w przeglądarce do poziomego PDF A4. Każdy arkusz staje się czytelną stroną tabeli do pobrania.
Konwerter PDF do Word
Konwertuj pliki PDF na w pełni edytowalne dokumenty Word. Zachowuje nagłówki, listy, obrazy i tabele. Zeskanowane PDF-y są automatycznie przetwarzane przez OCR.