Kreator przeszukiwalnego PDF

Wybierz zeskanowany plik PDF

Tylko PDF · 10 MB

Tylko PDF, do 10 MB i 10 stron

Zeskanowany PDF to tak naprawdę tylko stos obrazów w kontenerze PDF, więc nie da się w nim zaznaczyć, skopiować ani wyszukać tekstu. To narzędzie przeprowadza optyczne rozpoznawanie znaków (OCR) na każdej stronie w Twojej przeglądarce i osadza wynik jako niewidoczną warstwę tekstową dopasowaną do oryginalnej strony. Wygląd strony zostaje zachowany, a Ctrl+F i zaznaczanie tekstu mogą korzystać z rozpoznanych słów. Rozpoznawanie może popełniać błędy, a wynik nie jest otagowanym, dostępnym plikiem PDF, dlatego porównaj ważny tekst ze skanem.

Jak wykonać OCR zeskanowanego PDF

  1. 1

    Prześlij skan

    Przeciągnij zeskanowany PDF (umowy, faktury, zarchiwizowane raporty). Tekst drukowany działa najlepiej; pismo odręczne nie.

  2. 2

    Wybierz język

    Wybierz język dokumentu (angielski, hiszpański, francuski, niemiecki, włoski, portugalski lub niderlandzki), aby silnik OCR wczytał właściwy model znaków.

  3. 3

    Uruchom rozpoznawanie

    Każda strona jest renderowana w wysokiej rozdzielczości w Twojej przeglądarce i przekazywana do silnika OCR. Długie dokumenty mogą zająć kilka minut.

  4. 4

    Osadzenie warstwy tekstowej

    Rozpoznane słowa są umieszczane jako niewidoczna warstwa dopasowana do oryginalnej strony, więc każda strona wygląda bez zmian.

  5. 5

    Pobierz nowy PDF

    Otrzymasz PDF, który zachowuje oryginalne skany i jest teraz przeszukiwalny w każdym nowoczesnym czytniku.

Kiedy OCR działa dobrze (a kiedy nie)

Jakość OCR zależy od skanu. Zawsze porównuj ważne nazwy, liczby i sformułowania prawne z oryginalną stroną.

Dane wejściowe Czego się spodziewać
Czysty skan drukowanego tekstu Często daje dobre wyniki; sprawdź ważny tekst.
Zdjęcie drukowanej strony Wynik zależy od ostrości, oświetlenia i kąta strony.
Stara książka lub wyblakły druk z maszyny Dokładnie sprawdź rozpoznany tekst.
Pismo odręczne lub kursywa Nie jest obsługiwane niezawodnie.
Paragony lub wydruk termiczny Dokładnie sprawdź liczby i blade znaki.
Mocny prześwit z drugiej strony Wyniki mogą być niepełne lub niedokładne.

Przeszukiwalny PDF a PDF tylko z obrazem

  • PDF tylko z obrazem: czyste bitmapy, bez tekstu. To, co Twój skaner tworzy domyślnie.
  • Przeszukiwalny PDF: bitmapy plus niewidoczna warstwa tekstowa (to, co daje to narzędzie). Wygląda identycznie, Ctrl+F działa.
  • PDF/A: archiwalny podzbiór PDF, który osadza swoje czcionki i zakazuje zasobów zewnętrznych, często wymagany przez sądy i archiwa. To narzędzie tworzy zwykły przeszukiwalny PDF, a nie certyfikowany PDF/A; przekonwertuj i zweryfikuj dedykowanym narzędziem PDF/A, jeśli Twój proces tego wymaga.

Wskazówki na najlepsze wyniki

  • Zacznij od około 300 DPI. To często dobry kompromis między czytelnymi szczegółami a czasem przetwarzania. Wyższa rozdzielczość wymaga więcej czasu i pamięci.
  • Wyprostuj przed OCR. Większość skanerów oferuje automatyczny obrót; nawet niewielkie przekrzywienie może obniżyć jakość rozpoznawania.
  • Jeden język na przebieg. Silnik rozpoznaje jeden język naraz, więc wybierz dominujący. Dla dokumentu dwujęzycznego uruchom go raz na każdy język i zachowaj lepszy wynik.
  • Zawsze zachowuj oryginał. OCR wprowadza drobne błędy; niewidoczna warstwa to wygoda, a nie dowód.

Najczęściej zadawane pytania

Oryginalna zawartość strony zostaje zachowana. Rozpoznany tekst jest dodawany jako niewidoczna warstwa dopasowana do niej, więc wygląd strony powinien pozostać bez zmian. Sprawdź wynik, jeśli dokładna zgodność wizualna ma znaczenie.

Siedem języków alfabetu łacińskiego: angielski, hiszpański, francuski, niemiecki, włoski, portugalski i niderlandzki. Wybierz ten, który pasuje do Twojego dokumentu. Pisma takie jak cyrylica, arabskie i CJK (chińskie, japońskie, koreańskie) nie są dostępne w tym narzędziu.

Nie w sposób niezawodny. To narzędzie jest przeznaczone do tekstu drukowanego. Rozpoznawanie pisma odręcznego to inna technologia, dlatego materiał odręczny sprawdzaj lub przepisuj osobno.

Nie. Wynik to zwykły przeszukiwalny PDF: oryginalne obrazy Twoich stron plus niewidoczna warstwa tekstowa OCR. To nie jest certyfikowany archiwalny plik PDF/A. Jeśli Twój proces wymaga PDF/A, przekonwertuj i zweryfikuj wynik dedykowanym narzędziem PDF/A.

OCR działa w całości w Twojej przeglądarce, więc źródłowy PDF nie jest wysyłany na serwer w celu rozpoznania. Zwykłe pobranie lokalne pozostaje na Twoim urządzeniu. Tylko gdy wybierzesz Utwórz stronę pobierania, gotowy przeszukiwalny PDF jest przesyłany na nasz serwer. Źródłowy PDF pozostaje lokalny, a przesłany wynik przechowujemy do 7 dni.

Powiązane narzędzia