Wyodrębnianie obrazów z pliku PDF

Prześlij PDF

Prześlij plik PDF i odtwórz wszystkie osadzone obrazy w ich oryginalnej rozdzielczości. Narzędzie przechodzi przez drzewo obiektów pliku PDF, lokalizuje wpisy typu /XObject /Image i eksportuje każdy z nich jako PNG; nie generuje zrzutów ekranu ani nie powoduje utraty jakości podczas rasteryzacji całej strony. Działa ze skanami, raportami zawierającymi wiele zdjęć, katalogami produktów oraz broszurami.

Jak wydobyć obrazy z pliku PDF

  1. 1

    Prześlij plik w formacie PDF

    Upuść jeden plik; zaszyfrowane pliki PDF muszą zostać najpierw odblokowane.

  2. 2

    Skanuj drzewo obiektów

    Ekstraktor wylicza każdy obraz XObject na wszystkich stronach.

  3. 3

    Przegląd wyników

    Każdy obraz widzisz jako miniaturę zawierającą numer strony oraz wymiary.

  4. 4

    Pobierz osobno lub w formacie ZIP

    Pobierz pojedynczy element lub wyeksportuj wszystkie elementy do jednego archiwum o nazwie `image-p1-1.png`.

Jak obrazy są umieszczone w pliku PDF

Plik PDF przechowuje obrazy jako odrębne zasoby (strumienie /XObject), do których odwołuje się treść strony. Narzędzie do ekstrakcji odczytuje każdy strumień w jego natywnym kodowaniu i odtwarza plik osadzony przez autora.

Formaty, które zobaczysz

Filtr PDF Co otrzymujesz Typowe źródło
/DCTDecode PNG (z JPEG) Fotografie, zdjęcia produktów, skany
/FlateDecode + RGB PNG Logotypy, wykresy, zrzuty ekranu interfejsu użytkownika
/JPXDecode PNG (z JPEG 2000) Skany archiwalne o wysokiej rozdzielczości
/CCITTFaxDecode PNG (ze skanu) Tekst zeskanowany w czerni i bieli
/JBIG2Decode PNG (przekonwertowane) Skompresowane zeskanowane dokumenty

Ekstraktor zawsze dostarcza PNG: ponownie koduje surowe piksele w Twojej przeglądarce, więc źródła JPEG, JPEG 2000 i CCITT również trafiają do Ciebie w formacie PNG.

Czego nie da się odzyskać

  • Ilustracje wektorowe. Logotypy narysowane za pomocą operatorów ścieżek w PDF nie są obrazami – znajdują się w strumieniu treści, a nie jako obiekty typu XObject. W takich przypadkach użyj narzędzia do konwersji plików PDF na format SVG.
  • Kolory tła i gradienty. To rysunek na poziomie strony, a nie osadzone zasoby.
  • Tekst przedstawiony jako kontury. Wygląda jak „grafika“, ale nie jest obiektem obrazu.

Porady przy pracy z eksportem

  • Sprawdź wymiary. Miniatura 300x300 na stronie może w rzeczywistości być oryginałem o rozmiarach 3000x3000, zmniejszonym podczas renderowania. Otrzymujesz piksele źródłowe, a nie rozmiar wyświetlania.
  • Szanuj licencję. Możliwość wyodrębnienia obrazu nie daje uprawnień do jego ponownego wykorzystania. Obrazy stockowe w pliku PDF pozostają obrazami stockowymi nawet po ich wyodrębnieniu.
  • Zeskanowane dokumenty. Jeśli każda strona tworzy jeden wielki obraz z wtopionym tekstem, plik PDF jest skanem. Aby odzyskać tekst, uruchom OCR na wyeksportowanych plikach PNG.

Najczęściej zadawane pytania

Strony PDF mogą stosować macierz transformacji do sposobu rysowania obrazu (odwrócenie, obrót, pochylenie). Ekstraktor zwraca zapisaną bitmapę, surowe piksele. Jeśli wydawca zapisał obraz odwrócony i odwrócił go podczas renderowania, eksport będzie wyglądać na odwrócony; wystarczy obrócić go z powrotem w dowolnym edytorze obrazów.

Tylko po ich odblokowaniu. Najpierw przetwórz plik narzędziem do odblokowania PDF, podając hasło właściciela, a następnie wyodrębnij zawartość.

Tak. Obrazy są dodawane w kolejności stron, a każda nazwa pliku zawiera numer strony, na przykład image-p1-2.png, dzięki czemu wiesz, z której strony pochodzi każdy obraz.

Nie. Źródłowy plik PDF jest otwierany i odczytywany w całości w Twojej przeglądarce i nigdy nie jest wysyłany na serwer. Tylko archiwum ZIP z wyodrębnionymi obrazami jest przesyłane, aby utworzyć chroniony sesją wynik; jest przechowywane do 7 dni, a następnie usuwane.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach