Tabela PDF do CSV

Tabela PDF do CSV

Wybierz tekstowy PDF

Zamieniaj proste, tekstowe tabele z PDF na pliki CSV lub TSV bez wysyłania dokumentu na serwer. Przeglądarka grupuje fragmenty tekstu według widocznego położenia i szuka powtarzalnych kolumn. Każdą wykrytą tabelę należy sprawdzić: to ostrożny mechanizm działający z najlepszym możliwym przybliżeniem, a nie gwarancja idealnych wierszy i kolumn w złożonym układzie.

Jak wyodrębnić tabelę PDF do CSV

  1. 1

    Wybierz tekstowy PDF

    Wybierz PDF do 20 MiB i 150 stron. Skan zawierający tylko obrazy trzeba najpierw poddać OCR.

  2. 2

    Wykryj tabele w przeglądarce

    Detektor korzysta z widocznych współrzędnych tekstu, uwzględniając obrót strony i CropBox, oraz szuka powtarzalnych położeń wierszy i kolumn.

  3. 3

    Sprawdź i wybierz format

    Zaznacz potrzebne tabele i sprawdź ich wiersze. Wybierz przecinek, średnik lub tabulator, znacznik UTF-8 oraz ochronę przed formułami.

  4. 4

    Pobierz wybrane tabele

    Każda wybrana tabela jest pobierana lokalnie jako osobny plik CSV lub TSV. Tabele z kolejnych stron nie są łączone.

Co detektor potrafi odtworzyć

PDF zwykle zapisuje tabelę jako fragmenty tekstu o określonych współrzędnych, a nie jako prawdziwą siatkę komórek. Narzędzie grupuje fragmenty w widocznych wierszach, łączy bliskie elementy i zachowuje położenia kolumn powtarzające się w wielu wierszach. Najlepiej radzi sobie z regularnymi tabelami tekstowymi. Komórki scalone, tekst zawijany i dekoracyjny układ mogą wymagać ręcznej korekty.

Obrót strony i przesunięty CropBox są normalizowane. W wierszach pisanych głównie od prawej do lewej kolejność kolumn wynika z kierunku warstwy tekstowej PDF. Kilka regularnych tabel na stronie może zostać wykrytych oddzielnie, ale jedna tabela ciągnąca się na kolejnej stronie nie jest automatycznie łączona.

Układ PDF Prawdopodobny wynik Co sprawdzić
Czysty eksport ze stałymi kolumnami Zwykle najlepszy wynik Nagłówki, znaki dziesiętne i puste komórki
Brak wartości w regularnym wierszu Pusta komórka w odtworzonej kolumnie Czy pusta jest właściwa kolumna
Komórka scalona lub zawinięta Tekst może się przesunąć lub rozdzielić Porównaj podgląd z PDF
Kilka regularnych tabel na jednej stronie Mogą zostać wykryte jako oddzielne, ponumerowane tabele Jeden plik dla każdej wybranej tabeli
Zeskanowany obraz Brak tabeli Najpierw wykonaj OCR

Oprócz limitów 20 MiB i 150 stron obowiązują limity bezpieczeństwa liczby fragmentów tekstu i znaków. Silnie rozdrobniony PDF może zatrzymać się wcześniej.

CSV, TSV i bezpieczeństwo arkusza

Dla CSV wybierz przecinek lub średnik, a dla TSV tabulator. Rekordy kończą się CRLF. Pole zawierające aktywny separator, cudzysłów, powrót karetki lub znak nowego wiersza jest ujmowane w cudzysłowy, a wewnętrzne cudzysłowy są podwajane. Są to powszechne reguły opisane w RFC 4180, dostosowane do wybranego separatora.

Ochrona przed formułami jest domyślnie włączona. Jeżeli po białych znakach komórka zaczyna się od =, +, - lub @, także w obsługiwanych wariantach pełnej szerokości, narzędzie dodaje apostrof. Zmienia to wartość, lecz arkusz częściej potraktuje ją jako tekst. Wyłączenie ochrony zachowuje surowy tekst, ale treść przypominająca formułę z niezaufanego PDF może być niebezpieczna. OWASP opisuje CSV Injection i ograniczenia takich zabezpieczeń.

Opcjonalny znacznik UTF-8 pomaga niektórym arkuszom rozpoznać tekst niełaciński. Zawsze sprawdź plik przed księgowaniem, raportowaniem lub automatycznym importem.

Prywatny stan kroków

PDF, wykryte tabele i ustawienia pozostają w tej przeglądarce. Są przechowywane w ograniczonej pamięci lokalnej przez maksymalnie 30 minut, aby zachować trzy kroki. Pliki do pobrania powstają lokalnie i narzędzie niczego nie wysyła. Rozpoczęcie od nowa usuwa bieżące zadanie, a przeglądarka może wyczyścić dane wcześniej.

Najczęściej zadawane pytania

Nie. Odczyt, wykrywanie oraz tworzenie CSV lub TSV odbywa się w przeglądarce. Zadanie pozostaje najwyżej 30 minut w ograniczonej pamięci lokalnej, a pobieranie jest lokalne.

Nie bez przygotowania. Skan będący wyłącznie obrazem nie ma warstwy tekstowej z położeniem. Najpierw wykonaj OCR, a potem użyj tekstowego PDF.

Wybierz przecinek, średnik lub tabulator. Rekordy używają CRLF; pola z separatorem, cudzysłowem lub końcem wiersza są ujmowane w cudzysłowy, a cudzysłowy wewnętrzne podwajane. Tabulator tworzy .tsv.

Dodaje apostrof do komórek zaczynających się po białych znakach od =, +, - lub @. Jest domyślnie włączona i zmienia takie wartości. Wyłącz ją tylko dla zaufanego PDF, gdy liczy się dokładny tekst.

Wykrywanie opiera się na położeniu tekstu, nie na prawdziwych komórkach. Zawijanie, scalenia, nietypowe odstępy i mieszane kierunki pisma mogą przesuwać wartości. Porównaj podgląd ze źródłem.

Kilka regularnych tabel na stronie może być wykrytych oddzielnie i wybranych. Każda daje osobny plik. Tabela kontynuowana na następnej stronie nie jest łączona.

Powiązane narzędzia