Tabela PDF do CSV
Wybierz tekstowy PDF
Zamieniaj proste, tekstowe tabele z PDF na pliki CSV lub TSV bez wysyłania dokumentu na serwer. Przeglądarka grupuje fragmenty tekstu według widocznego położenia i szuka powtarzalnych kolumn. Każdą wykrytą tabelę należy sprawdzić: to ostrożny mechanizm działający z najlepszym możliwym przybliżeniem, a nie gwarancja idealnych wierszy i kolumn w złożonym układzie.
Jak wyodrębnić tabelę PDF do CSV
-
1
Wybierz tekstowy PDF
Wybierz PDF do 20 MiB i 150 stron. Skan zawierający tylko obrazy trzeba najpierw poddać OCR.
-
2
Wykryj tabele w przeglądarce
Detektor korzysta z widocznych współrzędnych tekstu, uwzględniając obrót strony i CropBox, oraz szuka powtarzalnych położeń wierszy i kolumn.
-
3
Sprawdź i wybierz format
Zaznacz potrzebne tabele i sprawdź ich wiersze. Wybierz przecinek, średnik lub tabulator, znacznik UTF-8 oraz ochronę przed formułami.
-
4
Pobierz wybrane tabele
Każda wybrana tabela jest pobierana lokalnie jako osobny plik CSV lub TSV. Tabele z kolejnych stron nie są łączone.
Co detektor potrafi odtworzyć
PDF zwykle zapisuje tabelę jako fragmenty tekstu o określonych współrzędnych, a nie jako prawdziwą siatkę komórek. Narzędzie grupuje fragmenty w widocznych wierszach, łączy bliskie elementy i zachowuje położenia kolumn powtarzające się w wielu wierszach. Najlepiej radzi sobie z regularnymi tabelami tekstowymi. Komórki scalone, tekst zawijany i dekoracyjny układ mogą wymagać ręcznej korekty.
Obrót strony i przesunięty CropBox są normalizowane. W wierszach pisanych głównie od prawej do lewej kolejność kolumn wynika z kierunku warstwy tekstowej PDF. Kilka regularnych tabel na stronie może zostać wykrytych oddzielnie, ale jedna tabela ciągnąca się na kolejnej stronie nie jest automatycznie łączona.
| Układ PDF | Prawdopodobny wynik | Co sprawdzić |
|---|---|---|
| Czysty eksport ze stałymi kolumnami | Zwykle najlepszy wynik | Nagłówki, znaki dziesiętne i puste komórki |
| Brak wartości w regularnym wierszu | Pusta komórka w odtworzonej kolumnie | Czy pusta jest właściwa kolumna |
| Komórka scalona lub zawinięta | Tekst może się przesunąć lub rozdzielić | Porównaj podgląd z PDF |
| Kilka regularnych tabel na jednej stronie | Mogą zostać wykryte jako oddzielne, ponumerowane tabele | Jeden plik dla każdej wybranej tabeli |
| Zeskanowany obraz | Brak tabeli | Najpierw wykonaj OCR |
Oprócz limitów 20 MiB i 150 stron obowiązują limity bezpieczeństwa liczby fragmentów tekstu i znaków. Silnie rozdrobniony PDF może zatrzymać się wcześniej.
CSV, TSV i bezpieczeństwo arkusza
Dla CSV wybierz przecinek lub średnik, a dla TSV tabulator. Rekordy kończą się CRLF. Pole zawierające aktywny separator, cudzysłów, powrót karetki lub znak nowego wiersza jest ujmowane w cudzysłowy, a wewnętrzne cudzysłowy są podwajane. Są to powszechne reguły opisane w RFC 4180, dostosowane do wybranego separatora.
Ochrona przed formułami jest domyślnie włączona. Jeżeli po białych znakach komórka zaczyna się od =, +, - lub @, także w obsługiwanych wariantach pełnej szerokości, narzędzie dodaje apostrof. Zmienia to wartość, lecz arkusz częściej potraktuje ją jako tekst. Wyłączenie ochrony zachowuje surowy tekst, ale treść przypominająca formułę z niezaufanego PDF może być niebezpieczna. OWASP opisuje CSV Injection i ograniczenia takich zabezpieczeń.
Opcjonalny znacznik UTF-8 pomaga niektórym arkuszom rozpoznać tekst niełaciński. Zawsze sprawdź plik przed księgowaniem, raportowaniem lub automatycznym importem.
Prywatny stan kroków
PDF, wykryte tabele i ustawienia pozostają w tej przeglądarce. Są przechowywane w ograniczonej pamięci lokalnej przez maksymalnie 30 minut, aby zachować trzy kroki. Pliki do pobrania powstają lokalnie i narzędzie niczego nie wysyła. Rozpoczęcie od nowa usuwa bieżące zadanie, a przeglądarka może wyczyścić dane wcześniej.
Najczęściej zadawane pytania
Nie. Odczyt, wykrywanie oraz tworzenie CSV lub TSV odbywa się w przeglądarce. Zadanie pozostaje najwyżej 30 minut w ograniczonej pamięci lokalnej, a pobieranie jest lokalne.
Nie bez przygotowania. Skan będący wyłącznie obrazem nie ma warstwy tekstowej z położeniem. Najpierw wykonaj OCR, a potem użyj tekstowego PDF.
Wybierz przecinek, średnik lub tabulator. Rekordy używają CRLF; pola z separatorem, cudzysłowem lub końcem wiersza są ujmowane w cudzysłowy, a cudzysłowy wewnętrzne podwajane. Tabulator tworzy .tsv.
Dodaje apostrof do komórek zaczynających się po białych znakach od =, +, - lub @. Jest domyślnie włączona i zmienia takie wartości. Wyłącz ją tylko dla zaufanego PDF, gdy liczy się dokładny tekst.
Wykrywanie opiera się na położeniu tekstu, nie na prawdziwych komórkach. Zawijanie, scalenia, nietypowe odstępy i mieszane kierunki pisma mogą przesuwać wartości. Porównaj podgląd ze źródłem.
Kilka regularnych tabel na stronie może być wykrytych oddzielnie i wybranych. Każda daje osobny plik. Tabela kontynuowana na następnej stronie nie jest łączona.
Powiązane narzędzia
Edytuj PDF
Dodaj tekst, podświetlenia, prostokąty i białe pola do PDF w przeglądarce. Wyeksportuj nowy PDF bez instalowania oprogramowania.
Word na PDF
Konwertuj dokumenty Word .doc i .docx do PDF z zachowaniem układu strony, obrazów, tabel i nagłówków. Bezpieczne przesyłanie, automatyczne usunięcie po 2 godzinach.
Konwerter PDF na PNG
Zamień strony PDF na pliki PNG z ostrym tekstem, obsługą przezroczystości i wybraną wartością DPI. Dobre do dokumentacji i miniatur.
Dodaj widoczny podpis do pliku PDF
Narysuj, wpisz lub prześlij podpis PNG, umieść widoczny znak na jednej stronie PDF i pobierz plik lokalnie. Bez podpisu cyfrowego.
Konwerter Excel do PDF
Konwertuj pliki XLSX, XLS lub CSV w przeglądarce do poziomego PDF A4. Każdy arkusz staje się czytelną stroną tabeli do pobrania.
Konwerter PDF do Word
Konwertuj pliki PDF na w pełni edytowalne dokumenty Word. Zachowuje nagłówki, listy, obrazy i tabele. Zeskanowane PDF-y są automatycznie przetwarzane przez OCR.