Tabela PDF do CSV
Wybierz tekstowy PDF
Zamieniaj proste, tekstowe tabele z PDF na pliki CSV lub TSV bez wysyłania dokumentu na serwer. Przeglądarka grupuje fragmenty tekstu według widocznego położenia i szuka powtarzalnych kolumn. Każdą wykrytą tabelę należy sprawdzić: to ostrożny mechanizm działający z najlepszym możliwym przybliżeniem, a nie gwarancja idealnych wierszy i kolumn w złożonym układzie.
Jak wyodrębnić tabelę PDF do CSV
-
1
Wybierz tekstowy PDF
Wybierz PDF do 20 MiB i 150 stron. Skan zawierający tylko obrazy trzeba najpierw poddać OCR.
-
2
Wykryj tabele w przeglądarce
Detektor korzysta z widocznych współrzędnych tekstu, uwzględniając obrót strony i CropBox, oraz szuka powtarzalnych położeń wierszy i kolumn.
-
3
Sprawdź i wybierz format
Zaznacz potrzebne tabele i sprawdź ich wiersze. Wybierz przecinek, średnik lub tabulator, znacznik UTF-8 oraz ochronę przed formułami.
-
4
Pobierz wybrane tabele
Każda wybrana tabela jest pobierana lokalnie jako osobny plik CSV lub TSV. Tabele z kolejnych stron nie są łączone.
Co detektor potrafi odtworzyć
PDF zwykle zapisuje tabelę jako fragmenty tekstu o określonych współrzędnych, a nie jako prawdziwą siatkę komórek. Narzędzie grupuje fragmenty w widocznych wierszach, łączy bliskie elementy i zachowuje położenia kolumn powtarzające się w wielu wierszach. Najlepiej radzi sobie z regularnymi tabelami tekstowymi. Komórki scalone, tekst zawijany i dekoracyjny układ mogą wymagać ręcznej korekty.
Obrót strony i przesunięty CropBox są normalizowane. W wierszach pisanych głównie od prawej do lewej kolejność kolumn wynika z kierunku warstwy tekstowej PDF. Kilka regularnych tabel na stronie może zostać wykrytych oddzielnie, ale jedna tabela ciągnąca się na kolejnej stronie nie jest automatycznie łączona.
| Układ PDF | Prawdopodobny wynik | Co sprawdzić |
|---|---|---|
| Czysty eksport ze stałymi kolumnami | Zwykle najlepszy wynik | Nagłówki, znaki dziesiętne i puste komórki |
| Brak wartości w regularnym wierszu | Pusta komórka w odtworzonej kolumnie | Czy pusta jest właściwa kolumna |
| Komórka scalona lub zawinięta | Tekst może się przesunąć lub rozdzielić | Porównaj podgląd z PDF |
| Kilka regularnych tabel na jednej stronie | Mogą zostać wykryte jako oddzielne, ponumerowane tabele | Jeden plik dla każdej wybranej tabeli |
| Zeskanowany obraz | Brak tabeli | Najpierw wykonaj OCR |
Oprócz limitów 20 MiB i 150 stron obowiązują limity bezpieczeństwa liczby fragmentów tekstu i znaków. Silnie rozdrobniony PDF może zatrzymać się wcześniej.
CSV, TSV i bezpieczeństwo arkusza
Dla CSV wybierz przecinek lub średnik, a dla TSV tabulator. Rekordy kończą się CRLF. Pole zawierające aktywny separator, cudzysłów, powrót karetki lub znak nowego wiersza jest ujmowane w cudzysłowy, a wewnętrzne cudzysłowy są podwajane. Są to powszechne reguły opisane w RFC 4180, dostosowane do wybranego separatora.
Ochrona przed formułami jest domyślnie włączona. Jeżeli po białych znakach komórka zaczyna się od =, +, - lub @, także w obsługiwanych wariantach pełnej szerokości, narzędzie dodaje apostrof. Zmienia to wartość, lecz arkusz częściej potraktuje ją jako tekst. Wyłączenie ochrony zachowuje surowy tekst, ale treść przypominająca formułę z niezaufanego PDF może być niebezpieczna. OWASP opisuje CSV Injection i ograniczenia takich zabezpieczeń.
Opcjonalny znacznik UTF-8 pomaga niektórym arkuszom rozpoznać tekst niełaciński. Zawsze sprawdź plik przed księgowaniem, raportowaniem lub automatycznym importem.
Prywatny stan kroków
PDF, wykryte tabele i ustawienia pozostają w tej przeglądarce. Są przechowywane w ograniczonej pamięci lokalnej przez maksymalnie 30 minut, aby zachować trzy kroki. Pliki do pobrania powstają lokalnie i narzędzie niczego nie wysyła. Rozpoczęcie od nowa usuwa bieżące zadanie, a przeglądarka może wyczyścić dane wcześniej.
Najczęściej zadawane pytania
Nie. Odczyt, wykrywanie oraz tworzenie CSV lub TSV odbywa się w przeglądarce. Zadanie pozostaje najwyżej 30 minut w ograniczonej pamięci lokalnej, a pobieranie jest lokalne.
Nie bez przygotowania. Skan będący wyłącznie obrazem nie ma warstwy tekstowej z położeniem. Najpierw wykonaj OCR, a potem użyj tekstowego PDF.
Wybierz przecinek, średnik lub tabulator. Rekordy używają CRLF; pola z separatorem, cudzysłowem lub końcem wiersza są ujmowane w cudzysłowy, a cudzysłowy wewnętrzne podwajane. Tabulator tworzy .tsv.
Dodaje apostrof do komórek zaczynających się po białych znakach od =, +, - lub @. Jest domyślnie włączona i zmienia takie wartości. Wyłącz ją tylko dla zaufanego PDF, gdy liczy się dokładny tekst.
Wykrywanie opiera się na położeniu tekstu, nie na prawdziwych komórkach. Zawijanie, scalenia, nietypowe odstępy i mieszane kierunki pisma mogą przesuwać wartości. Porównaj podgląd ze źródłem.
Kilka regularnych tabel na stronie może być wykrytych oddzielnie i wybranych. Każda daje osobny plik. Tabela kontynuowana na następnej stronie nie jest łączona.
Powiązane narzędzia
Konwerter rozmiaru strony PDF
Przekształć każdą stronę PDF na A4, US Letter, Legal, A3, A5 lub Tabloid, skalując każdą stronę proporcjonalnie, aby się zmieściła. 100% w Twojej przeglądarce.
Word na PDF
Konwertuj dokumenty Word .doc i .docx do PDF z zachowaniem układu strony, obrazów, tabel i nagłówków. Bezpieczne przesyłanie, automatyczne usunięcie po 2 godzinach.
Wyodrębnianie stron PDF
Wyodrębnij wybrane strony z pliku PDF do nowego dokumentu, bezpośrednio w przeglądarce, aby udostępnić tylko te części, których potrzebujesz.
Kreator przeszukiwalnego PDF
Zamień zeskanowany PDF w dokument przeszukiwalny i z zaznaczalnym tekstem, dodając niewidoczną warstwę tekstową OCR. W całości w Twojej przeglądarce; 7 języków alfabetu łacińskiego.
Spłaszczanie PDF
Spłaszcz interaktywne pola formularza PDF do statycznej treści strony, w przeglądarce, aby wypełnionego formularza nie dało się już edytować.
Edytor metadanych PDF
Edytuj tytuł, autora, temat, słowa kluczowe i twórcę pliku PDF, aby uporządkować właściwości dokumentu przed udostępnieniem.
Narzędzie jest dostępne w innych językach
- Bảng PDF sang CSV [VI]
- PDF-tabell till CSV [SV]
- تحويل جداول PDF إلى CSV [AR]
- PDF 표를 CSV로 변환 [KO]
- แปลงตาราง PDF เป็น CSV [TH]
- Tableau PDF en CSV [FR]
- Tabel PDF ke CSV [ID]
- PDF表をCSVに変換 [JA]
- PDF-Tabelle in CSV [DE]
- PDF-tabel naar CSV [NL]
- Tabla PDF a CSV [ES]
- Tabela PDF para CSV [PT]
- PDF Table to CSV [EN]
- Tabella PDF in CSV [IT]
- Таблица PDF в CSV [RU]
- PDF Tablosunu CSV'ye Dönüştür [TR]
- PDF 表格转 CSV [ZH]