Streszczenie PDF

Krok 1 z 3

Otwieranie prywatnej sesji streszczania...

Wybierz PDF z warstwą tekstową

Użyj jednego pliku PDF o rozmiarze do 20 MiB i długości do 150 stron. Narzędzie odczytuje istniejącą warstwę tekstową; zeskanowane strony wymagają OCR.

lub upuść tutaj jeden PDF

Ładowanie...

Duże dokumenty mogą wymagać chwili. Możesz bezpiecznie zatrzymać proces bez zachowywania częściowego wyniku.

stron

Potrzebujesz szybko przejrzeć raport, artykuł lub brief? To narzędzie odczytuje warstwę tekstową już osadzoną w pliku PDF i ocenia zdania według powtarzających się słów. Następnie pokazuje wybrane zdania w kolejności ich wyodrębnienia oraz do 12 częstych wyrazów. Nie korzysta z AI, nie parafrazuje dokumentu, nie sprawdza faktów i nie zastępuje uważnej lektury. Plik PDF i wyodrębniony tekst pozostają w przeglądarce.

Jak streścić plik PDF

  1. 1

    Wybierz PDF z warstwą tekstową

    Wybierz prawidłowy plik PDF o rozmiarze do 20 MiB i długości do 150 stron. Skan zawierający wyłącznie obrazy stron wymaga wcześniejszego użycia OCR.

  2. 2

    Poczekaj na lokalne odczytanie tekstu

    Narzędzie odczytuje osadzoną warstwę tekstową w przeglądarce i zatrzymuje się po przekroczeniu 2 000 000 wyodrębnionych znaków. Pliki chronione hasłem, uszkodzone i nieczytelne są odrzucane.

  3. 3

    Ustaw długość

    Wybierz od 3 do 20 zdań. Jeśli dokument jest krótszy, narzędzie zwróci wszystkie dostępne zdania zamiast tworzyć dodatkowy tekst.

  4. 4

    Sprawdź i skopiuj

    Porównaj wybrane zdania i częste słowa z oryginalnym dokumentem, a następnie skopiuj streszczenie do swoich notatek.

Co można wywnioskować ze streszczenia ekstrakcyjnego

Streszczenie ekstrakcyjne zachowuje zdania ze źródła, zamiast układać nowy tekst. Narzędzie liczy istotne słowa, lekko premiuje zdania z początku dokumentu, wybiera żądaną liczbę zdań z najwyższą oceną, a następnie przywraca kolejność ich wyodrębnienia.

Prosty przykład

Załóżmy, że czterozdaniowy brief projektowy mówi:

  1. Program pilotażowy skrócił średni czas oczekiwania na pomoc.
  2. Zespół zaktualizował również podręcznik szkoleniowy.
  3. Czas oczekiwania ponownie spadł po drugim wdrożeniu.
  4. Raport zaleca comiesięczne monitorowanie czasu oczekiwania.

Ponieważ wyrażenie czas oczekiwania się powtarza, zdania 1, 3 i 4 mogą otrzymać wyższą ocenę niż zdanie 2. Przy ustawieniu trzech zdań wynik zachowa kolejność 1, 3, 4. Narzędzie nie dopisze nowego wniosku ani nie oceni, czy raport jest prawdziwy.

Co robi przeglądarka

Etap Rzeczywiste działanie
Odczyt PDF Wczytuje osadzoną warstwę tekstową za pomocą PDF.js; nie wykonuje OCR
Granice zdań Korzysta z reguł Intl.Segmenter dla języka strony, jeśli są dostępne, oraz z awaryjnego podziału według interpunkcji Unicode
Granice słów Stosuje podział słów właściwy dla języka, gdy przeglądarka go obsługuje, i odfiltrowuje krótką listę polskich słów pospolitych
Ocena Ocenia zdania na podstawie powtarzających się słów i niewielkiej premii za pozycję na początku
Wynik Zachowuje wybrane zdania w kolejności wyodrębnienia i pokazuje do 12 częstych słów

Ważne ograniczenia

  • Wynik zależy od warstwy tekstowej PDF. Kolumny, tabele, nagłówki, stopki i nietypowe kodowanie czcionek mogą zmienić kolejność odczytanego tekstu.
  • Język strony kieruje segmentacją. Narzędzie nie analizuje całego dokumentu, aby automatycznie rozpoznać jego język. PDF w innym języku może zostać podzielony i oceniony mniej trafnie.
  • Wybór zdań może usuwać kontekst. Zdanie skopiowane dokładnie z tekstu nadal może wprowadzać w błąd bez otaczającego akapitu, tabeli lub zastrzeżenia.
  • To nie jest weryfikacja faktów. Narzędzie ocenia powtórzenia, a nie jakość dowodów, sprzeczności czy prawdziwość twierdzeń.
  • Duże pliki mają limity. Maksymalny rozmiar to 20 MiB, 150 stron i 2 000 000 wyodrębnionych znaków.

Prywatność w trzyetapowym procesie

Źródłowy PDF i wyodrębniony tekst pozostają w pamięci przeglądarki. Proces wieloetapowy wskazuje ten lokalny zapis za pomocą losowo wyglądającego identyfikatora w adresie URL i usuwa go po 30 minutach. Strona i biblioteka PDF nadal pobierają zwykłe zasoby, ale żądania te nie zawierają Twojego pliku. PDF nie jest przesyłany do naszych serwerów ani do usługi konwersji.

Najczęściej zadawane pytania

Nie. Deterministycznie ocenia częstość słów i wybiera zdania z wyodrębnionego tekstu PDF. Nie wywołuje modelu językowego, nie parafrazuje źródła, nie tworzy nowych twierdzeń i nie sprawdza faktów.

Nie bezpośrednio. Skan zawierający wyłącznie obrazy stron nie ma warstwy tekstowej, którą narzędzie mogłoby odczytać. Najpierw wykonaj OCR, a potem użyj powstałego pliku z możliwością wyszukiwania.

Pliki PDF przechowują tekst rozmieszczony na współrzędnych, a nie zwykłe akapity. Układ wielokolumnowy, tabele, powtarzane nagłówki i stopki oraz nietypowe czcionki mogą zmienić kolejność ekstrakcji. Narzędzie zachowuje kolejność wyodrębnioną, która nie zawsze odpowiada kolejności wizualnej.

Narzędzie prosi przeglądarkę o podział zdań i słów zgodnie z bieżącym językiem strony, także dla systemów pisma bez spacji między każdym słowem. Dostępny jest awaryjny podział oparty na interpunkcji Unicode, ale język dokumentu nie jest rozpoznawany automatycznie. Najlepsze granice uzyskasz, gdy język strony odpowiada językowi PDF.

Użyj jednego prawidłowego pliku PDF o rozmiarze nie większym niż 20 MiB, liczącego maksymalnie 150 stron i 2 000 000 wyodrębnionych znaków. Pliki chronione hasłem, uszkodzone i nieczytelne są odrzucane.

Nie. PDF i wyodrębniony tekst pozostają w przeglądarce. W trzyetapowym procesie prywatny zapis w przeglądarce istnieje najwyżej 30 minut, a adres URL zawiera tylko jego nieprzejrzysty identyfikator. Zwykłe zasoby strony i biblioteki są pobierane bez Twojego pliku.

Powiązane narzędzia