Sprawdzanie podobieństwa tekstów

Dalej

Dwa zgłoszenia do pomocy technicznej, które brzmią identycznie, wpis na blogu podobny do wpisu konkurenta albo dwa opisy produktu, które wyglądają na skopiowane: intuicja podpowiada, że się pokrywają, ale chcesz liczbę. To narzędzie porównuje dwa teksty i zwraca dwa wyniki: pokrycie słów, czyli udział unikalnych słów, które oba teksty mają wspólne, oraz podobieństwo znaków, czyli jak bardzo surowe znaki do siebie pasują. Razem pokazują, czy teksty mają wspólne słownictwo, sformułowania, czy jedno i drugie.

Jak mierzone jest podobieństwo

  1. 1

    Wklej oba teksty

    Dowolnej długości, od zdania po cały artykuł.

  2. 2

    Pokrycie słów

    Każdy tekst jest zamieniany na małe litery i dzielony na unikalne słowa. Wynik Jaccarda to wspólne słowa podzielone przez łączną liczbę różnych słów.

  3. 3

    Podobieństwo znaków

    Narzędzie porównuje też surowe ciągi znaków i podaje procent znaków, które się zgadzają.

  4. 4

    Odczytaj oba wyniki

    Wysokie pokrycie słów przy niższym podobieństwie znaków oznacza te same słowa w innej kolejności. Wysokie podobieństwo znaków oznacza teksty niemal identyczne, litera po literze.

Co mówi każdy wynik

Wynik Zakres Mierzy Martwy punkt
Pokrycie słów (Jaccard) 0-100% Udział unikalnych słów wspólnych dla obu tekstów Ignoruje kolejność słów i częstość ich występowania
Podobieństwo znaków 0-100% Jak bardzo pasuje surowy ciąg znaków Wrażliwe na długość i drobne zmiany
  • Pokrycie słów bliskie 100% oznacza, że oba teksty używają niemal tego samego zestawu słów.
  • Podobieństwo znaków bliskie 100% oznacza, że teksty są niemal identyczne znak po znaku.
  • Duża różnica (wysokie pokrycie słów, niższe podobieństwo znaków) wskazuje na to samo słownictwo ułożone inaczej.

Przykład

Porównanie The quick brown fox z The quick red fox:

  • Pokrycie słów: 60.00% (mają wspólne the, quick i fox z pięciu różnych słów)
  • Podobieństwo znaków: 83.33% (różni się tylko brown wobec red)

Obie liczby razem opowiadają historię: niemal te same słowa i, poza jednym słowem, niemal te same znaki.

Czego to narzędzie nie robi

To powierzchowne porównanie ciągów, a nie wykrywacz plagiatu ani znaczenia:

  • Porównuje słowa i znaki, więc dwa fragmenty mówiące to samo innymi słowami mają niski wynik.
  • Nie ma bazy opublikowanych prac, więc nie powie Ci, czy tekst skopiowano skądinąd.
  • Porównanie oparte na znaczeniu (semantyczne) wymaga modelu osadzeń (embeddingów), którego to narzędzie nie używa.

Traktuj wyniki jako szybki sygnał niemal duplikatów, a nie jako werdykt.

Wskazówki dotyczące przygotowania

  • Usuń szablonowe fragmenty (podpisy, nagłówki, stopki) przed porównaniem; sztucznie zawyżają oba wyniki.
  • Znormalizuj odstępy i luźne znaki interpunkcyjne, aby różnice w formatowaniu nie przytłumiły prawdziwych zgodności treści.
  • Uważaj na różnice długości: bardzo różne długości obniżają podobieństwo znaków, nawet gdy krótszy tekst mieści się w dłuższym, więc porównuj porównywalne fragmenty.

Najczęściej zadawane pytania

Tylko jako zgrubny sygnał. Narzędzie mierzy pokrycie słów i podobieństwo znaków między dwoma tekstami, które wklejasz; nie ma bazy istniejących prac i nie wykryje kopii z nieznanego źródła. Wysoki wynik oznacza niemal duplikaty warte bliższego przyjrzenia się, nic więcej.

Nie bardzo. Jeśli przeróbka zachowuje większość słów, pokrycie słów pozostaje wysokie. Ale jeśli podmienia je na synonimy, oba wyniki spadają, bo narzędzie porównuje słowa i znaki, a nie znaczenie. Wykrycie prawdziwej parafrazy wymaga modelu semantycznego (osadzeń).

Oba wyniki radzą sobie z długimi tekstami, ale porównanie podobieństwa znaków spowalnia wraz ze wzrostem długości, więc utrzymuj każdy tekst w granicach kilku tysięcy znaków, aby uzyskać szybki wynik.

Twoje dwa teksty są wysyłane na nasz serwer w celu porównania i nie są przechowywane. Porównanie to zwykłe dopasowanie słów i znaków, bez udziału osób trzecich.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach