Sprawdzanie podobieństwa tekstów
Dwa zgłoszenia do pomocy technicznej, które brzmią identycznie, wpis na blogu podobny do wpisu konkurenta albo dwa opisy produktu, które wyglądają na skopiowane: intuicja podpowiada, że się pokrywają, ale chcesz liczbę. To narzędzie porównuje dwa teksty i zwraca dwa wyniki: pokrycie słów, czyli udział unikalnych słów, które oba teksty mają wspólne, oraz podobieństwo znaków, czyli jak bardzo surowe znaki do siebie pasują. Razem pokazują, czy teksty mają wspólne słownictwo, sformułowania, czy jedno i drugie.
Jak mierzone jest podobieństwo
-
1
Wklej oba teksty
Dowolnej długości, od zdania po cały artykuł.
-
2
Pokrycie słów
Każdy tekst jest zamieniany na małe litery i dzielony na unikalne słowa. Wynik Jaccarda to wspólne słowa podzielone przez łączną liczbę różnych słów.
-
3
Podobieństwo znaków
Narzędzie porównuje też surowe ciągi znaków i podaje procent znaków, które się zgadzają.
-
4
Odczytaj oba wyniki
Wysokie pokrycie słów przy niższym podobieństwie znaków oznacza te same słowa w innej kolejności. Wysokie podobieństwo znaków oznacza teksty niemal identyczne, litera po literze.
Co mówi każdy wynik
| Wynik | Zakres | Mierzy | Martwy punkt |
|---|---|---|---|
| Pokrycie słów (Jaccard) | 0-100% | Udział unikalnych słów wspólnych dla obu tekstów | Ignoruje kolejność słów i częstość ich występowania |
| Podobieństwo znaków | 0-100% | Jak bardzo pasuje surowy ciąg znaków | Wrażliwe na długość i drobne zmiany |
- Pokrycie słów bliskie 100% oznacza, że oba teksty używają niemal tego samego zestawu słów.
- Podobieństwo znaków bliskie 100% oznacza, że teksty są niemal identyczne znak po znaku.
- Duża różnica (wysokie pokrycie słów, niższe podobieństwo znaków) wskazuje na to samo słownictwo ułożone inaczej.
Przykład
Porównanie The quick brown fox z The quick red fox:
- Pokrycie słów: 60.00% (mają wspólne the, quick i fox z pięciu różnych słów)
- Podobieństwo znaków: 83.33% (różni się tylko brown wobec red)
Obie liczby razem opowiadają historię: niemal te same słowa i, poza jednym słowem, niemal te same znaki.
Czego to narzędzie nie robi
To powierzchowne porównanie ciągów, a nie wykrywacz plagiatu ani znaczenia:
- Porównuje słowa i znaki, więc dwa fragmenty mówiące to samo innymi słowami mają niski wynik.
- Nie ma bazy opublikowanych prac, więc nie powie Ci, czy tekst skopiowano skądinąd.
- Porównanie oparte na znaczeniu (semantyczne) wymaga modelu osadzeń (embeddingów), którego to narzędzie nie używa.
Traktuj wyniki jako szybki sygnał niemal duplikatów, a nie jako werdykt.
Wskazówki dotyczące przygotowania
- Usuń szablonowe fragmenty (podpisy, nagłówki, stopki) przed porównaniem; sztucznie zawyżają oba wyniki.
- Znormalizuj odstępy i luźne znaki interpunkcyjne, aby różnice w formatowaniu nie przytłumiły prawdziwych zgodności treści.
- Uważaj na różnice długości: bardzo różne długości obniżają podobieństwo znaków, nawet gdy krótszy tekst mieści się w dłuższym, więc porównuj porównywalne fragmenty.
Najczęściej zadawane pytania
Tylko jako zgrubny sygnał. Narzędzie mierzy pokrycie słów i podobieństwo znaków między dwoma tekstami, które wklejasz; nie ma bazy istniejących prac i nie wykryje kopii z nieznanego źródła. Wysoki wynik oznacza niemal duplikaty warte bliższego przyjrzenia się, nic więcej.
Nie bardzo. Jeśli przeróbka zachowuje większość słów, pokrycie słów pozostaje wysokie. Ale jeśli podmienia je na synonimy, oba wyniki spadają, bo narzędzie porównuje słowa i znaki, a nie znaczenie. Wykrycie prawdziwej parafrazy wymaga modelu semantycznego (osadzeń).
Oba wyniki radzą sobie z długimi tekstami, ale porównanie podobieństwa znaków spowalnia wraz ze wzrostem długości, więc utrzymuj każdy tekst w granicach kilku tysięcy znaków, aby uzyskać szybki wynik.
Twoje dwa teksty są wysyłane na nasz serwer w celu porównania i nie są przechowywane. Porównanie to zwykłe dopasowanie słów i znaków, bez udziału osób trzecich.
Powiązane narzędzia
Przewodnik po znakach korektorskich
Praktyczny przewodnik po 14 popularnych znakach tradycyjnej korekty anglojęzycznej, z oznaczeniami, przykładami i kontekstem norm.
Detektor klišejów
Wklej tekst, a detektor porówna go z listą popularnych angielskich frazesów i poda, ile razy pojawia się każda fraza.
Generator imion fantasy
Twórz imiona postaci fantasy w pięciu stylach: elf, krasnolud, ork, wróżka lub smoczy. Wybierz liczbę, a potem imiona, pełne imiona lub imiona z tytułami, do kampanii D&D, prozy i list NPC.
Generator Prawda czy Wyzwanie
Losuj pytania prawdy i wyzwania z dopracowanej, rodzinnej puli: 15 pytań i 15 zadań, po angielsku. Tryb mieszany, same prawdy lub same wyzwania, do 20 naraz.
Generator „to czy tamto”
Przetasuj talię dylematów „to czy tamto” na przełamywanie lodów, randki, gry urodzinowe i rozgrzewki zespołowe. Wybierz, ile potrzebujesz, i zacznij pytać.
Generator Spelling Bee
Twórz pomieszaną listę angielskich słów do literowania według poziomu, od klasy 1 po trudną rundę Bee. Darmowe, wbudowane listy słów do ćwiczeń.
Narzędzie jest dostępne w innych językach
- Comprobador de similitud de textos [ES]
- Trình kiểm tra độ tương đồng văn bản [VI]
- テキスト類似度チェッカー [JA]
- Verificador de similaridade de textos [PT]
- 텍스트 유사도 검사기 [KO]
- مدقق تشابه النصوص [AR]
- Kontroll av textlikhet [SV]
- Textähnlichkeit prüfen [DE]
- Vérificateur de similarité de textes [FR]
- เครื่องมือตรวจความคล้ายของข้อความ [TH]
- Pemeriksa kemiripan teks [ID]
- Tekstgelijkenis controleren [NL]
- Text Similarity Checker [EN]
- Verifica similarità testi [IT]
- Проверка схожести текстов [RU]
- Metin benzerliği denetleyici [TR]
- 文本相似度检查器 [ZH]