Usuwanie zduplikowanych wierszy

Eksport CSV z powtarzającymi się wierszami, plik dziennika ze zduplikowanymi wpisami, lista słów kluczowych z trzech nakładających się źródeł: gdy Twój tekst zawiera identyczne linie, to narzędzie je scala, zachowując pierwsze wystąpienie w pierwotnym miejscu. Dwie opcje dopasowania, z rozróżnianiem wielkości liter lub bez, opcjonalne przycinanie białych znaków oraz licznik usuniętych linii.

Jak usuwać zduplikowane wiersze

  1. 1

    Wklej tekst

    Wklej listę, dziennik, kolumnę CSV lub dowolny tekst, w którym każdy wpis znajduje się w osobnej linii.

  2. 2

    Wybierz opcje dopasowania

    "Rozróżniaj wielkość liter" zachowuje `Apple` i `apple` jako osobne linie; wyłączenie tej opcji je scala. "Przycinaj białe znaki" usuwa spacje na początku i końcu przed porównaniem.

  3. 3

    Usuń duplikaty

    Kliknij przycisk. Pierwsze wystąpienie każdej linii zostaje, a późniejsze powtórzenia są usuwane.

  4. 4

    Sprawdź i skopiuj

    Statystyki pokazują liczbę oryginalnych linii, unikalnych linii i usuniętych duplikatów. Skopiuj oczyszczony tekst, gdy wygląda dobrze.

Jak działa dopasowanie

Opcja Zachowanie
Rozróżniaj wielkość liter (domyślne) Apple i apple pozostają osobnymi liniami
Nie rozróżniaj wielkości liter Apple i apple liczą się jako ta sama linia
Przycinaj białe znaki (domyślne) hello” i “hello ” są traktowane jako ta sama linia

Zachowywane jest pierwsze wystąpienie każdej linii, dzięki czemu pierwotny porządek tekstu pozostaje nietknięty.

Typowe przypadki użycia

  • Czyszczenie plików CSV. Wklej pojedynczą kolumnę (nazwy, e-maile, SKU) i usuń powtórzenia przed ponownym połączeniem z pozostałymi kolumnami.
  • Listy adresów URL. Porządkuj listy zebrane ze stron, gdzie ta sama strona pojawia się wiele razy.
  • Badanie słów kluczowych. Łączenie eksportów słów kluczowych z kilku narzędzi nieuchronnie tworzy duplikaty.
  • Listy e-mailowe. Przed importem do CRM usuń dokładne duplikaty, aby uniknąć błędów “już istnieje”.
  • Analiza dzienników. Usuń powtarzające się linie ostrzeżeń, aby zobaczyć unikalne problemy.

Czego narzędzie nie robi

  • Bez deduplikacji po kolumnach. CSV z danymi email,name, gdzie e-mail się powtarza, ale nazwa jest inna, zachowa oba wiersze, bo całe linie się różnią. Aby deduplikować po jednej kolumnie, najpierw ją wyodrębnij, usuń duplikaty, a potem użyj jej jako klucza do filtrowania oryginalnego pliku.
  • Bez ochrony nagłówków. Każda linia jest traktowana jak dane, więc powtarzający się nagłówek zostanie usunięty jak każda inna linia.
  • Bez dopasowania rozmytego. Linie różniące się literówką, wewnętrznymi spacjami lub znakami interpunkcyjnymi nie zostaną scalone.

Wskazówki

  • Normalizuj przed dopasowaniem. Zmień na małe litery i usuń otaczającą interpunkcję, aby “Apple, “, “ apple “ i “Apple” liczyły się jako jeden wpis.
  • Zachowaj kopię zapasową oryginalnego tekstu przed większymi porządkami.
  • Sprawdź statystyki. Jeśli spodziewałeś się 10 procent duplikatów, a usunięto 80 procent, coś jest nie tak z danymi wejściowymi.

Najczęściej zadawane pytania

Pierwsze. Porządek oryginalnego tekstu zostaje zachowany, więc każda unikalna linia pozostaje na swoim pierwotnym miejscu.

Nie automatycznie. Każda linia, w tym nagłówek, jest porównywana jak każda inna. Jeśli późniejsza linia równa się nagłówkowi, zostanie usunięta. Jeśli go potrzebujesz, zachowaj nagłówek osobno.

To narzędzie jest nastawione na dokładne dopasowanie dla szybkości. Do dopasowania rozmytego (literówki, różna wielkość liter, dodatkowa interpunkcja) użyj dedykowanego narzędzia do deduplikacji z progiem podobieństwa.

Tak. Tekst jest wysyłany na nasz serwer, aby narzędzie mogło go przetworzyć, a wynik pojawia się na stronie. Tekst nie jest później przechowywany.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach