Usuwanie zduplikowanych wierszy
Eksport CSV z powtarzającymi się wierszami, plik dziennika ze zduplikowanymi wpisami, lista słów kluczowych z trzech nakładających się źródeł: gdy Twój tekst zawiera identyczne linie, to narzędzie je scala, zachowując pierwsze wystąpienie w pierwotnym miejscu. Dwie opcje dopasowania, z rozróżnianiem wielkości liter lub bez, opcjonalne przycinanie białych znaków oraz licznik usuniętych linii.
Jak usuwać zduplikowane wiersze
-
1
Wklej tekst
Wklej listę, dziennik, kolumnę CSV lub dowolny tekst, w którym każdy wpis znajduje się w osobnej linii.
-
2
Wybierz opcje dopasowania
"Rozróżniaj wielkość liter" zachowuje `Apple` i `apple` jako osobne linie; wyłączenie tej opcji je scala. "Przycinaj białe znaki" usuwa spacje na początku i końcu przed porównaniem.
-
3
Usuń duplikaty
Kliknij przycisk. Pierwsze wystąpienie każdej linii zostaje, a późniejsze powtórzenia są usuwane.
-
4
Sprawdź i skopiuj
Statystyki pokazują liczbę oryginalnych linii, unikalnych linii i usuniętych duplikatów. Skopiuj oczyszczony tekst, gdy wygląda dobrze.
Jak działa dopasowanie
| Opcja | Zachowanie |
|---|---|
| Rozróżniaj wielkość liter (domyślne) | Apple i apple pozostają osobnymi liniami |
| Nie rozróżniaj wielkości liter | Apple i apple liczą się jako ta sama linia |
| Przycinaj białe znaki (domyślne) | “ hello” i “hello ” są traktowane jako ta sama linia |
Zachowywane jest pierwsze wystąpienie każdej linii, dzięki czemu pierwotny porządek tekstu pozostaje nietknięty.
Typowe przypadki użycia
- Czyszczenie plików CSV. Wklej pojedynczą kolumnę (nazwy, e-maile, SKU) i usuń powtórzenia przed ponownym połączeniem z pozostałymi kolumnami.
- Listy adresów URL. Porządkuj listy zebrane ze stron, gdzie ta sama strona pojawia się wiele razy.
- Badanie słów kluczowych. Łączenie eksportów słów kluczowych z kilku narzędzi nieuchronnie tworzy duplikaty.
- Listy e-mailowe. Przed importem do CRM usuń dokładne duplikaty, aby uniknąć błędów “już istnieje”.
- Analiza dzienników. Usuń powtarzające się linie ostrzeżeń, aby zobaczyć unikalne problemy.
Czego narzędzie nie robi
- Bez deduplikacji po kolumnach. CSV z danymi
email,name, gdzie e-mail się powtarza, ale nazwa jest inna, zachowa oba wiersze, bo całe linie się różnią. Aby deduplikować po jednej kolumnie, najpierw ją wyodrębnij, usuń duplikaty, a potem użyj jej jako klucza do filtrowania oryginalnego pliku. - Bez ochrony nagłówków. Każda linia jest traktowana jak dane, więc powtarzający się nagłówek zostanie usunięty jak każda inna linia.
- Bez dopasowania rozmytego. Linie różniące się literówką, wewnętrznymi spacjami lub znakami interpunkcyjnymi nie zostaną scalone.
Wskazówki
- Normalizuj przed dopasowaniem. Zmień na małe litery i usuń otaczającą interpunkcję, aby “Apple, “, “ apple “ i “Apple” liczyły się jako jeden wpis.
- Zachowaj kopię zapasową oryginalnego tekstu przed większymi porządkami.
- Sprawdź statystyki. Jeśli spodziewałeś się 10 procent duplikatów, a usunięto 80 procent, coś jest nie tak z danymi wejściowymi.
Najczęściej zadawane pytania
Pierwsze. Porządek oryginalnego tekstu zostaje zachowany, więc każda unikalna linia pozostaje na swoim pierwotnym miejscu.
Nie automatycznie. Każda linia, w tym nagłówek, jest porównywana jak każda inna. Jeśli późniejsza linia równa się nagłówkowi, zostanie usunięta. Jeśli go potrzebujesz, zachowaj nagłówek osobno.
To narzędzie jest nastawione na dokładne dopasowanie dla szybkości. Do dopasowania rozmytego (literówki, różna wielkość liter, dodatkowa interpunkcja) użyj dedykowanego narzędzia do deduplikacji z progiem podobieństwa.
Tak. Tekst jest wysyłany na nasz serwer, aby narzędzie mogło go przetworzyć, a wynik pojawia się na stronie. Tekst nie jest później przechowywany.
Powiązane narzędzia
Licznik słów
Policz słowa, znaki, zdania i akapity wraz z czasem czytania, czasem mówienia, gęstością słów kluczowych i wskaźnikiem czytelności Flescha, dla wypracowań, postów, podpisów i meta opisów.
Generator nazw miast
Generuj fikcyjne nazwy miast, miasteczek, wsi i stolic do worldbuildingu, map, gier, opowieści i danych testowych, z krótkimi notatkami do każdego wyniku.
Symbol „mniejsze lub równe"
Skopiuj znak ≤ oraz powiązane matematyczne symbole porównania. Obejmuje Unicode, encje HTML i zapis LaTeX do arkuszy kalkulacyjnych, prac naukowych i stron internetowych.
Symbole strzałek do skopiowania
Kopiuj popularne strzałki Unicode jednym kliknięciem: proste, podwójne, ukośne, zawinięte, okrężne i trójkątne do dokumentów, czatu i projektów.
Generator tekstu glitch
Twórz tekst glitch w stylu Zalgo za pomocą łączących znaków Unicode. Wybierz intensywność, obejrzyj warianty i skopiuj uszkodzony tekst do profilu, mema lub horrorowego wpisu.
Generator losowych imion i nazwisk
Generuj wiarygodne angielskie imiona i nazwiska na podstawie popularnych list. Wybierz płeć, liczbę i format.
Narzędzie jest dostępne w innych językach
- Trình xóa dòng trùng [VI]
- Suppression des lignes en double [FR]
- Duplikatzeilenentferner [DE]
- Penghapus Baris Duplikat [ID]
- Dubbele-regelverwijderaar [NL]
- 重複行削除ツール [JA]
- Eliminador de líneas duplicadas [ES]
- 重复行删除器 [ZH]
- 중복 줄 제거기 [KO]
- Yinelenen Satır Kaldırıcı [TR]
- Ta bort dubbletter av rader [SV]
- Duplicate Line Remover [EN]
- ตัวลบบรรทัดซ้ำ [TH]
- Removedor de linhas duplicadas [PT]
- أداة إزالة السطور المكررة [AR]
- Rimuovi righe duplicate [IT]
- Удаление дубликатов строк [RU]