Rozmyte dopasowywanie list
Uzgadnianie eksportu z CRM z arkuszem klientów faktur albo dopasowywanie nazw dostawców z dwóch różnych ERP niemal zawsze rozbija się o drobne różnice, „Acme Corp.” kontra „ACME Corporation” kontra „acme corp”. Wklej obie listy, ustaw próg podobieństwa, a narzędzie zasugeruje najlepszego kandydata z listy B dla każdego wpisu z listy A, oznaczając te poniżej progu do ręcznej weryfikacji.
Jak dopasować dwie niechlujne listy
-
1
Wklej listę A
Jeden wpis na wiersz: nazwy klientów, kody produktów, adresy.
-
2
Wklej listę B
Pula kandydatów. Różnice w wielkości liter, odstępach i literówki są OK.
-
3
Ustaw próg
Procent podobieństwa, powyżej którego dopasowanie jest akceptowane (70% to sensowna wartość domyślna).
-
4
Odczytaj raport
Każdy element A jest sparowany z najlepszym kandydatem B i wynikiem pewności. Elementy poniżej progu są oznaczone do przeglądu.
Jak mierzone jest podobieństwo
Narzędzie używa similar_text z PHP (wyniku najdłuższego wspólnego podciągu) i podaje rezultat jako procent. Wyższy jest lepszy; dokładne dopasowanie to 100%.
| Próg | Zachowanie |
|---|---|
| ≥ 95% | Niemal identyczne, tylko różnice wielkości liter lub spacji |
| 80–94% | Literówki, brak interpunkcji, obcięte sufiksy |
| 60–79% | Zmiany kolejności słów, skróty kontra pełne formy |
| < 60% | Prawdopodobnie nie jest realnym dopasowaniem, przejrzyj ręcznie |
Wskazówki
- Najpierw znormalizuj, jeśli znasz typowy szum: małe litery, usuwanie interpunkcji, scalanie spacji. Dostaniesz ciaśniejsze wyniki.
- Usuń sufiksy firmowe („Inc”, „Ltd”, „GmbH”), jeśli pojawiają się niespójnie na jednej liście, a nie na drugiej.
- Rozdziel długie adresy, dopasowanie „ulica + miasto” osobno bije dopasowanie jednej złączonej linii.
- Uważaj na jeden-do-wielu. Narzędzie wybiera najlepsze dopasowanie B na wpis A; nie zapobiega temu, by ten sam B pasował do wielu wierszy A.
Kiedy użyć surowszego algorytmu
Przy dużych pracach deduplikacyjnych odległość Levenshteina lub Jaro–Winkler bije similar_text, zwłaszcza dla nazw, gdzie pozycja znaków ma znaczenie. Jeśli rozmyte dopasowanie napędza rozliczenia lub scalania, sprawdź wyrywkowo 20 losowych par przed zaufaniem wynikowi na skalę.
Najczęściej zadawane pytania
70% wychwytuje większość prawdziwych dopasowań, sygnalizując realne pominięcia. Zaostrz do 85%, jeśli lista B jest czysta i nie stać Cię na fałszywe trafienia; poluzuj do 55%, jeśli obie listy są zaszumione i planujesz wszystko przejrzeć ręcznie.
Tak, ale najpierw znormalizuj, usuń spacje, myślniki i prefiksy kierunkowe kraju, e-maile na małe litery. Rozmyte dopasowanie surowych wartości poda niskie wyniki dla strukturalnie identycznych wpisów.
Wewnętrznie narzędzie zamienia obie strony na małe litery przed porównaniem, więc „Apple” i „apple” dają 100%.
Tak, dopasowywanie odbywa się po stronie serwera, więc obie listy są wysyłane do narzędzia w celu porównania. Są przetwarzane w pamięci na czas tego jednego żądania i nie są później przechowywane ani zapisywane w logach.
Powiązane narzędzia
Tabela ASCII
Pełna tabela ASCII od 0 do 127 z zapisem dziesiętnym, szesnastkowym, ósemkowym i binarnym oraz notacją numerycznych odwołań HTML, w tym kodami sterującymi NUL, LF i DEL.
Referencja znaków HTML
Przeszukiwalna lista encji HTML wraz z ich kodami nazwanymi i liczbowymi oraz kopiowaniem jednym kliknięciem specjalnych znaków i symboli.
Skróty klawiaturowe
Wyszukuj udokumentowane skróty domyślne VS Code, Chrome i Bash z GNU Readline w macOS, Windows i Linux.
Generator EditorConfig
Wygeneruj plik .editorconfig z własnymi regułami stylu i rozmiaru wcięć, końca linii, kodowania i białych znaków, aby uzyskać spójne formatowanie w różnych IDE i edytorach.
Walidator adresów e-mail
Zweryfikuj adres e-mail: sprawdzenie składni RFC 5322, sprawdzenie rekordu MX w czasie rzeczywistym oraz szczegóły dotyczące części lokalnej, domeny i długości. Żadna wiadomość nie jest wysyłana.
Formatowanie HTML
Formatuj HTML lokalnie w przeglądarce, używając wcięć dwóch lub czterech spacji. HTML nie jest wysyłany ani walidowany.
Narzędzie jest dostępne w innych językach
- Correspondance de listes floues [FR]
- 퍼지 목록 매처 [KO]
- مطابق القوائم الضبابية [AR]
- Luddig listmatchare [SV]
- Fuzzy-Listenabgleich [DE]
- Comparador de Listas Difusas [ES]
- เครื่องจับคู่รายการแบบฟัซซี่ (Fuzzy List Matcher) [TH]
- Pembanding Daftar Fuzzy [ID]
- ファジーリストマッチャー [JA]
- Bộ so khớp danh sách mờ [VI]
- Fuzzy lijstmatcher [NL]
- Correspondência de Lista Difusa [PT]
- Fuzzy List Matcher [EN]
- Corrispondente di Liste Fuzzy [IT]
- Метод сопоставления нечётких списков [RU]
- Bulanık Liste Eşleştirici [TR]
- 模糊列表匹配器 [ZH]