Rozmyte dopasowywanie list

Uzgadnianie eksportu z CRM z arkuszem klientów faktur albo dopasowywanie nazw dostawców z dwóch różnych ERP niemal zawsze rozbija się o drobne różnice, „Acme Corp.” kontra „ACME Corporation” kontra „acme corp”. Wklej obie listy, ustaw próg podobieństwa, a narzędzie zasugeruje najlepszego kandydata z listy B dla każdego wpisu z listy A, oznaczając te poniżej progu do ręcznej weryfikacji.

Jak dopasować dwie niechlujne listy

  1. 1

    Wklej listę A

    Jeden wpis na wiersz: nazwy klientów, kody produktów, adresy.

  2. 2

    Wklej listę B

    Pula kandydatów. Różnice w wielkości liter, odstępach i literówki są OK.

  3. 3

    Ustaw próg

    Procent podobieństwa, powyżej którego dopasowanie jest akceptowane (70% to sensowna wartość domyślna).

  4. 4

    Odczytaj raport

    Każdy element A jest sparowany z najlepszym kandydatem B i wynikiem pewności. Elementy poniżej progu są oznaczone do przeglądu.

Jak mierzone jest podobieństwo

Narzędzie używa similar_text z PHP (wyniku najdłuższego wspólnego podciągu) i podaje rezultat jako procent. Wyższy jest lepszy; dokładne dopasowanie to 100%.

Próg Zachowanie
≥ 95% Niemal identyczne, tylko różnice wielkości liter lub spacji
80–94% Literówki, brak interpunkcji, obcięte sufiksy
60–79% Zmiany kolejności słów, skróty kontra pełne formy
< 60% Prawdopodobnie nie jest realnym dopasowaniem, przejrzyj ręcznie

Wskazówki

  • Najpierw znormalizuj, jeśli znasz typowy szum: małe litery, usuwanie interpunkcji, scalanie spacji. Dostaniesz ciaśniejsze wyniki.
  • Usuń sufiksy firmowe („Inc”, „Ltd”, „GmbH”), jeśli pojawiają się niespójnie na jednej liście, a nie na drugiej.
  • Rozdziel długie adresy, dopasowanie „ulica + miasto” osobno bije dopasowanie jednej złączonej linii.
  • Uważaj na jeden-do-wielu. Narzędzie wybiera najlepsze dopasowanie B na wpis A; nie zapobiega temu, by ten sam B pasował do wielu wierszy A.

Kiedy użyć surowszego algorytmu

Przy dużych pracach deduplikacyjnych odległość Levenshteina lub Jaro–Winkler bije similar_text, zwłaszcza dla nazw, gdzie pozycja znaków ma znaczenie. Jeśli rozmyte dopasowanie napędza rozliczenia lub scalania, sprawdź wyrywkowo 20 losowych par przed zaufaniem wynikowi na skalę.

Najczęściej zadawane pytania

70% wychwytuje większość prawdziwych dopasowań, sygnalizując realne pominięcia. Zaostrz do 85%, jeśli lista B jest czysta i nie stać Cię na fałszywe trafienia; poluzuj do 55%, jeśli obie listy są zaszumione i planujesz wszystko przejrzeć ręcznie.

Tak, ale najpierw znormalizuj, usuń spacje, myślniki i prefiksy kierunkowe kraju, e-maile na małe litery. Rozmyte dopasowanie surowych wartości poda niskie wyniki dla strukturalnie identycznych wpisów.

Wewnętrznie narzędzie zamienia obie strony na małe litery przed porównaniem, więc „Apple” i „apple” dają 100%.

Tak, dopasowywanie odbywa się po stronie serwera, więc obie listy są wysyłane do narzędzia w celu porównania. Są przetwarzane w pamięci na czas tego jednego żądania i nie są później przechowywane ani zapisywane w logach.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach