Zum Hauptinhalt springen
Handel Schweiz

Intelligente Duplikatserkennung für Adressen und Kontakte

Für Handel Schweiz entwickelte CONSENSO TECH eine Mini-Applikation zur intelligenten Duplikatserkennung in Adress- und Kontaktdaten. Mit einem vektorbasierten Ansatz werden nicht nur exakte Duplikate erkannt, sondern auch ähnliche Schreibweisen, Abkürzungen und abweichende Kontaktinformationen.

Auf einen Blick

Ausgangslage

  • Duplikate in Firmenadressen und Kontakten
  • Abweichende Schreibweisen, Tippfehler, Abkürzungen und Zusatzinformationen
  • Standardfunktionen erkennen oft nur exakte Übereinstimmungen
  • Datenqualität ist zentral für Rechnungsstellung und Reporting
  • Manuelle Duplikatserkennung ist zeitaufwendig und fehleranfällig

Lösung

  • Konzept und Prototyp für intelligente Duplikatserkennung
  • Vektorbasierter Vergleich von Adress- und Kontaktdaten
  • Einsatz von TF-IDF und Cosine Similarity
  • Bewertung potenzieller Dubletten anhand von Ähnlichkeitsscores
  • Grundlage für UI-gestützte Bereinigung, Reports und Datenqualitäts-Dashboards
  • Flexible Schwellenwerte und Gewichtungen für unterschiedliche Datenqualitätsregeln

Ergebnis

  • Bessere Erkennung nicht offensichtlicher Duplikate
  • Höhere Datenqualität in Adress- und Kontaktdaten
  • Weniger manuelle Prüfaufwände
  • Verlässlichere Grundlage für Rechnungsstellung und Reporting
  • Möglichkeit für kontinuierlichen Data-Quality-Cycle
  • Basis für proaktives Stammdatenmanagement

Im Rahmen der ERP-Transformation von Handel Schweiz zeigte sich, dass Datenqualität ein zentraler Erfolgsfaktor für korrekte Rechnungsstellung, Reporting und effiziente operative Prozesse ist. Besonders herausfordernd waren Duplikate in Firmenadressen und Kontakten, die nicht immer als 1:1-Dubletten auftreten, sondern häufig kleine Abweichungen, unterschiedliche Schreibweisen oder ergänzende Informationen enthalten.

CONSENSO TECH entwickelte dafür ein Konzept und einen Prototyp zur intelligenten Duplikatserkennung. Adressen und Kontakte werden in eine mathematische Form überführt und mit Methoden wie TF-IDF und Cosine Similarity paarweise verglichen. Dadurch lassen sich auch ähnliche Datensätze identifizieren, bei denen klassische Dublettenprüfungen an ihre Grenzen stossen.

Der Ansatz ermöglicht eine flexiblere und präzisere Datenqualitätsprüfung als reine Standardabgleiche. Potenzielle Duplikate können nach Ähnlichkeitsscores bewertet und in einem nächsten Schritt über Workflows, UI-gestützte Bereinigung oder Reporting weiterbearbeitet werden.