Startseite Themen Brennpunkt INNOVATIONSPREIS-IT IT-Bestenliste INDUSTRIEPREIS INDUSTRIE-Bestenliste TrafficGenerator
INNOVATIONSPREIS-IT 2017

Drucken
Mittelstandspresse

21.09.2026

KI braucht saubere Identitäten, nicht nur mehr Daten

Warum Dubletten, unterschiedliche Schreibweisen und verteilte Datenbestände zum Problem für KI und automatisierte Prozesse werden

KI versteht Sprache. Aber erkennt sie auch, welche Daten zusammengehören?
KI versteht Sprache. Aber erkennt sie auch, welche Daten zusammengehören?

Konstanz, 21.09.2026 (PresseBox) - Unternehmen investieren in künstliche Intelligenz, RAG, intelligente Assistenten und zunehmend auch in KI Agenten. Gleichzeitig bleibt eine wesentlich ältere Frage bestehen: Wissen die Systeme eigentlich, welche Daten zu welcher Person oder welchem Unternehmen gehören?

Ein Beispiel: Ein Geschäftspartner wird im CRM als „Müller Maschinenbau GmbH“ geführt, im ERP als „Mueller Maschinenbau“ und in einem weiteren System als „Müller Maschinenbau GmbH & Co.“. Dazu kommen unterschiedliche Adressen, Ansprechpartner oder unvollständige Stammdaten.

Für einen Menschen kann schnell erkennbar sein, dass diese Datensätze zusammengehören. Für ein automatisiertes System ist das keineswegs selbstverständlich.

Und genau hier beginnt ein Problem, das durch den Einsatz von KI nicht verschwindet.

Mehr KI macht Daten nicht automatisch eindeutig

Large Language Models können Texte verstehen, Informationen zusammenfassen und Zusammenhänge herstellen. Sie sind jedoch kein Ersatz für eine verlässliche Zuordnung von Identitäten innerhalb großer strukturierter Datenbestände.

Wenn ein KI System Informationen zu einem Kunden, Geschäftspartner oder einer Person benötigt, muss zunächst geklärt sein, welche Datensätze tatsächlich zu dieser Entität gehören.

Sind beispielsweise Kundendaten auf CRM, ERP, Vertragsverwaltung und weitere Anwendungen verteilt, können unterschiedliche Schreibweisen und Datenstände existieren. Fehlerhafte Eingaben, fehlende Felder, Namensänderungen oder abweichende Adressen erschweren die Zuordnung zusätzlich.

Das Problem wird durch Automatisierung sogar relevanter. Denn je mehr Prozesse Maschinen selbstständig ausführen, desto wichtiger wird die Qualität der zugrunde liegenden Zuordnung.

Datenqualität ist mehr als ein korrekt geschriebenes Feld

Datenqualität wird häufig mit vollständigen und korrekt gepflegten Datensätzen gleichgesetzt. Doch ein Datensatz kann für sich betrachtet korrekt sein und trotzdem ein Problem verursachen.

Entscheidend ist auch die Frage: Welche Datensätze beschreiben dieselbe reale Identität?

Genau damit beschäftigt sich Identity Resolution.

Dabei werden Datensätze anhand verschiedener Merkmale miteinander verglichen. Bei Personen können dies beispielsweise Name, Anschrift oder Geburtsdaten sein. Bei Unternehmen kommen Firmenname, Rechtsform, Adresse oder weitere Identifikationsmerkmale hinzu.

Das Ziel besteht nicht darin, lediglich identische Datensätze zu finden. Gute Identity Resolution muss auch erkennen können, wenn Informationen voneinander abweichen und trotzdem dieselbe reale Entität beschreiben.

Exakte Suche reicht in realen Datenbeständen nicht aus

Das klingt zunächst einfach. In der Praxis sind Daten jedoch selten einheitlich.

„Schmidt“ und „Schmitt“ können dieselbe Person bezeichnen. „Müller“ und „Mueller“ können zusammengehören. Ein Vorname kann ausgeschrieben oder abgekürzt sein. Firmenbezeichnungen enthalten unterschiedliche Rechtsformen oder Zusätze. Adressen verändern sich.

Gleichzeitig darf Ähnlichkeit allein nicht dazu führen, dass zwei unterschiedliche Personen oder Unternehmen fälschlicherweise zusammengeführt werden.

Die Herausforderung liegt deshalb zwischen zwei Extremen: relevante Zusammenhänge trotz Abweichungen zu erkennen und gleichzeitig falsche Zuordnungen zu vermeiden.

Genau dafür wurde M|MAKER entwickelt

Die exorbyte GmbH beschäftigt sich seit mehr als 20 Jahren mit dieser Aufgabenstellung.

M|MAKER durchsucht und vergleicht große Datenbestände fehlertolerant. Dabei können verschiedene Merkmale und Matching Verfahren kombiniert werden. Dazu gehören beispielsweise Edit Distanzen, phonetische Verfahren und feldspezifische Bewertungen.

Statt ausschließlich nach exakten Übereinstimmungen zu suchen, bewertet die Software, wie gut Datensätze zueinander passen.

Ein wichtiger Aspekt dabei ist die Nachvollziehbarkeit. Anwender können erkennen, welche Merkmale zu einer Bewertung beigetragen haben. Damit wird aus einem Treffer eine erklärbare Zuordnung.

Auf dieser Grundlage lassen sich Dubletten erkennen, Datenbestände konsolidieren und Datensätze zu gemeinsamen Identitäten beziehungsweise Clustern zusammenführen.

Warum das für KI wichtig wird

Mit RAG, KI Assistenten und Agenten bekommt Identity Resolution eine neue Bedeutung.

Ein KI Agent, der in Unternehmensprozessen arbeitet, benötigt Kontext. Er muss beispielsweise Informationen zu einem Geschäftspartner aus unterschiedlichen Datenquellen zusammentragen oder Vorgänge einer bestimmten Person zuordnen.

Dafür reicht es nicht immer aus, semantisch ähnliche Inhalte zu finden. Das System muss auch wissen, welche Informationen tatsächlich zur gesuchten Entität gehören.

Semantische Suche beantwortet beispielsweise die Frage: Welche Inhalte passen zu meiner Anfrage?

Identity Resolution beantwortet eine andere Frage: Welche Datensätze gehören tatsächlich zu derselben Person oder demselben Unternehmen?

Beide Fähigkeiten können sich innerhalb moderner KI Architekturen ergänzen.

Automatisierung braucht Verlässlichkeit

Das wird insbesondere dann relevant, wenn KI nicht mehr nur Texte erzeugt, sondern Prozesse vorbereitet oder selbstständig Aktionen ausführt.

Solange ein Mensch das Ergebnis einer Suche prüft, können Unsicherheiten häufig erkannt werden. Bei automatisierten Abläufen wird diese Kontrollinstanz kleiner.

„Mit KI steigt nicht nur der Wert guter Daten. Es steigt auch die Bedeutung einer zuverlässigen Zuordnung“, sagt Thilo Torkler, Geschäftsführer der exorbyte GmbH. „Bevor ein Agent mit Daten arbeitet, sollte möglichst klar sein, mit welcher Person, welchem Unternehmen oder welcher anderen Entität er es tatsächlich zu tun hat.“

Damit wird Identity Resolution von einer klassischen Disziplin der Datenqualität zunehmend zu einer möglichen Grundlage für automatisierte und KI gestützte Prozesse.

Erst verstehen, dann automatisieren

Die Entwicklung hin zu KI Agenten verändert deshalb nicht die grundlegenden Anforderungen an Unternehmensdaten.

Sie macht sie sichtbarer.

Unternehmen müssen nicht nur wissen, welche Daten sie besitzen. Sie müssen verstehen, welche Informationen zusammengehören, wo Widersprüche bestehen und welche Datensätze dieselbe reale Identität beschreiben.

Erst auf dieser Grundlage können RAG Systeme, KI Assistenten und automatisierte Prozesse gezielt auf den richtigen Kontext zugreifen.

Die zentrale Herausforderung der nächsten Generation von Unternehmens KI liegt deshalb nicht allein darin, immer leistungsfähigere Modelle einzusetzen.

Sie liegt auch darin, den Modellen und Agenten die richtigen Daten über die richtigen Identitäten bereitzustellen.

 

Ansprechpartner

Thilo Torkler
Zuständigkeitsbereich: CEO

Über exorbyte GmbH:

Die exorbyte GmbH aus Konstanz entwickelt seit 2001 Software für fehlertolerantes Data Matching, Identity Resolution und Retrieval. M|MAKER wird eingesetzt, um Personen, Unternehmen und andere Entitäten auch bei fehlerhaften, unvollständigen oder unterschiedlich geschriebenen Daten zu finden, zu vergleichen und zuverlässig zuzuordnen.

Die Technologie lässt sich in bestehende IT Landschaften integrieren und bildet eine Grundlage für Datenqualität, Datenkonsolidierung, Retrieval sowie moderne KI und RAG Anwendungen.

Datei-Anlagen:


(437 kB)
1629272.attachment

KI versteht Sprache. Aber erkennt sie auch, welche Daten zusammengehören?