DataGenie

Kontextwissen für die KI-gestützte Datenqualitätsanalyse

 

Im Projekt »DataGenie« entwickeln wir einen funktionsfähigen Prototyp für die KI-gestützte Datenqualitätsanalyse von Produktstammdaten. Ein Chat-Agent erfasst fachliches Kontextwissen von Datenverantwortlichen und Mitarbeitenden aus den Fachabteilungen. So können Large Language Models (LLMs) unternehmensspezifische Regeln berücksichtigen, Fehler präziser erkennen und Fehlalarme reduzieren.

DataGenie – Kontextwissen für die KI-gestützte Datenqualitätsanalyse

Die Herausforderung  

LLM-basierte Datenqualitätsanalysen greifen meist auf allgemeines Wissen zurück. Unternehmensspezifische Regeln, Abläufe und Besonderheiten befinden sich dagegen häufig nur in den Köpfen der Mitarbeitenden oder in Dokumenten innerhalb isolierter Datensilos. Dadurch entstehen zahlreiche Fehlalarme (False Positives), während fachliche Fehler unentdeckt bleiben. Die zentrale Herausforderung ist, relevantes Kontextwissen im Chat zuverlässig und möglichst vollständig zu erfassen. Dazu müssen statische Grundfragen mit dynamischen Fragen kombiniert werden, die sich aus Auffälligkeiten in den Daten ergeben.

 

Unsere Leistung  

Wir entwickeln einen Chat-Agenten zur Kontextsammlung nach gängigen Agentenkonventionen. Dazu erarbeiten wir einen statischen Fragenkatalog mit Folgefragen sowie ein System zur dynamischen Fragengenerierung. Dieses clustert Produktstammdaten und untersucht sie mit klassischen Algorithmen auf Auffälligkeiten, um gezielte Rückfragen abzuleiten. Ergänzend integrieren wir eine LLM-basierte Datenqualitätsanalyse, die Fehler unter Einbezug des erfassten Kontextwissens erkennt.

 

Das Ergebnis 

Bis zum Projektende entsteht ein funktionsfähiger Prototyp, der Kontextwissen dialogbasiert erfasst, statische und dynamische Fragen stellt und die Antworten für die Analyse von Produktstammdaten nutzt. DataGenie soll mehr fachliche Fehler erkennen, False Positives reduzieren und Expertenwissen dauerhaft sichern. Dadurch sinkt der manuelle Aufwand für Datenverantwortliche bei der Prüfung und nachhaltigen Verbesserung der Datenqualität.

 

Die Partner

  • Fraunhofer-Institut für Materialfluss und Logistik IML

 

Die Förderung

  • Das Projekt ist Teil des Leistungszentrums Logistik und IT
  • Laufzeit: Mai 2026 – Oktober 2026