Die Herausforderung
LLM-basierte Datenqualitätsanalysen greifen meist auf allgemeines Wissen zurück. Unternehmensspezifische Regeln, Abläufe und Besonderheiten befinden sich dagegen häufig nur in den Köpfen der Mitarbeitenden oder in Dokumenten innerhalb isolierter Datensilos. Dadurch entstehen zahlreiche Fehlalarme (False Positives), während fachliche Fehler unentdeckt bleiben. Die zentrale Herausforderung ist, relevantes Kontextwissen im Chat zuverlässig und möglichst vollständig zu erfassen. Dazu müssen statische Grundfragen mit dynamischen Fragen kombiniert werden, die sich aus Auffälligkeiten in den Daten ergeben.
Unsere Leistung
Wir entwickeln einen Chat-Agenten zur Kontextsammlung nach gängigen Agentenkonventionen. Dazu erarbeiten wir einen statischen Fragenkatalog mit Folgefragen sowie ein System zur dynamischen Fragengenerierung. Dieses clustert Produktstammdaten und untersucht sie mit klassischen Algorithmen auf Auffälligkeiten, um gezielte Rückfragen abzuleiten. Ergänzend integrieren wir eine LLM-basierte Datenqualitätsanalyse, die Fehler unter Einbezug des erfassten Kontextwissens erkennt.
Das Ergebnis
Bis zum Projektende entsteht ein funktionsfähiger Prototyp, der Kontextwissen dialogbasiert erfasst, statische und dynamische Fragen stellt und die Antworten für die Analyse von Produktstammdaten nutzt. DataGenie soll mehr fachliche Fehler erkennen, False Positives reduzieren und Expertenwissen dauerhaft sichern. Dadurch sinkt der manuelle Aufwand für Datenverantwortliche bei der Prüfung und nachhaltigen Verbesserung der Datenqualität.
Die Partner
- Fraunhofer-Institut für Materialfluss und Logistik IML
Die Förderung
- Das Projekt ist Teil des Leistungszentrums Logistik und IT
- Laufzeit: Mai 2026 – Oktober 2026