Name des Teilnehmers: Jan-Micha Bodensohn
Projekttitel: ADEE: Automatisierte Datenaufbereitung in Unternehmenskontexten mithilfe großer Sprachmodelle
Beschreibung des IT-Forschungsprojektes:
Große Unternehmen erzeugen gigantische Datenmengen. Jede Transaktion, jeder Prozess und jede Geschäftshandlung hinterlässt eine Spur in den Unternehmensdaten, in der sich wertvolle Informationen verbergen. Welche Kosten sind entstanden? Wie entwickelt sich die Nachfrage? Wo gibt es Engpässe oder Ausfälle? Um diese Informationen nutzbar zu machen, müssen die entsprechenden Daten jedoch erst für ihren konkreten Anwendungsfall aufbereitet werden. Dieser Prozess, der aus den im Unternehmen anfallenden Rohdaten die passenden auswählt und für eine Anwendung vorbereitet, wird als Data Engineering bezeichnet.
Die Fragmentierung der Unternehmensdaten in eine Vielzahl von Datensystemen macht Data Engineering zu einer komplexen Aufgabe. Während manche Daten in relationalen Datenbanken mit durchdachtem Schema gespeichert sind, liegen viele Daten lediglich in sogenannten Data Lakes, in denen sie in ihrer Rohform ohne einheitliche Organisation gespeichert werden. Viele Projekte beginnen deshalb mit der langwierigen Suche nach brauchbaren Daten, die dann erst aufwendig extrahiert und integriert werden müssen. Dieser Prozess ist auch heute noch mit einem hohen Aufwand verbunden und erfordert neben technischen Fähigkeiten auch konkretes Wissen über die Datenorganisation im Unternehmen.
Das Ziel des Software Campus-Projekts ADEE ist deshalb die Automatisierung des Data Engineerings im Unternehmenskontext, indem für neue Anwendungen automatisch die passenden Daten gefunden und vorbereitet werden. Anstatt manuell nach Daten zu suchen und Programme für ihre Verarbeitung zu implementieren, beschreiben Nutzer in unserer Vision des automatischen Data Engineerings losgelöst von der zugrundeliegenden Datenorganisation im Unternehmen, welche Daten sie für ihre Anwendungen benötigen.
Um dennoch die passenden Daten zu finden und für ihre Anwendung vorzubereiten, setzt das Projekt auf große Sprachmodelle (Large Language Models, kurz LLMs), die als Agenten mit den Unternehmensdaten interagieren und dabei Ausführungspläne erstellen, anhand derer die Daten für ihre konkrete Anwendung vorbereitet werden. Dazu erforscht das Projekt zunächst, wie Agenten effizient mit großen Datenmengen interagieren und so einfache Datenprobleme lösen können. Anschließend entwickelt es Strategien, anhand derer Agenten komplexe Datenprobleme lösen und so den Prozess des Data Engineerings von Anfang bis Ende automatisieren können.
Software Campus Partner: TU Darmstadt & Celonis SE
Umsetzungszeitraum: 01.01.2026 – 30.06.2027








































![[KOM,BI]: Kozitierungsbasierte Maschinelle Lernverfahren zur Bestimmung Vielversprechender Forschungsvorhaben](https://softwarecampus.de/wp-content/uploads/2022/02/KOMBI-768x768.png)































































