Name des Teilnehmers: Joshua Oehms
Projekttitel: INDEX: INtegration Domänenspezifischer Konzepte und Extrahierten Wissens zur strukturierten Darstellung medizinischer Literatur
Beschreibung des IT-Forschungsprojektes:
Das Forschungsvorhaben INDEX adressiert die grundlegende Herausforderung, dass der stetig wachsende Wissensschatz der Medizin zu einem Großteil in unstrukturierter, natürlicher Sprache vorliegt. Obwohl Wissen seit jeher schriftlich dokumentiert wird, sind diese Inhalte oft nicht systematisch oder nur mit einem extrem hohen personellen Aufwand nutzbar. Besonders bei medizinischen Systematic Reviews und Metastudien spielen das strukturierte Durchsuchen und Aggregieren publizierter Inhalte eine zentrale Rolle. Hierbei besitzen die definierten Suchkriterien oft komplexe semantische Bedeutungen, die mit einfachen Stichwortsuchen nicht adäquat abgedeckt werden können. Trotz Bemühungen zur Formalisierung bleibt ein Großteil dieser Informationen für die Forschung schwer zugänglich, was die evidenzbasierte medizinische Entscheidungsfindung erschwert.
Eine wesentliche Hürde liegt in der großen sprachlichen Varianz medizinischer Daten, da Fachbegriffe, Markennamen und chemische Bezeichnungen oft uneinheitlich verwendet werden. Digitale Suchmethoden können diese semantischen Zusammenhänge ohne Kontextsensitivität meist nicht vollständig erfassen. Zwar helfen moderne NLP-Technologien bei der maschinellen Verarbeitung durch Vektoreinbettungen, doch stoßen diese bei umfangreichen wissenschaftlichen Artikeln und komplexen semantischen Beziehungen häufig an ihre Grenzen. Oft werden entscheidende Informationen durch eine Flut an irrelevanten Details im Volltext überlagert oder doppeldeutige Konzepte werden falsch zugeordnet.
Vor diesem Hintergrund untersucht das Projekt INDEX, wie die Grenzen aktueller vektor- und stichwortbasierter Retrieval-Systeme durch die Nutzung domänenspezifischer, semantischer Strukturen überwunden werden können. Im Fokus steht die Verbesserung der maschinellen Wissensrepräsentation durch die direkte Einbeziehung strukturierender Konzepte in die Datenmodelle. Das Projekt erforscht hierzu unterschiedliche Ansätze, wie zum Beispiel hybride Strategien, die vektorbasierte Ähnlichkeitssuchen mit der expliziten Extraktion biomedizinischer Merkmale kombinieren.
Software Campus Partner: TU München und Holtzbrinck
Umsetzungszeitraum: 01.01.2026 – 31.12.2027








































![[KOM,BI]: Kozitierungsbasierte Maschinelle Lernverfahren zur Bestimmung Vielversprechender Forschungsvorhaben](https://softwarecampus.de/wp-content/uploads/2022/02/KOMBI-768x768.png)































































