Lab NLP: Disambiguating biological entities in scientific language
In biomedizinischen Fachtexten haben gleiche Wörter je nach Kontext ganz unterschiedliche Bedeutungen. Die manuelle Zuordnung dieser Begriffe kostet Forschende viel Zeit. Eine End-to-End-Pipeline übernimmt das automatisch — mit FAISS-Ähnlichkeitssuche über MeSH, UMLS, Wikidata und DBpedia, domänenspezifischen Filterregeln und einem lokal betriebenen, per LoRA feinjustierten LLM.
- Zeitraum
- Apr 2026 — heute
- Rolle
- Lab-Projekt
- Kontext
- Bonn-Aachen International Center for Information Technology (b-it) · Supervisor: Frederik Labonte
Über das Projekt
In biomedizinischen Fachtexten haben identische Begriffe je nach Kontext unterschiedliche Bedeutungen. Die manuelle Zuordnung dieser Begriffe zu den passenden Einträgen in Fachdatenbanken kostet Forschende viel Zeit und bremst die eigentliche wissenschaftliche Arbeit aus.
Das Projekt entwickelt eine End-to-End-Pipeline, die diese Zuordnung automatisiert: Kandidaten werden über Embedding-basierte Ähnlichkeitssuche mit FAISS in mehreren biomedizinischen und allgemeinen Wissensdatenbanken gefunden, über domänenspezifische Regeln gefiltert und anschließend von einem lokal betriebenen LLM final aufgelöst.
Weil es um sensible Forschungsdaten geht, läuft das Sprachmodell bewusst on-premise über LM Studio — die Daten verlassen die eigene Infrastruktur zu keinem Zeitpunkt. Für die Domäne wurde das Modell per LoRA auf dem Universitäts-GPU-Cluster Bender feinjustiert; Pydantic AI erzwingt schema-validierte, maschinell weiterverarbeitbare Ausgaben statt freier Textantworten.
Kernpunkte
- End-to-End-Pipeline, die mehrdeutige biomedizinische Begriffe automatisch dem korrekten Datenbankeintrag zuordnet und den manuellen Annotationsaufwand deutlich reduziert
- Embedding-basiertes Candidate Retrieval per FAISS über MeSH, UMLS, Wikidata und DBpedia, kombiniert mit domänenspezifischen Filterregeln
- Lokal gehostetes LLM via LM Studio für die finale Disambiguierung — sensible Forschungsdaten bleiben on-premise
- LoRA-Fine-Tuning auf dem GPU-Cluster Bender der Universität; strukturierte Ausgaben mit Pydantic AI für verlässliche, schema-validierte Ergebnisse
Tech-Stack
Sprache
NLP & KI
Retrieval
Infrastruktur
Fragen zu diesem Projekt?