Finanzwesen

Document AI im Finanzwesen: Erweiterung eines multimodalen Ensemble-Modells zur automatisierten Klassifikation von Immobiliendokumenten

Wie ein IT-Dienstleister im Finanzsektor sein bestehendes KI-System zur Dokumentenverarbeitung erfolgreich um neue Dokumentenklassen erweiterte und verschiedene Modelle in einer einheitlichen, skalierbaren Architektur konsolidierte.
Person am Schreibtisch sortiert Immobilien-Dokumente in eine Ablage (KI-generiert)

Ausgangssituation

Ein führender IT-Dienstleister im Finanzsektor betreibt ein KI-gestütztes System zur automatischen Klassifikation von Dokumenten der Immobilienfinanzierung. Das bestehende System konnte bereits rund 30 verschiedene Dokumentenklassen zuverlässig erkennen und verarbeiten. Mit dem stetig wachsenden Volumen an hochgeladenen Dokumenten durch die Sachbearbeiter entstand jedoch der strategische Bedarf, das System um weitere, für die Immobilienfinanzierung zentrale Dokumentenklassen zu erweitern.

Ohne die automatische Erkennung dieser spezifischen Klassen mussten die zuständigen Mitarbeiter diese Dokumente manuell identifizieren und zuordnen, was den Bearbeitungsprozess verlangsamte und wertvolle Ressourcen band. Die Herausforderung bestand nicht nur in der Integration der neuen Klassen, sondern auch in der strategischen Konsolidierung verschiedener, parallel entwickelter Modelle in ein einheitliches, leistungsstarkes Gesamtmodell. Zudem musste die Entwicklung unter strengen regulatorischen Vorgaben und in einer restriktiven On-Premise-Infrastruktur des Rechenzentrums erfolgen, was höchste Anforderungen an die Datensicherheit und den Entwicklungsprozess stellte.

Unsere Lösung

Um die Anforderungen an Skalierbarkeit und Präzision zu erfüllen, wurde das bestehende multimodale Ensemble-Modell um die neuen Dokumentenklassen erweitert und neu trainiert. Der Fokus lag dabei auf einer robusten Architektur, die sowohl Text- als auch Bildinformationen verarbeitet und sich flexibel um neue Dokumentenklassen erweitern lässt.

  • Multimodale Ensemble-Architektur: Die technische Basis bildet das etablierte Ensemble-Modell, das Text- und Bildinformationen kombiniert. Eine Natural Language Processing-Komponente verarbeitet den mittels OCR extrahierten Text jeder einzelnen Dokumentseite, während eine Computer Vision-Komponente parallel das visuelle Erscheinungsbild der Seite analysiert. Die Ergebnisse beider Modelle werden auf Logit-Ebene fusioniert, um eine präzise finale Klassifikationsentscheidung zu treffen, die sowohl inhaltliche als auch strukturelle Merkmale berücksichtigt.
  • Strukturierte Datenaufbereitung und Labeling: Aufgrund der variierenden Qualität der historischen Finanzdokumente war eine systematische Datenaufbereitung essenziell. In einem iterativen Prozess wurden repräsentative Datensätze für die neuen Dokumentenklassen analysiert und manuell annotiert. Durch die Erstellung präziser Label-Guides und den Einsatz professioneller Annotationswerkzeuge konnte eine hohe Datenqualität sichergestellt werden, die als verlässliche Grundlage für das anschließende Modelltraining diente.
  • Erweiterung und Konsolidierung im Modell-Training: In einem ersten Schritt wurde das Ensemble-Modell mit den beiden neuen Dokumentenklassen neu trainiert. Anschließend galt es, mehrere parallel entwickelte Modelle und ihre Datensätze zusammenzuführen. Diese wurden zu einem gemeinsamen Gesamtdatensatz konsolidiert, auf dessen Basis das Modell erneut von Grund auf trainiert wurde. Systematisches Experiment Tracking machte die Trainingsläufe vergleichbar und nachvollziehbar. Das resultierende Gesamtmodell behält die Erkennungsleistung für die bisherigen rund 30 Dokumententypen bei.

Die finale Lösung wurde als Docker-basierter Service On-Premise in einem Kubernetes-Cluster im Rechenzentrum des Kunden bereitgestellt und in den bestehenden Klassifikationsservice integriert.

Ergebnisse & Business-Impact

Durch die Erweiterung und Konsolidierung des Klassifikationsmodells deckt die automatische Dokumentenverarbeitung nun einen größeren Teil der eingehenden Unterlagen ab. Die neuen Dokumentenklassen werden vollautomatisch und zuverlässig klassifiziert. Dies schließt eine Lücke im digitalen Verarbeitungsprozess der Immobilienfinanzierung.

Für die Sachbearbeiter liegen hochgeladene Immobiliendokumente damit bereits vorklassifiziert vor und lassen sich den entsprechenden Vorgängen zuordnen, ohne dass der Dokumententyp zuvor manuell bestimmt werden muss. Gleichzeitig wurde durch die Zusammenführung der verschiedenen Modelle in eine einheitliche Architektur die Wartbarkeit des Systems verbessert und eine solide Grundlage für die zukünftige Integration weiterer Dokumentenklassen geschaffen, ohne die Performance bei bestehenden Klassen zu beeinträchtigen.

Inhalt
Branche
Finanzwesen
Thema
Computer Vision
Deep Learning
Document AI
Natural Language Processing
Dauer
10 Monate
Jetzt teilen
Link kopiert!
Dr. Jürgen Stumpp

Bereit für den nächsten Schritt?

Lassen Sie uns gemeinsam herausfinden, wie wir Ihr Unternehmen mit maßgeschneiderter KI unterstützen können.

Dr. Jürgen Stumpp
Managing Partner | AI Strategy Consultant
+49 170 9374842
Kontakt aufnehmen
Case Studies

Erfolgsgeschichten, die zeigen, was KI leisten kann

Als spezialisiertes KI-Beratungs- und Entwicklungsunternehmen aus Karlsruhe realisiert AMAI praxisnahe und verantwortungsvolle KI-Lösungen. Unser Anspruch: Mensch und KI arbeiten gemeinsam für konkrete, messbare Ergebnisse. Hier zeigen wir Ihnen, wie wir Unternehmen verschiedener Branchen dabei unterstützen, mit Künstlicher Intelligenz echten Mehrwert zu schaffen.