Framework für Ahnenforschung

Ich habe seit meinem ersten Kontakt mit ChatGPT vor etwa zwei Monaten ein Framework entwickelt, das eine strukturierte Ahnenforschung mit Unterstützung durch KI ermöglichen soll.

Die Dateien habe ich jetzt in einem GitHub-Repository bereitgestellt:

Für die Benutzung müssen derzeit folgende Dateien aus dem Repository in eine KI-Umgebung hochgeladen und eingelesen werden:

  • GSL
  • GM-Core
  • GM-Exec_Source_Registration
  • GM-Exec_Person_Identity_Research
  • GM-Exec_Transcription

„Bitte lese die bereitgestellten Daten ein, ich möchte damit ein Forschungsprojekt zu … beginnen“

Danach können im Gespräch mit der KI ein Forschungsprojekt und ein Forschungsziel festgelegt werden. Anschließend lassen sich Urkunden oder andere Quellen einlesen und innerhalb dieses Forschungsrahmens bearbeiten.

1) Wie es dazu gekommen ist

Bis vor etwa zwei Monaten hatte ich noch keine Berührungspunkte mit KI. Bei meiner Familienforschung bin ich aber immer wieder an Grenzen gestoßen, insbesondere bei polnischen Urkunden.

Mein bisheriger Arbeitsablauf war beispielsweise: Transkribus hat einen Text erkannt, dieser kam anschließend in Google Übersetzer und am Ende entstand irgendeine Übersetzung. Das Ergebnis klang auf den ersten Blick teilweise durchaus interessant. Problematisch wurde es aber, wenn schon die Veränderung eines einzelnen Buchstabens die Übersetzung des gesamten Textes veränderte. Teilweise ließ sich auch ein einzelner Satz nicht sinnvoll für sich übersetzen. Damit war offensichtlich, dass bereits das Ausgangsmaterial nicht zuverlässig genug war.

Also kam ich auf die Idee, die kostenlose Version von ChatGPT auszuprobieren – zunächst einfach, „um mal eine Urkunde zu übersetzen“.
Sowohl die Transkription als auch die Übersetzung aus dem Polnischen waren erstaunlich gut.
Anfangs gab es dabei einige merkwürdige Angewohnheiten. Mit fortschreitendem Gespräch ließen diese jedoch nach. Nach einiger gemeinsamer Arbeit an den Urkunden entstand eine zunehmend gut kalibrierte Arbeitsgrundlage.

Nach mehreren Urkunden und einigen Fortschritten bei der Familienforschung zeigte sich allerdings ein anderes Problem: Die Ergebnisse ließen sich nicht ohne Weiteres in einer für die weitere Forschung dauerhaft nutzbaren Form erhalten.

Ich begann daher, Gesprächsinhalte zu kopieren und zu speichern. Das ergab aber noch immer keine wirklich brauchbare Forschungsbasis. Hinzu kam die Erkenntnis, dass ältere Inhalte bei langen Gesprächen irgendwann nicht mehr vollständig im aktuellen Gesprächskontext verfügbar waren.

2) Vom Gespräch zum Framework

Daraus entstand die Idee, von der KI ein Modell für KI-Umgebungen entwickeln zu lassen, in dem eine verbindliche wissenschaftliche Arbeitsweise beschrieben wird.
Eine erste Version habe ich an einem kleinen Sippenbuch getestet und das Framework danach schrittweise erweitert.

Die ersten Blindtests waren allerdings ernüchternd: Eine neue KI-Instanz erhielt nur die Framework-Dateien, aber nicht den vorherigen Gesprächskontext. Das Verhalten unterschied sich erheblich von dem über längere Zeit gemeinsam erarbeiteten Arbeitsmodus. Teilweise war es zu analytisch oder zu „agentisch“, an anderen Stellen fehlte die notwendige methodische Zurückhaltung wobei die KI die Initiative über die Forschung übernahm und dabei zu unrichtigen Schlussfolgerungen genommen ist.
Es waren deshalb einige weitere Anpassungen erforderlich, bis ich den Eindruck hatte, dass eine KI allein aufgrund der bereitgestellten Dateien in einen vergleichbaren Arbeitsmodus versetzt werden kann, wie er zuvor erst durch ein langes Entwicklungsgespräch entstanden war.

Aus der ursprünglichen Idee von ein oder zwei kleinen Dateien ist dabei leider etwas mehr geworden.
Heute besteht das Framework im Wesentlichen aus:

  • GSL – allgemeinen wissenschaftlichen Regeln,
  • GM-Core – einem Genealogiemodell innerhalb dieses wissenschaftlichen Regelwerks,
  • verschiedenen GM-Execs – Ausführungsroutinen für konkrete Aufgaben wie Quellenregistrierung, Personenidentitätsforschung oder Transkription.

Die ersten Entwicklungsschritte habe ich mit der kostenlosen ChatGPT-Version durchgeführt. Dort sind jedoch unter anderem die Nutzungsmöglichkeiten begrenzter und das verfügbare Modell weniger leistungsfähig. Für die weitere Entwicklung bin ich deshalb auf die Plus-Version gewechselt.

3) Einige wesentliche Ideen des Frameworks

  • Ein Grundgedanke war, das Framework nicht primär als Anleitung für Menschen zu schreiben, sondern in einer Sprache und Struktur, die auf LLM-basierte KI-Modelle zugeschnitten ist.
  • Die Forschungsdaten sollen außerdem nicht nur im Gespräch existieren. Wesentliche Arbeits- und Forschungsergebnisse werden deshalb in AWD-Dateien (Authoritative Working Drafts) festgehalten, die wieder heruntergeladen und bei einer späteren Sitzung erneut bereitgestellt werden können.
  • Ein weiterer wichtiger Punkt ist die Trennung zwischen Beobachtungen aus Quellen und den daraus gewonnenen Forschungsergebnissen. Eine unsichere Lesung in einer Urkunde ist beispielsweise zunächst eine Beobachtung und nicht automatisch eine genealogische Tatsache.
  • Die eigentliche Ahnenforschung wird außerdem als Graph betrachtet. Personen, Ereignisse, Informationen, Quellen usw. werden als Artefakte beziehungsweise Knoten modelliert und über Beziehungen miteinander verbunden.
  • Eine Person ist dabei nicht einfach ein Datensatz mit zahlreichen fest eingetragenen Eigenschaften. Sie bildet zunächst ein Rumpfartefakt für eine Personenidentität. Weitere Informationen werden über eigene Artefakte und Beziehungen zugeschrieben.
    Dadurch entsteht im Laufe der Forschung ein Netz aus Knoten und Kanten, das von einer KI systematisch untersucht und traversiert werden kann.
  • Der Forschungsraum wird derzeit in einem AGRAR-Register abgebildet, in dem die wissenschaftlichen Artefakte und ihre Beziehungen gespeichert werden.

4) Bisherige praktische Erfahrungen

Nach mehreren Tests halte ich das Framework inzwischen für weit genug entwickelt, dass es auch außerhalb meines eigenen Forschungsprojekts ausprobiert werden kann.

Ich konnte damit insbesondere historische polnische Urkunden transkribieren und auswerten. Auch russische Urkunden ließen sich erschließen. Das war allerdings deutlich aufwendiger, weil weniger geeignetes Basismaterial für die jeweilige Handschrift vorhanden war und deshalb zunächst eine umfangreichere Kalibrierung erforderlich wurde.
Ein wichtiger Bestandteil der Transkriptionsarbeit ist dabei gerade, dass die KI eine schwer lesbare Stelle nicht einfach möglichst plausibel „errät“. Unsichere Glyphen, Wörter und Lesungen können zunächst als solche erhalten, mit anderen Stellen derselben Handschrift verglichen und erst später aufgelöst werden.

Das Framework ist also weniger als fertiges Genealogieprogramm gedacht. Es soll vielmehr einen reproduzierbaren wissenschaftlichen Arbeitsrahmen schaffen, innerhalb dessen Mensch und KI gemeinsam Quellen bearbeiten und genealogische Zusammenhänge untersuchen können.

4) Mein Testprojekt

Mein eigenes Beispielprojekt ist ein Sippenbuch über die Auswanderer mit dem Familiennamen Wurster, die aus Württemberg nach Polen ausgewandert sind.
An diesem realen Forschungsfall ist ein großer Teil des Frameworks entstanden und getestet worden.

Das Repository mit den aktuellen Dateien befindet sich hier:

Mich würde besonders interessieren, wie sich das Framework bei völlig anderen Familien, Regionen und Quellenbeständen verhält. Gerade Erfahrungen von anderen Ahnenforschern wären deshalb für die weitere Entwicklung sehr hilfreich.

3 „Gefällt mir“