系図 - KI-gestützte Genealogie

Dieser Leitfaden beschreibt die Nutzung von KI-Tools zur Erforschung der Familiengeschichte, wobei ein Schwerpunkt auf der Datenverifizierung und der Bewältigung von Herausforderungen liegt.

Prozess der Ahnenforschung mit KI

Der Prozess beginnt mit der Identifizierung von Lücken im Stammbaum, wie z.B. unbekannte Eltern. Eine KI-Assistentin wird dann beauftragt, diese Personen auf bekannten Stammbaum-Websites und in Archiven mit Personenstandsregistern zu suchen. Die gefundenen Einträge werden transkribiert, neue Personen in die GEDCOM-Datei eingefügt und mit ihren Nachkommen verknüpft, wobei die Quellen sorgfältig vermerkt werden. Dieser iterative Prozess wird fortgesetzt, um Generationen hinzuzufügen, bis keine weiteren Datensätze gefunden werden.

Qualitätssicherung mit QUAY-Werten in GEDCOM

GEDCOM nutzt „Qualität“ und zugehörige QUAY-Richtlinien zur Bewertung der Verlässlichkeit von Daten:

QUAY 0: Unzuverlässige oder geschätzte Daten.
QUAY 1: Hinweise auf fragliche Zuverlässigkeit (z.B. Interviews, mündliche Überlieferungen).
QUAY 2: Sekundäre Beweismittel (z.B. Daten, die nachträglich erfasst wurden).
QUAY 3: Direkte und primäre Beweise oder Beweise, die auf der Überlegenheit der Beweise basieren.

Der Autor stuft Stammbaum-Websites generell als QUAY 2 ein. Offizielle Aufzeichnungen, die auf Angaben von Bürgern oder Kirchen basieren, werden als QUAY 3 bewertet. Die Datenverifizierung beinhaltet das Sammeln von Daten von Stammbaum-Websites (QUAY 2) und deren Abgleich mit offiziellen Aufzeichnungen. Bei Übereinstimmung wird der QUAY-Wert auf 3 gesetzt; andernfalls werden die Daten verworfen.

Archivierungs- und Browsing-Strategien

Es wird empfohlen, für jede Stammbaum-Website und jeden Archivstandort eine eigene Fähigkeit (Capability) zu erstellen. Archivseiten können nach zwei Kriterien kategorisiert werden:

Zugangsbeschränkung: Vollständiger öffentlicher Zugang vs. Erforderliches Konto.
Bot-Schutz: Verschiedene Stufen, von einfachen Mechanismen bis hin zu komplexen Schutzsystemen (z.B. Cloudflare), die den Einsatz eines vollwertigen Browsers wie Playwright erfordern können.
Automatisierte Kontoanmeldung

Aus Sicherheitsgründen sollten Zugangsdaten nicht direkt an den Assistenten weitergegeben werden. Stattdessen kann eine gespeicherte Sitzung über Playwright genutzt werden: Der Browser wird gestartet, angemeldet und dann geschlossen. Die Authentifizierungsdaten bleiben im Profil gespeichert, sodass der Assistent innerhalb derselben Sitzung mit den entsprechenden Zugriffsrechten agieren kann.

Nutzung von Stammbaum-Websites – Verfeinerte Vorgehensweise

Die verfeinerte Vorgehensweise umfasst das initiale Sammeln von Daten von Stammbaum-Websites und den anschließenden Abgleich mit offiziellen Aufzeichnungen. Bei der Entdeckung neuer Vorfahren wird zur Stammbaum-Website zurückgekehrt, um zu prüfen, ob diese bereits in anderen Stammbäumen vorhanden sind.

Intelligentes Matching: Vorsicht ist geboten bei Algorithmen zur Personen-Zuordnung auf Stammbaum-Websites, um die Aufnahme irrelevanter Personen zu vermeiden.
Zugriffsebenen: Viele Websites bieten unterschiedliche Zugriffsebenen an, wobei voller Zugriff oft kostenpflichtig ist.
Bildverwaltung mit Topola

Topola, ein GEDCOM-Viewer, wird zur Anzeige von Fotominiaturen verwendet. Dabei gelten folgende Regeln für Profil- und verlinkte Bilder:

Profilbilder sollten Porträts sein.
Verlinkte Bilder sollten chronologisch geordnet sein.
Transkriptionsherausforderungen und Werkzeugvergleich

Die Transkription handschriftlicher Aufzeichnungen ist essenziell, wird aber durch Schreibstile, Sprachkenntnisse und das Alter von Dokumenten erschwert.

Delegation: Die Transkription kann an eine Assistentin delegiert werden.
Werkzeugvergleich:
Transkribus: Ein kostenpflichtiges Online-Tool, das bei Training mit eigenen Dokumenten gute Ergebnisse erzielt, ansonsten aber unzuverlässig sein kann.
Kraken: Ein lokales Tool, das besser als Transkribus war, aber nicht die Leistung des Assistenten erreichte.
Filae: Eine französische Website, die für ihre Transkriptionsfähigkeiten gelobt wurde, aber anscheinend eingestellt wurde.
Kleinere Schwierigkeiten und Hindernisse
Namensgleichheit: Mehrere Generationen mit denselben Vor- und Nachnamen an demselben Ort erschweren die Unterscheidung.
Aufzeichnungsvielfalt: Die Kombination verschiedener Ereignisarten und uneinheitliche Datumsangaben in einem einzigen Datensatz erschwert binäre Suchen.

Der Autor setzt sein Projekt fort, das über 1200 Mitarbeiter in 13 Generationen umfasst, und teilt diese Erkenntnisse für andere, die ähnliche genealogische Forschungen betreiben möchten.

Sources:

https://hackernoon.com/lang/ja/ai-assisted-genealogy-using-ai-to-trace-my-family-tree

KI-gestützt gefunden, übersetzt und zusammengefasst – anschließend von einem Menschen geprüft und bewertet. Zur Verfügung gestellt von news@genealogy.net - den Machern des Blog

2 „Gefällt mir“