Logische Struktur

Tagged-PDF-Struktur

PDF-Dokumente können einen logischen Strukturbaum (ISO32000-1:2008, §14.7) enthalten, der den Dokumentinhalt auf semantische Elemente wie Überschriften, Absätze und Tabellen abbildet. Dieser Strukturbau wird von Screenreadern und Barrierefreiheits-Tools verwendet.

StructTreeRoot

StructTreeRoot ist die Wurzel des Strukturbaums. Sie ist über den Dokumentkatalog zugänglich und bietet Methoden zum Navigieren des Elternbaums:

try (Document doc = new Document("tagged.pdf")) {
    PdfDictionary catalog = doc.getCatalog();
    // Access structure tree via catalog MarkInfo and StructTreeRoot entries
}

findElementByMcid() löst eine Marked-Content-ID (MCID) in das entsprechende Strukturelement im Elternbaum auf.

Strukturelemente

Strukturelemente werden als PdfDictionary-Instanzen mit einem Typ-Tag (z.B. H1, P, Table) dargestellt. Der Elternbaum ordnet MCID-Ganzzahlen Strukturelementen zu, wodurch Werkzeuge zur Inhaltsextraktion Inhaltsmarkierungen ihren semantischen Rollen zuordnen können.

Siehe auch

 Deutsch