Logische Struktur
Tagged-PDF-Struktur
PDF-Dokumente können einen logischen Strukturbaum (ISO32000-1:2008, §14.7) enthalten, der den Dokumentinhalt auf semantische Elemente wie Überschriften, Absätze und Tabellen abbildet. Dieser Strukturbau wird von Screenreadern und Barrierefreiheits-Tools verwendet.
StructTreeRoot
StructTreeRoot ist die Wurzel des Strukturbaums. Sie ist über den Dokumentkatalog zugänglich und bietet Methoden zum Navigieren des Elternbaums:
try (Document doc = new Document("tagged.pdf")) {
PdfDictionary catalog = doc.getCatalog();
// Access structure tree via catalog MarkInfo and StructTreeRoot entries
}findElementByMcid() löst eine Marked-Content-ID (MCID) in das entsprechende Strukturelement im Elternbaum auf.
Strukturelemente
Strukturelemente werden als PdfDictionary-Instanzen mit einem Typ-Tag (z.B. H1, P, Table) dargestellt. Der Elternbaum ordnet MCID-Ganzzahlen Strukturelementen zu, wodurch Werkzeuge zur Inhaltsextraktion Inhaltsmarkierungen ihren semantischen Rollen zuordnen können.