Logische structuur
Getagde PDF-structuur
PDF-documenten kunnen een logische structuurboom (ISO 32000-1:2008, §14.7) bevatten die de documentinhoud koppelt aan semantische elementen zoals koppen, alinea’s en tabellen. Deze structuur wordt gebruikt door schermlezers en toegankelijkheidstools.
StructTreeRoot
StructTreeRoot is de wortel van de structuurboom. Het is toegankelijk via de documentcatalogus en biedt methoden voor het navigeren door de bovenliggende boom:
try (Document doc = new Document("tagged.pdf")) {
PdfDictionary catalog = doc.getCatalog();
// Access structure tree via catalog MarkInfo and StructTreeRoot entries
}findElementByMcid() vertaalt een Marked Content ID (MCID) naar het overeenkomstige structuur-element in de bovenliggende boom.
Structuurelementen
Structuurelementen worden weergegeven als PdfDictionary-instanties met een type-tag (bijv. H1, P, Table). De bovenliggende boom mappt MCID-integers naar structuurelementen, waardoor content-extractietools content-markeringen kunnen koppelen aan hun semantische rollen.