Struttura logica
Struttura PDF con tag
I documenti PDF possono includere un albero di struttura logica (ISO 32000-1:2008, §14.7) che mappa il contenuto del documento a elementi semantici come intestazioni, paragrafi e tabelle. Questa struttura è utilizzata da lettori di schermo e strumenti di accessibilità.
StructTreeRoot
StructTreeRoot è la radice dell’albero di struttura. È accessibile tramite il catalogo del documento e fornisce metodi per navigare l’albero genitore:
try (Document doc = new Document("tagged.pdf")) {
PdfDictionary catalog = doc.getCatalog();
// Access structure tree via catalog MarkInfo and StructTreeRoot entries
}findElementByMcid() risolve un ID di Contenuto Marcato (MCID) nell’elemento di struttura corrispondente nell’albero genitore.
Elementi di struttura
Gli elementi di struttura sono rappresentati come istanze PdfDictionary con un tag di tipo (ad esempio, H1, P, Table). L’albero genitore mappa gli interi MCID agli elementi di struttura, consentendo agli strumenti di estrazione del contenuto di associare i segni di contenuto ai loro ruoli semantici.