Struktura logiczna
Struktura oznaczonego PDF
Dokumenty PDF mogą zawierać drzewo struktury logicznej (ISO 32000-1:2008, §14.7), które mapuje zawartość dokumentu na elementy semantyczne, takie jak nagłówki, akapity i tabele. Struktura ta jest używana przez czytniki ekranowe i narzędzia dostępnościowe.
StructTreeRoot
StructTreeRoot jest korzeniem drzewa struktury. Jest dostępny poprzez katalog dokumentu i zapewnia metody nawigacji po drzewie rodziców:
try (Document doc = new Document("tagged.pdf")) {
PdfDictionary catalog = doc.getCatalog();
// Access structure tree via catalog MarkInfo and StructTreeRoot entries
}findElementByMcid() rozwiązuje identyfikator oznaczonej treści (MCID) do odpowiadającego elementu struktury w drzewie rodziców.
Elementy struktury
Elementy struktury są reprezentowane jako instancje PdfDictionary z tagiem typu (np. H1, P, Table). Drzewo rodziców mapuje liczby całkowite MCID na elementy struktury, umożliwiając narzędziom do wyodrębniania treści kojarzenie oznaczeń treści z ich rolami semantycznymi.