Parser PDF
PDFParser
PDFParser legge e interpreta il flusso di byte PDF grezzo, costruendo il grafo di oggetti COS per il documento. È il punto di ingresso per l’analisi di una sorgente di byte PDF esistente in un modello di oggetti navigabile.
PDFLexer
PDFLexer tokenizza la sintassi PDF da un flusso di byte, identificando parole chiave, nomi, stringhe, numeri e altri elementi lessicali. È lo scanner di base utilizzato da PDFParser.
PDFWriter
PDFWriter serializza il modello di oggetti COS in un flusso di byte PDF. Gestisce la generazione della tabella dei riferimenti incrociati e la logica di aggiornamento incrementale.
Utilizzando il Parser API
Il costruttore della classe Document invoca il parser internamente quando gli viene fornito un percorso file o uno stream. Per un accesso diretto al parser, usa Document.getParser() per ottenere l’istanza PDFParser associata al documento caricato:
try (Document doc = new Document("input.pdf")) {
PDFParser parser = doc.getParser();
// Access low-level document structure
}