PDF-Parser
PDFParser
PDFParser liest und interpretiert den rohen PDF-Byte-Stream und erstellt den COS-Objektgraphen für das Dokument. Es ist der Einstiegspunkt für das Parsen einer bestehenden PDF-Byte-Quelle in ein navigierbares Objektmodell.
PDFLexer
PDFLexer tokenisiert die PDF-Syntax aus einem Byte-Stream, erkennt Schlüsselwörter, Namen, Zeichenketten, Zahlen und andere lexikalische Elemente. Es ist der zugrunde liegende Scanner, der von PDFParser verwendet wird.
PDFWriter
PDFWriter serialisiert das COS-Objektmodell zurück in einen PDF-Byte-Stream. Es übernimmt die Erzeugung der Cross-Reference-Tabelle und die Logik für inkrementelle Updates.
Verwendung des Parsers API
Der Konstruktor der Document-Klasse ruft den Parser intern auf, wenn ein Dateipfad oder ein Stream übergeben wird. Für den direkten Zugriff auf den Parser verwenden Sie Document.getParser(), um die mit dem geladenen Dokument verbundene PDFParser-Instanz zu erhalten:
try (Document doc = new Document("input.pdf")) {
PDFParser parser = doc.getParser();
// Access low-level document structure
}