Parser PDF

PDFParser

PDFParser odczytuje i interpretuje surowy strumień bajtów PDF, tworząc graf obiektów COS dla dokumentu. Jest punktem wejścia do parsowania istniejącego źródła bajtów PDF w nawigowalny model obiektów.

PDFLexer

PDFLexer tokenizuje składnię PDF ze strumienia bajtów, identyfikując słowa kluczowe, nazwy, łańcuchy, liczby i inne elementy leksykalne. Jest podstawowym skanerem używanym przez PDFParser.

PDFWriter

PDFWriter serializuje model obiektów COS z powrotem do strumienia bajtów PDF. Obsługuje generowanie tabeli odwołań krzyżowych i logikę przyrostowych aktualizacji.

Używając parsera API

Konstruktor klasy Document wywołuje parser wewnętrznie, gdy podana jest ścieżka do pliku lub strumień. Aby uzyskać bezpośredni dostęp do parsera, użyj Document.getParser(), aby uzyskać instancję PDFParser powiązaną z załadowanym dokumentem:

try (Document doc = new Document("input.pdf")) {
    PDFParser parser = doc.getParser();
    // Access low-level document structure
}

Zobacz także

 Polski