Parser PDF
PDFParser
PDFParser odczytuje i interpretuje surowy strumień bajtów PDF, tworząc graf obiektów COS dla dokumentu. Jest punktem wejścia do parsowania istniejącego źródła bajtów PDF w nawigowalny model obiektów.
PDFLexer
PDFLexer tokenizuje składnię PDF ze strumienia bajtów, identyfikując słowa kluczowe, nazwy, łańcuchy, liczby i inne elementy leksykalne. Jest podstawowym skanerem używanym przez PDFParser.
PDFWriter
PDFWriter serializuje model obiektów COS z powrotem do strumienia bajtów PDF. Obsługuje generowanie tabeli odwołań krzyżowych i logikę przyrostowych aktualizacji.
Używając parsera API
Konstruktor klasy Document wywołuje parser wewnętrznie, gdy podana jest ścieżka do pliku lub strumień. Aby uzyskać bezpośredni dostęp do parsera, użyj Document.getParser(), aby uzyskać instancję PDFParser powiązaną z załadowanym dokumentem:
try (Document doc = new Document("input.pdf")) {
PDFParser parser = doc.getParser();
// Access low-level document structure
}