PDF 분석기
PDF파서 (PDF)
PDFParser 원시 PDF 바이트 스트림을 읽고 해석하고 COS를 구성합니다. 문서의 객체 그래프. 기존 PDF을 분석하기 위한 입력 포인트입니다. 바이트 소스는 항해 가능한 객체 모델로 변환됩니다.
PDF 렉서
PDFLexer 바이트 스트림에서 PDF 문법을 토큰화하여 키워드를 식별합니다., 이름, 문자열, 숫자 및 다른 사전적 요소. 그것은 기본 스캐너입니다 사용: PDFParser.
PDFWriter (PDF 작성자)
PDFWriter PDF 바이트 스트림으로 COS 오브젝트 모델을 연쇄화합니다. 교차 참조 표 생성 및 단계적 업데이트 논리.
파서 API를 사용함
이 Document 클래스 컨스트럭터 는 파서 를 내부 로 호출 합니다. 경로 또는 스트림. 직접 파저 액세스, 사용 Document.getParser() 이 같은 것을 얻으려면, PDFParser 로드된 문서와 연관된 인스턴스:
try (Document doc = new Document("input.pdf")) {
PDFParser parser = doc.getParser();
// Access low-level document structure
}