CMap (Mappatura dei caratteri)

CMap in PDF

Una CMap (Mappa dei caratteri) associa i codici dei caratteri in un flusso di contenuto PDF a punti di codice Unicode o nomi di glifi. Le risorse CMap sono utilizzate per l’estrazione del testo, la ricerca e l’accessibilità nei documenti PDF (ISO 32000-1:2008, §9.10).

AdobeGlyphList

AdobeGlyphList fornisce una mappatura statica dai nomi di glifi Adobe ai punti di codice Unicode:

int unicode = AdobeGlyphList.getUnicode("bullet");  // returns 0x2022
boolean exists = AdobeGlyphList.contains("copyright");  // true

Questo è usato quando si decodificano i nomi dei glifi da font Type 1 e TrueType che utilizzano la convenzione di denominazione dei glifi standard di Adobe.

Codifica del testo

La codifica del testo PDF associa i codici dei caratteri ai glifi tramite una combinazione del dizionario Encoding del font, della ToUnicode CMap e della tabella delle larghezze dei caratteri del font. Una corretta gestione della CMap è essenziale per un’estrazione affidabile del testo.

Vedi anche

 Italiano