CMap (Zeichenzuordnung)
CMap in PDF
Ein CMap (Zeichenkarte) ordnet Zeichencodes in einem PDF-Inhaltsstrom Unicode-Codepunkten oder Glyphennamen zu. CMap-Ressourcen werden für die Textextraktion, Suche und Barrierefreiheit in PDF-Dokumenten verwendet (ISO 32000-1:2008, §9.10).
AdobeGlyphList
AdobeGlyphList stellt eine statische Zuordnung von Adobe-Glyphennamen zu Unicode-Codepunkten bereit:
int unicode = AdobeGlyphList.getUnicode("bullet"); // returns 0x2022
boolean exists = AdobeGlyphList.contains("copyright"); // trueDies wird verwendet, wenn Glyphennamen von Type-1- und TrueType-Schriften dekodiert werden, die die Adobe-Standard-Glyphennamenskonvention verwenden.
Textkodierung
Die PDF-Textkodierung ordnet Zeichencodes Glyphen über eine Kombination aus dem Encoding-Verzeichnis der Schrift, dem ToUnicode-CMap und der Zeichenbreitentabelle der Schrift zu. Eine korrekte CMap-Verarbeitung ist für eine zuverlässige Textextraktion unerlässlich.