CMap (Mapowanie znaków)
CMap (Mapowanie znaków)
CMap w PDF
CMap (Mapa znaków) mapuje kody znaków w strumieniu zawartości PDF na punkty kodowe Unicode lub nazwy glifów. Zasoby CMap są używane do wyodrębniania tekstu, wyszukiwania i dostępności w dokumentach PDF (ISO 32000-1:2008, §9.10).
AdobeGlyphList
AdobeGlyphList zapewnia statyczne mapowanie nazw glifów Adobe na punkty kodowe Unicode:
int unicode = AdobeGlyphList.getUnicode("bullet"); // returns 0x2022
boolean exists = AdobeGlyphList.contains("copyright"); // trueJest to używane przy dekodowaniu nazw glifów z czcionek Type 1 oraz TrueType, które stosują standardową konwencję nazewnictwa glifów Adobe.
Kodowanie tekstu
Kodowanie tekstu w PDF mapuje kody znaków na glify za pomocą kombinacji słownika Encoding czcionki, CMap ToUnicode oraz tabeli szerokości znaków czcionki. Poprawne obsługiwanie CMap jest niezbędne dla niezawodnego wyodrębniania tekstu.