राजपत्र की PDF दो तरह की होती हैं
egazette.gov.in से ली गई 2010 से 2026 तक की भारत के राजपत्र की सोलह PDF पाँच तरह की निकलीं। आठ में केवल अंग्रेज़ी है। पाँच की हिन्दी यूनिकोड में है, इसलिए कॉपी करने पर हिन्दी ही आती है और साधारण PDF से Word उन्हें बदल देता है। एक, 2022 की, कृतिदेव में टाइप की गई है, और उससे कॉपी करने पर jSad dks fu;ekuqlkj जैसी पंक्तियाँ आती हैं। एक, 2013 की, अपनी हिन्दी Devnagari-ChanakyaNormalA नाम के फ़ॉन्ट में रखती है, जिसे यहाँ की कोई तालिका अभी नहीं पढ़ती। और एक, 2010 की, बिना किसी पाठ वाला स्कैन है।
इस पेज का अपलोड यूनिकोड और कृतिदेव दोनों तरह की अधिसूचना लेता है: पहली साधारण कन्वर्ज़न से जाती है, और दूसरी कृतिदेव की तालिका से पढ़ी जाती है। आपके पास कौन-सी है, यह एनालाइज़र बदलने से पहले बता देता है।
घुमावदार उद्धरण चिह्नों वाले अक्षर
कृतिदेव में श और ष उन्हीं कुंजियों पर हैं जिन पर अंग्रेज़ी में उद्धरण चिह्न टाइप होते हैं, और Word टाइप करते समय उद्धरण चिह्नों को घुमावदार बना देता है। इसलिए Word में टाइप की गई सूचना श और ष को घुमावदार उद्धरण चिह्नों के कोड पर सहेजती है: उदाहरण में ” संशोधित का श है। टाइप की गई कुंजियों की तरह पढ़ें तो वे कोड केवल उद्धरण चिह्न हैं, और अक्षर खो जाता है। कन्वर्टर जानता है कि फ़ॉन्ट उन कोड पर कौन-से अक्षर बनाता है, और कृतिदेव का कौन-सा रूप वहाँ कौन-सा अक्षर रखता है, और उन्हें अक्षर के रूप में वापस पढ़ता है।
मापा गया
2022 का अंक 103 पेज का है, और उसकी हिन्दी ज़्यादातर सेना की रैंकों, नामों और तिथियों की सूचियाँ हैं। बदलने पर उसमें 12,987 शब्द हैं, और उनमें से 86.7% Tesseract की हिन्दी या देवनागरी शब्द-सूची में हैं; बाकी ज़्यादातर नाम, रैंक और आई सी व ब्रिग जैसे संक्षिप्त रूप हैं, जो सही हैं। ऐसे चार मात्रा-क्रम बचे हैं जो किसी हिन्दी शब्द में नहीं होते, असामान्य ढंग से टाइप किए गए नामों में, जैसे रॅाय। ऊपर की पंक्ति छपे पेज से मिलाई गई। एक दूसरी अधिसूचना, जिससे सबसे पहले पता चला कि राजपत्र कृतिदेव का कौन-सा रूप इस्तेमाल करता है, अपने 406 में से 392 शब्द एक स्वतंत्र डिकोडर जैसे ही पढ़ती है।
राजपत्र कुल मापी गई चौदह कृतिदेव PDF में से एक है, जिनमें 19,885 शब्द हैं और 88.0% सूची में हैं; बाकी जानकारी कृतिदेव PDF से Word वाले पेज पर है।
कहाँ अब भी गलती होती है
नाम अक्षर-दर-अक्षर वैसे ही पढ़े जाते हैं जैसे टाइप किए गए, इसलिए गलत कुंजी से टाइप किया गया नाम गलत ही रहता है। हिन्दी अक्षरों में टाइप किए गए अंग्रेज़ी संक्षिप्त रूप हिन्दी अक्षरों में ही रहते हैं। राजपत्र की नामों, रैंकों और तिथियों की रेखाओं वाली तालिकाएँ खाने-दर-खाने Word तालिका के रूप में आती हैं; नामों या तिथियों के कॉलम पर भरोसा करने से पहले उसे मूल से मिला लें। टाइप करने की जगह स्कैन की गई अधिसूचना में कोड नहीं होते, उसके लिए OCR चाहिए।