कृतिदेव PDF से कॉपी करने पर अंग्रेज़ी अक्षर क्यों आते हैं
कृतिदेव एक अंग्रेज़ी फ़ॉन्ट के खानों पर बना है। जहाँ अंग्रेज़ी फ़ॉन्ट H रखता है, वहाँ यह आधा भ बनाता है, और जहाँ k रखता है वहाँ वह खड़ी पाई जो उसे पूरा करती है, इसलिए भ को Hk टाइप किया जाता है। PDF में H और k ही सहेजे जाते हैं, और PDF का अपना नक्शा भी H और k ही बताता है, क्योंकि किसी भी दूसरे फ़ॉन्ट में वे खाने यही होते हैं। हर कॉपी, हर खोज और हर साधारण PDF-से-Word कन्वर्टर वही नक्शा पढ़ता है, और भारत की जगह Hkkjr पाता है।
पेज सही इसलिए दिखता है क्योंकि PDF के साथ कृतिदेव फ़ॉन्ट भी है जो उन कोड को सही आकार में बनाता है। यह कन्वर्टर उस नक्शे पर भरोसा नहीं करता। वह कोड को सीधे कृतिदेव 010 की तालिका से पढ़ता है, जिसे असली फ़ॉन्ट में जाँचा गया है, और फिर हर मात्रा को यूनिकोड के क्रम में रखता है: व्यंजन से पहले टाइप की गई छोटी इ की मात्रा उसके बाद जाती है, और अक्षर के बाद टाइप किया गया रेफ़ उससे पहले।
Word फ़ाइल में क्या आता है
Noto Sans Devanagari में यूनिकोड देवनागरी, जो कृतिदेव के बिना किसी भी कंप्यूटर पर खुलती है। दस्तावेज़ पेज-दर-पेज दोबारा बनता है: हर छपे पेज के लिए Word का एक सेक्शन, उसी पेज के आकार और हाशियों के साथ, और अनुच्छेद अपने संरेखण, इंडेंट, फ़ॉन्ट साइज़ और बोल्ड के साथ। रेखाओं से बनी तालिकाएँ, जहाँ ग्रिड उन्हें सँभाल सके, Word तालिका बनती हैं, और घने खानों वाला फ़ॉर्म छपे फ़ॉर्म से लंबा निकलता है। पेज पर लगे चित्र (पूरे पेज का स्कैन नहीं) उसी पेज पर रखे जाते हैं, और हर पेज पर दोहराया जाने वाला शीर्षक या पेज नंबर Word के हेडर में जाता है। PDF में Times या Calibri जैसे साधारण फ़ॉन्ट में लिखी अंग्रेज़ी और अंक जैसे के तैसे आते हैं।
वर्ड प्रोसेसर पंक्तियाँ फिर भी अपने ढंग से तोड़ता है, इसलिए कोई पेज PDF के पेज से एक-दो पंक्ति आगे-पीछे खत्म हो सकता है। यह Word फ़ाइल पाठ को संपादित करने और दोबारा इस्तेमाल करने के लिए है, और उसकी शुरुआत में लिखा होता है कि मैपिंग सत्यापित नहीं है, क्योंकि वह नहीं है।
मापा गया
कृतिदेव में टाइप की गई चौदह असली PDF: सरकारी निविदाएँ और आदेश, एक पेंशन पुस्तिका, और राजपत्र की 103 पेज की एक अधिसूचना। बदलने पर उनमें 19,885 शब्द हैं, और उनमें से 88.0% Tesseract की हिन्दी या देवनागरी शब्द-सूची में हैं, हर दस्तावेज़ में 80% से 97% के बीच। यह शुद्धता का आँकड़ा नहीं है: सूची से बाहर के शब्दों में सही नाम, स्थानों के नाम और संक्षिप्त रूप भी हैं। हर दस्तावेज़ की एक छपी पंक्ति को आँख से कन्वर्ज़न से मिलाया गया, और चौदहों मेल खाईं।
मापते समय कुछ गलतियाँ मिलीं, और सब ठीक की गईं: पाई से पूरे होने वाले अक्षर के बाद का रेफ़ छूट जाता था, इसलिए वार्मिंग की जगह वाम्िांग आता था; मात्रा से पहले टाइप किया गया अनुस्वार वहीं रह जाता था; और 03%00 के रूप में टाइप किया समय ०३ः०० पढ़ा जाता था। जो बचा है वह ज़्यादातर फ़ाइलों में ही है: ऐसे 40 मात्रा-क्रमों में से, जो किसी हिन्दी शब्द में नहीं होते, 29 एक ही निविदा के हैं जिसमें टाइपिस्ट ने तालिका के एक कॉलम में हर बार एक स्थान-नाम के बाद नुक़्ता की कुंजी दबाई थी, और बाकी दो बार दबाई गई कुंजियाँ और भटके हुए चिह्न हैं।
कहाँ अब भी गलती होती है
कृतिदेव के दर्जनों कोड ऐसे आकार बनाते हैं जिन्हें अभी तक पहचाना नहीं गया है, ज़्यादातर दुर्लभ संयुक्ताक्षर; वे ऐसे चिह्नों के रूप में आते हैं जो साफ़ तौर पर देवनागरी नहीं हैं, इसलिए आसानी से दिख जाते हैं। घने खानों वाला आवेदन-पत्र छपे फ़ॉर्म से लंबा निकलता है, क्योंकि वर्ड प्रोसेसर खानों का पाठ अपने ढंग से तोड़ता है। एक पुस्तिका 1,651 अक्षर ऐसे कृतिदेव फ़ॉन्ट में रखती है जिसका कोई नाम ही नहीं है, और वे टाइप की गई कुंजियों के रूप में ही आते हैं। फ़ाइल आप तक पहुँचने से पहले खो चुका अक्षर वापस नहीं लाया जा सकता।
स्कैन की गई PDF में पढ़ने को कोड नहीं होते, केवल अक्षरों की तस्वीरें होती हैं; उसके लिए OCR चाहिए। और कुछ PDF हर पेज पर कृतिदेव फ़ॉन्ट साथ नहीं रखतीं, इसलिए व्यूअर उन पेजों को अंग्रेज़ी अक्षरों में दिखाता है। वे फिर भी बदल जाती हैं, क्योंकि कोड मौजूद हैं।