कृतिदेव Word फ़ाइल में अंग्रेज़ी अक्षर क्यों दिखते हैं
कृतिदेव एक अंग्रेज़ी फ़ॉन्ट के खानों पर बना है। जहाँ अंग्रेज़ी फ़ॉन्ट H रखता है, वहाँ यह आधा भ बनाता है, और जहाँ k रखता है वहाँ वह खड़ी पाई जो उसे पूरा करती है, इसलिए भ को Hk टाइप किया जाता है। Word में H और k ही सहेजे जाते हैं। जिस कंप्यूटर पर कृतिदेव है वहाँ पेज सही दिखता है; बाकी हर जगह, खोज में, मेल के प्रीव्यू में या फ़ोन पर, भारत की जगह Hkkjr दिखता है। फ़ॉन्ट बदलकर यूनिकोड फ़ॉन्ट कर देने से कुछ नहीं होता, क्योंकि सहेजे गए अक्षर H और k ही हैं।
कन्वर्टर फ़ाइल को रन-दर-रन पढ़ता है और देखता है कि Word हर रन को किस फ़ॉन्ट में बनाता है: रन का अपना फ़ॉन्ट, फिर उसकी कैरेक्टर स्टाइल, अनुच्छेद की स्टाइल और दस्तावेज़ की डिफ़ॉल्ट, उसी क्रम में जैसे Word तय करता है। कृतिदेव या DevLys वाले रन की कुंजियाँ तालिका से पढ़ी जाती हैं और हर मात्रा यूनिकोड के क्रम में रखी जाती है: व्यंजन से पहले टाइप की गई छोटी इ की मात्रा उसके बाद जाती है, और अक्षर के बाद टाइप किया गया रेफ़ उससे पहले। Times, Arial या Calibri वाला रन अंग्रेज़ी है और जैसा है वैसा रहता है। जो शब्द दो रनों में बँटा हो, क्योंकि उसका आधा हिस्सा बोल्ड है, उसे पूरा पढ़ा जाता है।
क्या वापस मिलता है
वही Word फ़ाइल, .docx के रूप में। कृतिदेव वाला पाठ Noto Sans Devanagari में यूनिकोड देवनागरी बन जाता है, रन के चारों फ़ॉन्ट-खानों में, उन भाषा और कॉम्प्लेक्स-स्क्रिप्ट गुणों के साथ जिनसे Word हिन्दी दिखाता है, ताकि बोल्ड और साइज़ हिन्दी पर बने रहें। बाकी सब वैसा ही रहता है: तालिकाएँ, हेडर, फ़ुटर, फ़ुटनोट, संरेखण, इंडेंट, स्पेसिंग, चित्र, और अंग्रेज़ी फ़ॉन्ट वाला हर रन।
कृतिदेव अपने पॉइंट साइज़ के हिसाब से छोटा बनता है, इसलिए उसी साइज़ पर रखा पाठ बढ़ जाता: उसके अक्षर Noto Sans Devanagari में लगभग 1.22 गुना ऊँचे हैं। बदले गए पाठ का साइज़ इस तरह घटाया जाता है कि अक्षरों की ऊँचाई वही रहे, इसलिए 14 pt कृतिदेव 11.5 pt बनता है। ऐसा न करने पर 21 पेज का एक फ़ॉर्म 36 पेज का बना; साइज़ घटाने पर 23 पेज का। मैपिंग सत्यापित नहीं है, यह टिप्पणी फ़ाइल की Comments प्रॉपर्टी में जाती है, आपके दस्तावेज़ के पाठ में नहीं।
मापा गया
कृतिदेव और DevLys में टाइप की गई दस असली सरकारी Word फ़ाइलें, नौ कार्यालयों की: परिपत्र, आदेश, फ़ॉर्म, पत्र और एक निविदा, जिनमें से आठ पुराने .doc रूप में थीं। बदलने पर उनमें पाँच या अधिक अक्षरों के 21,229 शब्द हैं, और उनमें से 89.9% Tesseract की हिन्दी या देवनागरी शब्द-सूची में हैं, हर फ़ाइल में 86% से 94% के बीच। यह शुद्धता का आँकड़ा नहीं है: सूची से बाहर के नाम, स्थानों के नाम और संक्षिप्त रूप भी सही हो सकते हैं। कोई कोड बिना पढ़े नहीं छूटा। बदली गई फ़ाइलों से बने पेज मूल पेजों से पंक्ति-दर-पंक्ति मिलते हैं। दस में से सात मूल लंबाई से एक पेज के भीतर खत्म होती हैं, और तीन छोटी निकलती हैं (119 की जगह 106 पेज, 17 की जगह 13, 53 की जगह 41), क्योंकि ऊँचाई में बराबर किए गए अक्षर Noto में कम चौड़े होते हैं।
मापते समय कुछ गलतियाँ मिलीं, और सब ठीक की गईं। दो फ़ाइलें पूरी तरह सादी कुंजियों पर टाइप थीं, 3,429 और 45,255 अक्षर, जिनमें बुनियादी ASCII से ऊपर कुछ नहीं था, और पहले उन्हें मना कर दिया जाता था; अब कन्वर्टर हर रन के फ़ॉन्ट से तय करता है। चार फ़ाइलों में शीर्षक Calibri नाम के फ़ॉन्ट में थे पर कृतिदेव की कुंजियों पर टाइप थे; वे अब पढ़े जाते हैं जब उनसे हिन्दी शब्द बनते हैं, और Name of या Loan Agreement जैसे अंग्रेज़ी लेबल वैसे ही रहते हैं। अंक या अनुस्वार के बाद विसर्ग की कुंजी पर टाइप किया कोलन अब कोलन ही पढ़ा जाता है। और एक निविदा में 11 KV Jaw कई रनों में बँटा था, जिससे KV J अकेला रह गया और हिन्दी पढ़ा गया; रनों में बँटा शब्द अब पूरा जाँचा जाता है।
कहाँ अब भी गलती होती है
केवल कृतिदेव और DevLys की फ़ाइलें मापी गई हैं। जिन दूसरे पुराने फ़ॉन्टों की तालिका कन्वर्टर के पास है, वे भी इसी तरह बदलते हैं, पर उन्हें मापा नहीं गया। अंग्रेज़ी फ़ॉन्ट के नाम में कृतिदेव की कुंजियों पर टाइप की गई हिन्दी तभी बदली जाती है जब उसे पढ़ने पर हिन्दी शब्द बनें, इसलिए ऐसे फ़ॉन्ट की बहुत छोटी पंक्ति कुंजियों के रूप में रह सकती है। ऐसे 79 मात्रा-क्रमों में से, जो किसी हिन्दी शब्द में नहीं होते, ज़्यादातर फ़ाइलों में ही हैं: दो बार दबाई गई कुंजियाँ, और ँ की जगह ू के बाद चंद्र की कुंजी। वे जैसे टाइप हुए वैसे ही रहते हैं।
Noto Sans Devanagari अक्षर-दर-अक्षर कृतिदेव से चौड़ा या पतला है, इसलिए पंक्तियाँ दूसरी जगह टूटती हैं और कोई पेज एक-दो पंक्ति आगे-पीछे खत्म हो सकता है। .doc फ़ाइल पहले LibreOffice से खोली जाती है और .docx के रूप में वापस आती है। कृतिदेव के जिन कोड को अभी तक पहचाना नहीं गया, वे ऐसे चिह्नों के रूप में आते हैं जो साफ़ तौर पर देवनागरी नहीं हैं, इसलिए आसानी से दिख जाते हैं। स्कैन किए दस्तावेज़ में पढ़ने को कुंजियाँ नहीं होतीं; उसके लिए OCR चाहिए।