चाणक्य PDF कॉपी करने पर चिह्न क्यों आते हैं
चाणक्य, कृतिदेव की तरह, देवनागरी को 8-बिट लैटिन फ़ॉन्ट के खानों में बनाता है, पर उसका लेआउट अपना है: पूरा अक्षर प्रायः आधे रूप और एक पाई से बनता है, छोटी इ की मात्रा व्यंजन से पहले टाइप होती है, और रेफ़ अक्षर के बाद। PDF वही कोड सहेजती है, और कॉपी के लिए साथ रखा नक्शा उन्हें चिह्नों में बदल देता है, इसलिए हर कॉपी, हर खोज और हर साधारण कन्वर्टर की की जगह ∑§Ë पाता है।
कुछ अख़बारों की टेक्स्ट लेयर इससे भी बुरी है: फ़ॉन्ट जिन अक्षरों को 0x80 से 0x9F तक के कोड पर रखता है, वे कॉपी किए पाठ से पूरी तरह गायब हो जाते हैं, इसलिए मुख्यमंत्री का ख और गिरफ्तार का फ छूट जाता है। यह कन्वर्टर कोड को सीधे चाणक्य की तालिका से पढ़ता है, जिसे असली फ़ॉन्ट में बनाकर जाँचा गया है, और हर मात्रा को यूनिकोड के क्रम में रखता है।
एक नाम, तीन संस्करण
चाणक्य में छपे सभी दस्तावेज़ हर कुंजी पर एक ही चीज़ नहीं रखते। कुछ अख़बार 1 से 9 तक के अंक उन कुंजियों पर रखते हैं जिन पर दूसरे संस्करण आधे अक्षर रखते हैं, और एक परीक्षा-पत्र ने क् और ख् को अपनी अलग कुंजियों पर रखा। कन्वर्टर हर दस्तावेज़ को इन संस्करणों के हर तरीके से पढ़ता है और वही पाठ रखता है जिससे शब्द बनते हैं, ताकि दामों वाला पेज आधे अक्षरों की लड़ी न बन जाए। कुछ चुनना नहीं पड़ता।
वॉकमैन-चाणक्य, मिलते-जुलते नाम वाला एक अलग फ़ॉन्ट, का लेआउट अपना है और उसे अभी नहीं पढ़ा जाता। अख़बार जो शीर्षक किसी दूसरे फ़ॉन्ट में छापता है, वे भी नहीं पढ़े जाते: केवल चाणक्य वाला पाठ बदला जाता है।
मापा गया
चाणक्य में छपी छब्बीस असली PDF, कम से कम सात प्रकाशकों की: अख़बारों के पेज, PageMaker में छपा एक दल का दस्तावेज़ और एक आध्यात्मिक मासिक पत्रिका, Word में बने स्कूल बोर्ड के दो परीक्षा-पत्र, और गीता की एक टीका। बदलने पर उनमें 101,746 शब्द हैं, और उनमें से 94.0% Tesseract की हिन्दी या देवनागरी शब्द-सूची में हैं: हर दस्तावेज़ में 93% से 98% के बीच, और गीता की टीका में 79.5%, क्योंकि उसके संस्कृत श्लोक और समास सूचियों में नहीं हैं। यह शुद्धता का आँकड़ा नहीं है; सूची से बाहर के नाम और दुर्लभ शब्द भी सही हो सकते हैं। कोई कोड बिना पढ़े नहीं छूटा, और हर दस्तावेज़ की एक छपी पंक्ति को आँख से कन्वर्ज़न से मिलाया गया।
मापते समय कुछ गलतियाँ मिलीं, और सब ठीक की गईं। जिस आकार को र का पदेन पढ़ा जा रहा था, वह नीचे लगा न है, इसलिए अग्नि की जगह अग्रि और प्रश्न की जगह प्रश्र आ रहा था; बिना खड़ी पाई वाले अक्षरों के बाद लगने वाला य का चिह्न नहीं पढ़ा जाता था, इसलिए पाठ्यक्रम और बुद्ध्या में वह छूट जाता था; ू से पहले टाइप किया चंद्रबिंदु उसके पहले ही रह जाता था; और समय व दाम वाले पेजों पर अंक आधे अक्षर पढ़े जाते थे।
कहाँ अब भी गलती होती है
101,746 शब्दों में से 17 में ऐसा मात्रा-क्रम है जो किसी हिन्दी शब्द में नहीं होता, ज़्यादातर दो बार दबाई गई कुंजियाँ। फ़ॉन्ट के कुछ कोड ऐसे आकार बनाते हैं जिन्हें अभी तक पहचाना नहीं गया; वे ऐसे चिह्नों के रूप में आते हैं जो साफ़ तौर पर देवनागरी नहीं हैं, इसलिए आसानी से दिख जाते हैं। डिब्बों में बँटी ख़बरों वाला अख़बार का पेज सबसे कठिन लेआउट है, इसलिए Word फ़ाइल में ख़बरों का क्रम जाँच लें।
वॉकमैन-चाणक्य या चाणक्य के अलावा किसी शीर्षक-फ़ॉन्ट का पाठ जैसा था वैसा रहता है। स्कैन किए पेज में पढ़ने को कोड नहीं होते; उसके लिए OCR चाहिए।