DevLys कृतिदेव 010 ही है, दो अक्षरों की अदला-बदली के साथ
असली सरकारी PDF में जुड़े फ़ॉन्ट से एक-एक कोड बनाकर देखने पर, DevLys 010 के 503 में से 501 आकार कृतिदेव 010 के ही हैं, उन्हीं कोड पर, अंकों समेत। जो दो अलग हैं, उनमें से एक वह कोड है जो Word का घुमावदार उद्धरण चिह्न देता है: वहाँ कृतिदेव 010 ष बनाता है और DevLys श। इसलिए DevLys को उसी अदला-बदली के साथ कृतिदेव की तालिका से पढ़ा जाता है, वही बनावट जो कृतिदेव में टाइप की गई राजपत्र की एक अधिसूचना में भी मिली।
इसीलिए केवल कृतिदेव 010 के लिए बना कन्वर्टर DevLys में थोड़ी गलती करता है: वह उन कुंजियों पर टाइप किए गए हर श को ष पढ़ता है। दोनों तरह से बनने वाले शब्द असली शब्द होते हैं, इसलिए कुछ टूटा हुआ नहीं दिखता; बस वर्तनी गलत होती है।
वह अक्षर जो पाठ की परत से छूट जाता था
DevLys PDF में श के लिए सहेजा गया कोड Word के घुमावदार उद्धरण चिह्न से आ सकता है। इनमें से दो सूचनाओं में जुड़े फ़ॉन्ट के अपने नक्शे में उस कोड की कोई प्रविष्टि नहीं है, और जो रीडर पेज से केवल साधारण लैटिन अक्षर लेता था, वह उसे छोड़ देता था: आदेश की जगह आदेा और विशेष की जगह विोष, ऐसे शब्दों में जो बाकी सब तरह से ठीक दिखते थे। अब कन्वर्टर पेज में दर्ज घुमावदार उद्धरण चिह्न से कोड लेता है। दो सूचनाओं में इससे विशेष, आवश्यक, पश्चात् और आदेश पूरे वापस आए।
मापा गया
DevLys में टाइप की गई चौदह असली PDF, राज्यों की भर्ती संस्थाओं की: परिणाम सूचनाएँ, पाठ्यक्रम, अभ्यर्थियों के लिए निर्देश और एक जाँच प्रपत्र। बदलने पर उनमें 17,025 शब्द हैं, और उनमें से 95.2% Tesseract की हिन्दी या देवनागरी शब्द-सूची में हैं, हर दस्तावेज़ में 89% से 98% के बीच। बाकी में नाम और हिन्दी अक्षरों में लिखे अंग्रेज़ी शब्द भी हैं, जो सही हैं। हर दस्तावेज़ की एक छपी पंक्ति को आँख से कन्वर्ज़न से मिलाया गया, और सब मेल खाईं।
मापते समय ऊपर वाला छूटा हुआ श मिला, और टाइपिंग की ऐसी आदतें भी जिन्हें कन्वर्टर अब पेज पर दिखने के अनुसार पढ़ता है: ए की मात्रा के बाद र-पदेन टाइप किया गया अंग्रेजी, ओ या ऐ की कुंजी से पहले आधा अक्षर टाइप किया गया जिम्मेदारी और बगैर, और आ के बाद ए टाइप किया गया अंकों। एक सूचना पेज हेडर खोजने वाले चरण की खराबी के कारण पूरी तरह लौटा दी जाती थी; अब वह बदलती है। ऐसे 16 मात्रा-क्रम बचे हैं जो किसी हिन्दी शब्द में नहीं होते, और जो देखे गए वे फ़ाइलों में ही दो बार दबाई गई कुंजियाँ और भटके हुए चिह्न हैं, जैसे परी के बाद दबाया गया नुक़्ता।
कहाँ अब भी गलती होती है
केवल PDF मापी गई हैं, इसलिए यह पेज PDF ही लेता है। DevLys में टाइप की गई Word फ़ाइल भी इसी तरह पढ़ी जाती है, पर दस असली फ़ाइलें अभी जाँची नहीं गई हैं। चार घुमावदार-उद्धरण कोड में से केवल एक इन सूचनाओं के फ़ॉन्ट में मिलता है; बाकी तीन उसी के आधार पर उसी अदला-बदली से पढ़े जाते हैं, और जिस दस्तावेज़ में वे हों उसके लिए वह पढ़त चुनी जाती है जिसमें ज़्यादा असली शब्द हों।
कृतिदेव वाले पेज पर लिखी बातें यहाँ भी लागू हैं: अनपहचाने कोड ऐसे चिह्नों के रूप में आते हैं जो साफ़ तौर पर देवनागरी नहीं हैं, घने खानों वाला फ़ॉर्म छपे फ़ॉर्म से लंबा निकलता है, और स्कैन के लिए OCR चाहिए।