चाणक्य PDF से यूनिकोड: अख़बार की हिन्दी जिसे संपादित किया जा सके

चाणक्य में छपी PDF अपलोड करें, वही फ़ॉन्ट जिसमें हिन्दी अख़बार और कई प्रेस छापते हैं, और उसे यूनिकोड हिन्दी की Word फ़ाइल के रूप में वापस पाएँ। न कॉपी-पेस्ट, न दोबारा टाइपिंग, न पैराग्राफ़ की कोई सीमा। ऐसी PDF से एक पंक्ति कॉपी करें तो कहा कि सरकार की जगह ∑§„Ê Á∑§ ‚⁄U∑§Ê⁄U जैसे चिह्न आते हैं, क्योंकि PDF का अपना कोड-से-अक्षर नक्शा चिह्नों की ओर इशारा करता है। यह कन्वर्टर उस नक्शे को छोड़कर वे कोड पढ़ता है जिन्हें फ़ॉन्ट बनाता है।

PDF फ़ाइलें, 25 MB तक · फ़ाइलें 4 घंटे के भीतर हटा दी जाती हैं · साइन-अप की ज़रूरत नहीं

Read this page in English

PDF का पाठ, जैसा PyMuPDF पढ़ता है

∑§„Ê Á∑§ ‚⁄U∑§Ê⁄U ‚÷Ë ’Ê…∏ ¬˝÷ÊÁflÃÙ¥ ∑‘§ ‚ÊÕ π«∏Ë „Ò–

चाणक्य की तालिका से पढ़ा गया

कहा कि सरकार सभी बाढ़ प्रभावितों के साथ खड़ी है।

चाणक्य में छपे एक हिन्दी अख़बार के पेज की पंक्ति। बाईं ओर: PDF का अपना नक्शा जो पाठ देता है, यानी वही जो कॉपी करने पर और साधारण कन्वर्टर में आता है। दाईं ओर: वही पंक्ति फ़ॉन्ट के कोड से पढ़ी गई; छपे पेज पर दाईं ओर वाली पंक्ति ही दिखती है।
Back to Tools
🔤

Legacy PDF to DOCX

A PDF whose text was set in a legacy Indic font, recovered as editable Unicode Word — read from the font’s own table rather than by OCR.

How to use?

Leave it on detect if you are not sure. The ones marked “not yet” will tell you so rather than converting badly.

Files are stored encrypted
Deleted within 4 hours
SSL Encrypted

चाणक्य PDF कॉपी करने पर चिह्न क्यों आते हैं

चाणक्य, कृतिदेव की तरह, देवनागरी को 8-बिट लैटिन फ़ॉन्ट के खानों में बनाता है, पर उसका लेआउट अपना है: पूरा अक्षर प्रायः आधे रूप और एक पाई से बनता है, छोटी इ की मात्रा व्यंजन से पहले टाइप होती है, और रेफ़ अक्षर के बाद। PDF वही कोड सहेजती है, और कॉपी के लिए साथ रखा नक्शा उन्हें चिह्नों में बदल देता है, इसलिए हर कॉपी, हर खोज और हर साधारण कन्वर्टर की की जगह ∑§Ë पाता है।

कुछ अख़बारों की टेक्स्ट लेयर इससे भी बुरी है: फ़ॉन्ट जिन अक्षरों को 0x80 से 0x9F तक के कोड पर रखता है, वे कॉपी किए पाठ से पूरी तरह गायब हो जाते हैं, इसलिए मुख्यमंत्री का ख और गिरफ्तार का फ छूट जाता है। यह कन्वर्टर कोड को सीधे चाणक्य की तालिका से पढ़ता है, जिसे असली फ़ॉन्ट में बनाकर जाँचा गया है, और हर मात्रा को यूनिकोड के क्रम में रखता है।

एक नाम, तीन संस्करण

चाणक्य में छपे सभी दस्तावेज़ हर कुंजी पर एक ही चीज़ नहीं रखते। कुछ अख़बार 1 से 9 तक के अंक उन कुंजियों पर रखते हैं जिन पर दूसरे संस्करण आधे अक्षर रखते हैं, और एक परीक्षा-पत्र ने क् और ख् को अपनी अलग कुंजियों पर रखा। कन्वर्टर हर दस्तावेज़ को इन संस्करणों के हर तरीके से पढ़ता है और वही पाठ रखता है जिससे शब्द बनते हैं, ताकि दामों वाला पेज आधे अक्षरों की लड़ी न बन जाए। कुछ चुनना नहीं पड़ता।

वॉकमैन-चाणक्य, मिलते-जुलते नाम वाला एक अलग फ़ॉन्ट, का लेआउट अपना है और उसे अभी नहीं पढ़ा जाता। अख़बार जो शीर्षक किसी दूसरे फ़ॉन्ट में छापता है, वे भी नहीं पढ़े जाते: केवल चाणक्य वाला पाठ बदला जाता है।

मापा गया

चाणक्य में छपी छब्बीस असली PDF, कम से कम सात प्रकाशकों की: अख़बारों के पेज, PageMaker में छपा एक दल का दस्तावेज़ और एक आध्यात्मिक मासिक पत्रिका, Word में बने स्कूल बोर्ड के दो परीक्षा-पत्र, और गीता की एक टीका। बदलने पर उनमें 101,746 शब्द हैं, और उनमें से 94.0% Tesseract की हिन्दी या देवनागरी शब्द-सूची में हैं: हर दस्तावेज़ में 93% से 98% के बीच, और गीता की टीका में 79.5%, क्योंकि उसके संस्कृत श्लोक और समास सूचियों में नहीं हैं। यह शुद्धता का आँकड़ा नहीं है; सूची से बाहर के नाम और दुर्लभ शब्द भी सही हो सकते हैं। कोई कोड बिना पढ़े नहीं छूटा, और हर दस्तावेज़ की एक छपी पंक्ति को आँख से कन्वर्ज़न से मिलाया गया।

मापते समय कुछ गलतियाँ मिलीं, और सब ठीक की गईं। जिस आकार को र का पदेन पढ़ा जा रहा था, वह नीचे लगा न है, इसलिए अग्नि की जगह अग्रि और प्रश्न की जगह प्रश्र आ रहा था; बिना खड़ी पाई वाले अक्षरों के बाद लगने वाला य का चिह्न नहीं पढ़ा जाता था, इसलिए पाठ्यक्रम और बुद्ध्या में वह छूट जाता था; ू से पहले टाइप किया चंद्रबिंदु उसके पहले ही रह जाता था; और समय व दाम वाले पेजों पर अंक आधे अक्षर पढ़े जाते थे।

कहाँ अब भी गलती होती है

101,746 शब्दों में से 17 में ऐसा मात्रा-क्रम है जो किसी हिन्दी शब्द में नहीं होता, ज़्यादातर दो बार दबाई गई कुंजियाँ। फ़ॉन्ट के कुछ कोड ऐसे आकार बनाते हैं जिन्हें अभी तक पहचाना नहीं गया; वे ऐसे चिह्नों के रूप में आते हैं जो साफ़ तौर पर देवनागरी नहीं हैं, इसलिए आसानी से दिख जाते हैं। डिब्बों में बँटी ख़बरों वाला अख़बार का पेज सबसे कठिन लेआउट है, इसलिए Word फ़ाइल में ख़बरों का क्रम जाँच लें।

वॉकमैन-चाणक्य या चाणक्य के अलावा किसी शीर्षक-फ़ॉन्ट का पाठ जैसा था वैसा रहता है। स्कैन किए पेज में पढ़ने को कोड नहीं होते; उसके लिए OCR चाहिए।

अक्सर पूछे जाने वाले सवाल

चाणक्य फ़ॉन्ट की PDF को यूनिकोड में कैसे बदलें?

ऊपर PDF अपलोड करें और जो Word फ़ाइल मिले उसे डाउनलोड करें। पूरी फ़ाइल एक साथ पढ़ी जाती है, और हिन्दी यूनिकोड में आती है।

Chanakya font PDF ko Unicode me kaise badle?

PDF upload kijiye aur Word file download kar lijiye. Poori file ek saath padhi jaati hai aur Hindi Unicode mein aati hai.

हिन्दी अख़बार की PDF से कॉपी करने पर चिह्न क्यों आते हैं?

क्योंकि PDF चाणक्य जैसे पुराने फ़ॉन्ट में छपी है, और कॉपी के लिए उसका नक्शा चिह्नों की ओर इशारा करता है। पेज सही इसलिए दिखता है क्योंकि फ़ॉन्ट उन कोड को हिन्दी अक्षरों के रूप में बनाता है।

क्या चाणक्य और कृतिदेव एक ही हैं?

नहीं। दोनों देवनागरी को अंग्रेज़ी फ़ॉन्ट की कुंजियों पर रखते हैं, पर अलग-अलग कुंजियों पर, इसलिए कृतिदेव का कन्वर्टर चाणक्य के पाठ को दूसरे अक्षरों में बदल देता है। यहाँ हर एक अपनी तालिका से पढ़ा जाता है।

वॉकमैन-चाणक्य का क्या?

वह अपने लेआउट वाला एक अलग फ़ॉन्ट है, और उसे अभी नहीं पढ़ा जाता। उसका पाठ जैसा था वैसा रहता है।

मेरी अख़बार की PDF स्कैन की हुई है। क्या यह काम करेगा?

नहीं। स्कैन में अक्षरों की तस्वीरें होती हैं, पढ़ने को कोड नहीं। उसके लिए हिन्दी OCR तस्वीरों को पढ़ता है।

मेरी फ़ाइल का क्या होता है?

बदलते समय फ़ाइल एन्क्रिप्ट करके रखी जाती है और हर कन्वर्ज़न के बाद चलने वाली सफ़ाई उसे हटा देती है, इसलिए अपलोड के 4 घंटे बाद तक कुछ नहीं रखा जाता। 25 MB तक की फ़ाइलें, बिना खाते के।

संबंधित टूल

दूसरे लेगेसी फ़ॉन्ट पेज