అను ఫాంట్ తెలుగును ఎలా దాచుకుంటుంది
అను ఫాంట్ ఒక అక్షరాన్ని భాగాలుగా కూర్చుతుంది. హల్లు అంటే ఒక ఆకారం, దాని వెంట దాని తలకట్టు. గుణింతపు గుర్తును తలకట్టు తర్వాత కాదు, తలకట్టు స్థానంలోనే టైప్ చేస్తారు. ఒత్తులు వేరే గ్లిఫ్లు, వాటిని అక్షరం తర్వాత టైప్ చేస్తారు. క్రావడిని మాత్రం అది చేరే అక్షరానికి ముందే టైప్ చేస్తారు. కాబట్టి ఒక తెలుగు అక్షరం అంటే టైపిస్టు నొక్కిన క్రమంలో ఉన్న రెండు నుండి ఐదు కోడ్లు, వాటిలో ఏదీ తెలుగు అక్షరం కాదు.
ఇలాంటి ఫైల్ నుండి తయారైన PDF లో సాధారణంగా కోడ్లను అక్షరాలకు కలిపే ఒక పట్టిక ఉంటుంది, కానీ అది తప్పు: ఆ కోడ్లు ఇంగ్లీషు ఫాంట్లో ఏ అక్షరాలు, గుర్తులు అవుతాయో వాటినే అది చెబుతుంది. పైన చూపిన నమూనా అలా కాపీ అవడానికి కారణం ఇదే. సాధారణ PDF నుండి Word కన్వర్టర్ కూడా అవే ఇంగ్లీషు అక్షరాలను ఇచ్చి, పని పూర్తయిందని చెబుతుంది. ఈ కన్వర్టర్ నేరుగా కోడ్లనే చదివి, భాగాలను అక్షరాలుగా కలిపి, యూనికోడ్ క్రమంలో పెడుతుంది.
కుటుంబం మొత్తానికి ఒకే లేఅవుట్, ఇంకొకటి కూడా
అను స్క్రిప్ట్ మేనేజర్ 7 ఇన్స్టాల్ చేసే 86 తెలుగు ఫాంట్లలో ప్రతిదానిలో పన్నెండు పరీక్షా పదాలను గీసి, యూనికోడ్ ఫాంట్తో పక్కపక్కన పోల్చాం. ప్రతి ఫాంట్ అవే కోడ్ల నుండి అవే అక్షరాలను గీస్తుంది. అందుకే ప్రియాంక, గౌతమి, అనుపమ, పల్లవి, బ్రహ్మ, క్రాంతి, మిగతావి అన్నిటినీ, అవి ఎంత దళసరిగా ఉన్నా, ఒకే పట్టిక చదువుతుంది.
కొన్ని పుస్తకాలు దీన్ని పాటించవు. ఒక పుస్తకంలో ఉన్న ప్రియాంక ఫాంట్లో గ్లిఫ్లు అవే, కానీ కోడ్లు వేరు: మామూలు పట్టికతో చదివితే దాని పదాల్లో 1.7% మాత్రమే నిజమైన తెలుగు పదాలు. ఆ పుస్తకంలోని ఫాంట్ ఆకారాలను గీసి, ఇన్స్టాల్ అయిన ఫాంట్తో ఒక్కో గ్లిఫ్ను సరిపోల్చాం. అలా రెండో లేఅవుట్ దొరికింది, దానితో అదే పుస్తకంలో 73.8% పదాలు నిజమైన తెలుగు పదాలుగా వస్తాయి. ఈ విషయంలో కన్వర్టర్ ఫాంట్ పేరును నమ్మదు. ఒక ఫాంట్ పాఠాన్ని రెండు లేఅవుట్లతోనూ చదివి, తెలుగులో సాధ్యం కాని పదాలు తక్కువగా వచ్చే దాన్ని ఎంచుకుంటుంది.
నిజమైన పుస్తకాలపై దొరికిన లోపాలు
తప్పు పదాల్లో ఎక్కువ భాగం ఒకే రకం లోపం వల్ల వచ్చాయి: పట్టికలో రెండు కోడ్ల పొడవున్న ఒక నమోదు, తర్వాతి అక్షరపు మొదటి కోడ్ను మింగేయడం. పదివరాలు అనే పదం పదివలు అని వచ్చింది, ఎందుకంటే వ నమోదు ర ఆకారాన్ని తీసేసుకుంది. అబ్బాయ్ అనే పదం అబ్బాయు అని వచ్చింది, ఎందుకంటే య తోకకు ముందున్న పొల్లును ఏమీ లేనట్లు చదివింది. నర్సింహం అనే పదం నర్సింహాం అని వచ్చింది, ఎందుకంటే హ ను పూర్తి చేసే తోకను ఒక నమోదు దాచేసింది. ప్రతి లోపాన్ని అచ్చు పేజీ నుండి ఆ పదాన్ని కత్తిరించి చూసి, లేదా ఆ కోడ్లను అసలు ప్రియాంక ఫాంట్లో గీసి తేల్చాం. ప్రతి సవరణను, మా దగ్గరున్న ప్రతి అను పుస్తకంపై కొలిచిన తర్వాతే ఉంచాం.
ఇంకో పెద్ద లోపం పట్టికలో లేదు. PDF ఒక పేజీ పాఠాన్ని ఒకే పొడవైన వరుసగా ఇస్తుంది. కన్వర్టర్ పంక్తులను ఖాళీ లేకుండా కలిపేది, దాంతో ప్రతి పంక్తి చివరి పదం తర్వాతి పంక్తి మొదటి పదంతో అతుక్కుపోయేది: ఒక నవలలోని పది పేజీల్లో అలా అతుక్కున్న పదాలు 54. ఇప్పుడు అచ్చులో పంక్తి ఎక్కడ ముగుస్తుందో అక్కడే పంక్తులను విడదీస్తున్నాం.
కొలిచినది
తెలుగు పాఠకులు ఒకరు అచ్చు పంక్తులను మార్చిన పాఠంతో పదం పదంగా పోల్చి చూశారు: అను ఫాంట్లలో ఉన్న పన్నెండు పుస్తకాలు, పత్రాల నుండి యాదృచ్ఛికంగా తీసిన 288 పంక్తులు, 2,475 పదాలు, నాలుగు విడతల్లో. మొదటి మూడు విడతల్లో 2, 7, 2 తప్పు పదాలు దొరికాయి. ప్రతి తప్పుకూ కారణమైన పట్టిక నమోదును కనుక్కొని సరిచేశాం. నాలుగో విడతలో, ఇంతకు ముందు చూడని పంక్తుల నుండి తీసిన 610 పదాల్లో, ఒక్క తప్పు కూడా దొరకలేదు. అందులో పాఠకులు ఆరు పదాలను గుర్తించారు, కానీ ఆ ఆరూ పుస్తకంలో అలాగే అచ్చయి ఉన్నాయి: అవి పుస్తకంలోని అచ్చుతప్పులు, మార్పిడి వాటిని అలాగే ఉంచుతుంది.
ఆ పంక్తులు ఎక్కువగా మూడు ఫాంట్లలో ఉన్నాయి: Priyaanka (వాటిలో 1,428 పదాలు), GowthamiMedium (543), AnupamaMedium (428). నమూనాలో చాలా తక్కువగా వచ్చిన ఫాంట్లను, ఉదాహరణకు 62 పదాలే ఉన్న PriyaankaBold ను, అదే పట్టిక చదువుతుంది, కానీ వాటిపై తనిఖీ చాలా తక్కువ జరిగింది.
మొత్తం పుస్తకాల మీద చూస్తే, మార్చిన 116,750 పదాల్లో 75.8% పదాలు Tesseract వారి 221,189 పదాల తెలుగు జాబితాలో ఉన్నాయి. జాబితాలో లేని పదాలు ఎక్కువగా పేర్లు, ఇతర భాషల నుండి వచ్చిన పదాలు, కలిసిపోయిన రూపాలు. కాబట్టి ఈ సంఖ్య ఒక వెర్షన్ నుండి మరో వెర్షన్కు వచ్చిన మార్పును చూపుతుంది, తప్పుల శాతాన్ని కాదు.
ఇంకా ఎక్కడ తప్పు జరుగుతుంది
పాఠకుల తనిఖీ కొన్ని పంక్తులను నమూనాగా తీసుకుంది, ప్రతి పదాన్ని చదవలేదు. పట్టికలో ఒక నమోదు తప్పయితే, అది వచ్చిన ప్రతి చోటా తప్పే. కాబట్టి ఫలితంపై ఆధారపడే ముందు దాన్ని చదివి చూసుకోండి, ముఖ్యంగా పేర్లు, సంఖ్యలు. CVTEMeghna అనే ఒక తెలుగు ఫాంట్ను ఇది అసలు చదవదు. ఆ ఫాంట్లో ఉన్న పుస్తకాన్ని, ఆ విషయం చెప్పే సందేశంతో తిరస్కరిస్తుంది. కొన్ని సబ్సెట్ ఫాంట్లలో ఉపయోగపడే కోడ్లే ఉండవు. ఎక్కువ భాగం అలాంటి ఫాంట్లో ఉన్న పత్రాన్ని కూడా తిరస్కరిస్తుంది.
Word ఫైల్ను పేజీ పేజీగా తిరిగి నిర్మిస్తాం: అచ్చులోని పేరాలు, అక్షరాల సైజులు, బోల్డ్, బొమ్మలు, పేజీ శీర్షికలతో. యూనికోడ్ తెలుగు ఫాంట్లు అను కంటే వెడల్పుగా ఉంటాయి. అందుకే అక్షరాలు అచ్చులో ఉన్నంత ఎత్తుగా కనిపించే సైజులో పాఠాన్ని పెడతాం. అయినా పెద్ద పుస్తకం అచ్చులో ఉన్న వాటి కంటే ఎక్కువ పేజీలతో రావచ్చు. స్కాన్ చేసిన పుస్తకంలో చదవడానికి కోడ్లు ఉండవు, దానికి తెలుగు OCR కావాలి.