اسکین شدہ PDF میں سرچ کیوں نہیں ہوتی
کیونکہ اس میں کوئی الفاظ ہیں ہی نہیں۔ یہ سمجھ لینا کہ فائل میں اصل میں کیا ہے، ہر علامت کی وضاحت کر دیتا ہے، اور اس ایک سیٹنگ کی طرف اشارہ کرتا ہے جو طے کرتی ہے کہ اسے کتنا اچھا ٹھیک کیا جا سکتا ہے۔
آخری جائزہ
فائل میں کوئی الفاظ نہیں ہیں
PDF میں دو بالکل مختلف چیزیں ہو سکتی ہیں جو اسکرین پر ایک جیسی دکھتی ہیں۔ Word سے ایکسپورٹ کی گئی دستاویز میں ٹیکسٹ ہوتا ہے — اصل حروف، ہر ایک کی اپنی جگہ اور فونٹ کے ساتھ — اسی لیے آپ جملہ سلیکٹ کر سکتے ہیں، کوئی نام سرچ کر سکتے ہیں اور پیراگراف کاپی کر سکتے ہیں۔ اسکین شدہ دستاویز میں صفحے کی تصویر ہوتی ہے۔ اس میں پکسلز کے سوا کچھ نہیں، بالکل ویسے ہی جیسے سڑک کے نشان کی تصویر میں پکسلز کے سوا کچھ نہیں ہوتا۔
ہر علامت اسی ایک حقیقت سے نکلتی ہے۔ سرچ کو کچھ نہیں ملتا کیونکہ ملانے کو کچھ ہے ہی نہیں۔ ٹیکسٹ سلیکٹ نہیں ہوتا کیونکہ سلیکٹ کرنے کو ٹیکسٹ نہیں — کرسر اس کے بجائے تصویر پر ایک مستطیل بنا دیتا ہے۔ کاپی کرنے سے کچھ نہیں ملتا۔ فائل اپنی لمبائی کے لحاظ سے بڑی ہوتی ہے، کیونکہ تصاویر بھاری ہوتی ہیں اور الفاظ نہیں۔ اور اسے Word میں تبدیل کرنے سے یا تو خالی دستاویز بنتی ہے یا ایسی دستاویز جس میں ایک تصویر چسپاں ہو۔
فوری ٹیسٹ: ماؤس سے کوئی ایک لفظ سلیکٹ کرنے کی کوشش کریں۔ اگر ٹیکسٹ کرسر اور ہائی لائٹ ہوا لفظ ملے تو اصل ٹیکسٹ موجود ہے۔ اگر ایک باکس بنے تو یہ تصویر ہے۔
OCR اصل میں کیا شامل کرتا ہے
آپٹیکل کریکٹر ریکگنیشن (OCR) تصویر میں موجود شکلیں پڑھ کر معلوم کرتا ہے کہ وہ کون سے حروف ہیں۔ کارآمد حصہ اس کے بعد ہوتا ہے: پہچانے گئے الفاظ PDF میں نظر نہ آنے والے ٹیکسٹ کے طور پر، تصویر کے الفاظ کے عین اوپر لکھ دیے جاتے ہیں۔ صفحہ بالکل پہلے جیسا دکھتا ہے، کیونکہ دیکھنے میں کچھ نہیں بدلا — لیکن اب اس میں سرچ، سلیکٹ، کاپی اور انڈیکسنگ ہو سکتی ہے۔
یہ جان بوجھ کر محتاط ڈیزائن ہے اور دستاویزات کے لیے یہی درست ہے۔ کچھ بھی دوبارہ ٹائپ سیٹ نہیں ہوتا، اس لیے معاہدہ اب بھی ویسا ہی دکھتا ہے جیسا دستخط ہوا تھا، اور اصل اسکین ہی بصری ریکارڈ رہتا ہے۔ اسکین شدہ PDF کو سرچ کے قابل بنانا یہ کام ایک ہی بار میں کرتا ہے، اور عموماً صفحات کو سیدھا اور درست رخ پر بھی کر دیتا ہے، کیونکہ پڑھنے کے لیے یہ ویسے بھی ضروری تھا۔
اگر آپ کو سرچ کے قابل کے بجائے ترمیم کے قابل دستاویز چاہیے، تو یہ مختلف اور کہیں مشکل کام ہے: ٹیکسٹ نکالنا ہوتا ہے، لے آؤٹ کا اندازہ لگانا ہوتا ہے، اور نتیجے کو پیراگرافس اور ٹیبلز کی شکل میں دوبارہ بنانا ہوتا ہے۔ Word میں تبدیل کرنا یہ کرتا ہے، اور اس کے نتیجے کو ہمیشہ اس طرح چیک کرنا پڑتا ہے جس طرح ٹیکسٹ کی تہہ کو نہیں۔
وہ سیٹنگ جو سب کچھ طے کرتی ہے: 300 DPI
پہچان کی درستگی سافٹ ویئر سے کہیں زیادہ اسکین پر منحصر ہے، اور سب سے اہم عدد ریزولوشن ہے۔ 300 DPI معیار ہے، اور یہ من مانی نہیں — اس سے عام ٹیکسٹ کی اونچائی میں تقریباً 30 پکسلز آتے ہیں، جو ملتی جلتی شکلوں والے حروف میں فرق کرنے کی کم از کم ضرورت سے آرام سے زیادہ ہے۔
150 DPI پر درستگی واضح طور پر گرتی ہے، اور غلطیاں چپکے سے ہونے والی قسم کی ہوتی ہیں: 1 کو l پڑھنا، 5 کو S، اور rn کو m۔ اس سے نیچے یہ تیزی سے بگڑتی ہے۔ 300 سے اوپر جانا شاذ و نادر ہی مدد کرتا ہے اور فائلیں بہت بڑی کر دیتا ہے — 600 DPI صرف بہت باریک چھپائی یا خراب اصل کے لیے فائدہ مند ہے۔
تین اور کیپچر سیٹنگز تقریباً اتنی ہی اہم ہیں۔ بلیک اینڈ وائٹ کے بجائے گرے اسکیل، کیونکہ سخت حد حروف کے باریک حصے مٹا دیتی ہے۔ سینسر کے سامنے سیدھا اور ہموار، کیونکہ زاویے سے لی گئی تصویر میں حروف کی شکل پورے صفحے پر بدلتی رہتی ہے۔ اور یکساں روشنی — سب سے عام ناکامی یہ ہے کہ اوپر سے تصویر لیتے وقت آپ کا اپنا سایہ صفحے پر پڑ جائے۔
جو کوئی OCR نہیں پڑھے گا
اس بارے میں ایمان داری بہت سا وقت بچاتی ہے۔ جڑی ہوئی (کرسیو) لکھائی عام مقصد کا OCR نہیں پہچانتا، اور وجہ محنت کی کمی نہیں بلکہ ساختی ہے: چھپے ہوئے حروف پڑھنے کا طریقہ حروف کے درمیان حدیں ڈھونڈنا ہے، اور کرسیو میں کوئی حد ہوتی ہی نہیں۔ ہاتھ سے الگ الگ لکھے حروف، بڑے انگریزی حروف (block capitals) اور فارم کے خانے اکثر اچھے پڑھے جاتے ہیں، کیونکہ یہ ایسی الگ شکلیں ہیں جن کے درمیان خلا ہوتا ہے۔
جو ٹیکسٹ کسی تصویر کا حصہ ہو — کسی بورڈ پر، کسی پراڈکٹ پر، کسی بھرے ہوئے بیک گراؤنڈ پر لکھے الفاظ — وہ کاغذ کے ٹیکسٹ سے کہیں مشکل ہے، اور بہت زیادہ اسٹائل والی یا آرائشی لکھائی اس سے بھی مشکل۔ فوٹو کاپی کی فوٹو کاپی میں وہ باریک لکیریں مٹ جاتی ہیں جو حروف میں فرق کرتی ہیں۔ اور جس دستاویز پر مہر لگی ہو، نوٹس لکھے ہوں یا ہائی لائٹ کیا گیا ہو، وہ وہاں بدتر پڑھی جاتی ہے جہاں یہ نشان ٹیکسٹ پر آتے ہیں۔
اچھا ٹول بتاتا ہے کہ اسے کتنا یقین تھا، اور یہ عدد استعمال کرنے کے لیے ہے۔ کسی ایسے جملے کے بیچ کم یقین جسے آپ سیاق و سباق سے پڑھ سکتے ہیں، اکاؤنٹ نمبر کے کسی ہندسے پر کم یقین کے مقابلے میں بہت کم اہم ہے۔ خطرناک غلطیاں وہ ہیں جن پر یقین زیادہ ہو، کیونکہ کوئی چیز ان کی نشاندہی نہیں کرتی۔
یہ سہولت سے بڑھ کر کیوں اہم ہے
ٹیکسٹ کی تہہ کے بغیر اسکین شدہ آرکائیو عملی طور پر گمشدہ ہے۔ نہ اس میں کچھ سرچ ہو سکتا ہے، نہ اسے انڈیکس کیا جا سکتا ہے، کوئی کمپلائنس سسٹم اس میں نام نہیں ڈھونڈ سکتا، اور کوئی اسکرین ریڈر اسے بلند آواز میں نہیں پڑھ سکتا — جس کی وجہ سے کئی قانونی دائرہ اختیار میں اسے شائع کرنا صرف زحمت نہیں بلکہ قانونی مسئلہ بن جاتا ہے۔
اسی لیے پہلی بار ہی صحیح سیٹنگز پر اسکین کرنے پر اصرار کرنا فائدہ مند ہے۔ دستاویزات کا ایک ڈبہ دوبارہ اسکین کرنا اسے ایک بار ٹھیک سے اسکین کرنے سے کہیں مہنگا ہے، اور کوئی پروسیسنگ وہ تفصیل واپس نہیں لا سکتی جو کبھی کیپچر ہی نہیں ہوئی۔
اکثر پوچھے جانے والے سوالات
OCR واقعی کتنا درست ہے؟
عام چھپے ہوئے ٹیکسٹ کے صاف 300 DPI اسکین پر، بہت درست — اتنا کہ غلطیاں معمول نہیں بلکہ اکا دکا ہوتی ہیں۔ کم روشنی میں زاویے سے لی گئی فون کی تصویر پر، ڈرامائی طور پر بدتر۔ اسکین کی کوالٹی سافٹ ویئر کے انتخاب سے کہیں زیادہ اہم ہے۔
کیا OCR میری دستاویز کی شکل بدل دے گا؟
نہیں۔ پہچانا گیا ٹیکسٹ موجودہ تصویر کے اوپر نظر نہ آنے والے طریقے سے شامل کیا جاتا ہے، اس لیے صفحہ بالکل پہلے جیسا دکھتا ہے۔ اس عمل کے دوران صفحات عموماً سیدھے اور درست رخ پر کر دیے جاتے ہیں، جس سے ٹیڑھے اسکین مختلف نہیں بلکہ بہتر دکھتے ہیں۔
کیا OCR کے بعد میں ٹیکسٹ ایڈٹ کر سکتا ہوں؟
خود PDF میں نہیں — نظر آنے والا صفحہ اب بھی تصویر ہے، اور ٹیکسٹ کی تہہ اس کے اوپر نظر نہ آنے والے طریقے سے موجود ہے۔ ترمیم کے قابل چیز کے لیے پہچانی گئی دستاویز کو Word میں تبدیل کریں، اور نتیجہ چیک کرنے کی توقع رکھیں۔
کیا OCR ہاتھ کی لکھائی پر کام کرتا ہے؟
الگ الگ، ہاتھ سے لکھے حروف اور بھرے ہوئے فارم اکثر کام کر جاتے ہیں۔ جڑی ہوئی لکھائی کسی بھی عام مقصد کے OCR ٹول میں کام نہیں کرتی — حروف آپس میں ملے ہوتے ہیں اور ڈھونڈنے کو کوئی حد نہیں ہوتی۔ خاص طور پر ہاتھ کی لکھائی پر تربیت یافتہ ٹولز بہتر کرتے ہیں، لیکن اس کی قیمت یہ ہے کہ آپ کے صفحات کسی تیسرے فریق کو بھیجے جاتے ہیں۔
میری سرچ کے قابل PDF اتنی بڑی کیوں ہو گئی؟
اسے مشکل سے بدلنا چاہیے — ٹیکسٹ کی تہہ فی صفحہ چند کلو بائٹس کی ہوتی ہے۔ اگر یہ بہت بڑھ گئی تو غالباً صفحات برقرار رکھنے کے بجائے دوبارہ رینڈر کیے گئے، جسے چیک کرنا چاہیے، کیونکہ ٹیکسٹ کی تہہ کا مقصد ہی یہ ہے کہ اصل تصویر بغیر چھیڑے محفوظ رہے۔
یہ بھی پڑھنے کے لائق ہے
PDF ای میل کے لیے بہت بڑی ہے
PDF بڑی ہونے کی تین وجوہات، اور آپ کی فائل پر کون سا حل لاگو ہوتا ہے۔
کون سا تصویری فارمیٹ؟
ایک سوال فیصلہ کرتا ہے۔ JPG، PNG، WebP اور AVIF کا ایمان دارانہ موازنہ۔
PDF کو درست طریقے سے ریڈیکٹ کرنا
کالا باکس کچھ کیوں نہیں چھپاتا، اور PDF کن جگہوں پر وہ نام رکھتی ہے جو آپ بھول گئے۔