مواد پر جائیں

OCR جو آپ کی تصویر کبھی نہیں رکھتا

چھ ٹولز جو تصاویر سے ٹیکسٹ، کوڈز اور بارکوڈز پڑھتے ہیں۔ زبان کے پیکس اسی سائٹ سے آتے ہیں، اور آپ کی تصویر کبھی محفوظ نہیں کی جاتی۔

6 ٹولز، نہ سائن اپ، نہ واٹر مارک

ان میں سے زیادہ تر ایک تصویر پر ایک کام کرتے ہیں۔ کسی تصویر سے الفاظ کاپی کرنے ہوں تو “تصویر سے ٹیکسٹ” سے شروع کریں؛ اسکرین پر وہ ٹیکسٹ حاصل کرنا ہو جسے آپ سلیکٹ نہیں کر سکتے تو “اسکرین شاٹ سے ٹیکسٹ”؛ اسکین کی شکل بدلے بغیر اسے سرچ کے قابل بنانا ہو تو “PDF پر OCR کریں”۔ فہرست کے نیچے دیے گئے نوٹس ان باتوں کا احاطہ کرتے ہیں جو لوگوں کو حیران کرتی ہیں — ریزولوشن فائل کے سائز سے زیادہ اہم کیوں ہے، اور کہاں براؤزر غلط ٹول ہے۔

QR کوڈ اور بارکوڈ

2 ٹولز

QR کوڈ کھولنے سے پہلے دیکھیں اس میں کیا لکھا ہے، اور بارکوڈ کا نمبر اس کے چیک ڈیجٹ کی تصدیق کے ساتھ حاصل کریں۔

OCR اصل میں کیا کرتا ہے، اور کیا نہیں کر سکتا

OCR شکلیں پہچان کر حروف لوٹاتا ہے۔ یہ پڑھتا نہیں۔ اس کے پیچھے الفاظ کی کوئی سمجھ نہیں، اس لیے “l” سمجھا گیا “1” بالکل اتنے ہی یقین کے ساتھ واپس آتا ہے جتنا اس کے ارد گرد کا ہر درست حرف۔ اسی لیے یہ صفحات صاف ستھرا دکھنے والا نتیجہ دے کر غلطیاں ڈھونڈنے کا کام آپ پر چھوڑنے کے بجائے ٹیکسٹ کے ساتھ پڑھنے والے کا اپنا اعتماد دکھاتے ہیں۔ صاف چھپے ہوئے ٹیکسٹ پر، جس کی تصویر سیدھی اور فوکس میں لی گئی ہو، غلطی کی شرح ہزار میں چند حروف ہے۔ چمک، سائے یا غیر معمولی فونٹ پر یہ کہیں زیادہ خراب ہو سکتی ہے، اور آؤٹ پٹ میں کچھ بھی مختلف نظر نہیں آئے گا۔

ان صفحات کے پیچھے دو ریڈرز ہیں۔ ایک صفحے پر ٹیکسٹ جہاں بھی ہو ڈھونڈ لیتا ہے، یہ جانے بغیر کہ وہ کس رسم الخط میں ہے، اور ایک ہی لغت سے پچاس کے قریب زبانیں پڑھتا ہے۔ دوسرا، جسے ہر زبان کے لیے الگ تربیت دی گئی ہے، اس کے پیچھے رہتا ہے اور 120 سے زیادہ زبانوں کا احاطہ کرتا ہے۔ زبان کو خودکار پر چھوڑنے سے پہلا ریڈر کوشش کرتا ہے، جو اہم ہے کیونکہ غلط زبان بتانا کچھ بھی واپس نہ ملنے کا سب سے عام طریقہ ہے — پولش مینو کو سیریلک سمجھ کر روسی کے طور پر پڑھا جائے تو پورے یقین سے خالی صفحہ واپس آتا ہے۔ زبان خود بتانے سے کام اسی زبان کے ریڈر سے بندھ جاتا ہے، اور جب آپ ٹھیک ٹھیک جانتے ہوں کہ آپ کے پاس کیا ہے تو آپ یہی چاہتے ہیں۔

اہم ریزولوشن ہے، فائل کا سائز نہیں۔ ریڈر کو حروف کی ایک خاص اونچائی چاہیے اور ہر چیز کو اسی کے مطابق چھوٹا بڑا کیا جاتا ہے: اسکین شدہ PDF کے صفحات پڑھنے کے لیے 300 DPI پر رینڈر ہوتے ہیں، اور تصویر کو اس کے ابعاد کے بجائے خود سیاہی سے ناپا جاتا ہے، پھر ضرورت کے مطابق بڑا یا چھوٹا کیا جاتا ہے۔ اسکرین کا ٹیکسٹ وہ صورت ہے جس میں لوگ غلطی کرتے ہیں — عام سائز پر ایک حرف تقریباً دس پکسل اونچا ہوتا ہے، یعنی ریڈر کی ضرورت کا تقریباً ایک تہائی، اس لیے اسکرین شاٹ کو پڑھنے سے پہلے بڑا کیا جاتا ہے۔ فی حرف تقریباً آٹھ پکسل سے کم پر بڑا کرنے کے لیے کوئی تفصیل باقی نہیں رہتی، اور کتنی بھی پروسیسنگ اسے ایجاد نہیں کر سکتی۔ دوسری طرف، مینو کی 48 میگا پکسل تصویر کسی تیز، چھوٹی تصویر سے زیادہ درست نہیں ہوتی؛ ایک حد کے بعد مزید پکسلز وقت لیتے ہیں اور کچھ نہیں دیتے۔

ٹیڑھا پن اور غیر یکساں روشنی جتنا نقصان دکھتے ہیں اس سے زیادہ کرتے ہیں۔ تصویر میں لیا گیا صفحہ ایک دو ڈگری ٹیڑھا ہوتا ہے اور ایک طرف سے روشن، اس لیے “تصویر سے ٹیکسٹ” اور “دستاویز اسکین کریں” پورے صفحے پر وہ زاویہ ناپ کر اسے ختم کرتے ہیں، پھر حصوں میں سیاہی کے پیچھے کاغذ کی چمک کا اندازہ لگا کر اسے یکساں سفید تک لے آتے ہیں۔ یہ صرف دکھاوے کے لیے نہیں۔ سیدھی لکیریں ہی ٹیبل کو گرڈ کے طور پر پہچاننے دیتی ہیں، اور یکساں کنٹراسٹ ہی آپ کے ہاتھ کے سائے کو سیاہی سمجھ کر پڑھے جانے سے روکتا ہے۔ اسکرین شاٹ کے ساتھ جان بوجھ کر ان میں سے کچھ نہیں کیا جاتا: وہ پہلے ہی سیدھا اور یکساں روشن ہوتا ہے، اور اسے تصویر سمجھ کر درست کرنا صرف غلطیاں بڑھاتا ہے۔

ٹیبلز اور کئی کالمز والے لے آؤٹس واقعی مشکل صورت ہیں، اور اعداد و شمار جاننے لائق ہیں۔ پورے صفحے کو عام تحریر کی طرح پڑھنے پر، لکیروں والے فارم میں سیل کا ٹیکسٹ اگلے کالم میں جا ملا اور ایک تہائی لیبلز غائب ہو گئے — پندرہ سے بیس فیصد حروف غلط۔ پہلے لکیریں ڈھونڈ کر ہر سیل کو الگ پڑھنے سے یہ تقریباً پانچ فیصد رہ گیا۔ اس لیے دکھائی دینے والی لکیروں والا ٹیبل گرڈ کے طور پر پہچانا جاتا ہے اور ٹیب سے الگ رو کی صورت میں واپس آتا ہے جو سیدھی اسپریڈشیٹ میں پیسٹ ہو جاتی ہیں، اور تحریر کے کالمز پورے صفحے پر سیدھا پڑھنے کے بجائے پڑھنے کی ترتیب میں پڑھے جاتے ہیں۔ جو ٹیبل صرف خالی جگہ سے ترتیب دیا گیا ہو اس میں ڈھونڈنے کو لکیریں نہیں، اور وہ پیسٹ میں قسمت سے بچتا ہے، ڈیزائن سے نہیں۔

سرچ کے قابل PDF اور نکالا گیا ٹیکسٹ الگ چیزیں ہیں۔ “PDF پر OCR کریں” اور “دستاویز اسکین کریں” تصویر کو بالکل ویسا ہی رہنے دیتے ہیں اور پہچانے گئے الفاظ اس کے اوپر غیر مرئی طور پر رکھ دیتے ہیں: صفحہ بالکل ویسا ہی دکھتا ہے، Ctrl+F چیزیں ڈھونڈنے لگتا ہے، اور آپ سلیکٹ اور کاپی کر سکتے ہیں۔ صفحے پر کبھی کچھ بنایا نہیں جاتا — جس کا مطلب یہ بھی ہے کہ کوئی غلط پڑھائی بظاہر مکمل دکھنے والی دستاویز میں چھپی رہتی ہے۔ “تصویر سے ٹیکسٹ” اور “اسکرین شاٹ سے ٹیکسٹ” اس کا الٹ کرتے ہیں: آپ کو صرف حروف ملتے ہیں، نہ فونٹس، نہ رنگ، نہ بولڈ اور نہ تصویر۔ ٹیکسٹ لیئر کے بارے میں ایک احتیاط، کیونکہ اسے نظر انداز کرنا آسان ہے — یہ صرف وہ حروف رکھ سکتی ہے جو ساتھ شامل کوئی فونٹ لکھ سکے، اس لیے چینی، جاپانی اور کوریائی الفاظ لکھے جانے کے بجائے آپ کے لیے گنے جاتے ہیں، جب تک ان کا فونٹ شامل نہ ہو جائے۔

جہاں براؤزر واقعی غلط ٹول ہے

تصویر کا آپ کے ڈیوائس سے باہر نہ جانا ہی اسے یہاں پڑھنے کی پوری دلیل ہے، اور مشکل دستاویزات پر اس کی قیمت درستگی میں چکانی پڑتی ہے۔ یہ سودا حقیقی ہے، اور اسے دبانے کے بجائے صاف کہہ دینا بہتر ہے۔

جڑی ہوئی لکھائی نہیں پہچانی جاتی — نہ یہاں، نہ کسی عام OCR ٹول میں۔ یہ چھپے ہوئے حروف کے ریڈرز ہیں: یہ حروف کی شکلیں پہچانتے ہیں، اور شکستہ لکھائی میں پہچاننے کو الگ حروف کی شکلیں ہوتی ہی نہیں۔ ہاتھ سے الگ الگ لکھے حروف اکثر اتنے ٹھیک واپس آ جاتے ہیں کہ دوبارہ ٹائپ کرنے کے بجائے درست کیے جا سکیں — بڑے حروف، ہاتھ سے بھرا گیا فارم، احتیاط سے لکھا گیا نوٹ — اسی لیے “ہاتھ کی لکھائی پڑھیں” موجود ہے اور اسی لیے یہ ٹیکسٹ کے ساتھ اعتماد کا عدد دکھاتا ہے۔ شکستہ لکھائی کو ٹھیک طرح پڑھنے کے لیے خاص طور پر ہاتھ کی لکھائی پر تربیت یافتہ ریڈر چاہیے، اور اچھے ریڈرز ٹیب کے بجائے سرور پر چلتے ہیں۔

مشکل دستاویزات پر کلاؤڈ OCR اس سے بہتر ہوگا۔ Google، Amazon اور Microsoft ایسے ریڈرز چلاتے ہیں جنہیں براؤزر ٹیب میں سمانے والے ڈیٹا سے کہیں زیادہ پر تربیت دی گئی ہے، اور کمزور تصویر، گنجان کئی کالمز والے صفحے، غیر معمولی فونٹ یا بھرے ہوئے فارم پر وہ واضح طور پر زیادہ درست ہوں گے۔ ABBYY FineReader جیسا پیڈ ڈیسک ٹاپ سافٹ ویئر بھی۔ اگر کسی مشکل دستاویز پر درستگی اس سے زیادہ اہم ہے کہ دستاویز آپ کے کمپیوٹر پر رہے، تو ان میں سے کوئی استعمال کریں — یہی ایماندارانہ موازنہ ہے، اور یہی وہ کسوٹی ہے جس پر آپ کو فیصلہ کرنا چاہیے۔

بڑی تعداد کا کام کمانڈ لائن کا ہے۔ یہ ٹولز ایک دستاویز تب پڑھتے ہیں جب کوئی انسان کلک کرے۔ شیڈول پر دو ہزار اسکینز OCRmyPDF جیسے ڈیسک ٹاپ OCR ٹول کا کام ہے، جو ایک ہی کمانڈ میں PDFs کے پورے فولڈر میں ٹیکسٹ لیئر شامل کر دیتا ہے — مفت، اور ویسی ہی پڑھائی، بغیر کسی کلک کے۔

کچھ کام کیے ہی نہیں جاتے۔ پرسپیکٹو درست نہیں کیا جاتا: ایک طرف سے لی گئی صفحے کی تصویر اپنی ذوزنقہ شکل برقرار رکھتی ہے اور صرف گھماؤ ٹھیک کیا جاتا ہے، اس لیے بالکل اوپر سے تصویر لینا ایک اضافی سیکنڈ کے لائق ہے۔ گہری تہہ، یا کتاب کی جلد کے قریب کا خم، خم دار ہی رہتا ہے۔ اور یہاں کوئی کیمرا نہیں — کوڈ ریڈرز وہ تصویر ڈیکوڈ کرتے ہیں جو آپ کے پاس پہلے سے ہو، لائیو فیڈ نہیں۔

مقامی طور پر چلانے کی ایک عملی قیمت: جب آپ کوئی زبان پہلی بار استعمال کرتے ہیں تو ریڈر اور زبان کا پیک اسی سائٹ سے لایا جاتا ہے، جو چند میگا بائٹس ہے اور پہلی بار کو بعد والوں سے سست بنا دیتا ہے۔ کسی اور کے CDN سے کچھ نہیں آتا، اور کچھ واپس نہیں جاتا۔

ملتے جلتے ناموں والے ٹولز میں سے انتخاب

تصویر سے ٹیکسٹ بمقابلہ اسکرین شاٹ سے ٹیکسٹ۔ وہی ریڈر، مختلف تیاری کے ساتھ، اور یہ فرق دکھاوے کا نہیں۔ تصویر کو سیدھا کیا جاتا ہے اور اس کی روشنی برابر کی جاتی ہے؛ اسکرین شاٹ کو بڑا کیا جاتا ہے اور باقی جوں کا توں چھوڑ دیا جاتا ہے، کیونکہ اس میں نہ ٹیڑھا پن ہوتا ہے نہ غیر یکساں روشنی، اور اسے ایسا سمجھ کر برتاؤ کرنا اسے مزید خراب کر دیتا ہے۔ “اسکرین شاٹ سے ٹیکسٹ” پیسٹ بھی لیتا ہے — Ctrl+V، یا Mac پر Cmd+V، سیدھا کلپ بورڈ سے، پہلے ڈسک پر کچھ محفوظ کیے بغیر۔

تصویر سے ٹیکسٹ بمقابلہ دستاویز اسکین کریں۔ “تصویر سے ٹیکسٹ” آپ کو الفاظ دیتا ہے اور تصویر پھینک دیتا ہے۔ “دستاویز اسکین کریں” تصویر رکھتا ہے، اسے سیدھا کرتا ہے، سیاہی کے پیچھے کاغذ کو سفید کرتا ہے اور آپ کو اسکین جیسی دکھنے والی PDF دیتا ہے — اختیاری طور پر اس کے پیچھے غیر مرئی ٹیکسٹ کے ساتھ۔ اگر آپ ٹیکسٹ کہیں پیسٹ کرنا چاہتے ہیں تو پہلا۔ اگر آپ کسی کو دستاویز بھیجنا چاہتے ہیں تو دوسرا۔

دستاویز اسکین کریں بمقابلہ PDF پر OCR کریں۔ “دستاویز اسکین کریں” تصاویر سے شروع ہو کر PDF بناتا ہے۔ “PDF پر OCR کریں” پہلے سے موجود PDF سے شروع ہو کر اس میں ٹیکسٹ لیئر شامل کرتا ہے۔ کوئی بھی صفحات کی شکل نہیں بدلتا۔ کسی معاہدے کی تصویر لی ہو تو آپ کو پہلا چاہیے؛ ای میل میں اسکین ملا ہو تو دوسرا۔

ہاتھ کی لکھائی پڑھیں بمقابلہ تصویر سے ٹیکسٹ۔ وہی ریڈر، ٹیبل ڈھونڈنے والا حصہ بند اور اعتماد کے عدد کو وہ نمایاں جگہ دی گئی جس کا وہ حقدار ہے، کیونکہ ہاتھ کی لکھائی میں وہی نمبر نتیجے کا کارآمد حصہ ہے۔ اگر لکھائی جڑی ہوئی ہو تو کوئی بھی صفحہ اسے نہیں پڑھے گا، اور ہاتھ کی لکھائی والا صفحہ قابلِ یقین لگنے والی بے معنی چیز لوٹانے کے بجائے یہ بات کہہ دیتا ہے۔

QR کوڈ اسکینر بمقابلہ بارکوڈ ریڈر۔ چوکور کوڈز بمقابلہ دھاری دار، اور یہ جاننا فائدہ مند ہے کہ آپ کے ہاتھ میں کون سا ہے۔ QR والا صفحہ QR، Micro QR، Data Matrix، Aztec اور PDF417 پڑھتا ہے — جس میں بورڈنگ پاسز اور ڈرائیونگ لائسنس آ جاتے ہیں، جن کے کوڈز چوکور قسم کے ہوتے ہیں چاہے وہ نقطوں کے دھبے جیسے دکھیں۔ بارکوڈ والا صفحہ ریٹیل اور لاجسٹکس کے دھاری دار فارمیٹس پڑھتا ہے — EAN، UPC، Code 128، Code 39، ITF — اور چیک ڈیجٹ جانچتا ہے، یعنی آخری ہندسہ جو باقی ہندسوں سے حساب لگا کر نکالا جاتا ہے، اور یہی قابلِ اعتماد نمبر اور محض درست دکھنے والے نمبر کا فرق ہے۔ کوئی بھی OCR نہیں: کوڈ ایک معلوم جیومیٹری والی علامت ہے، اس لیے اسے ڈیکوڈ کرنا حروف کی شکلوں کا اندازہ نہیں بلکہ حساب ہے۔ یہ ناکام بھی مختلف طرح ہوتے ہیں۔ چوکور کوڈز میں error correction ہوتی ہے اور وہ خراش یا بیچ میں چھپے لوگو کو جھیل جاتے ہیں؛ دھاری دار کوڈز میں بالکل نہیں ہوتی، اس لیے دھاریوں پر چمک کا مطلب غلط نمبر نہیں بلکہ کوئی پڑھائی ہی نہیں۔

یہ ٹولز کس چیز پر بنے ہیں

اصل کام کرنے والے اوپن سورس انجن، اور وہ اسپیسیفکیشنز جن پر وہ عمل کرتے ہیں۔

  • TesseractApache-2.0 — 120 سے زیادہ زبانوں میں ٹیکسٹ پہچانتا ہے، لینگویج پیکس اسی سائٹ سے فراہم ہوتے ہیں.
  • ZXingApache-2.0 — QR کوڈز اور بارکوڈز پڑھتا ہے.
  • QR code specification (Denso Wave)Specification — فارمیٹ کے موجد کی جانب سے ورژن سائز اور ایرر کریکشن لیولز شائع کرتا ہے.

اکثر پوچھے جانے والے سوالات

کیا میری تصویر یا دستاویز کہیں محفوظ کی جاتی ہے؟

نہیں۔ جب آپ کوئی زبان پہلی بار استعمال کرتے ہیں تو ریڈر اور زبان کا پیک اسی سائٹ سے آتے ہیں، اور تصویر خود کبھی کہیں نہیں بھیجی جاتی — اس لیے اس پہلی لوڈ کے بعد یہ Wi-Fi بند ہونے پر بھی کام کرتا ہے، اور کچھ بھی کہیں محفوظ نہیں کیا جاتا۔ یہ سب سے زیادہ کوڈ والے صفحات پر اہم ہے، جہاں QR کوڈ میں Wi-Fi پاس ورڈ، ادائیگی کی درخواست یا two-factor سیکرٹ ہو سکتا ہے۔

یہ کتنا درست ہے؟

صاف چھپے ہوئے ٹیکسٹ پر، جس کی تصویر سیدھی اور فوکس میں لی گئی ہو، ہزار میں چند حروف غلط۔ دھندلاہٹ، چمک، کم کنٹراسٹ، غیر معمولی فونٹس اور کسی تصویر کے اوپر چھپی ہر چیز کے ساتھ درستگی کم ہوتی ہے۔ اعتماد کا عدد آپ کے اندازے پر چھوڑنے کے بجائے ٹیکسٹ کے ساتھ دکھایا جاتا ہے، اور جب یہ کم ہو تو مسئلہ تقریباً ہمیشہ تصویر میں ہوتا ہے: زیادہ روشنی، کم زاویہ، اور فریم کو ٹیکسٹ سے بھر دینا زیادہ تر مسئلہ حل کر دیتا ہے۔

کیا یہ ہاتھ کی لکھائی پڑھ سکتا ہے؟

ہاتھ سے الگ الگ لکھے حروف اکثر ہاں، جڑی ہوئی لکھائی نہیں۔ یہ اس سائٹ کی کمی نہیں: عام OCR ٹولز کو چھپے ہوئے حروف پر تربیت دی جاتی ہے اور وہ حروف کی شکلیں پہچانتے ہیں، اور شکستہ لکھائی میں پہچاننے کو الگ حروف کی شکلیں ہوتی ہی نہیں۔ “ہاتھ کی لکھائی پڑھیں” وہ صفحہ ہے جو یہ بات صاف کہتا ہے اور دکھاتا ہے کہ وہ کتنا پڑھ پایا، جو پورے یقین والے غلط جواب سے زیادہ کارآمد ہے۔

یہ کون سی زبانیں پڑھ سکتا ہے؟

120 سے زیادہ، جن میں انگریزی، بنگالی، ہندی، اردو، عربی، ہسپانوی، فرانسیسی، جرمن، پرتگالی، روسی، چینی، جاپانی اور کوریائی شامل ہیں۔ رسم الخط خود تصویر سے معلوم کیا جاتا ہے؛ جہاں کئی زبانیں ایک رسم الخط استعمال کرتی ہیں — لاطینی، سیریلک، عربی، دیوناگری — وہاں آپ کے براؤزر کی اپنی زبان فیصلہ کرتی ہے، اور آپ اسے ہمیشہ بدل سکتے ہیں۔

کیا یہ میرا کیمرا استعمال کرتا ہے؟

نہیں، اور کوئی اجازت دینے کی ضرورت نہیں۔ یہاں ہر ٹول وہ تصویر پڑھتا ہے جو آپ کے پاس پہلے سے ہو — کیمرا رول کی تصویر، اسکرین شاٹ، کسی کی بھیجی ہوئی فائل۔ اگر کوڈ یا صفحہ آپ کے سامنے ہے تو پہلے اس کی تصویر لیں اور وہ تصویر یہاں ڈراپ کریں۔

کیا ٹیبل، ٹیبل کی صورت میں ہی نکلے گا؟

اگر اس کی لکیریں دکھائی دیتی ہوں تو ہاں: پہلے گرڈ ڈھونڈا جاتا ہے اور ہر سیل الگ پڑھا جاتا ہے، اس لیے لیبل اپنی ویلیو میں نہیں جا ملتا، اور نتیجہ ٹیب سے الگ رو کی صورت میں ہوتا ہے جو سیدھی اسپریڈشیٹ میں پیسٹ ہو جاتی ہیں۔ جو ٹیبل صرف خالی جگہ سے ترتیب دیا گیا ہو اور اس میں لکیریں نہ ہوں، وہ پڑھنے کی ترتیب میں ٹیکسٹ کے کالمز کے طور پر پڑھا جاتا ہے، جو عموماً پیسٹ میں ٹھیک رہتا ہے مگر اس کی ضمانت نہیں۔