تصویر سے ٹیکسٹ نکالیں
تصویر، اسکین یا اسکرین شاٹ سے الفاظ پڑھیں اور انہیں ایسے ٹیکسٹ کے طور پر لے جائیں جسے آپ ایڈٹ، سرچ اور پیسٹ کر سکیں۔ تصویر کبھی محفوظ نہیں کی جاتی۔
- کبھی محفوظ نہیں کی جاتی
- نہ قطار، نہ انتظار
- نہ سائن اپ، نہ واٹر مارک
یہ کیسے کام کرتا ہے
اپنی تصویر شامل کریں
JPG، PNG، WebP، GIF، BMP، iPhone کی HEIC یا اسکینر کی TIFF۔ ترچھی لی گئی تصویر کو پڑھنے سے پہلے سیدھا کیا جاتا ہے اور اس کی روشنی برابر کی جاتی ہے۔
زبان چیک کریں
رسم الخط تصویر سے پڑھا جاتا ہے اور زبان آپ کے لیے چن لی جاتی ہے۔ اگر اندازہ غلط ہو، یا تصویر میں ایک سے زیادہ زبانیں ہوں، تو 120 سے زیادہ زبانیں دستیاب ہیں۔
کاپی یا ڈاؤن لوڈ کریں
لے آؤٹ برقرار رکھیں، یعنی لائنیں اور کالم اپنی جگہ پر رہیں، یا لائنوں کو جوڑ کر رواں پیراگراف بنائیں جو کہیں اور پیسٹ کرنے کے لیے تیار ہوں۔
تصویر کیسے پڑھی جاتی ہے
پڑھنے والے کو جس سائز کی ضرورت ہے وہ فائل سے نہیں بلکہ سیاہی سے ناپا جاتا ہے۔ ٹیکسٹ کی ایک لائن کی اونچائی کا اندازہ خود تصویر سے لگایا جاتا ہے اور سب کچھ اس طرح دوبارہ اسکیل کیا جاتا ہے کہ ایک لائن تقریباً چونتیس پکسل کی ہو — چھوٹا اسکرین شاٹ چار گنا تک بڑا کیا جاتا ہے، اور بہت بڑی تصویر چھوٹی کی جاتی ہے، اور دونوں صورتوں میں لمبی سائیڈ کی ایک حد ہے۔ اسی لیے مینو کی نو میگا پکسل تصویر کسی تیز چھوٹی تصویر سے زیادہ درست نہیں، اور اسی لیے جس تصویر کی چھوٹی سائیڈ تقریباً تین سو پکسل سے کم ہو وہ زبان کی پہچان بالکل چھوڑ کر لاطینی رسم الخط کے طور پر پڑھی جاتی ہے۔ اس سب سے پہلے، سیاہی کے پیچھے کاغذ کا اندازہ ٹکڑوں میں لگا کر اسے تقسیم کر دیا جاتا ہے تاکہ روشنی برابر ہو، صفحے کا جھکاؤ اس کی پوری اونچائی میں ناپ کر اسے سیدھا گھمایا جاتا ہے، اور نتیجے کو ایک ہی مجموعی حد پر بلیک اینڈ وائٹ کر دیا جاتا ہے۔
زبان چننا کسی فہرست میں دیکھنے کے بجائے ایک آزمائش ہے، کیونکہ عام ڈیٹیکٹر دراصل زبانیں نہیں پہچانتا۔ پہلا مرحلہ صرف رسم الخط اور گھماؤ بتاتا ہے، اس سے زیادہ کچھ نہیں؛ رسم الخط امیدواروں کو محدود کرتا ہے، ایک ہی رسم الخط والی زبانوں میں آپ کے براؤزر کی زبان کی سیٹنگز فیصلہ کرتی ہیں، اور پھر ہر امیدوار زبان سے تصویر کی ایک چھوٹی کاپی واقعی پڑھی جاتی ہے اور اسے اس بنیاد پر نمبر دیے جاتے ہیں کہ اس نے کتنے پُراعتماد الفاظ دیے۔ جیتنے والی زبان اصل صفحہ پڑھتی ہے، اور پہچانے گئے ٹیکسٹ کو دوبارہ جانچا جاتا ہے — اعراب، مخصوص حرفی جوڑوں اور عام چھوٹے الفاظ کے لیے — تاکہ دیکھا جائے کہ کوئی دوسری زبان بہتر تو نہیں رہے گی۔ “غلط زبان بتانے سے آپ کو پُراعتماد خالی صفحہ ملتا ہے” کے پیچھے یہی نظام ہے: آزمائش اسی لیے ہے کہ اندازہ دعوے کے طور پر نہیں بلکہ آپ کی تصویر پر پرکھ کر لیا جائے۔
آؤٹ پٹ تک کیا پہنچتا ہے، اس بارے میں ایک بات جاننے کے قابل ہے۔ جس پیراگراف پر پڑھنے والے کو اعتماد نہ ہو وہ دکھانے کے بجائے ہٹا دیا جاتا ہے، اس لیے جو ٹیکسٹ آپ تصویر میں دیکھ سکتے ہیں وہ بے معنی الفاظ کی صورت میں آنے کے بجائے نتیجے سے پوری طرح غائب ہو سکتا ہے۔ یہی ان بلاکس کے ساتھ ہوتا ہے جنہیں پڑھنے والے نے تصویر یا شور قرار دیا، اور ان اکیلے نشانات کے ساتھ جن میں کوئی حرف یا ہندسہ نہ ہو۔ عام کم اعتماد والے الفاظ پر کوئی کٹوتی نہیں کی جاتی، اس لیے پیراگراف کے اندر کی غلط خوانیاں باقی رہتی ہیں اور انہیں پکڑنا آپ کا کام ہے۔ جب اعتماد کا عدد معقول ہو اور صفحے کا کوئی حصہ بس موجود نہ ہو، تو یہی ہوا ہے۔
جب آپ کو کچھ اور چاہیے
کچھ بھی محفوظ نہیں کیا جاتا، لیکن سائٹ پر یہ واحد ٹول ہے جس کا پہلا استعمال مفت نہیں: پڑھنے والا خود چند میگا بائٹس کا ہے اور ہر لینگویج پیک مزید ایک سے پانچ میگا بائٹس کا، جو اسی سائٹ سے لایا جاتا ہے اور پھر اگلی بار کے لیے رکھ لیا جاتا ہے۔ ایک صفحے کے لیے یہ انتظار قابلِ قدر ہے، لیکن شیڈول پر دو ہزار اسکینز کے لیے نہیں — اس کے لیے OCRmyPDF جیسا ڈیسک ٹاپ OCR ٹول ہے، جو ایک کمانڈ میں پورے فولڈر پر ٹیکسٹ لیئر لگا دیتا ہے، بغیر ڈاؤن لوڈ اور بغیر کلک کیے۔
تین چیزیں یہاں آزمائی ہی نہیں جاتیں، اور انہیں پہلے سے جان لینا دریافت کرنے سے جلدی ہے۔ پرسپیکٹو درست نہیں کیا جاتا — صفحے کا گھماؤ ناپ کر اسے سیدھا کیا جاتا ہے، لیکن ایک طرف سے لی گئی تصویر اپنی ذوزنقہ نما شکل برقرار رکھتی ہے، اس لیے بالکل اوپر سے تصویر لینا اس ایک سیکنڈ کے قابل ہے۔ سیاہی کو کاغذ سے الگ کرنے والی حد ہر حصے کے لیے الگ نہیں بلکہ پوری تصویر کے لیے ایک ہے، اس لیے آدھا سائے میں پڑا صفحہ روشنی برابر ہونے کے بعد بھی تاریک آدھا حصہ کھو دے گا؛ اس سے لڑنے کے بجائے یکساں روشنی میں دوبارہ تصویر لیں۔ اور لکیروں کے بجائے فاصلوں سے بنایا گیا ٹیبل ڈھونڈنے کے لیے کوئی لکیریں نہیں رکھتا، اس لیے وہ تحریر کے کالموں کی طرح پڑھا جاتا ہے اور اسپریڈشیٹ میں پیسٹ ہو کر صحیح رہ جائے تو یہ قسمت کی بات ہے۔
اکثر پوچھے جانے والے سوالات
یہ کتنا درست ہے؟
صاف چھپے ہوئے ٹیکسٹ پر، جو سیدھا اور فوکس میں لیا گیا ہو، بہت زیادہ — ہزار میں چند حروف کی غلطی۔ دھندلاہٹ، چمک، کم کنٹراسٹ اور غیر معمولی فونٹس کے ساتھ درستگی کم ہوتی ہے، اور صفحہ آپ کو اندازہ لگانے پر چھوڑنے کے بجائے دکھاتا ہے کہ پڑھنے والا کتنا پُراعتماد تھا۔ اگر یہ نمبر کم ہو تو عموماً مسئلہ تصویر میں ہوتا ہے: زیادہ روشنی، کم زاویہ، اور فریم کو ٹیکسٹ سے بھر دینا زیادہ تر مسئلہ حل کر دیتا ہے۔
کیا میری تصویر کہیں محفوظ کی جاتی ہے؟
نہیں۔ جب آپ پہلی بار کوئی زبان استعمال کرتے ہیں تو اس کا لینگویج پیک اسی سائٹ سے آتا ہے؛ تصویر خود نہ کبھی محفوظ کی جاتی ہے اور نہ کہیں بھیجی جاتی ہے، اس لیے یہ Wi-Fi بند ہونے پر بھی کام کرتا ہے۔
یہ کون سی زبانیں پڑھ سکتا ہے؟
120 سے زیادہ، جن میں انگریزی، بنگالی، ہندی، اردو، عربی، ہسپانوی، فرانسیسی، جرمن، پرتگالی، روسی، چینی، جاپانی اور کوریائی شامل ہیں۔ رسم الخط خود تصویر سے پڑھا جاتا ہے؛ جہاں کئی زبانیں ایک ہی رسم الخط استعمال کرتی ہیں — لاطینی، سیریلک، عربی، دیوناگری — وہاں آپ کے براؤزر کی زبان فیصلہ کرتی ہے، اور آپ اسے ہمیشہ بدل سکتے ہیں۔
کیا کالم اور ٹیبل برقرار رہیں گے؟
جی ہاں، اگر آپ چاہیں۔ لکیروں والے ٹیبلز ڈھونڈ کر سیل بہ سیل پڑھے جاتے ہیں، تاکہ لیبل اپنی ویلیو میں گڈمڈ نہ ہو، اور وہ ٹیب سے الگ کی گئی قطاروں کی صورت میں واپس آتے ہیں جو سیدھی اسپریڈشیٹ میں پیسٹ ہو جاتی ہیں۔ تحریر کے کالم سیدھے آر پار کے بجائے پڑھنے کی ترتیب میں پڑھے جاتے ہیں۔ اس کے بجائے لائنیں جوڑنے کا انتخاب جان بوجھ کر یہ ڈھانچہ ختم کر دیتا ہے، جو اس پیراگراف کے لیے آپ کی ضرورت ہے جسے آپ نئے سرے سے ترتیب دینے والے ہیں۔
کیا یہ ہاتھ کی لکھائی پڑھ سکتا ہے؟
صاف، الگ الگ لکھے حروف — فارم پر بڑے حروف — اکثر پڑھے جاتے ہیں۔ جڑی ہوئی لکھائی نہیں پڑھی جاتی، نہ یہاں نہ کسی اور عام OCR ٹول میں؛ سچ یہ ہے کہ یہ ایک الگ مسئلہ ہے جس کا طریقہ بھی الگ ہے۔ ہاتھ کی لکھائی کے لیے ایک الگ صفحہ ہے جو یہ بات صاف صاف کہتا ہے اور دکھاتا ہے کہ وہ کتنا پڑھ سکا۔
کون سے تصویری فارمیٹس چلتے ہیں؟
JPG، PNG، WebP، GIF، BMP اور SVG خود براؤزر کے ذریعے، ساتھ میں iPhone کی HEIC اور اسکینر کی TIFF۔ فون پر عمودی لی گئی تصویر درست رخ میں آتی ہے، کیونکہ کیمرے کا لکھا ہوا اورینٹیشن فلیگ پہلے لاگو کیا جاتا ہے۔
اس نے کچھ الفاظ غلط کیوں پڑھے؟
تقریباً ہمیشہ مسئلہ ٹیکسٹ کے بجائے تصویر میں ہوتا ہے: صفحے پر چمک، ہاتھ کا سایہ، کیمرے کا ہلنا، یا اسکرین پر اتنا چھوٹا ٹیکسٹ کہ ہر حرف چند پکسلز کا ہو۔ پڑھنے والے کو تصویر اس سائز پر دی جاتی ہے جس پر وہ سب سے اچھا پڑھتا ہے، اور روشنی پہلے برابر کی جاتی ہے، لیکن کوئی بھی تیاری وہ تفصیل پیدا نہیں کر سکتی جو کیمرے نے قید ہی نہیں کی۔
کیا سائز کی کوئی حد ہے؟
صرف آپ کے ڈیوائس کی اپنی میموری۔ کچھ بھی محفوظ نہیں کیا جاتا، اس لیے سرور کی کوئی حد نہیں۔ بہت بڑی تصویر کو اس سائز تک چھوٹا کیا جاتا ہے جو پڑھنے والا استعمال کر سکے — ایک حد کے بعد زیادہ پکسلز خرچ بڑھاتے ہیں، درستگی نہیں۔
جاننا مفید ہے: جڑی ہوئی لکھائی کو کوئی بھی عام OCR ٹول قابلِ اعتماد طور پر نہیں پہچانتا، یہ ٹول بھی نہیں۔ تصویر کے اوپر چھپا ٹیکسٹ، بہت آرائشی حروف اور بہت کم کنٹراسٹ ادھورا نکلے گا۔ نتیجہ سادہ ٹیکسٹ ہوتا ہے: فونٹس، رنگ، بولڈ اور اٹیلک منتقل نہیں ہوتے، اور نہ ہی خود تصویر۔
یہ ٹول اپنی ویب سائٹ پر لگائیں
کسی بھی بلاگ، کلاس پیج یا ہیلپ آرٹیکل کے لیے مفت۔ ایک اسنیپٹ پیسٹ کریں اور آپ کے وزیٹرز اسے سیدھا آپ کے صفحے پر استعمال کر سکیں گے۔
متعلقہ ٹولز
اسکرین شاٹ سے ٹیکسٹ
اسکرین شاٹ پیسٹ کریں، ٹیکسٹ حاصل کریں
دستاویز اسکین کریں
صفحے کی تصویر، اسکین کی طرح صاف
PDF پر OCR کریں
اسکین کو سرچ کے قابل بنائیں
ہاتھ کی لکھائی پڑھیں
الگ الگ لکھے حروف، دیانت داری سے پڑھے گئے
QR کوڈ اسکینر
QR کوڈ کھولنے سے پہلے دیکھیں اس میں کیا لکھا ہے
بارکوڈ ریڈر
بارکوڈ کا نمبر، جانچ کے ساتھ