اسکین شدہ PDF کو سرچ کے قابل بنائیں
اسکین سے الفاظ پڑھیں اور انہیں صفحات پر پوشیدہ طور پر رکھ دیں۔ دستاویز ویسی ہی دکھتی ہے — بس سرچ، منتخب اور کاپی کے قابل ہو جاتی ہے۔ ٹیڑھے یا پہلو کے بل اسکین ہوئے صفحات سیدھے کر دیے جاتے ہیں۔
- کبھی محفوظ نہیں کی جاتی
- نہ قطار، نہ انتظار
- نہ سائن اپ، نہ واٹر مارک
یہ کیسے کام کرتا ہے
اپنی اسکین شدہ PDF شامل کریں
فائل ڈراپ کریں۔ ٹول چیک کرتا ہے کہ اس میں پہلے سے ٹیکسٹ لیئر ہے یا نہیں، اور اگر OCR سے فائل بہتر ہونے کے بجائے بدتر ہو تو آپ کو بتا دیتا ہے۔
زبان چیک کریں
ٹول پہلا صفحہ پڑھ کر بتاتا ہے کہ اسے کون سی زبان ملی۔ اگر آپ کو خود چننی ہو تو 120 سے زیادہ زبانیں دستیاب ہیں۔
ڈاؤن لوڈ کریں
آپ کو وہی دستاویز ملتی ہے، اب اسکین کے پیچھے ایک پوشیدہ ٹیکسٹ لیئر کے ساتھ۔
بغیر بدلے صفحے پر ایک پوشیدہ لیئر
اسکین بالکل ویسا ہی رکھا جاتا ہے۔ جو شامل ہوتا ہے وہ پوشیدہ رینڈرنگ موڈ میں بنی ٹیکسٹ کی ایک لیئر ہے — اصل حروف، جو تصویر کے الفاظ پر لفظ بہ لفظ رکھے جاتے ہیں اور اس طرح نشان زد ہوتے ہیں کہ کبھی بنائے نہ جائیں۔ صفحہ ہو بہو ویسا دکھتا ہے کیونکہ دیکھنے میں کچھ نہیں بدلا؛ کوئی جملہ منتخب کریں تو ہائی لائٹ صحیح الفاظ پر آتی ہے کیونکہ پوشیدہ ٹیکسٹ وہیں ہے جہاں نظر آنے والی سیاہی ہے۔ سرچ کے قابل اسکین بنانے کا یہی معیاری طریقہ ہے، اور اسی لیے نتیجہ سرچ، کاپی اور انڈیکس ہو سکتا ہے جبکہ وہ اب بھی دستاویز کی ایک تصویر ہی ہے۔
صفحے کی دو چیزیں جان بوجھ کر درست کی جاتی ہیں، کیونکہ پڑھنے کے لیے ان کی ضرورت تھی ہی۔ پہلو کے بل اسکین ہوا صفحہ سیدھا کیا جاتا ہے، اور جو صفحہ فیڈر سے ٹیڑھا گزرا ہو اسے سیدھا کر دیا جاتا ہے — اس لیے آؤٹ پٹ اکثر ان پٹ سے زیادہ صاف ستھرا ہوتا ہے۔ صفحات کے سائز یکساں کرنے کے بجائے اصل PDF والے ہی رکھے جاتے ہیں، اس لیے مختلف سائز کے صفحات والی دستاویز ویسی ہی رہتی ہے اور کچھ بھی ری اسکیل نہیں ہوتا۔
درستگی تقریباً مکمل طور پر اسکین پر منحصر ہے، اور فرق معمولی نہیں۔ پرنٹ شدہ ٹیکسٹ کا صاف 300 DPI اسکین بہت زیادہ درستگی سے پڑھا جاتا ہے؛ وہی صفحہ 150 DPI پر واضح طور پر بدتر پڑھا جاتا ہے؛ کم روشنی میں ترچھے زاویے سے لی گئی تصویر بالکل الگ معاملہ ہے۔ اگر اسکیننگ آپ کے ہاتھ میں ہے تو گرے اسکیل میں 300 DPI ہی وہ سیٹنگ ہے جو اہم ہے — اس سے زیادہ ریزولوشن شاذ و نادر ہی مدد کرتی ہے، اور اس سے کم فوراً نقصان کرتی ہے۔ باریک لکھائی، قریب قریب لائنیں، رنگین بیک گراؤنڈ، فوٹو کاپی کی فوٹو کاپی اور ہر مہر لگی یا ہاتھ سے لکھی چیز ایسے طریقوں سے مشکل ہیں جنہیں کوئی سافٹ ویئر پوری طرح حل نہیں کرتا۔
جو چیز جان بوجھ کر چھوڑی جاتی ہے وہ اتنی ہی اہم ہے جتنی شامل کی جانے والی۔ تصاویر، لوگوز، دستخط اور آرائشی گرافکس پڑھنے کے بجائے نظر انداز کیے جاتے ہیں، کیونکہ کسی تصویر سے زبردستی حروف نکالنے سے بظاہر معقول مگر بے معنی ٹیکسٹ بنتا ہے جو پھر ہر سرچ میں آتا ہے۔ چینی، جاپانی اور کوریائی الفاظ پہچانے تو جاتے ہیں مگر جب تک انہیں لکھ سکنے والا فونٹ شامل نہ ہو، ٹیکسٹ لیئر سے باہر رکھے جاتے ہیں اور خالی جگہ کے طور پر لکھنے کے بجائے آپ کے لیے گن دیے جاتے ہیں۔ یہاں دستاویز کو دوبارہ ٹائپ سیٹ نہیں کیا جاتا: صفحے پر الفاظ اب بھی تصویر ہیں، اور انہیں قابلِ ترمیم ٹیکسٹ میں بدلنے کے لیے Word میں تبدیل کرنا صحیح ٹول ہے۔
جب آپ کو کچھ اور چاہیے
OCRmyPDF وہ ٹول ہے جس کے مقابلے میں یہ صفحہ محض ایک سہولت ہے، اور وہ مفت ہے۔ ocrmypdf --deskew --rotate-pages in.pdf out.pdf یہی کام زیادہ کنٹرول کے ساتھ کرتا ہے، نتیجہ چھوٹا کرنے کے لیے --optimize 3، خراب موجودہ لیئر بدلنے کے لیے --redo-ocr، اور اسی مرحلے میں آرکائیو فائل بنانے کے لیے --output-type pdfa شامل کرتا ہے۔ یہ ہزاروں صفحات سنبھالتا ہے، فولڈر واچر میں چلتا ہے، اور لائبریریاں اور دستاویزی آرکائیوز اصل میں یہی استعمال کرتے ہیں۔
مشکل مواد کے لیے — تاریخی چھپائی، غیر معمولی لے آؤٹس، بھاری ٹیبلز — Google، Amazon یا Microsoft کی ہوسٹڈ سروس وہ صفحات پڑھ لے گی جو عام مقصد کی شناخت نہیں پڑھ سکتی، کیونکہ انہیں کہیں زیادہ مواد پر تربیت دی گئی ہے۔ یہ صلاحیت کا حقیقی فرق ہے اور جاننے کے لائق ہے۔ اس کا مطلب یہ بھی ہے کہ آپ اپنی دستاویزات کسی تیسرے فریق کو بھیجیں، اور یہی وہ سودا ہے جس سے بچنے کے لیے یہ صفحہ موجود ہے — اس لیے کسی نازک پرانی کتاب کے لیے یہ صحیح انتخاب ہے اور میڈیکل ریکارڈز کے ڈبے کے لیے غلط۔
اکثر پوچھے جانے والے سوالات
کیا بعد میں صفحات مختلف دکھیں گے؟
صرف زیادہ سیدھے: جو صفحہ ایک ڈگری ٹیڑھا یا پہلو کے بل اسکین ہوا ہو، اسے سیدھا کر دیا جاتا ہے۔ اسکین خود برقرار رہتا ہے اور پہچانے گئے الفاظ اس کے اوپر پوشیدہ سیاہی میں رکھے جاتے ہیں — کبھی بنائے نہیں جاتے، کبھی پرنٹ نہیں ہوتے۔ فرق یہ پڑتا ہے کہ Ctrl+F چیزیں ڈھونڈنے لگتا ہے۔
کیا میری دستاویز کہیں محفوظ کی جاتی ہے؟
نہیں۔ شناخت کے دوران کچھ بھی محفوظ نہیں کیا جاتا۔ جب آپ کوئی زبان پہلی بار استعمال کرتے ہیں تو ریڈر اور لینگویج پیک اسی سائٹ سے آتے ہیں؛ دستاویز خود کبھی ڈیوائس سے باہر نہیں جاتی۔
یہ کتنا درست ہے؟
پرنٹ شدہ ٹیکسٹ کے صاف اسکینز پر، بہت زیادہ۔ دھندلی تصاویر، ہاتھ کی لکھائی اور غیر معمولی فونٹس اسے کم کرتے ہیں؛ پڑھنے سے پہلے ٹیڑھا پن درست کیا جاتا ہے۔ لکیروں والی ٹیبلز خانہ بہ خانہ پڑھی جاتی ہیں، اس لیے فارم کے لیبل اپنی ویلیوز میں گڈمڈ نہیں ہوتے۔
کون سی زبانیں کام کرتی ہیں؟
120 سے زیادہ، جن میں انگریزی، بنگالی، ہندی، اردو، عربی، ہسپانوی، فرانسیسی، چینی، جاپانی اور کوریائی شامل ہیں۔ رسم الخط صفحے سے پہچانا جاتا ہے؛ جہاں کئی زبانیں ایک ہی رسم الخط استعمال کرتی ہوں، وہاں فیصلے کے لیے آپ کے براؤزر کی زبان استعمال ہوتی ہے اور آپ اسے بدل سکتے ہیں۔
ٹیکسٹ لیئر میں کچھ الفاظ غائب ہیں۔ کیوں؟
ٹیکسٹ لیئر میں صرف وہی حروف آ سکتے ہیں جو ساتھ شامل کوئی فونٹ لکھ سکے۔ بنگالی، دیوناگری، عربی، تھائی اور دو درجن دیگر رسم الخط کے اپنے فونٹ یہاں موجود ہیں؛ چینی، جاپانی اور کوریائی کے ابھی نہیں، اس لیے وہ الفاظ خالی جگہ کے طور پر محفوظ کرنے کے بجائے آپ کے لیے گن دیے جاتے ہیں۔ OCR کے ساتھ “PDF سے Word” آپ کو وہ ٹیکسٹ مکمل دیتا ہے۔
اس میں کتنا وقت لگتا ہے؟
ہر صفحے کے لیے چند سیکنڈ، کیونکہ پڑھنے کا کام سرورز کا کوئی فارم نہیں بلکہ آپ کا اپنا ڈیوائس کر رہا ہے۔ پیش رفت صفحہ بہ صفحہ دکھائی جاتی ہے۔
جاننا مفید ہے: جب تک چینی، جاپانی اور کوریائی کا فونٹ شامل نہیں ہوتا، ان کے الفاظ ٹیکسٹ لیئر سے باہر رکھے جاتے ہیں اور خالی جگہ کے طور پر محفوظ کرنے کے بجائے آپ کے لیے گن دیے جاتے ہیں؛ ریڈر جو باقی رسم الخط جانتا ہے وہ سب لکھے جاتے ہیں۔ تصاویر، لوگوز اور دستخط نظر انداز کیے جاتے ہیں تاکہ وہ کبھی بے معنی ٹیکسٹ نہ بنیں۔ کوئی بھی عام OCR ٹول ہاتھ کی لکھائی قابلِ اعتماد طور پر نہیں پہچانتا۔
یہ ٹول اپنی ویب سائٹ پر لگائیں
کسی بھی بلاگ، کلاس پیج یا ہیلپ آرٹیکل کے لیے مفت۔ ایک اسنیپٹ پیسٹ کریں اور آپ کے وزیٹرز اسے سیدھا آپ کے صفحے پر استعمال کر سکیں گے۔
مزید PDF ٹولز
PDF سے Word
قابلِ ترمیم .docx میں، اسکین کے لیے OCR کے ساتھ
PDF سے ٹیکسٹ
سادہ ٹیکسٹ جسے کاپی اور ایڈٹ کر سکیں
PDF کمپریس کریں
چھوٹی فائل، وہی دستاویز
پرنٹ کے لیے تیار PDF
یکساں سائز، بلیڈ اور کراپ مارکس
PDF پر پاس ورڈ لگائیں
پاس ورڈ کے ساتھ AES-256 انکرپشن
PDF ان لاک کریں
وہ پاس ورڈ ہٹائیں جو آپ پہلے سے جانتے ہیں