PDF کو ٹیکسٹ میں تبدیل کریں
PDF سے الفاظ اس کی لائنوں اور پیراگرافس سمیت نکالیں — سیدھے کلپ بورڈ پر کاپی کریں یا .txt فائل ڈاؤن لوڈ کریں۔ کچھ بھی محفوظ نہیں کیا جاتا۔
- کبھی محفوظ نہیں کی جاتی
- نہ قطار، نہ انتظار
- نہ سائن اپ، نہ واٹر مارک
یہ کیسے کام کرتا ہے
اپنی PDF شامل کریں
PDF کو صفحے پر ڈراپ کریں۔ ٹیکسٹ نکالنے کا کام فوراً، صفحہ بہ صفحہ شروع ہو جاتا ہے۔
پڑھیں اور درست کریں
ٹیکسٹ ایک قابلِ ترمیم باکس میں آ جاتا ہے۔ صفحہ ختم ہونے کے نشانات آن یا آف کریں، اور محفوظ کرنے سے پہلے جو چاہیں ایڈٹ کریں۔
کاپی یا ڈاؤن لوڈ کریں
سب کچھ کلپ بورڈ پر کاپی کریں، یا اسے .txt فائل کے طور پر ڈاؤن لوڈ کریں۔
الفاظ کہاں سے آتے ہیں، اور کس ترتیب میں پہنچتے ہیں
PDF میں حروف ٹیکسٹ کی صورت میں محفوظ نہیں ہوتے۔ وہ گلیف نمبرز کی صورت میں ہوتے ہیں جو فائل میں شامل فونٹ کی طرف اشارہ کرتے ہیں، اور انہیں واپس حروف میں بدلنا فائل کے اندر موجود ایک ٹیبل پر منحصر ہے جو بتاتا ہے کہ ہر گلیف کون سا حرف ہے۔ زیادہ تر سافٹ ویئر یہ ٹیبل شامل کرتے ہیں۔ جب کوئی شامل نہیں کرتا — اور عموماً قصوروار کچھ ڈیزائن سافٹ ویئر کے بنائے ہوئے کٹے چھٹے فونٹ سب سیٹس ہوتے ہیں — تو صفحہ اسکرین پر بالکل ٹھیک نظر آتا ہے مگر نکالنے پر بے معنی حروف دیتا ہے، کیونکہ اسے پڑھنے کے لیے ضروری معلومات کبھی لکھی ہی نہیں گئیں۔ کوئی بھی ٹیکسٹ نکالنے والا ٹول اسے ٹھیک نہیں کر سکتا؛ یہ کوئی مشکل مسئلہ نہیں بلکہ غائب ڈیٹا ہے۔
نتیجے پر بھروسہ کرنے سے پہلے پڑھنے کی ترتیب ضرور دیکھیں۔ ٹیکسٹ اسی ترتیب میں نکلتا ہے جس میں صفحہ اسے بناتا ہے، یعنی وہ ترتیب جس میں PDF بنانے والے سافٹ ویئر نے اتفاقاً اسے لکھا — اور یہ اکثر وہ ترتیب نہیں ہوتی جس میں انسان پڑھتا ہے۔ دو کالم والا صفحہ کبھی بائیں اور دائیں کالم کو درست طور پر الگ الگ نکالتا ہے، اور کبھی دونوں کی لائنیں آپس میں ملا دیتا ہے — یہ پوری طرح اس پر منحصر ہے کہ فائل کیسے بنائی گئی۔ ہیڈرز، فوٹرز، صفحہ نمبرز اور سائیڈ بارز وہیں آتے ہیں جہاں وہ بنائے گئے تھے، عموماً عبارت کے بیچ میں۔
چند چھوٹی خامیاں ایسی ہیں جنہیں پہچان لینا ان پر سر کھپانے سے بہتر ہے۔ لیگیچرز اسی ایک حرف کی صورت میں آتے ہیں جو فونٹ نے واقعی استعمال کیا، اس لیے “find” میں f اور i الگ الگ کے بجائے ایک گلیف ہو سکتا ہے، اور پھر “find” کی سادہ تلاش اسے نہیں ڈھونڈ پاتی۔ لائن کے آخر میں ہائفن سے ٹوٹے الفاظ ہائفن سمیت ہی رہتے ہیں، کیونکہ فائل میں یہ بریک واقعی موجود ہے۔ اور سیدھے کوٹیشن مارکس اکثر خمدار ہوتے ہیں، جو اس وقت اہم ہے جب ٹیکسٹ کوڈ یا CSV میں جا رہا ہو۔
اسکین شدہ صفحے سے کچھ بھی نہیں نکلتا، اور ٹول خالی فائل تھمانے کے بجائے یہی بتا دیتا ہے — کسی دستاویز کی تصویر میں کوئی حروف نہیں ہوتے، صرف پکسلز ہوتے ہیں۔ یہی حال آؤٹ لائنز میں بدلے گئے ٹیکسٹ کا ہے، جو ڈیزائنرز جان بوجھ کر کرتے ہیں تاکہ فائل ہر جگہ ایک جیسی پرنٹ ہو؛ اس مرحلے پر وہ واقعی آرٹ ورک بن چکا ہوتا ہے۔ دونوں کو نکالنے کے بجائے OCR کی ضرورت ہے۔
جب آپ کو کچھ اور چاہیے
جب کالمز اہم ہوں تو Poppler کا pdftotext -layout in.pdf out.txt براؤزر میں ہونے والی کسی بھی چیز سے بہتر ہے: یہ اصل خالی جگہوں سے بصری فاصلہ دوبارہ بناتا ہے، اس لیے کالمز کالمز ہی رہتے ہیں اور ٹیبل ایسا ٹیبل رہتا ہے جسے پڑھا جا سکے۔ pdftotext -raw اس کے الٹ کام کرتا ہے اور بنانے کی ترتیب جوں کی توں دیتا ہے، جو کبھی کبھی کسی اسکرپٹ کو یہی چاہیے ہوتا ہے۔
سینکڑوں فائلوں سے ٹیکسٹ نکالنے کے لیے mutool draw -F txt اور Python کا pdfplumber ہی بنیاد بنانے کے قابل ہیں — خاص طور پر pdfplumber آپ کو ہر حرف اس کے کوآرڈینیٹس، فونٹ اور سائز سمیت دیتا ہے، اس لیے آپ ہیڈر اور فوٹر کو اندازے کے بجائے ان کی جگہ کی بنیاد پر الگ کر سکتے ہیں۔ یہی وہ کام ہے جو یہ صفحہ نہیں کر سکتا، اور بڑی تعداد میں کام کرتے وقت یہی سب سے اہم ہے۔
اکثر پوچھے جانے والے سوالات
کیا پیراگراف اور لائن بریکس برقرار رہتے ہیں؟
جی ہاں۔ PDF میں پیراگراف سرے سے محفوظ ہی نہیں ہوتے — صرف مخصوص کوآرڈینیٹس پر حروف ہوتے ہیں — اس لیے ٹیکسٹ کو دوبارہ بنایا جاتا ہے: ایک ہی بیس لائن والے الفاظ کو اکٹھا کیا جاتا ہے اور جہاں عمودی فاصلہ بڑھ جائے وہاں نیا پیراگراف شروع کیا جاتا ہے۔ نتیجہ ایک مسلسل عبارت کے بجائے اصل جیسا پڑھا جاتا ہے۔
کیا میری PDF کہیں محفوظ کی جاتی ہے؟
نہیں۔ ٹیکسٹ آپ کا اپنا براؤزر پڑھتا ہے اور اسے کہیں نہیں بھیجا جاتا۔ صفحہ لوڈ ہونے کے بعد آپ انٹرنیٹ بند بھی کر دیں تو یہ کام کرتا رہتا ہے۔
یہ کہتا ہے کہ میری PDF میں کوئی ٹیکسٹ نہیں — کیوں؟
کیونکہ یہ اسکین یا تصویر ہے: صفحہ ایک تصویر ہے، اور تصویر میں نکالنے کے لیے کوئی ٹیکسٹ نہیں ہوتا۔ PDF پر OCR کریں استعمال کریں، جو الفاظ خود تصویر سے پڑھتا ہے۔
کیا ڈاؤن لوڈ سے پہلے ٹیکسٹ ایڈٹ کر سکتا ہوں؟
جی ہاں — باکس مکمل طور پر قابلِ ترمیم ہے اور جو آپ دیکھتے ہیں بالکل وہی محفوظ ہوتا ہے۔
ٹیبلز اور کالمز کا کیا ہوتا ہے؟
کالمز اسی ترتیب میں پڑھے جاتے ہیں جس میں PDF انہیں بناتی ہے، جو عموماً درست ہوتی ہے مگر پیچیدہ کئی کالم والے لے آؤٹ میں لائنیں آپس میں مل سکتی ہیں۔ ٹیبلز گرڈ کے بجائے ٹیکسٹ کی لائنوں کی صورت میں آتے ہیں — ٹیبلز کے لیے PDF سے Excel استعمال کریں۔
جاننا مفید ہے: سادہ ٹیکسٹ میں کوئی فارمیٹنگ نہیں ہوتی: بولڈ، سائز، رنگ، تصاویر اور ٹیبل کی ساخت، سب لازمی طور پر ختم ہو جاتے ہیں۔ جو ٹیکسٹ اصل حروف کے بجائے ویکٹر آؤٹ لائنز کی صورت میں بنایا گیا ہو (لوگوز اور کچھ ڈیزائنر PDFs میں عام) اسے کوئی بھی ٹول OCR کے بغیر نہیں نکال سکتا۔
یہ ٹول اپنی ویب سائٹ پر لگائیں
کسی بھی بلاگ، کلاس پیج یا ہیلپ آرٹیکل کے لیے مفت۔ ایک اسنیپٹ پیسٹ کریں اور آپ کے وزیٹرز اسے سیدھا آپ کے صفحے پر استعمال کر سکیں گے۔