مواد پر جائیں

PDF کو Excel میں تبدیل کریں

PDF کے ٹیبلز کو ایک اصل .xlsx میں نکالیں جسے آپ ترتیب دے سکیں، فلٹر کر سکیں اور جوڑ سکیں — خود صفحے سے دوبارہ بنایا گیا۔

  • کبھی محفوظ نہیں کی جاتی
  • نہ قطار، نہ انتظار
  • نہ سائن اپ، نہ واٹر مارک

یہ کیسے کام کرتا ہے

1

اپنی PDF شامل کریں

وہ دستاویز ڈراپ کریں جس میں آپ کا مطلوبہ ٹیبل ہے۔

2

تبدیل کریں

قطاریں مشترک بیس لائنز سے، اور کالم اس سے پہچانے جاتے ہیں کہ صفحے پر ٹیکسٹ کہاں سے شروع ہوتا ہے۔

3

ڈاؤن لوڈ کریں

ہر صفحے کی ایک شیٹ، جو Excel، Google Sheets، Numbers اور LibreOffice میں کھلتی ہے۔

جس چیز میں گرڈ ہی نہ ہو، اس سے گرڈ کیسے نکالا جاتا ہے

PDF میں ٹیبل نہیں ہوتا۔ اس میں کوآرڈینیٹس پر حروف ہوتے ہیں، اور جو لکیریں ٹیبل جیسی دکھتی ہیں وہ بنایا گیا آرٹ ورک ہیں جن کا اپنے اندر کے ٹیکسٹ سے کوئی تعلق نہیں۔ اس لیے گرڈ کا اندازہ لگایا جاتا ہے، دو اصولوں سے جنہیں ٹھیک ٹھیک جاننا مفید ہے۔ قطاریں مشترک بیس لائنز سے آتی ہیں، اور عمودی جگہ کو چار پوائنٹ کے خانوں میں گول کیا جاتا ہے تاکہ کوئی سپر اسکرپٹ یا تھوڑا اوپر اٹھا کرنسی کا نشان اپنی الگ قطار شروع نہ کر دے۔ کالم صفحے پر ہر الگ بائیں کنارے کو جمع کر کے اور آٹھ پوائنٹ کے اندر موجود کسی بھی دو کو ملا کر بنتے ہیں — یہ قطار بہ قطار نہیں بلکہ پورے صفحے پر کیا جاتا ہے، اس لیے جو کالم کسی ایک لائن پر خالی ہو وہ بھی باقی لائنوں پر اپنی جگہ برقرار رکھتا ہے۔

اسی لیے دائیں طرف سیدھ والے نمبرز مشکل صورت ہیں، اور یہ صاف کہنا ضروری ہے کیونکہ یہاں سب سے عام مایوسی یہی ہے۔ دائیں طرف سیدھ والے اعداد کے کالم کا بایاں کنارہ ہر قطار میں مختلف ہوتا ہے — 9.99 کا آغاز 1,234,567.89 سے کافی دائیں ہوتا ہے — اور جب ان کناروں میں آٹھ پوائنٹ سے زیادہ فرق ہو تو انہیں الگ الگ کالم سمجھا جاتا ہے۔ اس لیے کوئی مالیاتی ٹیبل ایسے کئی کالمز میں بکھر کر آ سکتا ہے جنہیں ایک ہونا چاہیے تھا۔ بائیں طرف سیدھ والے اور درمیان والے کالمز میں یہ مسئلہ نہیں ہوتا۔ ٹیکسٹ کے جو دو ٹکڑے ایک ہی سیل میں آ جائیں انہیں ایک دوسرے کے اوپر لکھنے کے بجائے اسپیس سے جوڑ دیا جاتا ہے۔

باہر نکلتے وقت سیلز کی قسم طے کی جاتی ہے: جو کچھ صاف طور پر نمبر کے طور پر پڑھا جائے وہ نمبر کے طور پر لکھا جاتا ہے اور جمع ہو سکتا ہے، اور باقی سب ٹیکسٹ کے طور پر۔ اکاؤنٹنگ کی عام سجاوٹ نمبر کے طور پر نہیں پڑھی جاتی — ہزار کا سیپریٹر، آخر میں فیصد کا نشان، کرنسی کا نشان، یا بریکٹ میں (1,234) کی صورت میں لکھا منفی عدد — اس لیے ایسے سیلز نمبر جیسے دکھنے والے ٹیکسٹ کی صورت میں آتے ہیں اور جمع ہونے سے انکار کرتے ہیں۔ Excel کا اپنا Text to Columns ایک ہی بار میں ان کا پورا کالم ٹھیک کر دیتا ہے۔

ہر صفحہ ایک مسلسل ٹیبل میں جوڑے جانے کے بجائے اپنی الگ شیٹ بنتا ہے، جس کا نام Page 1، Page 2 وغیرہ ہوتا ہے — تین صفحات کا ٹیبل تین شیٹس کی صورت میں آتا ہے جن میں ہیڈر دہرایا گیا ہو۔ صرف ویلیوز منتقل ہوتی ہیں۔ فارمولے PDF میں کبھی تھے ہی نہیں کہ واپس لائے جائیں، اور بھرے رنگ، بارڈرز، فونٹس، مرج کیے گئے سیلز اور چارٹس جان بوجھ کر دوبارہ نہیں بنائے جاتے، کیونکہ ان کا اندازہ لگانے سے ایسی اسپریڈشیٹ بنتی ہے جو مستند دکھتی ہے لیکن باریکی سے غلط ہوتی ہے۔

جب آپ کو کچھ اور چاہیے

ٹیبل نکالنا ایک حقیقی تحقیقی مسئلہ ہے اور ایسے ٹولز موجود ہیں جو صرف یہی کام کرتے ہیں۔ جب ٹیبلز لکیروں والے ہوں تو Tabula سب سے مناسب ہے: یہ ٹیکسٹ کی جگہوں سے گرڈ کا اندازہ لگانے کے بجائے بنی ہوئی لکیروں کو ہی گرڈ کے طور پر پڑھتا ہے، جس سے دائیں سیدھ والے نمبرز کا مسئلہ مکمل حل ہو جاتا ہے۔ یہ مفت ہے، اس کا پوائنٹ اینڈ کلک انٹرفیس ہے، اور یہ CSV ایکسپورٹ کرتا ہے۔ Camelot یہی کام Python سے کرتا ہے، لکیروں والے ٹیبلز کے لیے lattice موڈ اور بغیر لکیروں والوں کے لیے stream موڈ کے ساتھ، اور یہ بھی بتاتا ہے کہ اسے کتنا یقین ہے۔

جب لے آؤٹ سادہ ہو اور آپ بس اسے پڑھنے کے قابل چاہتے ہوں تو Poppler کا pdftotext -layout in.pdf out.txt کالمز کے فاصلے سادہ ٹیکسٹ میں برقرار رکھتا ہے، جو فکسڈ وڈتھ ڈیٹا کے طور پر سیدھا اسپریڈشیٹ میں کھل جاتا ہے اور اندازے کا پورا مرحلہ چھوڑ دیتا ہے۔ اور اگر PDF اسکین ہے تو یہاں کی کوئی بات لاگو نہیں ہوتی — جگہ دینے کو کوئی ٹیکسٹ ہی نہیں، اور اسے پہلے OCR کی ضرورت ہے۔

اکثر پوچھے جانے والے سوالات

PDF کا ٹیبل آخر اسپریڈشیٹ کیسے بن سکتا ہے؟

PDF میں ٹیبل کا کوئی تصور نہیں — صرف کوآرڈینیٹس پر حروف ہوتے ہیں۔ گرڈ دوبارہ بنایا جاتا ہے: ایک ہی بیس لائن والا ٹیکسٹ ایک قطار بنتا ہے، اور پورے صفحے پر ٹیکسٹ کے بائیں کناروں کو اکٹھا کر کے کالم بنائے جاتے ہیں، اس لیے جو سیل ایک قطار میں خالی ہو وہ بھی باقی قطاروں میں اپنی جگہ برقرار رکھتا ہے۔

یہ کتنا درست ہے؟

صاف، لکیروں والے اور یکساں کالمز والے ٹیبلز پر بہت اچھا۔ مرج کیے گئے سیلز، سیل کے اندر کئی لائنوں میں لپٹا ٹیکسٹ، اور صفحے پر کھسکتے کالمز اس کے لیے مشکل ہیں — ٹیبل کا مطلب جانے بغیر یہ سب واقعی مبہم ہیں۔ اس پر بھروسہ کرنے سے پہلے نتیجہ چیک کر لیں۔

کیا نمبرز نمبرز ہی رہتے ہیں؟

جی ہاں۔ جو کچھ نمبر کے طور پر پڑھا جائے وہ عددی سیل کے طور پر لکھا جاتا ہے، اس لیے ٹوٹل اور فارمولے ہر چیز کو ٹیکسٹ سمجھنے کے بجائے فوراً کام کرتے ہیں۔

کیا میری PDF کہیں محفوظ کی جاتی ہے؟

نہیں۔ ہر صفحہ محفوظ کیے بغیر پڑھا جاتا ہے۔

اسکین شدہ PDF کا کیا؟

اسکین میں نکالنے کو کوئی ٹیکسٹ نہیں ہوتا۔ پہلے PDF پر OCR کریں چلائیں، پھر تبدیل کریں۔

جاننا مفید ہے: مرج کیے گئے سیلز، کئی لائنوں والے سیلز اور کھسکتے کالمز مشکل صورتیں ہیں اور بعد میں انہیں درست کرنا پڑ سکتا ہے۔ فارمیٹنگ، رنگ، فارمولے اور چارٹس دوبارہ نہیں بنائے جاتے — صرف ویلیوز۔ ہر PDF صفحہ ایک لمبے ٹیبل میں جوڑے جانے کے بجائے اپنی الگ شیٹ بنتا ہے۔

یہ ٹول اپنی ویب سائٹ پر لگائیں

کسی بھی بلاگ، کلاس پیج یا ہیلپ آرٹیکل کے لیے مفت۔ ایک اسنیپٹ پیسٹ کریں اور آپ کے وزیٹرز اسے سیدھا آپ کے صفحے پر استعمال کر سکیں گے۔