सीधे कंटेंट पर जाएं

PDF को Excel में बदलें

PDF की टेबल को एक असली .xlsx में निकालें जिसे आप सॉर्ट, फ़िल्टर और जोड़ सकें — सीधे पेज से दोबारा बनाई गई।

  • कभी स्टोर नहीं होती
  • न कतार, न इंतज़ार
  • साइनअप नहीं, वॉटरमार्क नहीं

यह कैसे काम करता है

1

अपनी PDF जोड़ें

वह डॉक्यूमेंट छोड़ें जिसमें आपकी ज़रूरत की टेबल है।

2

कन्वर्ट करें

पंक्तियां साझा बेसलाइन से पहचानी जाती हैं और कॉलम इस बात से कि पेज पर टेक्स्ट कहां से शुरू होता है।

3

डाउनलोड करें

हर पेज की एक शीट, जो Excel, Google Sheets, Numbers और LibreOffice में खुलती है।

जिसमें ग्रिड है ही नहीं, उससे ग्रिड कैसे निकाला जाता है

PDF में टेबल नहीं होती। उसमें कोऑर्डिनेट पर अक्षर होते हैं, और जो लाइनें टेबल जैसी दिखती हैं, वे बनाई गई आर्टवर्क हैं जिनका अपने अंदर के टेक्स्ट से कोई संबंध नहीं। इसलिए ग्रिड का अनुमान लगाया जाता है, दो नियमों से, जिन्हें ठीक-ठीक जानना काम का है। पंक्तियां साझा बेसलाइन से आती हैं, खड़ी जगह को चार-पॉइंट के खानों में राउंड करके, ताकि सुपरस्क्रिप्ट या थोड़ा ऊपर उठा करेंसी चिह्न अपनी अलग पंक्ति न शुरू कर दे। कॉलम पेज के हर अलग बाएं किनारे को इकट्ठा करके और आठ पॉइंट के भीतर वाले किन्हीं दो को मिलाकर बनते हैं — यह पंक्ति-दर-पंक्ति नहीं, पूरे पेज पर होता है, ताकि जो कॉलम किसी एक लाइन पर ख़ाली है, वह बाक़ी लाइनों पर अपनी जगह बनाए रखे।

इसीलिए दाईं ओर अलाइन नंबर मुश्किल मामला हैं, और यह साफ़ कहना ज़रूरी है क्योंकि यहां सबसे आम निराशा यही है। दाईं ओर अलाइन आंकड़ों के कॉलम में हर पंक्ति का बायां किनारा अलग होता है — 9.99, 1,234,567.89 से काफ़ी दाईं ओर शुरू होता है — और जब ये किनारे आठ पॉइंट से ज़्यादा अलग हों, तो वे अलग कॉलम माने जाते हैं। इसलिए कोई फ़ाइनेंशियल टेबल कई कॉलम में बिखरकर आ सकती है जो एक होने चाहिए थे। बाईं ओर और बीच में अलाइन कॉलम में यह समस्या नहीं होती। जो दो टेक्स्ट एक ही सेल में पड़ते हैं, वे एक-दूसरे के ऊपर लिखे जाने के बजाय स्पेस से जोड़ दिए जाते हैं।

बाहर निकलते समय सेल का टाइप तय होता है: जो कुछ साफ़ तौर पर नंबर के रूप में पार्स होता है, वह नंबर के रूप में लिखा जाता है और जुड़ जाएगा, और बाक़ी सब टेक्स्ट के रूप में लिखा जाता है। अकाउंटिंग की आम सजावट पार्स नहीं होती — हज़ार का सेपरेटर, आख़िर में प्रतिशत का चिह्न, करेंसी चिह्न, या ब्रैकेट में लिखी ऋणात्मक संख्या जैसे (1,234) — इसलिए वे सेल ऐसे टेक्स्ट के रूप में आते हैं जो नंबर जैसा दिखता है पर जुड़ने से मना कर देता है। Excel का अपना Text to Columns ऐसे पूरे कॉलम को एक बार में ठीक कर देता है।

हर पेज अपनी अलग शीट बनता है, जिनके नाम Page 1, Page 2 वग़ैरह होते हैं, बजाय एक लगातार टेबल में जुड़ने के — तीन पेज की टेबल तीन शीट में आती है, हर एक में हेडर दोहराया हुआ। जो आता है वह सिर्फ़ वैल्यू हैं। फ़ॉर्मूले PDF में कभी थे ही नहीं कि उन्हें वापस लाया जाए, और फ़िल रंग, बॉर्डर, फ़ॉन्ट, मर्ज किए गए सेल और चार्ट जान-बूझकर दोबारा नहीं बनाए जाते, क्योंकि उनका अंदाज़ा लगाने से ऐसी स्प्रेडशीट बनती है जो भरोसेमंद दिखती है पर बारीकी से ग़लत होती है।

जब आपको कुछ और चाहिए

टेबल निकालना एक असली रिसर्च समस्या है, और ऐसे टूल हैं जो सिर्फ़ यही करते हैं। जब टेबल में लाइनें हों, तो Tabula सबसे सही है: वह टेक्स्ट की जगहों से ग्रिड का अनुमान लगाने के बजाय बनी हुई लाइनों को ही ग्रिड मानता है, जिससे दाईं ओर अलाइन नंबर वाली समस्या सीधे हल हो जाती है। वह मुफ़्त है, उसमें पॉइंट-एंड-क्लिक इंटरफ़ेस है, और वह CSV एक्सपोर्ट करता है। Camelot यही काम Python से करता है, लाइन वाली टेबल के लिए lattice मोड और बिना लाइन वाली के लिए stream मोड के साथ, और बताता है कि वह कितना आश्वस्त है।

जब लेआउट सीधा-सादा हो और आप बस उसे पढ़ने लायक चाहते हों, तो Poppler का pdftotext -layout in.pdf out.txt कॉलम की दूरी को प्लेन टेक्स्ट में बचाए रखता है, जो फ़िक्स्ड-विड्थ डेटा के रूप में सीधे स्प्रेडशीट में खुल जाता है और अनुमान वाला काम पूरी तरह छोड़ देता है। और अगर PDF एक स्कैन है, तो यहां की कोई बात लागू नहीं होती — जगह पर रखने को कोई टेक्स्ट नहीं है, और उसे पहले OCR चाहिए।

अक्सर पूछे जाने वाले सवाल

PDF की टेबल स्प्रेडशीट बन ही कैसे सकती है?

PDF में टेबल जैसी कोई चीज़ होती ही नहीं — सिर्फ़ कोऑर्डिनेट पर अक्षर होते हैं। ग्रिड को दोबारा बनाया जाता है: एक ही बेसलाइन वाला टेक्स्ट एक पंक्ति बनता है, और पूरे पेज पर टेक्स्ट के बाएं किनारों को समूहों में बांटकर कॉलम बनाए जाते हैं, ताकि जो सेल किसी एक पंक्ति में ख़ाली है, वह बाक़ी पंक्तियों में अपनी जगह बनाए रखे।

यह कितना सटीक है?

एक जैसे कॉलम वाली साफ़, लाइन वाली टेबल पर बहुत अच्छा। मर्ज किए गए सेल, सेल के अंदर लिपटा (रैप) टेक्स्ट, और पेज पर खिसकते कॉलम इसके लिए मुश्किल हैं — टेबल का मतलब जाने बिना ये सब सचमुच अस्पष्ट हैं। भरोसा करने से पहले नतीजा जांच लें।

क्या नंबर, नंबर ही रहते हैं?

हां। जो कुछ भी नंबर की तरह पढ़ा जाता है, वह न्यूमेरिक सेल के रूप में लिखा जाता है, इसलिए सब कुछ टेक्स्ट मानने के बजाय टोटल और फ़ॉर्मूले तुरंत काम करते हैं।

क्या मेरी PDF कहीं स्टोर होती है?

नहीं। हर पेज स्टोर हुए बिना पढ़ा जाता है।

स्कैन की गई PDF का क्या?

स्कैन से निकालने के लिए कोई टेक्स्ट नहीं होता। पहले PDF OCR करें, फिर कन्वर्ट करें।

ध्यान दें: मर्ज किए गए सेल, कई लाइन वाले सेल और खिसकते कॉलम मुश्किल मामले हैं और बाद में इन्हें ठीक करना पड़ सकता है। फ़ॉर्मैटिंग, रंग, फ़ॉर्मूले और चार्ट दोबारा नहीं बनते — वैल्यू बनती हैं। हर PDF पेज एक लंबी टेबल में जुड़ने के बजाय अपनी अलग शीट बनता है।

यह टूल अपनी वेबसाइट पर लगाएं

किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।