مواد پر جائیں

بنگالی PDF کو Word میں تبدیل کریں

بنگالی PDF — سرکلر، فارم، کتاب کا باب، اسکین — کو ایسی .docx میں جسے آپ ایڈٹ کر سکیں، مرکب حروف اور اعراب درست ترتیب میں، اور اسکین صفحات کے لیے OCR بنگالی پر سیٹ۔ کچھ بھی محفوظ نہیں کیا جاتا۔

  • کبھی محفوظ نہیں کی جاتی
  • نہ قطار، نہ انتظار
  • نہ سائن اپ، نہ واٹر مارک

یہ کیسے کام کرتا ہے

1

اپنی PDF شامل کریں

ٹیکسٹ PDF یا اسکین۔ ٹول پہلا صفحہ دیکھتا ہے اور اسکین ہونے پر OCR آن کر دیتا ہے؛ ریڈر پہلے سے بنگالی پر سیٹ ہے۔

2

موڈ چنیں

قابلِ ایڈٹ ٹیکسٹ ایک عام Word دستاویز دیتا ہے، صفحہ بہ صفحہ۔ ہو بہو شکل ہر لائن کو صفحے کی تصویر کے اوپر اسی جگہ رکھتا ہے جہاں وہ تھی، ایڈٹ کے بجائے پرنٹ کے لیے۔

3

تبدیل اور ڈاؤن لوڈ کریں

یونیکوڈ بنگالی فونٹ میں .docx، ہیڈنگز، پیراگراف، تصاویر اور لنکس کے ساتھ۔

بنگالی PDF میں کیا الگ ہے

دوبارہ ترتیب ہی اصل بات ہے۔ PDF کی ٹیکسٹ لیئر گلفس کو بنانے کی ترتیب میں رکھتی ہے، اور بنگالی شیپنگ انجن حرف سے پہلے آنے والے اعراب (ি، ে، ৈ) حرف سے پہلے بناتا ہے اور ো اور ৌ کو اس کے اطراف دو گلفس میں بانٹ دیتا ہے؛ اس لیے سادہ ایکسٹریکٹر سے نکلنے والا ٹیکسٹ "স্ব␃াভািবক" ہوتا ہے جہاں صفحے پر "স্বাভাবিক" لکھا ہے۔ کچھ اور ہونے سے پہلے ہر لائن کو منطقی ترتیب میں واپس لایا جاتا ہے — اعراب اپنے کلسٹر کے بعد، ریف র্ کی صورت میں اس کلسٹر سے پہلے جس پر وہ بیٹھتا ہے، دو حصوں والے اعراب ایک کوڈ پوائنٹ کی صورت میں۔ OCR کے آؤٹ پٹ کو اس میں سے کسی چیز کی ضرورت نہیں، کیونکہ انجن پہلے ہی منطقی ترتیب دیتا ہے۔

ہیڈنگز، پیراگراف، لنکس، تصاویر اور پیج بریکس بالکل عام PDF سے Word صفحے کی طرح نکالے جاتے ہیں: ایک بیس لائن پر موجود الفاظ ایک لائن ہیں، بڑھتا ہوا فاصلہ نیا پیراگراف شروع کرتا ہے، عام ٹیکسٹ سے 1.6 گنا بڑی چھوٹی لائن ہیڈنگ ہے، اور لنک اینوٹیشن Word ہائپر لنک بن جاتی ہے۔ ہو بہو شکل صفحے کا آرٹ ورک 144 DPI پر رینڈر کرتا ہے اور اصل ٹیکسٹ اس کے اوپر رکھتا ہے؛ قابلِ ایڈٹ ٹیکسٹ پڑھنے کی ترتیب میں صاف پیراگراف دوبارہ بناتا ہے۔

بنگالی ہندسے بنگالی ہندسے ہی رہتے ہیں، اور صفحے پر موجود لاطینی لفظ — ای میل ایڈریس، ریفرنس نمبر — لاطینی رہتا ہے۔ اسکین کے لیے بنگالی پیک ہی لوڈ ہوتا ہے، اس لیے انگریزی لیٹر ہیڈ والا بنگالی صفحہ بنگالی درست پڑھتا ہے اور لیٹر ہیڈ کو بنگالی شکل کے بے معنی الفاظ کی طرح پڑھ سکتا ہے؛ اگر انگریزی اہم ہو تو زبانوں کی فہرست میں انگریزی شامل کریں۔

جب آپ کو کچھ اور چاہیے

Word فائل سے بنی PDF ایک ایسی تعمیرِ نو ہے جو ہونے کا انتظار کر رہی ہے؛ ہو سکے تو .docx مانگ لیں۔ اور Bijoy کی .docx کو PDF میں پرنٹ کر کے واپس تبدیل کرنے کے بجائے Bijoy سے یونیکوڈ کنورٹر سے تبدیل کرنا بہتر ہے — کی اسٹروکس ایک بھی غلطی کے بغیر تبدیل ہوتی ہیں، فارمیٹنگ برقرار رہتی ہے، اور کچھ بھی پکسلز سے دوبارہ نہیں پڑھا جاتا۔

اسکین شدہ بنگالی کتابوں کے آرکائیو کے لیے بنگالی ماڈل والا ڈیسک ٹاپ OCR ٹول رات بھر میں پورا فولڈر پڑھ لیتا ہے، اور OCRmyPDF ہر PDF کی شکل بدلے بغیر اس پر سرچ کے قابل لیئر لگا دیتا ہے — سینکڑوں فائلوں کے لیے یہی درست قسم کا ٹول ہے، جہاں یہ صفحہ ایک فائل کے لیے ہے۔

اکثر پوچھے جانے والے سوالات

کیا میری PDF محفوظ کی جاتی ہے؟

نہیں۔ کچھ بھی محفوظ نہیں کیا جاتا؛ فائل کبھی نہیں رکھی جاتی۔ اسکین کے لیے ریڈر اور بنگالی پیک اسی سائٹ سے ایک بار آتے ہیں اور اگلی بار کے لیے رکھ لیے جاتے ہیں — دستاویز خود کہیں نہیں جاتی۔

PDF سے نکلی بنگالی عموماً غلط ہجوں میں کیوں آتی ہے؟

کیونکہ PDF گلفس کو اسی ترتیب میں رکھتی ہے جس میں وہ بنائے گئے، اور بنگالی کے لیے یہ بصری ترتیب ہے: اِ-کار اس حرف سے پہلے بنتا ہے جس کے بعد وہ آتا ہے، اور ো کے دو حصے اس کے دونوں طرف بیٹھتے ہیں۔ زیادہ تر کنورٹر یہ ترتیب جیسی ہے ویسی نقل کر دیتے ہیں، اس لیے বাংলাদেশ کے اعراب غلط حروف کے آگے آ جاتے ہیں اور ہر لفظ کے ہجے ایسے بگڑتے ہیں جنہیں سپیل چیکر ٹھیک نہیں کر سکتا۔ یہ کنورٹر نشانات وہاں واپس رکھتا ہے جہاں یونیکوڈ انہیں چاہتا ہے — وہی دوبارہ ترتیب جو ہر بنگالی PDF کو چاہیے، اس سائٹ کی بنائی ہوئی PDF کو بھی۔

کیا یہ Bijoy دستاویز سے بنی PDF سنبھال لیتا ہے؟

اگر PDF میں SutonnyMJ کی ٹیکسٹ لیئر ہو تو ٹیکسٹ Bijoy کی اسٹروکس کی صورت میں نکلتا ہے، کیونکہ فائل میں یہی ہوتا ہے؛ نتیجے کو Bijoy سے یونیکوڈ کنورٹر سے گزاریں اور فارمیٹنگ برقرار رہتی ہے۔ اگر PDF اسکین ہو تو OCR تصویر پڑھتا ہے اور سیدھا یونیکوڈ دیتا ہے۔

بنگالی اسکینز پر OCR کتنا اچھا ہے؟

چھپی بنگالی کے صاف 300 dpi اسکینز اچھے پڑھے جاتے ہیں؛ مدھم فوٹو کاپیاں اور فون کی تصاویر مرکب حروف کھو دیتی ہیں۔ اس صفحے پر زبان بنگالی پر مقرر ہے، اس لیے لاطینی لیٹر ہیڈ یا ریفرنس نمبر ریڈر کو پورے صفحے کے لیے انگریزی کی طرف نہیں دھکیل سکتا۔ ٹیڑھے اسکین ہوئے صفحات پہلے سیدھے کیے جاتے ہیں۔

مجھے کون سا Word فارمیٹ ملتا ہے؟

ایک معیاری .docx، یونیکوڈ بنگالی فونٹ میں، جو Word، Google Docs اور LibreOffice میں کھلتی ہے۔ ٹیکسٹ اصل یونیکوڈ ہے: سرچ کے قابل، اور Avro یا Ridmik سے ٹائپ کرنے کے قابل۔

ٹیبلز اور فارمز کا کیا ہوتا ہے؟

اسکین میں لکیروں والے فارم قابلِ ایڈٹ ٹیکسٹ موڈ میں اصل Word ٹیبلز بن کر آتے ہیں۔ ٹیکسٹ PDF کے ٹیبلز مخصوص جگہوں پر رکھے ٹیکسٹ کی صورت میں آتے ہیں، ہر PDF سے Word کنورٹر کی طرح — اسپریڈشیٹ کے لیے PDF سے Excel بہتر ٹول ہے۔

جاننا مفید ہے: فونٹس بدل جاتے ہیں: .docx میں PDF کا اپنا فونٹ نہیں بلکہ یونیکوڈ بنگالی فونٹ ہوتا ہے، اس لیے شکل ایک جیسی نہیں بلکہ قریب قریب ہوتی ہے۔ Bijoy فونٹ میں لگی ٹیکسٹ PDF Bijoy کی اسٹروکس کی صورت میں تبدیل ہوتی ہے اور بعد میں اسے Bijoy سے یونیکوڈ کنورٹر کی ضرورت ہوتی ہے۔ OCR تصاویر اور لوگوز کو نظر انداز کرتا ہے، ہاتھ کی لکھائی کو تصویر ہی رہنے دیتا ہے، اور فی صفحہ چند سیکنڈ لیتا ہے، کیونکہ پڑھنے کا کام آپ کا اپنا ڈیوائس کرتا ہے۔

یہ ٹول اپنی ویب سائٹ پر لگائیں

کسی بھی بلاگ، کلاس پیج یا ہیلپ آرٹیکل کے لیے مفت۔ ایک اسنیپٹ پیسٹ کریں اور آپ کے وزیٹرز اسے سیدھا آپ کے صفحے پر استعمال کر سکیں گے۔