মূল অংশে যান

স্ক্যান করা PDF-এ কেন সার্চ করা যায় না

কারণ এতে কোনো শব্দই নেই। ফাইলে আসলে কী আছে তা বুঝলেই প্রতিটি সমস্যার ব্যাখ্যা মেলে, আর বোঝা যায় কোন একটি সেটিং ঠিক করে এটি কতটা ভালোভাবে ঠিক করা যাবে।

সর্বশেষ পর্যালোচনা:

ফাইলে কোনো শব্দই নেই

একটি PDF সম্পূর্ণ আলাদা দুই ধরনের জিনিস রাখতে পারে, যা স্ক্রিনে দেখতে হুবহু এক। Word থেকে এক্সপোর্ট করা ডকুমেন্টে থাকে লেখা — আসল অক্ষর, প্রতিটির নিজস্ব অবস্থান ও ফন্ট — এ কারণেই আপনি একটি বাক্য সিলেক্ট করতে, কোনো নাম সার্চ করতে আর একটি প্যারাগ্রাফ কপি করতে পারেন। স্ক্যান করা ডকুমেন্টে থাকে একটি পেজের ছবি। এতে পিক্সেল ছাড়া আর কিছুই নেই — ঠিক যেমন রাস্তার সাইনবোর্ডের ছবিতে পিক্সেল ছাড়া কিছু থাকে না।

প্রতিটি সমস্যা ওই একটি সত্য থেকেই আসে। সার্চ কিছু খুঁজে পায় না, কারণ মেলানোর মতো কিছুই নেই। লেখা সিলেক্ট হয় না, কারণ সিলেক্ট করার মতো লেখাই নেই — কার্সর বরং ছবির ওপর একটি আয়তক্ষেত্র আঁকে। কপি করলে কিছুই পান না। দৈর্ঘ্যের তুলনায় ফাইলটি বড়, কারণ ছবি ভারী আর শব্দ হালকা। আর Word-এ কনভার্ট করলে পান হয় একটি খালি ডকুমেন্ট, নয়তো তার ভেতরে পেস্ট করা একটি ছবি।

দ্রুত পরীক্ষা: মাউস দিয়ে একটি মাত্র শব্দ সিলেক্ট করার চেষ্টা করুন। টেক্সট কার্সর আর হাইলাইট হওয়া শব্দ পেলে সেখানে আসল লেখা আছে। একটি বাক্স পেলে সেটি ছবি।

OCR আসলে কী যোগ করে

অপটিক্যাল ক্যারেক্টার রিকগনিশন ছবির আকৃতিগুলো পড়ে বের করে সেগুলো কোন কোন অক্ষর। কাজের অংশটি ঘটে এর পরে: শনাক্ত করা শব্দগুলো PDF-এ আবার লেখা হয় অদৃশ্য লেখা হিসেবে, ছবির শব্দগুলোর ঠিক ওপরে বসিয়ে। পেজটি হুবহু আগের মতোই দেখায়, কারণ দেখতে কিছুই বদলায়নি — কিন্তু এখন এটি সার্চ, সিলেক্ট, কপি আর ইনডেক্স করা যায়।

এটি ইচ্ছাকৃতভাবে রক্ষণশীল নকশা, আর ডকুমেন্টের জন্য এটিই সঠিক। কিছুই নতুন করে টাইপসেট হয় না, তাই একটি চুক্তিপত্র দেখতে এখনো সেই চুক্তিপত্রের মতোই, যাতে সই করা হয়েছিল, আর মূল স্ক্যানটিই দৃশ্যমান রেকর্ড হিসেবে থাকে। স্ক্যান করা PDF সার্চযোগ্য করা এক ধাপেই এটি করে, আর সাধারণত পেজগুলো সোজা করে ও ঘুরিয়েও দেয়, কারণ পড়ার জন্য এমনিতেই সেটি দরকার ছিল।

আপনি যদি সার্চযোগ্য নয়, এডিটযোগ্য ডকুমেন্ট চান, সেটি আলাদা এবং অনেক কঠিন কাজ: লেখা বের করতে হয়, লেআউট অনুমান করতে হয়, আর ফলাফল প্যারাগ্রাফ ও টেবিল হিসেবে নতুন করে গড়তে হয়। Word-এ কনভার্ট সেটি করে, আর তার ফলাফল সবসময় এমনভাবে যাচাই করতে হয়, যা টেক্সট লেয়ারের বেলায় লাগে না।

যে সেটিং সবকিছু ঠিক করে: ৩০০ DPI

শনাক্তকরণের নির্ভুলতা সফটওয়্যারের চেয়ে স্ক্যানের ওপর অনেক বেশি নির্ভর করে, আর সবচেয়ে গুরুত্বপূর্ণ সংখ্যাটি হলো রেজোলিউশন। ৩০০ DPI হলো মানদণ্ড, আর তা খেয়ালখুশি মতো নয় — এতে সাধারণ বডি টেক্সটের উচ্চতায় প্রায় ৩০ পিক্সেল পড়ে, যা কাছাকাছি আকৃতির অক্ষর আলাদা করতে ন্যূনতম যা লাগে, তার চেয়ে স্বচ্ছন্দে বেশি।

১৫০ DPI-তে নির্ভুলতা লক্ষণীয়ভাবে কমে যায়, আর ভুলগুলো হয় চুপিসারে ঢুকে পড়ার মতো: 1 পড়া হয় l হিসেবে, 5 পড়া হয় S হিসেবে, rn পড়া হয় m হিসেবে। এর নিচে দ্রুত খারাপ হয়। ৩০০-এর বেশি দিলে খুব কমই লাভ হয়, আর ফাইল অনেক বড় হয় — ৬০০ DPI শুধু খুব ছোট ছাপা বা খারাপ মূল কপির জন্যই সার্থক।

আরও তিনটি ক্যাপচার সেটিং প্রায় ততটাই গুরুত্বপূর্ণ। সাদাকালোর বদলে গ্রেস্কেল, কারণ কঠোর থ্রেশহোল্ড অক্ষরের সরু অংশগুলো মুছে দেয়। সেন্সরের সামনে সমতল ও সোজা, কারণ কোণ থেকে তোলা পেজের অক্ষরগুলোর আকৃতি পেজজুড়ে বদলে যায়। আর সমানভাবে আলোকিত — সবচেয়ে পরিচিত ভুল হলো ওপর থেকে ছবি তোলার সময় পেজের ওপর আপনার নিজের ছায়া পড়া।

যা কোনো OCR-ই পড়তে পারে না

এ বিষয়ে সৎ থাকলে অনেক সময় বাঁচে। সাধারণ কাজের OCR টানা হাতের লেখা শনাক্ত করে না, আর এর কারণ চেষ্টার ঘাটতি নয়, গঠনগত: ছাপা লেখা পড়া কাজ করে অক্ষরগুলোর মধ্যের সীমা খুঁজে, আর টানা লেখায় কোনো সীমাই নেই। হাতে আলাদা করে লেখা অক্ষর, বড় হাতের ব্লক অক্ষর আর ফর্মের ঘরে লেখা প্রায়ই ভালো কাজ করে, কারণ সেগুলো মাঝে ফাঁকসহ আলাদা আলাদা আকৃতি।

ফটোর অংশ হয়ে থাকা লেখা — সাইনবোর্ডে, পণ্যের গায়ে, ব্যস্ত ব্যাকগ্রাউন্ডের ওপর লেখা শব্দ — কাগজের লেখার চেয়ে অনেক কঠিন, আর অতিরিক্ত স্টাইলিশ বা নকশাদার অক্ষর আরও কঠিন। ফটোকপির ফটোকপিতে অক্ষর আলাদা করার সরু টানগুলো হারিয়ে যায়। আর সিল, মন্তব্য বা হাইলাইট দেওয়া ডকুমেন্টে যেখানে সেই দাগ লেখার ওপর পড়ে, সেখানে পড়া খারাপ হয়।

একটি ভালো টুল জানায় সে কতটা নিশ্চিত ছিল, আর সেই সংখ্যাটি কাজে লাগানোর জন্যই। প্রসঙ্গ থেকে পড়া যায় এমন বাক্যের মাঝে কম নিশ্চয়তা, অ্যাকাউন্ট নম্বরের একটি অঙ্কে কম নিশ্চয়তার চেয়ে অনেক কম গুরুত্বপূর্ণ। বিপজ্জনক ভুল হলো সেগুলো, যেগুলোতে টুল নিশ্চিত, কারণ সেগুলো কেউ চিহ্নিত করে না।

কেন এটি শুধু সুবিধার চেয়েও বেশি গুরুত্বপূর্ণ

টেক্সট লেয়ারহীন স্ক্যান করা আর্কাইভ কার্যত হারিয়ে যাওয়া। কিছুই তাতে সার্চ করতে পারে না, কিছুই ইনডেক্স করতে পারে না, কোনো কমপ্লায়েন্স সিস্টেম তাতে কোনো নাম খুঁজে পায় না, আর কোনো স্ক্রিন রিডার তা জোরে পড়ে শোনাতে পারে না — ফলে অনেক দেশের আইনে এটি প্রকাশ করা শুধু অসুবিধা নয়, আইনি সমস্যা।

এ কারণেই প্রথমবারেই সঠিক সেটিংয়ে স্ক্যান করার ব্যাপারে জোর দেওয়া সার্থক। এক বাক্স ডকুমেন্ট আবার স্ক্যান করতে একবার ঠিকভাবে স্ক্যান করার চেয়ে অনেক বেশি খরচ হয়, আর যে খুঁটিনাটি কখনো ধরা হয়নি, কোনো প্রসেসিংই তা ফেরাতে পারে না।

সাধারণ প্রশ্নোত্তর

OCR আসলে কতটা নির্ভুল?

সাধারণ ছাপা লেখার পরিষ্কার ৩০০ DPI স্ক্যানে খুবই নির্ভুল — এতটাই যে ভুল হয় কালেভদ্রে, নিয়মিত নয়। কম আলোয় কোণ থেকে তোলা ফোনের ছবিতে নাটকীয়ভাবে খারাপ। সফটওয়্যার বাছাইয়ের চেয়ে স্ক্যানের মান অনেক বেশি গুরুত্বপূর্ণ।

OCR কি আমার ডকুমেন্টের চেহারা বদলে দেবে?

না। শনাক্ত করা লেখা বিদ্যমান ছবির ওপর অদৃশ্যভাবে যোগ হয়, তাই পেজ হুবহু আগের মতোই দেখায়। প্রক্রিয়ার অংশ হিসেবে পেজগুলো সাধারণত সোজা ও খাড়া করে দেওয়া হয়, যা বাঁকা স্ক্যানকে ভিন্ন নয়, বরং আরও ভালো দেখায়।

OCR চালানোর পর কি লেখা এডিট করা যায়?

PDF-এর ভেতরে নয় — দৃশ্যমান পেজটি এখনো ছবি, আর টেক্সট লেয়ার তার ওপর অদৃশ্যভাবে বসে থাকে। এডিটযোগ্য কিছু পেতে শনাক্ত করা ডকুমেন্টটি Word-এ কনভার্ট করুন, আর ফলাফল যাচাই করতে হবে ধরে নিন।

OCR কি হাতের লেখায় কাজ করে?

আলাদা আলাদা করে হাতে লেখা অক্ষর আর পূরণ করা ফর্মে প্রায়ই কাজ করে। টানা লেখায় কোনো সাধারণ কাজের OCR টুলেই কাজ করে না — অক্ষরগুলো একটার সঙ্গে আরেকটা মিশে যায়, খোঁজার মতো কোনো সীমা থাকে না। বিশেষভাবে হাতের লেখায় প্রশিক্ষিত টুল ভালো করে, তবে তার মূল্য হলো আপনার পেজ তৃতীয় কোনো পক্ষের কাছে পাঠানো।

আমার সার্চযোগ্য PDF এত বড় হয়ে গেল কেন?

সাইজ প্রায় বদলানোরই কথা নয় — টেক্সট লেয়ার প্রতি পেজে মাত্র কয়েক কিলোবাইট। অনেক বেড়ে গেলে সম্ভবত পেজগুলো অক্ষত না রেখে নতুন করে রেন্ডার করা হয়েছে, যা যাচাই করে দেখা উচিত, কারণ টেক্সট লেয়ারের মূল কথাই হলো মূল ছবি অক্ষত থাকে।