স্ক্যান করা PDF সার্চযোগ্য করুন
স্ক্যান থেকে শব্দগুলো পড়ে পেজের ওপর অদৃশ্যভাবে বসিয়ে দিন। ডকুমেন্ট দেখতে একই থাকে — শুধু সার্চ, সিলেক্ট আর কপি করা যায়। বাঁকা বা পাশ ফিরে স্ক্যান হওয়া পেজ সোজা করে দেওয়া হয়।
- কখনো সংরক্ষণ করা হয় না
- কোনো লাইন নেই, অপেক্ষা নেই
- সাইনআপ নেই, ওয়াটারমার্ক নেই
যেভাবে কাজ করে
স্ক্যান করা PDF যোগ করুন
ফাইলটি ছাড়ুন। টুলটি দেখে নেয় এতে আগে থেকেই টেক্সট লেয়ার আছে কি না, আর OCR করলে উল্টো ক্ষতি হবে কি না, তা জানিয়ে দেয়।
ভাষা দেখে নিন
টুলটি প্রথম পেজ পড়ে জানায় কোন ভাষা পেয়েছে। নিজে বেছে নিতে চাইলে ১২০টির বেশি ভাষা আছে।
ডাউনলোড
আপনি পাবেন একই ডকুমেন্ট, এখন স্ক্যানের পেছনে একটি লুকানো টেক্সট লেয়ারসহ।
অপরিবর্তিত পেজের ওপর একটি অদৃশ্য লেয়ার
স্ক্যানটি হুবহু যেমন ছিল তেমনই রাখা হয়। যা যোগ হয় তা হলো অদৃশ্য রেন্ডারিং মোডে আঁকা লেখার একটি লেয়ার — আসল অক্ষর, ছবির শব্দগুলোর ওপর শব্দ ধরে ধরে বসানো, এমনভাবে চিহ্নিত যে সেগুলো কখনো আঁকা হয় না। দেখতে পেজটি একই থাকে কারণ দৃশ্যত কিছুই বদলায়নি; একটি বাক্য সিলেক্ট করলে হাইলাইট ঠিক শব্দগুলোর ওপরই পড়ে, কারণ অদৃশ্য লেখা ঠিক দৃশ্যমান কালির জায়গাতেই আছে। সার্চযোগ্য স্ক্যান তৈরির এটাই প্রচলিত পদ্ধতি, আর এ কারণেই ফলাফলটি ডকুমেন্টের একটি ছবি থেকেও সার্চ, কপি ও ইনডেক্স করা যায়।
পেজের দুটি বিষয় ইচ্ছে করেই ঠিক করা হয়, কারণ পড়ার জন্য সেগুলো এমনিতেই দরকার ছিল। পাশ ফিরে স্ক্যান হওয়া পেজ খাড়া করা হয়, আর ফিডারে বাঁকা হয়ে ঢোকা পেজ সোজা করা হয় — তাই আউটপুট প্রায়ই ইনপুটের চেয়ে গোছানো হয়। পেজের সাইজ মূল PDF থেকেই রাখা হয়, একরকম করা হয় না, তাই মিশ্র সাইজের পেজওয়ালা ডকুমেন্ট তেমনই থাকে এবং কিছুই রিস্কেল হয় না।
নির্ভুলতা প্রায় পুরোটাই স্ক্যানের ওপর নির্ভর করে, আর পার্থক্যগুলো মোটেও কাছাকাছি নয়। ছাপা লেখার পরিষ্কার ৩০০ DPI স্ক্যান খুব উচ্চ নির্ভুলতায় পড়া যায়; একই পেজ ১৫০ DPI-তে লক্ষণীয়ভাবে খারাপ পড়া হয়; কম আলোয় কোনাকুনি তোলা ছবি একেবারেই অন্য ব্যাপার। স্ক্যানিং আপনার হাতে থাকলে গ্রেস্কেলে ৩০০ DPI-ই আসল সেটিং — এর চেয়ে বেশি রেজোলিউশন কদাচিৎ কাজে আসে, আর কম হলে সঙ্গে সঙ্গে ক্ষতি হয়। ছোট ছাপা, ঘন লাইন স্পেসিং, রঙিন ব্যাকগ্রাউন্ড, ফটোকপির ফটোকপি আর সিল মারা বা হাতে লেখা যেকোনো কিছু এমনভাবে কঠিন, যা কোনো সফটওয়্যারই পুরোপুরি সমাধান করতে পারে না।
যা ইচ্ছে করে বাদ রাখা হয়, তা যা যোগ হয় তার মতোই গুরুত্বপূর্ণ। ছবি, লোগো, সই আর সাজসজ্জার গ্রাফিক্স পড়া হয় না, উপেক্ষা করা হয়, কারণ ছবি থেকে জোর করে অক্ষর বের করলে বিশ্বাসযোগ্য দেখতে অর্থহীন লেখা তৈরি হয়, যা তারপর প্রতিটি সার্চে উঠে আসে। চীনা, জাপানি ও কোরিয়ান শব্দ শনাক্ত হয়, কিন্তু সেগুলো বহন করতে পারে এমন ফন্ট যোগ না হওয়া পর্যন্ত টেক্সট লেয়ার থেকে বাদ রেখে ফাঁকা হিসেবে না লিখে আপনার জন্য গুনে দেওয়া হয়। এখানে কিছুই ডকুমেন্টকে নতুন করে টাইপসেট করে না: পেজের শব্দগুলো এখনো একটি ছবি, আর সেগুলোকে এডিটযোগ্য লেখায় পরিণত করার টুল হলো Word-এ কনভার্ট।
অন্য কিছু দরকার হলে
OCRmyPDF হলো সেই টুল, যার পাশে এই পেজ শুধু একটি সুবিধা, আর এটি ফ্রি। ocrmypdf --deskew --rotate-pages in.pdf out.pdf আরও বেশি নিয়ন্ত্রণসহ একই কাজ করে; ফলাফল ছোট করতে --optimize 3, খারাপ পুরোনো লেয়ার বদলাতে --redo-ocr, আর একই দফায় আর্কাইভ ফাইল বানাতে --output-type pdfa যোগ করা যায়। এটি হাজার হাজার পেজ সামলায়, ফোল্ডার ওয়াচারে চলে, আর লাইব্রেরি ও ডকুমেন্ট আর্কাইভগুলো আসলে এটিই ব্যবহার করে।
কঠিন উপাদানের জন্য — ঐতিহাসিক ছাপা, অস্বাভাবিক লেআউট, ভারী টেবিল — Google, Amazon বা Microsoft-এর হোস্টেড সার্ভিস এমন পেজও পড়তে পারে যা সাধারণ শনাক্তকরণ পারে না, কারণ সেগুলো অনেক বেশি উপাদানে প্রশিক্ষিত। এটি সত্যিকারের সক্ষমতার পার্থক্য, আর জেনে রাখার মতো। তবে এর মানে আপনার ডকুমেন্ট তৃতীয় পক্ষের কাছে পাঠানো, আর ঠিক এই আপসটি এড়াতেই এই পেজের অস্তিত্ব — তাই একটি ভঙ্গুর পুরোনো বইয়ের জন্য এটি সঠিক পছন্দ, আর এক বাক্স মেডিকেল রেকর্ডের জন্য ভুল।
সাধারণ প্রশ্নোত্তর
পরে কি পেজগুলো দেখতে অন্য রকম হবে?
শুধু আরও সোজা: এক ডিগ্রি বাঁকা বা পাশ ফিরে স্ক্যান হওয়া পেজ খাড়া করে দেওয়া হয়। স্ক্যানটি রেখে দেওয়া হয় আর শনাক্ত করা শব্দগুলো তার ওপর অদৃশ্য কালিতে বসানো হয় — কখনো আঁকা হয় না, কখনো প্রিন্টে আসে না। যা বদলায় তা হলো, Ctrl+F এখন জিনিস খুঁজে পায়।
আমার ডকুমেন্ট কি কোথাও সংরক্ষণ করা হয়?
না। শনাক্তকরণে কিছুই সংরক্ষণ করা হয় না। কোনো ভাষা প্রথমবার ব্যবহারের সময় রিডার ও ভাষার প্যাক এই সাইট থেকে আসে; ডকুমেন্ট নিজে কখনো ডিভাইস ছেড়ে যায় না।
এটি কতটা নির্ভুল?
ছাপা লেখার পরিষ্কার স্ক্যানে, খুবই। ঝাপসা ছবি, হাতের লেখা আর অস্বাভাবিক ফন্টে তা কমে; পড়ার আগে বাঁকা ভাব ঠিক করা হয়। দাগ টানা টেবিল সেল ধরে ধরে পড়া হয়, তাই ফর্মের লেবেল তার মানের সঙ্গে মিশে যায় না।
কোন কোন ভাষা কাজ করে?
১২০টির বেশি, যার মধ্যে ইংরেজি, বাংলা, হিন্দি, উর্দু, আরবি, স্প্যানিশ, ফরাসি, চীনা, জাপানি ও কোরিয়ান আছে। হরফ পেজ থেকেই শনাক্ত হয়; কয়েকটি ভাষা একই হরফ ব্যবহার করলে আপনার ব্রাউজারের ভাষা দিয়ে মীমাংসা করা হয়, আর আপনি তা বদলাতে পারেন।
টেক্সট লেয়ারে কিছু শব্দ নেই। কেন?
টেক্সট লেয়ার শুধু সেই অক্ষরগুলোই বহন করতে পারে, যা সঙ্গে থাকা কোনো ফন্ট লিখতে পারে। বাংলা, দেবনাগরী, আরবি, থাই আর আরও দুই ডজন হরফের নিজস্ব ফন্ট এখানে আছে; চীনা, জাপানি ও কোরিয়ানের জন্য এখনো নেই, তাই ওই শব্দগুলো ফাঁকা হিসেবে সেভ না করে আপনার জন্য গুনে দেওয়া হয়। OCR-সহ “PDF থেকে Word” সেই লেখা পুরোপুরি দেয়।
কত সময় লাগে?
প্রতি পেজে কয়েক সেকেন্ড, কারণ পড়ার কাজটি কোনো সার্ভার ফার্ম নয়, আপনার নিজের ডিভাইস করছে। অগ্রগতি পেজ ধরে ধরে দেখানো হয়।
জেনে রাখুন: চীনা, জাপানি ও কোরিয়ান শব্দ টেক্সট লেয়ার থেকে বাদ রাখা হয় এবং ফাঁকা হিসেবে সেভ না করে আপনার জন্য গুনে দেওয়া হয়, যতদিন না সেগুলোর ফন্ট যোগ হয়; রিডার যে অন্য সব হরফ চেনে, সেগুলো লেখা হয়। ছবি, লোগো ও সই উপেক্ষা করা হয়, যাতে সেগুলো কখনো অর্থহীন লেখায় পরিণত না হয়। কোনো সাধারণ OCR টুলই হাতের লেখা নির্ভরযোগ্যভাবে শনাক্ত করতে পারে না।
এই টুলটি আপনার ওয়েবসাইটে যোগ করুন
যেকোনো ব্লগ, ক্লাসের পেজ বা হেল্প আর্টিকেলের জন্য ফ্রি। একটি স্নিপেট পেস্ট করলেই আপনার ভিজিটররা আপনার পেজেই এটি ব্যবহার করতে পারবেন।