Convertir un PDF bangla en Word
Un PDF bengali — une circulaire, un formulaire, un chapitre de livre, un scan — en .docx modifiable, avec les ligatures et les signes vocaliques dans le bon ordre et l'OCR réglée sur le bangla pour les pages scannées. Rien n'est conservé.
- Jamais conservé
- Pas de file d'attente, pas d'attente
- Sans inscription, sans filigrane
Comment ça marche
Ajoutez votre PDF
Un PDF texte ou un scan. L'outil examine la première page et active l'OCR pour un scan ; le lecteur est déjà réglé sur le bengali.
Choisissez le mode
Texte modifiable donne un document Word normal, page pour page. Aspect identique fixe chaque ligne à sa place par-dessus une image de la page, pour imprimer plutôt que modifier.
Convertissez et téléchargez
Un .docx dans une police bangla Unicode, avec titres, paragraphes, images et liens.
Ce qui est différent dans un PDF bangla
La remise en ordre est tout l'enjeu. Une couche de texte PDF contient des glyphes dans l'ordre de dessin, et le rendu du bangla dessine les signes vocaliques antéposés (ি, ে, ৈ) avant la consonne et scinde ো et ৌ en deux glyphes de part et d'autre ; le texte que donne un extracteur ordinaire est donc « স্ব␃াভািবক » là où la page dit « স্বাভাবিক ». Chaque ligne est remise en ordre logique — signe vocalique après son groupe, reph sous la forme র্ avant le groupe qu'il surmonte, voyelles en deux parties en un seul point de code — avant toute autre chose. La sortie de l'OCR n'a besoin de rien de tout cela, car la lecture produit d'elle-même l'ordre logique.
Titres, paragraphes, liens, images et sauts de page sont déterminés exactement comme sur la page PDF en Word générale : les mots qui partagent une ligne de base forment une ligne, un espace qui s'élargit ouvre un paragraphe, une ligne courte à 1,6 fois la taille du corps de texte est un titre, et une annotation de lien devient un lien hypertexte Word. Aspect identique rend les éléments graphiques de la page à 144 DPI et place le vrai texte par-dessus ; Texte modifiable reconstruit des paragraphes propres dans l'ordre de lecture.
Les chiffres bengalis restent des chiffres bengalis, et un mot en caractères latins sur la page — une adresse e-mail, un numéro de référence — reste en caractères latins. Pour un scan, c'est le pack bengali qui est chargé : une page de bangla avec un en-tête en anglais est lue correctement pour le bangla, mais l'en-tête peut ressortir en charabia aux allures de bangla ; ajoutez l'anglais dans la liste des langues si l'anglais compte.
Si vous cherchez autre chose
Un PDF issu d'un fichier Word est une reconstruction en attente ; demandez le .docx si vous le pouvez. Et un .docx Bijoy gagne à être converti avec Bijoy en Unicode plutôt qu'imprimé en PDF puis reconverti — les frappes se convertissent sans une seule erreur, la mise en forme est conservée, et rien n'est relu à partir de pixels.
Pour une archive de livres bangla scannés, un outil d'OCR de bureau doté du modèle bengali lit un dossier entier pendant la nuit, et OCRmyPDF ajoute une couche interrogeable à chaque PDF sans en changer l'aspect — le bon format d'outil pour des centaines de fichiers, là où cette page est faite pour un seul.
Questions fréquentes
Mon PDF est-il conservé ?
Non. Rien n'est conservé ; le fichier n'est jamais gardé. Pour un scan, le lecteur et le pack bengali sont chargés une fois depuis ce site et gardés pour la fois suivante — le document lui-même ne va nulle part.
Pourquoi le bangla extrait d'un PDF ressort-il généralement mal orthographié ?
Parce qu'un PDF enregistre les glyphes dans l'ordre où ils sont dessinés, ce qui, pour le bangla, est l'ordre visuel : le i-kar est dessiné avant la consonne qu'il suit, et les deux moitiés de ো se placent de part et d'autre. La plupart des convertisseurs recopient cet ordre tel quel, si bien que বাংলাদেশ ressort avec ses signes vocaliques devant les mauvaises lettres et que chaque mot est mal orthographié d'une façon qu'aucun correcteur ne peut réparer. Ce convertisseur remet les signes là où Unicode les attend — la même remise en ordre dont tout PDF bangla a besoin, y compris ceux produits par ce site.
Prend-il en charge un PDF issu d'un document Bijoy ?
Si le PDF a une couche de texte en SutonnyMJ, le texte ressort en frappes Bijoy, parce que c'est ce que contient le fichier ; passez le résultat dans Bijoy en Unicode et la mise en forme est conservée. Si le PDF est un scan, l'OCR lit l'image et donne directement de l'Unicode.
Quelle est la qualité de l'OCR sur les scans bangla ?
Des scans propres à 300 dpi de bangla imprimé se lisent bien ; les photocopies passées et les photos de téléphone perdent des ligatures. La langue est fixée au bengali sur cette page : un en-tête en caractères latins ou un numéro de référence ne peut donc pas faire basculer le lecteur en anglais pour toute la page. Les pages scannées de travers sont d'abord redressées.
Quel format Word est produit ?
Un .docx standard, composé dans une police bangla Unicode, qui s'ouvre dans Word, Google Docs et LibreOffice. Le texte est du vrai Unicode : interrogeable, et modifiable avec Avro ou Ridmik.
Et les tableaux et les formulaires ?
Les formulaires à lignes tracées d'un scan deviennent de vrais tableaux Word en mode Texte modifiable. Les tableaux d'un PDF texte ressortent en texte positionné, comme avec tous les convertisseurs PDF en Word — pour un tableur, PDF en Excel est le meilleur outil.
Bon à savoir : Les polices sont remplacées : le .docx utilise une police bangla Unicode, pas celle du PDF, et l'aspect est donc proche plutôt qu'identique. Les PDF texte composés dans une police Bijoy se convertissent en frappes Bijoy et demandent ensuite le convertisseur Bijoy en Unicode. L'OCR ignore les photos et les logos, laisse l'écriture manuscrite sous forme d'image et prend quelques secondes par page, car c'est votre propre appareil qui fait la lecture.
Intégrez cet outil à votre site
Gratuit pour tout blog, page de cours ou article d'aide. Collez un seul extrait de code et vos visiteurs pourront l'utiliser directement sur votre page.
Outils associés
PDF en Word
En .docx modifiable, avec OCR pour les scans
OCR bangla
Lisez le texte bengali d'une image ou d'un scan
Bijoy en Unicode
Lisez du texte SutonnyMJ en vrai bengali
PDF en texte
Du texte brut à copier et modifier
PDF en Excel
Des tableaux dans un vrai classeur
PDF en PowerPoint
Des diapositives modifiables à partir de n'importe quel PDF