Lire le bangla sur une image
Donnez-lui la photo d'une page, un scan ou une capture d'écran, et récupérez le texte bengali en Unicode — interrogeable, modifiable et prêt à coller. Le lecteur est réglé sur le bangla avant même l'arrivée de l'image : rien à détecter, rien à choisir. Votre image n'est jamais conservée.
- Jamais conservé
- Pas de file d'attente, pas d'attente
- Sans inscription, sans filigrane
Comment ça marche
Ajoutez l'image
La photo d'une page de livre, une vieille circulaire, un certificat scanné ou une capture d'écran de texte bangla. JPG, PNG, WebP, HEIC et TIFF sont tous acceptés ; une photo prise de biais est d'abord redressée.
Laissez-le lire
Le bengali est déjà sélectionné. Si la page contient aussi de l'anglais — un formulaire, un en-tête — ajoutez-le depuis la liste et les deux sont lus.
Copiez en Unicode
Le texte ressort en Unicode, quelle que soit la police d'origine : une circulaire en SutonnyMJ se lit comme du bangla ordinaire, pas comme « evsjv‡`k ». Conservez la mise en page ou fusionnez les lignes, puis copiez ou téléchargez.
Ce que le bangla change à la lecture
Le modèle bengali lit des groupes plutôt que des lettres. Une ligature comme ক্ষ ou ন্ত্র est une seule forme sur la page, et le modèle doit décider à la fois ce qu'elle est et comment elle se décompose en Unicode — c'est pourquoi une erreur de lecture en bangla produit généralement une mauvaise ligature ou un signe vocalique sur la mauvaise lettre, plutôt qu'une lettre franchement fausse. La sortie respecte l'ordre attendu par Unicode : un signe vocalique suit son groupe de consonnes, un reph s'écrit র + hasanta avant le groupe qu'il surmonte, et les voyelles en deux parties ressortent en un seul point de code. C'est l'ordre qu'attendent tous les champs de recherche, correcteurs orthographiques et polices, et c'est l'inverse de l'ordre visuel dans lequel travaille une personne qui tape en Bijoy.
Tout ce que fait le lecteur ordinaire est fait ici aussi : le papier est uniformisé, la page redressée, les tableaux à bordures lus cellule par cellule pour qu'un libellé et sa valeur restent séparés, et le résultat revient soit disposé comme la page, soit fusionné en paragraphes. Les nombres sont lus en chiffres bengalis quand ils sont imprimés en chiffres bengalis ; un formulaire qui mélange ০১২ et 012 garde les deux.
Le bengali ne partage son modèle avec aucune autre langue, mais l'image peut tout de même contenir de l'anglais — un en-tête, un numéro de référence, un bloc de signature — et chaque langue lit l'autre comme du charabia. Ajouter l'anglais depuis la liste fait lire la page avec les deux packs et garde chaque mot dans l'écriture où il a été imprimé.
Si vous cherchez autre chose
Un document Bijoy qui existe encore sous forme de fichier gagne à être converti plutôt que photographié. L'OCR reconstruit le texte à partir de pixels et se trompe sur quelques caractères sur mille, même sur la meilleure page ; le convertisseur Bijoy en Unicode le reconstruit à partir des frappes de clavier, sans une seule erreur, et conserve le gras et les tableaux. Ne photographiez une page que lorsque le fichier a disparu.
Pour un livre entier ou une archive de scans, un outil de bureau est le bon format : un outil d'OCR en ligne de commande doté du même modèle bengali lit un dossier entier pendant la nuit, et OCRmyPDF ajoute une couche de texte interrogeable à chacun de ses PDF. Cette page est faite pour la page que vous avez sous les yeux.
Questions fréquentes
Mon image est-elle conservée quelque part ?
Non. Le pack de langue est téléchargé depuis ce site la première fois que vous utilisez une langue ; l'image elle-même n'est jamais conservée ni envoyée nulle part, et l'outil fonctionne donc même avec le Wi-Fi coupé.
Quelle est la qualité de lecture du bangla ?
Du bangla imprimé dans une police courante — SutonnyMJ, Nikosh, Kalpurush, SolaimanLipi, un livre ou un journal — photographié de face et au point se lit bien, avec çà et là une ligature erronée sur une page floue ou passée. Les erreurs sont propres à l'écriture : un reph ou un signe vocalique sur une lettre que le modèle n'a pas vue sous cette forme, et des ligatures imprimées en petit. Un scan net à 300 dpi se lit mieux qu'une photo de téléphone, et une photo de téléphone à la lumière du jour mieux qu'une photo sous un néon.
Fonctionne-t-il sur un document Bijoy ?
Oui, et c'est l'un de ses meilleurs usages. L'OCR lit l'image des lettres, pas les points de code de la police : une page tapée en SutonnyMJ ressort donc directement en bangla Unicode, sans conversion. Pour un fichier Word encore en Bijoy (du texte, pas une image), utilisez plutôt Bijoy en Unicode, qui conserve la mise en forme et ne fait aucune erreur de lecture.
Pourquoi une page à part pour le bangla ?
Parce que la détection prend du temps et se trompe plus souvent sur le bangla que sur d'autres écritures : une page avec un en-tête en caractères latins, un tampon ou un numéro peut être lue comme de l'anglais, et le résultat est une page entière de charabia affirmé avec assurance. Régler la langue avant l'arrivée de l'image, c'est lancer le téléchargement du pack bengali dès l'ouverture de la page, et le lecteur n'essaie jamais la mauvaise langue. La page Image en texte ordinaire fait le même travail avec la détection activée, pour des images dans n'importe quelle langue.
Peut-il lire l'écriture manuscrite ?
Les capitales détachées, parfois ; l'écriture cursive liée, non, en bangla comme dans toute autre écriture — c'est vrai de tous les outils d'OCR généralistes. La page Reconnaissance d'écriture manuscrite le dit clairement et montre ce qu'elle a réussi à lire.
Et un PDF scanné ?
Pour un document entier, utilisez PDF bangla en Word : il lit chaque page de la même façon et vous donne un .docx. Cette page est faite pour une seule image.
Bon à savoir : Texte imprimé uniquement : l'écriture cursive liée n'est pas reconnue. Les polices bangla décoratives, le texte sur une photo et l'impression très passée donnent un résultat lacunaire. L'assamais est un pack à part — ajoutez-le depuis la liste si la page est en assamais. Le résultat est du texte brut : le gras, les couleurs et l'image elle-même ne sont pas repris.
Intégrez cet outil à votre site
Gratuit pour tout blog, page de cours ou article d'aide. Collez un seul extrait de code et vos visiteurs pourront l'utiliser directement sur votre page.
Outils associés
Image en texte
Le texte d'une image, dans plus de 120 langues
PDF bangla en Word
Des PDF bengalis en .docx modifiable, scannés ou non
Bijoy en Unicode
Lisez du texte SutonnyMJ en vrai bengali
OCR PDF
Rendez un scan interrogeable
OCR de capture d'écran
Collez une capture d'écran, récupérez le texte
Reconnaissance d'écriture manuscrite
L'écriture en capitales, lue honnêtement