OCR PDF
OCR PDF rend le texte d'un PDF scanné consultable par recherche et sélectionnable, en effectuant la reconnaissance de texte entièrement dans le navigateur plutôt que d'envoyer le fichier vers un serveur.
Le PDF reste sur cet appareil et est traité localement dans votre navigateur, y compris la reconnaissance de texte et la détection de langue.
Chaque page sélectionnée est rasterisée, puis lue par un moteur de reconnaissance de texte Tesseract.js local (sans envoi, sans service externe). Le résultat est du texte brut uniquement — cela ne génère pas de PDF consultable avec une couche de texte intégrée.
Limites : un PDF de 25 Mo maximum et 200 pages ; jusqu'à 10 pages peuvent être reconnues par opération, chacune rendue à environ 144 DPI, plafonnée pour rester sûre en mémoire sur mobile. Les PDF chiffrés ou protégés par mot de passe sont refusés.
Comment l'utiliser
- Sélectionnez un PDF scanné sur votre appareil et attendez la détection des pages.
- Choisissez de reconnaître toutes les pages ou saisissez des pages précises comme 1,3,5-8, puis sélectionnez la langue du document.
- Lancez la reconnaissance et attendez la fin du traitement dans le moteur Tesseract.js local.
- Copiez le texte reconnu ou téléchargez-le en fichier .txt.
Chaque page sélectionnée est rasterisée localement avec le même moteur de rendu PDF utilisé ailleurs dans Tooliba, puis lue par un moteur de reconnaissance de texte Tesseract.js local — le script worker, le moteur WASM et les données de langue anglais/français sont des ressources same-origin intégrées, jamais récupérées depuis un CDN. Choisissez l'anglais, le français, ou les deux avant de lancer l'opération, car la précision de reconnaissance dépend du choix des langues réelles du document ; un mauvais choix augmente le taux de caractères mal reconnus. Cette première version produit uniquement du texte brut reconnu, proposé à la copie dans le presse-papiers ou au téléchargement en fichier .txt — elle ne génère pas de nouveau PDF consultable avec une couche de texte invisible intégrée, et la précision dépend toujours de la qualité et de la résolution du scan. Aucune image ni donnée textuelle n'est envoyée à Tooliba, conservée après la session, ni incluse dans les données analytiques.
FAQ
Non. Cette version produit uniquement du texte brut reconnu, à copier ou télécharger en fichier .txt — les pages du PDF d'origine ne sont pas modifiées.
L'anglais, le français, ou les deux pour un document qui mélange les deux — la précision dépend du choix des langues réelles du document.
Non. Les pages sont rasterisées et reconnues entièrement dans votre navigateur grâce à un moteur Tesseract.js local et same-origin ; rien n'est envoyé à Tooliba ni à un service tiers.