Pourquoi vos documents restent invisibles
Le texte d'un PDF n'est pas stocké en clair. Il réside dans des flux de contenu compressés, encodés police par police. Depuis 2007, les fichiers Office sont des conteneurs ZIP contenant du XML compressé. Une recherche qui lit les octets bruts de ces fichiers n'y trouve rien par principe — et c'est précisément pour cela que tant de personnes sont convaincues qu'un document « n'est pas sur cet ordinateur » alors qu'il y a toujours été.
- PDF — le texte réside dans des flux compressés en FlateDecode
- DOCX, XLSX, PPTX — conteneurs ZIP renfermant du XML compressé
- ODT, ODS, ODP — même principe, XML différent
- Recherche Windows — n'indexe que certains dossiers et ignore des disques entiers
📄 Trouver le document, pas seulement son nom
Deskora recherche dans les fichiers PDF, Word, Excel, PowerPoint et OpenDocument — sur tous les disques.
Télécharger Deskora gratuitementQuels formats sont examinés
Deskora extrait le texte lisible d'un document puis le recherche. Voici ce qui est couvert — et ce qui ne l'est délibérément pas.
| Format | Ce qui est recherché |
|---|---|
| PDF (.pdf) | Texte complet des pages, y compris flux compressés et polices CID. Le numéro de page est indiqué. |
| Word (.docx, .docm) | Corps du texte, tableaux, en-têtes, pieds de page, notes. Le texte supprimé du suivi des modifications est exclu. |
| Excel (.xlsx, .xlsm) | Toutes les cellules de toutes les feuilles. Le nom de la feuille est indiqué. |
| PowerPoint (.pptx, .ppsx) | Tout le texte des diapositives, dans l'ordre. Le numéro de diapositive est indiqué. |
| OpenDocument (.odt) | Texte complet, titres et tableaux compris. |
| OpenDocument (.ods) | Toutes les cellules de tous les tableaux. Le nom du tableau est indiqué. |
| OpenDocument (.odp) | Tout le texte des diapositives. Le nom de la diapositive est indiqué. |
| RTF (.rtf) | Texte complet, mots de contrôle et codes de caractères résolus. |
| TXT, LOG, CSV, XML, JSON | Recherché directement, octet par octet — le chemin rapide, inchangé. |
| .doc, .xls, .msg | Non pris en charge. Les anciens formats binaires et les conteneurs de courrier sont un sujet à part, délibérément laissé de côté plutôt que traité à moitié. |
Comment cela fonctionne
L'extraction coûte cher, elle n'a donc lieu qu'une fois. Ensuite le texte réside compressé dans l'index, et chaque recherche suivante donne la sensation d'une recherche en texte brut.
🔍 Extraction du texte
Les flux PDF sont décompressés et décodés via les tables de polices ; les fichiers Office sont dépaquetés et leur XML correctement analysé — entités et séparations de paragraphes comprises.
💾 Index persistant
Le texte extrait est mis en cache et compressé. Il n'est réextrait que si la taille ou la date du fichier change.
🌙 Construction discrète
Priorité de thread et d'E/S la plus basse, interruptible à tout moment. Vous ne devez rien remarquer.
📄 Localisation réelle
Un résultat indique la page 7, la feuille « Chiffre d'affaires » ou la diapositive 3 — pas un numéro de ligne dénué de sens.
Deskora en comparaison
Comparaison honnête. Deskora est un logiciel de bureau gratuit, pas une plateforme d'e-discovery juridique — et ne prétend pas l'être.
| Deskora | Recherche Windows | Agent Ransack | dtSearch | |
|---|---|---|---|---|
| Recherche dans les PDF | Oui | Dossiers indexés uniquement | Oui | Oui |
| Recherche dans les fichiers Office | Oui | Dossiers indexés uniquement | Oui | Oui |
| Couvre tous les disques | Oui | Non | Oui | Oui |
| Expressions régulières | Oui | Non | Oui | Oui |
| Indique page / feuille / diapositive | Oui | Non | Non | Oui |
| Prix | Gratuit | Inclus | Gratuit / payant | À partir de plusieurs centaines d'euros |
À qui cela s'adresse
⚖️ Cabinets juridiques et comptables
Une référence de dossier figure dans l'en-tête d'un PDF, dans la troisième feuille d'un tableur et dans un contrat numérisé. Le nom de fichier n'en révèle aucun. Le contenu les révèle tous les trois, en indiquant la page à ouvrir.
🔬 Recherche et études
Des centaines d'articles, des dizaines de jeux de données, des notes dans trois formats. « Dans quel article se trouvait cette méthode ? » est une question de contenu, et elle devrait prendre une seconde, pas un après-midi.
🔧 Documentation technique
Les références de pièces et les codes d'erreur sont dans les manuels, pas dans leurs noms de fichiers. Une recherche qui lit à l'intérieur transforme un dossier de PDF en base de connaissances.
Vos documents restent sur votre ordinateur
L'extraction s'effectue entièrement en local. Rien n'est téléversé, rien n'est envoyé à un serveur, aucun compte n'est requis. L'index de documents peut être désactivé, limité à certains dossiers ou assorti d'exclusions — un programme qui connaît tous vos disques doit vous laisser tracer la limite.
Questions fréquentes
Trouve-t-il le texte des PDF numérisés ?
Non. Un PDF numérisé est une image de texte, pas du texte. Cela exigerait de la reconnaissance optique, un tout autre programme. Deskora signalera simplement l'absence de résultat plutôt que de faire semblant.
Et les fichiers protégés par mot de passe ?
Ils sont ignorés. Deskora ne tente pas de casser le chiffrement, pas même dans le cas courant d'un mot de passe utilisateur vide : ce verrou a été posé volontairement.
Cela ralentit-il l'ordinateur ?
L'index est construit en arrière-plan à la priorité la plus basse et peut être interrompu à tout moment. La recherche en texte brut reste inchangée : elle s'exécute toujours directement sur le fichier, sans copie.
Quelle place occupe l'index ?
Le texte extrait est stocké compressé et ne représente qu'une fraction des documents. Quelques milliers de documents coûtent typiquement quelques dizaines de mégaoctets.
Cela fonctionne-t-il avec des écritures non latines ?
Oui. Chinois, japonais, cyrillique, arabe et devanagari sont pris en charge, et la recherche insensible à la casse fonctionne au-delà de l'ASCII — « МОСКВА » trouve « Москва ».
Puis-je utiliser des expressions régulières ?
Oui, en syntaxe ECMAScript. Une expression invalide affiche un avertissement à côté du champ au lieu d'échouer en silence.
📄 Trouver le document, pas seulement son nom
Deskora recherche dans les fichiers PDF, Word, Excel, PowerPoint et OpenDocument — sur tous les disques.
Télécharger Deskora gratuitement