Perché i vostri documenti restano invisibili
Il testo di un PDF non è memorizzato in chiaro: si trova in flussi di contenuto compressi, codificati carattere per carattere. Dal 2007 i file Office sono contenitori ZIP con XML compresso all'interno. Una ricerca che legge i byte grezzi di questi file per principio non trova nulla — ed è esattamente per questo che tante persone sono convinte che un documento «non sia su questo computer» mentre c'è sempre stato.
- PDF — il testo risiede in flussi compressi con FlateDecode
- DOCX, XLSX, PPTX — contenitori ZIP con XML compresso
- ODT, ODS, ODP — stesso principio, XML diverso
- Ricerca di Windows — indicizza solo cartelle selezionate e salta interi dischi
📄 Trovare il documento, non solo il nome del file
Deskora cerca dentro PDF, Word, Excel, PowerPoint e OpenDocument — su tutti i dischi.
Scarica Deskora gratisQuali formati vengono esaminati
Deskora estrae il testo leggibile di un documento e cerca in quello. Ecco cosa è coperto — e cosa deliberatamente no.
| Formato | Cosa viene cercato |
|---|---|
| PDF (.pdf) | Testo completo delle pagine, inclusi flussi compressi e font CID. Viene indicato il numero di pagina. |
| Word (.docx, .docm) | Corpo del testo, tabelle, intestazioni, piè di pagina, note. Il testo eliminato dalle revisioni è escluso. |
| Excel (.xlsx, .xlsm) | Tutte le celle di tutti i fogli. Viene indicato il nome del foglio. |
| PowerPoint (.pptx, .ppsx) | Tutto il testo delle diapositive, in ordine. Viene indicato il numero della diapositiva. |
| OpenDocument (.odt) | Testo completo, inclusi titoli e tabelle. |
| OpenDocument (.ods) | Tutte le celle di tutte le tabelle. Viene indicato il nome della tabella. |
| OpenDocument (.odp) | Tutto il testo delle diapositive. Viene indicato il nome della diapositiva. |
| RTF (.rtf) | Testo completo, con parole di controllo e codici carattere risolti. |
| TXT, LOG, CSV, XML, JSON | Cercato direttamente, byte per byte — il percorso veloce, invariato. |
| .doc, .xls, .msg | Non supportati. I vecchi formati binari e i contenitori di posta sono un tema a sé e vengono deliberatamente esclusi anziché affrontati a metà. |
Come funziona
L'estrazione è costosa, quindi avviene una sola volta. Poi il testo resta compresso nell'indice e ogni ricerca successiva sembra una ricerca in testo semplice.
🔍 Estrazione del testo
I flussi PDF vengono decompressi e decodificati tramite le tabelle dei font; i file Office vengono spacchettati e il loro XML letto correttamente — entità e separazione dei paragrafi comprese.
💾 Indice persistente
Il testo estratto viene memorizzato compresso. Viene riestratto solo se cambiano dimensione o data del file.
🌙 Costruzione silenziosa
Priorità di thread e I/O minima, interrompibile in qualunque momento. Non dovete accorgervene.
📄 Posizioni reali
Un risultato indica pagina 7, foglio «Fatturato» o diapositiva 3 — non un numero di riga privo di significato.
Deskora a confronto
Confronto onesto. Deskora è software desktop gratuito, non una piattaforma legale di e-discovery — e non finge di esserlo.
| Deskora | Ricerca di Windows | Agent Ransack | dtSearch | |
|---|---|---|---|---|
| Cerca dentro i PDF | Sì | Solo cartelle indicizzate | Sì | Sì |
| Cerca dentro i file Office | Sì | Solo cartelle indicizzate | Sì | Sì |
| Copre tutti i dischi | Sì | No | Sì | Sì |
| Espressioni regolari | Sì | No | Sì | Sì |
| Indica pagina / foglio / diapositiva | Sì | No | No | Sì |
| Prezzo | Gratuito | Incluso | Gratuito / a pagamento | Da diverse centinaia di euro |
A chi serve
⚖️ Studi legali e commercialisti
Un numero di pratica compare nell'intestazione di un PDF, nel terzo foglio di un prospetto e in un contratto scansionato. Il nome del file non ne rivela nessuno. Il contenuto li rivela tutti e tre, indicando anche quale pagina aprire.
🔬 Ricerca e studio
Centinaia di articoli, decine di dataset, appunti in tre formati. «In quale articolo c'era quel metodo?» è una domanda di contenuto e dovrebbe richiedere un secondo, non un pomeriggio.
🔧 Documentazione tecnica
Codici articolo e codici di errore stanno nei manuali, non nei loro nomi di file. Una ricerca che legge dentro il manuale trasforma una cartella di PDF in una base di conoscenza.
I vostri documenti restano sul vostro computer
L'estrazione avviene interamente in locale. Nulla viene caricato, nulla inviato a un server, nessun account richiesto. L'indice dei documenti può essere disattivato del tutto, limitato a cartelle selezionate o corredato di esclusioni — un programma che conosce tutti i dischi deve lasciarvi tracciare il confine.
Domande frequenti
Trova il testo nei PDF scansionati?
No. Un PDF scansionato è un'immagine di testo, non testo. Servirebbe il riconoscimento ottico, che è un altro tipo di programma. Deskora segnalerà semplicemente nessun risultato invece di fingere.
E i file protetti da password?
Vengono saltati. Deskora non tenta di forzare la cifratura, nemmeno nel caso diffuso della password utente vuota: quel blocco è stato messo apposta.
Rallenta il computer?
L'indice viene costruito in background alla priorità più bassa ed è interrompibile in qualsiasi momento. La ricerca in testo semplice resta invariata: continua a lavorare direttamente sul file, senza copia.
Quanto spazio occupa l'indice?
Il testo estratto viene memorizzato compresso ed è una frazione dei documenti stessi. Qualche migliaio di documenti costa tipicamente qualche decina di megabyte.
Funziona con scritture non latine?
Sì. Cinese, giapponese, cirillico, arabo e devanagari sono gestiti, e la ricerca senza distinzione tra maiuscole e minuscole funziona anche oltre l'ASCII.
Posso usare espressioni regolari?
Sì, in sintassi ECMAScript. Un'espressione non valida mostra un avviso accanto al campo invece di fallire in silenzio.
📄 Trovare il documento, non solo il nome del file
Deskora cerca dentro PDF, Word, Excel, PowerPoint e OpenDocument — su tutti i dischi.
Scarica Deskora gratis