Por qué vuestros documentos siguen invisibles
El texto de un PDF no se guarda en claro: vive en flujos de contenido comprimidos, codificados fuente por fuente. Desde 2007 los archivos de Office son contenedores ZIP con XML comprimido dentro. Una búsqueda que lee los bytes crudos de esos archivos no encuentra nada por principio — y por eso tanta gente está convencida de que un documento «no está en este ordenador» cuando ha estado ahí todo el tiempo.
- PDF — el texto vive en flujos comprimidos con FlateDecode
- DOCX, XLSX, PPTX — contenedores ZIP con XML comprimido
- ODT, ODS, ODP — mismo principio, otro XML
- Búsqueda de Windows — solo indexa carpetas seleccionadas y omite unidades enteras
📄 Encontrar el documento, no solo el nombre del archivo
Deskora busca dentro de PDF, Word, Excel, PowerPoint y OpenDocument — en todas las unidades.
Descargar Deskora gratisQué formatos se examinan
Deskora extrae el texto legible de un documento y busca en él. Esto es lo que cubre — y lo que deliberadamente no.
| Formato | Qué se busca |
|---|---|
| PDF (.pdf) | Texto completo de las páginas, incluidos flujos comprimidos y fuentes CID. Se indica el número de página. |
| Word (.docx, .docm) | Cuerpo del texto, tablas, encabezados, pies y notas. El texto eliminado del control de cambios queda fuera. |
| Excel (.xlsx, .xlsm) | Todas las celdas de todas las hojas. Se indica el nombre de la hoja. |
| PowerPoint (.pptx, .ppsx) | Todo el texto de las diapositivas, en orden. Se indica el número de diapositiva. |
| OpenDocument (.odt) | Texto completo, incluidos títulos y tablas. |
| OpenDocument (.ods) | Todas las celdas de todas las tablas. Se indica el nombre de la tabla. |
| OpenDocument (.odp) | Todo el texto de las diapositivas. Se indica el nombre de la diapositiva. |
| RTF (.rtf) | Texto completo, con palabras de control y códigos de carácter resueltos. |
| TXT, LOG, CSV, XML, JSON | Se busca directamente, byte a byte — la vía rápida, sin cambios. |
| .doc, .xls, .msg | No compatibles. Los formatos binarios antiguos y los contenedores de correo son un tema aparte y se dejan fuera a propósito en lugar de hacerlos a medias. |
Cómo funciona
La extracción es cara, así que ocurre una sola vez. Después el texto queda comprimido en el índice y cada búsqueda posterior se siente como una búsqueda en texto plano.
🔍 Extracción de texto
Los flujos PDF se descomprimen y decodifican mediante las tablas de fuentes; los archivos de Office se desempaquetan y su XML se analiza correctamente — entidades y separación de párrafos incluidas.
💾 Índice persistente
El texto extraído se guarda comprimido. Solo se vuelve a extraer si cambian el tamaño o la fecha del archivo.
🌙 Construcción silenciosa
Prioridad mínima de hilo y de entrada/salida, cancelable en cualquier momento. No deberíais notarlo.
📄 Ubicaciones reales
Un resultado indica página 7, hoja «Ingresos» o diapositiva 3 — no un número de línea sin sentido.
Deskora en comparación
Comparación honesta. Deskora es software de escritorio gratuito, no una plataforma jurídica de e-discovery — y no pretende serlo.
| Deskora | Búsqueda de Windows | Agent Ransack | dtSearch | |
|---|---|---|---|---|
| Busca dentro de PDF | Sí | Solo carpetas indexadas | Sí | Sí |
| Busca dentro de archivos de Office | Sí | Solo carpetas indexadas | Sí | Sí |
| Cubre todas las unidades | Sí | No | Sí | Sí |
| Expresiones regulares | Sí | No | Sí | Sí |
| Indica página / hoja / diapositiva | Sí | No | No | Sí |
| Precio | Gratis | Incluido | Gratis / de pago | Desde varios cientos de euros |
Para quién está pensado
⚖️ Despachos jurídicos y asesorías
Un número de expediente aparece en el encabezado de un PDF, en la tercera hoja de una tabla y en un contrato escaneado. Por el nombre del archivo no se encuentra ninguno. Por el contenido, los tres — con la página que hay que abrir.
🔬 Investigación y estudios
Cientos de artículos, decenas de conjuntos de datos, notas en tres formatos. «¿En qué artículo estaba ese método?» es una pregunta de contenido y debería costar un segundo, no una tarde.
🔧 Documentación técnica
Los números de pieza y los códigos de error están dentro de los manuales, no en sus nombres de archivo. Una búsqueda que lee dentro convierte una carpeta de PDF en una base de conocimiento.
Vuestros documentos se quedan en vuestro ordenador
La extracción se realiza íntegramente en local. Nada se sube, nada se envía a un servidor, no hace falta cuenta. El índice de documentos se puede desactivar por completo, limitar a carpetas concretas o dotar de exclusiones — un programa que conoce todas las unidades tiene que dejaros trazar el límite.
Preguntas frecuentes
¿Encuentra texto en PDF escaneados?
No. Un PDF escaneado es una imagen de texto, no texto. Haría falta reconocimiento óptico, que es otro tipo de programa. Deskora informará simplemente de que no hay resultados en lugar de fingir.
¿Y los archivos protegidos con contraseña?
Se omiten. Deskora no intenta romper el cifrado, ni siquiera en el caso habitual de contraseña de usuario vacía: ese bloqueo lo puso alguien a propósito.
¿Ralentiza el ordenador?
El índice se construye en segundo plano con la prioridad más baja y se puede cancelar en cualquier momento. La búsqueda en texto plano no cambia: sigue trabajando directamente sobre el archivo, sin copia.
¿Cuánto espacio ocupa el índice?
El texto extraído se guarda comprimido y es una fracción de los documentos. Unos miles de documentos suelen costar unas decenas de megabytes.
¿Funciona con escrituras no latinas?
Sí. Chino, japonés, cirílico, árabe y devanagari se procesan, y la búsqueda sin distinguir mayúsculas funciona más allá de ASCII.
¿Puedo usar expresiones regulares?
Sí, con sintaxis ECMAScript. Una expresión no válida muestra un aviso junto al campo en lugar de fallar en silencio.
📄 Encontrar el documento, no solo el nombre del archivo
Deskora busca dentro de PDF, Word, Excel, PowerPoint y OpenDocument — en todas las unidades.
Descargar Deskora gratis