Почему ваши документы остаются невидимыми
Текст PDF не хранится в открытом виде. Он лежит в сжатых потоках содержимого, закодированный отдельно для каждого шрифта. Файлы Office с 2007 года — это ZIP-контейнеры со сжатым XML внутри. Поиск, читающий сырые байты таких файлов, принципиально ничего в них не найдёт — и именно поэтому так много людей уверены, что документа «нет на этом компьютере», хотя он лежал там всё время.
- PDF — текст лежит в потоках, сжатых FlateDecode
- DOCX, XLSX, PPTX — ZIP-контейнеры со сжатым XML
- ODT, ODS, ODP — тот же принцип, другой XML
- Поиск Windows — индексирует только выбранные папки и пропускает целые диски
📄 Найти документ, а не только имя файла
Deskora ищет внутри PDF, Word, Excel, PowerPoint и OpenDocument — на всех дисках.
Скачать Deskora бесплатноКакие форматы просматриваются
Deskora извлекает читаемый текст документа и ищет именно в нём. Вот что охвачено — и что сознательно нет.
| Формат | Что просматривается |
|---|---|
| PDF (.pdf) | Полный текст страниц, включая сжатые потоки и CID-шрифты. Сообщается номер страницы. |
| Word (.docx, .docm) | Основной текст, таблицы, колонтитулы, сноски. Удалённый текст из рецензирования не попадает. |
| Excel (.xlsx, .xlsm) | Все ячейки всех листов. Сообщается имя листа. |
| PowerPoint (.pptx, .ppsx) | Весь текст слайдов в порядке следования. Сообщается номер слайда. |
| OpenDocument (.odt) | Полный текст, включая заголовки и таблицы. |
| OpenDocument (.ods) | Все ячейки всех таблиц. Сообщается имя таблицы. |
| OpenDocument (.odp) | Весь текст слайдов. Сообщается имя слайда. |
| RTF (.rtf) | Полный текст, управляющие слова и коды символов раскрыты. |
| TXT, LOG, CSV, XML, JSON | Ищется напрямую, байт за байтом — быстрый путь, без изменений. |
| .doc, .xls, .msg | Не поддерживаются. Старые двоичные форматы и почтовые контейнеры — отдельная тема, и они сознательно оставлены за рамками, а не сделаны наполовину. |
Как это работает
Извлечение стоит дорого, поэтому оно происходит один раз. Дальше текст лежит в индексе в сжатом виде, и каждый следующий поиск ощущается как поиск по обычному тексту.
🔍 Извлечение текста
Потоки PDF распаковываются и декодируются через таблицы шрифтов; файлы Office распаковываются, а их XML разбирается правильно — вместе с сущностями и разделением абзацев.
💾 Постоянный индекс
Извлечённый текст хранится в сжатом виде. Повторное извлечение происходит только при изменении размера или даты файла.
🌙 Тихая фоновая сборка
Самый низкий приоритет потока и ввода-вывода, прерывается в любой момент. Вы не должны этого замечать.
📄 Настоящее место находки
Совпадение указывает страницу 7, лист «Выручка» или слайд 3 — а не бессмысленный номер строки.
Deskora в сравнении
Честное сравнение. Deskora — бесплатная настольная программа, а не юридическая платформа e-discovery, и не притворяется ею.
| Deskora | Поиск Windows | Agent Ransack | dtSearch | |
|---|---|---|---|---|
| Ищет внутри PDF | Да | Только проиндексированные папки | Да | Да |
| Ищет внутри файлов Office | Да | Только проиндексированные папки | Да | Да |
| Охватывает все диски | Да | Нет | Да | Да |
| Регулярные выражения | Да | Нет | Да | Да |
| Указывает страницу / лист / слайд | Да | Нет | Нет | Да |
| Цена | Бесплатно | Входит в систему | Бесплатно / платно | От нескольких сотен евро |
Для кого это сделано
⚖️ Юридические и налоговые практики
Номер дела встречается в колонтитуле PDF, на третьем листе таблицы и в отсканированном договоре. По имени файла не найти ни одного. По содержимому — все три, да ещё и с указанием страницы.
🔬 Наука и учёба
Сотни статей, десятки наборов данных, заметки в трёх форматах. «В какой статье был этот метод?» — вопрос о содержимом, и он должен занимать секунду, а не полдня.
🔧 Техническая документация
Артикулы и коды ошибок находятся внутри руководств, а не в их именах. Поиск, заглядывающий внутрь, превращает папку с PDF в базу знаний.
Ваши документы остаются на вашем компьютере
Извлечение текста выполняется полностью локально. Ничего не загружается, ничего не отправляется на сервер, учётная запись не нужна. Индекс документов можно полностью отключить, ограничить выбранными папками или дополнить исключениями — программа, знающая все диски, обязана дать вам провести границу.
Частые вопросы
Найдёт ли он текст в отсканированных PDF?
Нет. Отсканированный PDF — это изображение текста, а не текст. Понадобилось бы распознавание символов, а это программа другого рода. Deskora просто сообщит об отсутствии совпадений, а не сделает вид.
А файлы, защищённые паролем?
Они пропускаются. Deskora не пытается взломать шифрование, даже в распространённом случае пустого пользовательского пароля: эту защиту кто-то поставил намеренно.
Это замедлит компьютер?
Индекс строится в фоне с самым низким приоритетом и прерывается в любой момент. Поиск по обычному тексту не меняется: он по-прежнему работает прямо на файле, без копии.
Сколько места занимает индекс?
Извлечённый текст хранится сжатым и составляет малую долю от самих документов. Несколько тысяч документов обычно стоят несколько десятков мегабайт.
Работает ли это с нелатинскими письменностями?
Да. Китайский, японский, кириллица, арабский и деванагари обрабатываются, а поиск без учёта регистра работает и за пределами ASCII — «МОСКВА» находит «Москва».
Можно ли использовать регулярные выражения?
Да, в синтаксисе ECMAScript. Ошибочное выражение показывает подсказку рядом с полем, а не молча ничего не находит.
📄 Найти документ, а не только имя файла
Deskora ищет внутри PDF, Word, Excel, PowerPoint и OpenDocument — на всех дисках.
Скачать Deskora бесплатно