Dlaczego wasze dokumenty pozostają niewidoczne
Tekst PDF-a nie jest zapisany otwartym tekstem. Tkwi w skompresowanych strumieniach treści, kodowanych osobno dla każdego kroju pisma. Pliki Office od 2007 roku to kontenery ZIP ze skompresowanym XML-em w środku. Wyszukiwanie czytające surowe bajty takich plików z zasady nie znajdzie w nich nic — i właśnie dlatego tyle osób jest przekonanych, że dokumentu „nie ma na tym komputerze”, choć leżał tam cały czas.
- PDF — tekst tkwi w strumieniach skompresowanych FlateDecode
- DOCX, XLSX, PPTX — kontenery ZIP ze skompresowanym XML-em
- ODT, ODS, ODP — ta sama zasada, inny XML
- Wyszukiwanie Windows — indeksuje tylko wybrane foldery i pomija całe dyski
📄 Znaleźć dokument, a nie tylko nazwę pliku
Deskora przeszukuje PDF, Word, Excel, PowerPoint i OpenDocument — na wszystkich dyskach.
Pobierz Deskorę za darmoKtóre formaty są przeszukiwane
Deskora wydobywa czytelny tekst dokumentu i przeszukuje właśnie jego. Oto co jest objęte — i co świadomie nie.
| Format | Co jest przeszukiwane |
|---|---|
| PDF (.pdf) | Pełny tekst stron, także ze skompresowanych strumieni i fontów CID. Podawany jest numer strony. |
| Word (.docx, .docm) | Tekst główny, tabele, nagłówki, stopki, przypisy. Tekst usunięty w śledzeniu zmian jest pomijany. |
| Excel (.xlsx, .xlsm) | Wszystkie komórki wszystkich arkuszy. Podawana jest nazwa arkusza. |
| PowerPoint (.pptx, .ppsx) | Cały tekst slajdów, w kolejności. Podawany jest numer slajdu. |
| OpenDocument (.odt) | Pełny tekst wraz z nagłówkami i tabelami. |
| OpenDocument (.ods) | Wszystkie komórki wszystkich tabel. Podawana jest nazwa tabeli. |
| OpenDocument (.odp) | Cały tekst slajdów. Podawana jest nazwa slajdu. |
| RTF (.rtf) | Pełny tekst, ze słowami sterującymi i kodami znaków rozwiniętymi. |
| TXT, LOG, CSV, XML, JSON | Przeszukiwane bezpośrednio, bajt po bajcie — szybka ścieżka, bez zmian. |
| .doc, .xls, .msg | Nieobsługiwane. Stare formaty binarne i kontenery pocztowe to osobny temat i świadomie zostają poza zakresem, zamiast być zrobione połowicznie. |
Jak to działa
Wydobycie tekstu jest kosztowne, dlatego odbywa się raz. Potem tekst leży skompresowany w indeksie, a każde kolejne wyszukiwanie działa jak wyszukiwanie w zwykłym tekście.
🔍 Wydobycie tekstu
Strumienie PDF są rozpakowywane i dekodowane przez tablice fontów; pliki Office są rozpakowywane, a ich XML czytany poprawnie — wraz z encjami i podziałem akapitów.
💾 Trwały indeks
Wydobyty tekst jest przechowywany w postaci skompresowanej. Ponowne wydobycie następuje tylko wtedy, gdy zmieni się rozmiar lub data pliku.
🌙 Ciche budowanie w tle
Najniższy priorytet wątku i wejścia/wyjścia, w każdej chwili przerywalne. Nie powinniście tego zauważyć.
📄 Prawdziwe miejsca trafień
Trafienie wskazuje stronę 7, arkusz „Przychody” albo slajd 3 — nie bezsensowny numer wiersza.
Deskora w porównaniu
Uczciwe porównanie. Deskora to darmowe oprogramowanie desktopowe, a nie prawnicza platforma e-discovery — i nie udaje takiej.
| Deskora | Wyszukiwanie Windows | Agent Ransack | dtSearch | |
|---|---|---|---|---|
| Szuka wewnątrz PDF | Tak | Tylko zaindeksowane foldery | Tak | Tak |
| Szuka wewnątrz plików Office | Tak | Tylko zaindeksowane foldery | Tak | Tak |
| Obejmuje wszystkie dyski | Tak | Nie | Tak | Tak |
| Wyrażenia regularne | Tak | Nie | Tak | Tak |
| Podaje stronę / arkusz / slajd | Tak | Nie | Nie | Tak |
| Cena | Za darmo | W zestawie | Za darmo / płatne | Od kilkuset euro |
Dla kogo to jest
⚖️ Kancelarie prawne i biura rachunkowe
Sygnatura akt bywa w nagłówku PDF-a, w trzecim arkuszu zestawienia i w zeskanowanej umowie. Po nazwie pliku nie znajdziecie żadnej. Po treści — wszystkie trzy, wraz ze wskazaniem strony do otwarcia.
🔬 Nauka i studia
Setki artykułów, dziesiątki zbiorów danych, notatki w trzech formatach. „W którym artykule była ta metoda?” to pytanie o treść i powinno zająć sekundę, a nie popołudnie.
🔧 Dokumentacja techniczna
Numery części i kody błędów są w instrukcjach, nie w nazwach ich plików. Wyszukiwanie zaglądające do środka zamienia folder PDF-ów w bazę wiedzy.
Wasze dokumenty zostają na waszym komputerze
Wydobycie tekstu odbywa się w całości lokalnie. Nic nie jest wysyłane, nic nie trafia na serwer, nie trzeba konta. Indeks dokumentów można całkiem wyłączyć, ograniczyć do wybranych folderów albo uzupełnić o wykluczenia — program, który zna wszystkie dyski, musi pozwolić wam wyznaczyć granicę.
Najczęstsze pytania
Czy znajdzie tekst w zeskanowanych PDF-ach?
Nie. Zeskanowany PDF to obraz tekstu, a nie tekst. Potrzebne byłoby rozpoznawanie znaków, czyli zupełnie inny program. Deskora po prostu zgłosi brak trafień, zamiast udawać.
A pliki chronione hasłem?
Są pomijane. Deskora nie próbuje łamać szyfrowania, nawet w powszechnym przypadku pustego hasła użytkownika: tę blokadę ktoś ustawił świadomie.
Czy to spowolni komputer?
Indeks powstaje w tle z najniższym priorytetem i można go przerwać w każdej chwili. Wyszukiwanie w zwykłym tekście pozostaje bez zmian: nadal działa bezpośrednio na pliku, bez kopii.
Ile miejsca zajmuje indeks?
Wydobyty tekst jest przechowywany w postaci skompresowanej i stanowi ułamek objętości dokumentów. Kilka tysięcy dokumentów kosztuje zwykle kilkadziesiąt megabajtów.
Czy działa z pismem niełacińskim?
Tak. Chiński, japoński, cyrylica, arabski i dewanagari są obsługiwane, a wyszukiwanie bez rozróżniania wielkości liter działa też poza ASCII.
Czy mogę używać wyrażeń regularnych?
Tak, w składni ECMAScript. Błędne wyrażenie pokazuje wskazówkę przy polu, zamiast po cichu zawieść.
📄 Znaleźć dokument, a nie tylko nazwę pliku
Deskora przeszukuje PDF, Word, Excel, PowerPoint i OpenDocument — na wszystkich dyskach.
Pobierz Deskorę za darmo