문서가 보이지 않는 이유
PDF의 본문은 평문으로 저장되지 않습니다. 압축된 콘텐츠 스트림 안에, 글꼴마다 다르게 인코딩되어 들어 있습니다. 2007년 이후의 Office 파일은 압축된 XML을 담은 ZIP 컨테이너입니다. 이런 파일의 원시 바이트를 읽는 검색은 원리상 아무것도 찾을 수 없습니다. 문서가 「이 컴퓨터에 없다」고 확신하는 이유가 바로 여기에 있습니다. 사실은 내내 거기 있었습니다.
- PDF — 본문이 FlateDecode로 압축된 스트림 안에 있음
- DOCX, XLSX, PPTX — 압축 XML을 담은 ZIP 컨테이너
- ODT, ODS, ODP — 같은 원리, 다른 XML
- Windows 검색 — 지정한 폴더만 색인하고 드라이브 전체를 건너뜀
📄 파일 이름이 아니라 문서를 찾으세요
Deskora는 모든 드라이브에서 PDF·Word·Excel·PowerPoint·OpenDocument 내부를 검색합니다.
Deskora 무료 다운로드검색되는 형식
Deskora는 문서에서 읽을 수 있는 텍스트를 추출해 그것을 검색합니다. 다루는 범위와 의도적으로 다루지 않는 범위는 다음과 같습니다.
| 형식 | 검색되는 내용 |
|---|---|
| PDF (.pdf) | 페이지 전문. 압축 스트림과 CID 글꼴 포함. 페이지 번호를 알려 줍니다. |
| Word (.docx, .docm) | 본문, 표, 머리글, 바닥글, 각주. 변경 내용 추적에서 삭제된 텍스트는 제외됩니다. |
| Excel (.xlsx, .xlsm) | 모든 시트의 모든 셀. 시트 이름을 알려 줍니다. |
| PowerPoint (.pptx, .ppsx) | 슬라이드 순서대로 모든 슬라이드 텍스트. 슬라이드 번호를 알려 줍니다. |
| OpenDocument (.odt) | 제목과 표를 포함한 본문 전체. |
| OpenDocument (.ods) | 모든 표의 모든 셀. 표 이름을 알려 줍니다. |
| OpenDocument (.odp) | 모든 슬라이드 텍스트. 슬라이드 이름을 알려 줍니다. |
| RTF (.rtf) | 제어 단어와 문자 코드를 해석한 전체 텍스트. |
| TXT, LOG, CSV, XML, JSON | 바이트 단위로 직접 검색 — 빠른 경로는 그대로입니다. |
| .doc, .xls, .msg | 지원하지 않습니다. 옛 이진 형식과 메일 컨테이너는 별개의 과제이며, 어중간하게 시작하기보다 의도적으로 제외했습니다. |
작동 방식
텍스트 추출은 비용이 큽니다. 그래서 한 번만 합니다. 이후에는 압축된 상태로 색인에 남아, 다음 검색부터는 일반 텍스트 검색과 다르지 않게 느껴집니다.
🔍 텍스트 추출
PDF 스트림을 풀고 글꼴 표를 통해 디코딩합니다. Office 파일은 압축을 풀고 XML을 엔터티와 문단 구분까지 정확히 해석합니다.
💾 영구 색인
추출한 텍스트를 압축해 보관합니다. 파일 크기나 수정 시각이 바뀔 때만 다시 추출합니다.
🌙 조용한 백그라운드 구축
스레드와 입출력 우선순위 최저, 언제든 중단 가능. 눈치채지 못하는 것이 목표입니다.
📄 실제 위치
결과는 7쪽, 「매출」 시트, 3번 슬라이드를 알려 줍니다. 의미 없는 줄 번호가 아닙니다.
Deskora 비교
정직한 비교입니다. Deskora는 무료 데스크톱 소프트웨어이며 법무용 e-discovery 플랫폼이 아닙니다. 그런 척도 하지 않습니다.
| Deskora | Windows 검색 | Agent Ransack | dtSearch | |
|---|---|---|---|---|
| PDF 내부 검색 | 예 | 색인된 폴더만 | 예 | 예 |
| Office 파일 내부 검색 | 예 | 색인된 폴더만 | 예 | 예 |
| 모든 드라이브 포함 | 예 | 아니요 | 예 | 예 |
| 정규식 | 예 | 아니요 | 예 | 예 |
| 페이지 / 시트 / 슬라이드 표시 | 예 | 아니요 | 아니요 | 예 |
| 가격 | 무료 | OS 포함 | 무료 / 유료 | 수백 유로부터 |
이런 분께
⚖️ 법무·세무 사무소
사건 번호가 PDF의 머리글, 스프레드시트의 세 번째 시트, 스캔한 계약서에 흩어져 있습니다. 파일 이름으로는 하나도 찾지 못하지만, 내용으로는 셋 다 찾을 수 있고 어느 쪽을 열어야 하는지까지 알려 줍니다.
🔬 연구와 학습
수백 편의 논문, 수십 개의 데이터셋, 세 가지 형식의 메모. 「그 방법이 어느 논문에 있었지?」는 내용에 대한 질문이며, 오후 내내가 아니라 1초면 끝나야 합니다.
🔧 기술 문서
부품 번호와 오류 코드는 설명서 안에 있지 파일 이름에 있지 않습니다. 안까지 읽는 검색은 PDF 폴더를 지식 베이스로 바꿔 놓습니다.
문서는 컴퓨터 밖으로 나가지 않습니다
텍스트 추출은 전적으로 로컬에서 이뤄집니다. 업로드도, 서버 전송도, 계정도 없습니다. 문서 색인은 완전히 끌 수 있고, 지정한 폴더로 제한하거나 제외 폴더를 설정할 수 있습니다. 모든 드라이브를 아는 프로그램이라면 경계는 사용자가 긋게 해야 합니다.
자주 묻는 질문
스캔한 PDF의 글자도 찾나요?
아니요. 스캔한 PDF는 글자의 이미지이지 글자가 아닙니다. 광학 문자 인식이 필요하고 그것은 다른 종류의 프로그램입니다. Deskora는 그런 척하지 않고 결과 없음을 알립니다.
암호가 걸린 파일은요?
건너뜁니다. Deskora는 암호화를 깨뜨리려 하지 않습니다. 흔한 «사용자 암호가 빈 경우»도 마찬가지입니다. 그 잠금은 만든 사람이 의도해서 건 것입니다.
컴퓨터가 느려지나요?
색인은 가장 낮은 우선순위로 백그라운드에서 만들어지고 언제든 중단됩니다. 일반 텍스트 검색은 그대로입니다. 여전히 파일 위에서 복사 없이 직접 동작합니다.
색인은 용량을 얼마나 쓰나요?
추출한 텍스트는 압축 저장되며 문서 자체의 일부에 지나지 않습니다. 수천 건이면 보통 수십 메가바이트입니다.
비라틴 문자도 되나요?
됩니다. 중국어, 일본어, 키릴 문자, 아랍 문자, 데바나가리를 처리하며 대소문자를 구분하지 않는 검색이 ASCII 밖에서도 동작합니다.
정규식을 쓸 수 있나요?
네, ECMAScript 문법입니다. 잘못된 식은 조용히 실패하지 않고 입력란 옆에 안내를 표시합니다.
📄 파일 이름이 아니라 문서를 찾으세요
Deskora는 모든 드라이브에서 PDF·Word·Excel·PowerPoint·OpenDocument 내부를 검색합니다.
Deskora 무료 다운로드