Vì sao tài liệu của bạn vẫn vô hình
Văn bản của tệp PDF không được lưu ở dạng thuần. Nó nằm trong các luồng nội dung đã nén, mã hóa riêng theo từng phông chữ. Từ năm 2007, tệp Office là các bộ chứa ZIP với XML đã nén bên trong. Một cuộc tìm kiếm đọc byte thô của những tệp này về nguyên tắc sẽ không tìm thấy gì — và đó chính là lý do rất nhiều người tin rằng tài liệu «không có trên máy này», trong khi nó vẫn ở đó suốt.
- PDF — văn bản nằm trong luồng nén FlateDecode
- DOCX, XLSX, PPTX — bộ chứa ZIP với XML đã nén
- ODT, ODS, ODP — cùng nguyên tắc, XML khác
- Tìm kiếm Windows — chỉ lập chỉ mục vài thư mục và bỏ qua cả ổ đĩa
📄 Tìm tài liệu, không chỉ tên tệp
Deskora tìm bên trong PDF, Word, Excel, PowerPoint và OpenDocument — trên mọi ổ đĩa.
Tải Deskora miễn phíNhững định dạng được tìm kiếm
Deskora trích xuất văn bản đọc được của tài liệu rồi tìm trong đó. Đây là phạm vi được bao phủ — và phần cố ý không bao phủ.
| Định dạng | Nội dung được tìm |
|---|---|
| PDF (.pdf) | Toàn bộ văn bản trang, kể cả luồng nén và phông CID. Có báo số trang. |
| Word (.docx, .docm) | Thân bài, bảng, đầu trang, chân trang, chú thích. Văn bản đã xóa trong theo dõi thay đổi bị loại trừ. |
| Excel (.xlsx, .xlsm) | Mọi ô của mọi trang tính. Có báo tên trang tính. |
| PowerPoint (.pptx, .ppsx) | Toàn bộ văn bản trang chiếu, theo thứ tự. Có báo số trang chiếu. |
| OpenDocument (.odt) | Toàn bộ thân bài kể cả tiêu đề và bảng. |
| OpenDocument (.ods) | Mọi ô của mọi bảng. Có báo tên bảng. |
| OpenDocument (.odp) | Toàn bộ văn bản trang chiếu. Có báo tên trang chiếu. |
| RTF (.rtf) | Toàn văn, đã giải mã từ điều khiển và mã ký tự. |
| TXT, LOG, CSV, XML, JSON | Tìm trực tiếp, từng byte — đường nhanh, không đổi. |
| .doc, .xls, .msg | Không hỗ trợ. Các định dạng nhị phân cũ và bộ chứa thư là chủ đề riêng, được cố ý để ngoài thay vì làm nửa vời. |
Cách hoạt động
Việc trích xuất tốn kém nên chỉ diễn ra một lần. Sau đó văn bản nằm nén trong chỉ mục và mỗi lần tìm tiếp theo nhanh như tìm trong văn bản thuần.
🔍 Trích xuất văn bản
Luồng PDF được giải nén và giải mã qua bảng phông; tệp Office được giải nén và XML được phân tích đúng cách — kể cả thực thể và ngắt đoạn.
💾 Chỉ mục bền vững
Văn bản trích xuất được lưu ở dạng nén. Chỉ trích xuất lại khi kích thước hoặc thời gian sửa đổi của tệp thay đổi.
🌙 Xây dựng nền âm thầm
Ưu tiên luồng và vào/ra thấp nhất, có thể hủy bất cứ lúc nào. Bạn không nên nhận ra nó.
📄 Vị trí thật của kết quả
Kết quả cho biết trang 7, trang tính «Doanh thu» hay trang chiếu 3 — không phải một số dòng vô nghĩa.
Deskora khi so sánh
So sánh trung thực. Deskora là phần mềm máy tính miễn phí, không phải nền tảng e-discovery pháp lý — và cũng không giả vờ là như vậy.
| Deskora | Tìm kiếm Windows | Agent Ransack | dtSearch | |
|---|---|---|---|---|
| Tìm trong PDF | Có | Chỉ thư mục đã lập chỉ mục | Có | Có |
| Tìm trong tệp Office | Có | Chỉ thư mục đã lập chỉ mục | Có | Có |
| Bao phủ mọi ổ đĩa | Có | Không | Có | Có |
| Biểu thức chính quy | Có | Không | Có | Có |
| Báo trang / trang tính / trang chiếu | Có | Không | Không | Có |
| Giá | Miễn phí | Có sẵn | Miễn phí / trả phí | Từ vài trăm euro |
Dành cho ai
⚖️ Văn phòng luật và thuế
Một số hồ sơ xuất hiện ở đầu trang một tệp PDF, ở trang tính thứ ba của bảng tính và trong hợp đồng đã quét. Theo tên tệp thì không tìm được cái nào; theo nội dung thì tìm được cả ba — kèm theo trang cần mở.
🔬 Nghiên cứu và học tập
Hàng trăm bài báo, hàng chục bộ dữ liệu, ghi chú ở ba định dạng. «Phương pháp đó nằm ở bài nào?» là câu hỏi về nội dung và đáng ra chỉ tốn một giây, không phải cả buổi chiều.
🔧 Tài liệu kỹ thuật
Mã linh kiện và mã lỗi nằm trong sổ tay, không nằm ở tên tệp. Một cuộc tìm kiếm đọc được bên trong biến thư mục đầy PDF thành cơ sở tri thức.
Tài liệu của bạn ở lại trên máy bạn
Việc trích xuất chạy hoàn toàn cục bộ. Không tải lên, không gửi tới máy chủ, không cần tài khoản. Chỉ mục tài liệu có thể tắt hẳn, giới hạn ở các thư mục đã chọn hoặc bổ sung danh sách loại trừ — một chương trình biết mọi ổ đĩa thì phải để bạn vạch ranh giới.
Câu hỏi thường gặp
Có tìm được chữ trong PDF đã quét không?
Không. PDF đã quét là ảnh của chữ chứ không phải chữ. Việc đó cần nhận dạng ký tự quang học, một loại chương trình khác. Deskora sẽ báo không có kết quả thay vì giả vờ.
Còn tệp có mật khẩu thì sao?
Chúng bị bỏ qua. Deskora không cố phá mã hóa, kể cả trường hợp phổ biến là mật khẩu người dùng rỗng: khóa đó do người tạo tệp chủ ý đặt.
Việc này có làm chậm máy không?
Chỉ mục được dựng ở nền với mức ưu tiên thấp nhất và có thể hủy bất cứ lúc nào. Tìm kiếm văn bản thuần không đổi: vẫn chạy trực tiếp trên tệp, không tạo bản sao.
Chỉ mục chiếm bao nhiêu dung lượng?
Văn bản trích xuất được lưu nén và chỉ bằng một phần nhỏ so với tài liệu. Vài nghìn tài liệu thường tốn vài chục megabyte.
Có hoạt động với chữ viết không phải Latinh không?
Có. Tiếng Trung, tiếng Nhật, chữ Kirin, chữ Ả Rập và Devanagari đều được xử lý, và việc so khớp không phân biệt hoa thường vẫn đúng ngoài phạm vi ASCII.
Tôi dùng được biểu thức chính quy chứ?
Được, theo cú pháp ECMAScript. Biểu thức sai sẽ hiện chỉ dẫn cạnh ô nhập thay vì âm thầm thất bại.
📄 Tìm tài liệu, không chỉ tên tệp
Deskora tìm bên trong PDF, Word, Excel, PowerPoint và OpenDocument — trên mọi ổ đĩa.
Tải Deskora miễn phí