आपके दस्तावेज़ अदृश्य क्यों रह जाते हैं
PDF का पाठ सादे रूप में संग्रहित नहीं होता। वह संपीड़ित कंटेंट स्ट्रीम में, हर फ़ॉन्ट के लिए अलग एन्कोडिंग में रहता है। 2007 के बाद की Office फ़ाइलें ZIP कंटेनर हैं जिनके भीतर संपीड़ित XML होता है। ऐसी फ़ाइलों के कच्चे बाइट पढ़ने वाली खोज सैद्धांतिक रूप से कुछ नहीं पाती — और यही कारण है कि इतने लोग मानते हैं कि दस्तावेज़ «इस कंप्यूटर पर है ही नहीं», जबकि वह हमेशा वहीं था।
- PDF — पाठ FlateDecode से संपीड़ित स्ट्रीम में रहता है
- DOCX, XLSX, PPTX — संपीड़ित XML वाले ZIP कंटेनर
- ODT, ODS, ODP — वही सिद्धांत, दूसरा XML
- Windows सर्च — केवल चुने हुए फ़ोल्डर अनुक्रमित करता है, पूरे ड्राइव छोड़ देता है
📄 फ़ाइल नाम नहीं, दस्तावेज़ ढूँढ़ें
Deskora सभी ड्राइव पर PDF, Word, Excel, PowerPoint और OpenDocument के भीतर खोजता है।
Deskora निःशुल्क डाउनलोड करेंकौन-से प्रारूप खोजे जाते हैं
Deskora दस्तावेज़ का पठनीय पाठ निकालता है और उसी में खोजता है। यह रहा दायरा — और वह भी जो जान-बूझकर बाहर है।
| प्रारूप | क्या खोजा जाता है |
|---|---|
| PDF (.pdf) | पृष्ठों का पूरा पाठ, संपीड़ित स्ट्रीम और CID फ़ॉन्ट सहित। पृष्ठ संख्या बताई जाती है। |
| Word (.docx, .docm) | मुख्य पाठ, तालिकाएँ, हेडर, फ़ुटर, पाद-टिप्पणियाँ। ट्रैक-चेंज में हटाया गया पाठ शामिल नहीं। |
| Excel (.xlsx, .xlsm) | सभी शीटों की सभी कोशिकाएँ। शीट का नाम बताया जाता है। |
| PowerPoint (.pptx, .ppsx) | सभी स्लाइडों का पाठ, क्रम में। स्लाइड संख्या बताई जाती है। |
| OpenDocument (.odt) | शीर्षकों और तालिकाओं सहित पूरा पाठ। |
| OpenDocument (.ods) | सभी तालिकाओं की सभी कोशिकाएँ। तालिका का नाम बताया जाता है। |
| OpenDocument (.odp) | सभी स्लाइडों का पाठ। स्लाइड का नाम बताया जाता है। |
| RTF (.rtf) | पूरा पाठ, नियंत्रण-शब्द और वर्ण-कोड सुलझाए हुए। |
| TXT, LOG, CSV, XML, JSON | सीधे, बाइट-दर-बाइट खोजा जाता है — तेज़ रास्ता, अपरिवर्तित। |
| .doc, .xls, .msg | समर्थित नहीं। पुराने द्विआधारी प्रारूप और मेल कंटेनर अलग विषय हैं और अधूरे ढंग से शुरू करने के बजाय जान-बूझकर बाहर रखे गए हैं। |
यह कैसे काम करता है
पाठ निकालना महँगा है, इसलिए यह एक ही बार होता है। उसके बाद पाठ संपीड़ित रूप में अनुक्रमणिका में रहता है और हर अगली खोज सादे पाठ की खोज जैसी लगती है।
🔍 पाठ निष्कर्षण
PDF स्ट्रीम खोली जाती हैं और फ़ॉन्ट तालिकाओं के ज़रिए डिकोड होती हैं; Office फ़ाइलें खोली जाती हैं और उनका XML सही ढंग से पढ़ा जाता है — एंटिटी और अनुच्छेद-विभाजन सहित।
💾 स्थायी अनुक्रमणिका
निकाला गया पाठ संपीड़ित रूप में रखा जाता है। दोबारा तभी निकाला जाता है जब फ़ाइल का आकार या समय बदले।
🌙 शांत पृष्ठभूमि निर्माण
सबसे कम थ्रेड और I/O प्राथमिकता, किसी भी क्षण रोका जा सकता है। आपको इसका पता नहीं चलना चाहिए।
📄 असली स्थान
परिणाम पृष्ठ 7, शीट «राजस्व» या स्लाइड 3 बताता है — कोई निरर्थक पंक्ति संख्या नहीं।
Deskora की तुलना
ईमानदार तुलना। Deskora निःशुल्क डेस्कटॉप सॉफ़्टवेयर है, कोई क़ानूनी e-discovery मंच नहीं — और वैसा होने का दिखावा भी नहीं करता।
| Deskora | Windows सर्च | Agent Ransack | dtSearch | |
|---|---|---|---|---|
| PDF के भीतर खोजता है | हाँ | केवल अनुक्रमित फ़ोल्डर | हाँ | हाँ |
| Office फ़ाइलों के भीतर खोजता है | हाँ | केवल अनुक्रमित फ़ोल्डर | हाँ | हाँ |
| सभी ड्राइव शामिल | हाँ | नहीं | हाँ | हाँ |
| नियमित अभिव्यक्तियाँ | हाँ | नहीं | हाँ | हाँ |
| पृष्ठ / शीट / स्लाइड बताता है | हाँ | नहीं | नहीं | हाँ |
| मूल्य | निःशुल्क | सिस्टम में शामिल | निःशुल्क / सशुल्क | कई सौ यूरो से |
यह किसके लिए है
⚖️ विधि और कर परामर्श
एक फ़ाइल संख्या PDF के हेडर में, स्प्रेडशीट की तीसरी शीट में और स्कैन किए अनुबंध में होती है। फ़ाइल नाम से एक भी नहीं मिलती। सामग्री से तीनों मिलती हैं — और कौन-सा पृष्ठ खोलना है, यह भी।
🔬 शोध और अध्ययन
सैकड़ों शोध-पत्र, दर्जनों डेटासेट, तीन प्रारूपों में नोट्स। «वह विधि किस पेपर में थी?» सामग्री का प्रश्न है और इसमें एक सेकंड लगना चाहिए, पूरी दोपहर नहीं।
🔧 तकनीकी दस्तावेज़ीकरण
पुर्ज़ों के नंबर और त्रुटि-कोड मैनुअल के भीतर होते हैं, उनके नामों में नहीं। भीतर तक पढ़ने वाली खोज PDF से भरे फ़ोल्डर को ज्ञान-आधार बना देती है।
आपके दस्तावेज़ आपके कंप्यूटर पर ही रहते हैं
पाठ निष्कर्षण पूरी तरह स्थानीय रूप से चलता है। कुछ भी अपलोड नहीं होता, किसी सर्वर पर नहीं जाता, खाता नहीं चाहिए। दस्तावेज़ अनुक्रमणिका पूरी तरह बंद की जा सकती है, चुने हुए फ़ोल्डरों तक सीमित की जा सकती है या बहिष्करण जोड़े जा सकते हैं — जो प्रोग्राम सभी ड्राइव जानता है, उसे सीमा आपसे खिंचवानी चाहिए।
अक्सर पूछे जाने वाले प्रश्न
क्या यह स्कैन किए PDF का पाठ ढूँढ़ता है?
नहीं। स्कैन किया PDF पाठ की तस्वीर है, पाठ नहीं। इसके लिए ऑप्टिकल कैरेक्टर रेकग्निशन चाहिए, जो अलग तरह का प्रोग्राम है। Deskora दिखावा करने के बजाय सीधे «कोई परिणाम नहीं» बताता है।
पासवर्ड से सुरक्षित फ़ाइलों का क्या?
उन्हें छोड़ दिया जाता है। Deskora एन्क्रिप्शन तोड़ने की कोशिश नहीं करता, खाली उपयोक्ता-पासवर्ड वाले आम मामले में भी नहीं: वह ताला बनाने वाले ने जान-बूझकर लगाया है।
क्या इससे कंप्यूटर धीमा होगा?
अनुक्रमणिका पृष्ठभूमि में सबसे कम प्राथमिकता पर बनती है और कभी भी रोकी जा सकती है। सादे पाठ की खोज अछूती रहती है: वह अब भी बिना प्रति बनाए सीधे फ़ाइल पर चलती है।
अनुक्रमणिका कितनी जगह लेती है?
निकाला गया पाठ संपीड़ित रखा जाता है और दस्तावेज़ों का छोटा-सा अंश होता है। कुछ हज़ार दस्तावेज़ों पर सामान्यतः कुछ दर्जन मेगाबाइट।
क्या यह ग़ैर-लैटिन लिपियों के साथ चलता है?
हाँ। चीनी, जापानी, सिरिलिक, अरबी और देवनागरी संभाले जाते हैं, और बड़े-छोटे अक्षरों की परवाह किए बिना खोज ASCII के बाहर भी काम करती है।
क्या मैं नियमित अभिव्यक्तियाँ इस्तेमाल कर सकता हूँ?
हाँ, ECMAScript वाक्य-रचना में। ग़लत अभिव्यक्ति चुपचाप विफल होने के बजाय फ़ील्ड के पास संकेत दिखाती है।
📄 फ़ाइल नाम नहीं, दस्तावेज़ ढूँढ़ें
Deskora सभी ड्राइव पर PDF, Word, Excel, PowerPoint और OpenDocument के भीतर खोजता है।
Deskora निःशुल्क डाउनलोड करें