文書が見つからない理由
PDF の本文は平文では保存されていません。圧縮されたコンテンツストリームの中に、フォントごとに異なる符号で入っています。2007 年以降の Office ファイルは、圧縮された XML を収めた ZIP コンテナです。こうしたファイルの生バイトを読む検索は、原理的に何も見つけられません。だからこそ「この PC には無い」と思い込んでいる文書が、実はずっとそこにあるのです。
- PDF ― 本文は FlateDecode で圧縮されたストリームの中
- DOCX・XLSX・PPTX ― 圧縮 XML を収めた ZIP コンテナ
- ODT・ODS・ODP ― 同じ仕組み、別の XML
- Windows 検索 ― 指定フォルダーしか索引せず、ドライブごと抜け落ちる
📄 ファイル名ではなく、文書そのものを見つける
Deskora は PDF・Word・Excel・PowerPoint・OpenDocument の中を、全ドライブにわたって検索します。
Deskora を無料でダウンロード検索対象の形式
Deskora は文書から読める本文を取り出し、それを検索します。対応している範囲と、あえて対応していない範囲は次のとおりです。
| 形式 | 検索される内容 |
|---|---|
| PDF (.pdf) | ページ本文すべて。圧縮ストリームや CID フォントにも対応。ページ番号を報告します。 |
| Word (.docx, .docm) | 本文、表、ヘッダー、フッター、脚注。変更履歴の削除済みテキストは除外します。 |
| Excel (.xlsx, .xlsm) | 全シートの全セル。シート名を報告します。 |
| PowerPoint (.pptx, .ppsx) | 全スライドの本文をスライド順に。スライド番号を報告します。 |
| OpenDocument (.odt) | 見出しと表を含む本文すべて。 |
| OpenDocument (.ods) | 全表の全セル。表名を報告します。 |
| OpenDocument (.odp) | 全スライドの本文。スライド名を報告します。 |
| RTF (.rtf) | 制御語と文字コードを解決した本文すべて。 |
| TXT, LOG, CSV, XML, JSON | バイト単位で直接検索 ― 高速経路は変更なし。 |
| .doc, .xls, .msg | 非対応。旧来のバイナリ形式やメールコンテナは別課題であり、中途半端に始めるよりも意図的に対象外としています。 |
仕組み
テキストの取り出しは高くつくため、一度だけ行います。以後は圧縮された状態で索引に残り、2 回目からは平文検索と変わらない速さになります。
🔍 テキスト抽出
PDF のストリームを展開し、フォント表を通して復号します。Office ファイルは展開し、XML を実体参照と段落区切りまで含めて正しく解析します。
💾 永続索引
抽出した本文は圧縮して保存します。再抽出はファイルのサイズか更新日時が変わったときだけです。
🌙 静かな背景処理
スレッドと入出力の優先度は最低、いつでも中断できます。気づかれないことが目標です。
📄 本当の位置
ヒットはページ 7、シート「売上」、スライド 3 を示します。意味のない行番号ではありません。
他ツールとの比較
正直な比較です。Deskora は無料のデスクトップソフトであり、法務向けの e-discovery 基盤ではありません。そのふりもしません。
| Deskora | Windows 検索 | Agent Ransack | dtSearch | |
|---|---|---|---|---|
| PDF の中を検索 | はい | 索引済みフォルダーのみ | はい | はい |
| Office ファイルの中を検索 | はい | 索引済みフォルダーのみ | はい | はい |
| 全ドライブが対象 | はい | いいえ | はい | はい |
| 正規表現 | はい | いいえ | はい | はい |
| ページ/シート/スライドを報告 | はい | いいえ | いいえ | はい |
| 価格 | 無料 | OS 同梱 | 無料/有料 | 数百ユーロから |
こんな方に
⚖️ 法律事務所・税理士事務所
事件番号が PDF のヘッダー、表計算の 3 枚目のシート、スキャンした契約書に散らばっている。ファイル名ではどれも見つかりません。内容で探せば 3 つとも見つかり、開くべきページまで分かります。
🔬 研究・学習
数百の論文、数十のデータセット、3 形式にまたがるメモ。「あの手法はどの論文だったか」は内容の問いであり、1 秒で済むべきです。半日かける話ではありません。
🔧 技術文書
部品番号やエラーコードはマニュアルの中にあり、ファイル名にはありません。中身まで読む検索は、PDF の詰まったフォルダーを知識ベースに変えます。
文書はあなたの PC から出ません
テキスト抽出はすべてローカルで動きます。アップロードもサーバー送信もアカウントも不要です。文書索引は完全に無効化でき、対象フォルダーを限定したり除外フォルダーを設定したりできます。全ドライブを把握するプログラムには、線引きをあなたに委ねる責任があります。
よくある質問
スキャンした PDF の文字も見つかりますか?
いいえ。スキャンした PDF は文字の画像であって文字ではありません。光学文字認識が必要になり、それは別種のプログラムです。Deskora は取り繕わず、単に該当なしと報告します。
パスワード保護されたファイルは?
スキップします。Deskora は暗号を破ろうとはしません。よくある「ユーザーパスワードが空」の場合も同じです。その鍵は作成者が意図して掛けたものです。
PC が遅くなりませんか?
索引は最低優先度で背景処理され、いつでも中断できます。平文検索は変わりません。従来どおりファイル上で直接、コピーなしで動きます。
索引はどれくらい容量を使いますか?
抽出した本文は圧縮保存され、文書自体のごく一部の大きさです。数千件で通常は数十メガバイト程度です。
非ラテン文字でも動きますか?
はい。中国語・日本語・キリル文字・アラビア文字・デーヴァナーガリーに対応し、大文字小文字を区別しない検索は ASCII の外でも機能します。
正規表現は使えますか?
はい、ECMAScript 構文です。式が不正なときは黙って失敗せず、入力欄の横に注意が表示されます。
📄 ファイル名ではなく、文書そのものを見つける
Deskora は PDF・Word・Excel・PowerPoint・OpenDocument の中を、全ドライブにわたって検索します。
Deskora を無料でダウンロード