On post-index-creation configuration verification and troubleshooting methods for indexes built from PDF files

Daichi Ishikawa 210 評価のポイント
2026-03-11T09:29:20.53+00:00

PDF契約書をデータソースとしてインデックスを作成しましたが、検索エクスプローラー上では問題なさそうに見えるものの、AIエージェントからの利用時に不正確な挙動が見られます。インデックス構成に不備がないか確認したいです。

【環境】

  • **AI Searchリソース:
    ** azure-search-for-ai-agent-v3 (Blob由来)
    azure-search-for-ai-agent-v4 (SharePoint由来)
  • 対象データ: 契約書PDFファイル

【現状】

  • 同じPDFファイルをBlobとSharePointに配置し、それぞれのインデックスを作成しました。
  • 検索エクスプローラーでの検索結果には大きな差分は見られません。
  • しかし、これらを利用したAIエージェントが、ファイル名を正しく認識できない、または数値を誤認するケースがあります。

【質問】

  1. フィールドマッピングの確認:
    • AIエージェントが引用元として参照すべき「ファイル名」は、インデックス内のどのフィールド(metadata_storage_name、titleなど)に格納されている必要がありますか?また、それが正しくマッピングされているか確認する手順をご教示ください。
  2. インデクサー・スキルセットの診断:
    • 作成済みのインデクサーやスキルセットに、PDF解析上の不備(OCR設定漏れや、テキスト抽出の失敗など)がないかを確認するログや指標はどこを見ればよいですか?
  3. チャンク分割の影響:
    • 契約書の「金額」と「契約名」が離れた場所にある場合、チャンク分割によって文脈が切れている可能性があります。AIエージェント用途で推奨される、PDFドキュメントのチャンク分割設定(ページ単位、トークン単位など)のベストプラクティスはありますか?PDF契約書をデータソースとしてインデックスを作成しましたが、検索エクスプローラー上では問題なさそうに見えるものの、AIエージェントからの利用時に不正確な挙動が見られます。インデックス構成に不備がないか確認したいです。
    • チャンク分割したままの背景としては、根拠資料の提示とあわせて該当箇所のページ情報を提示したいためです。
Azure AI 検索
Azure AI 検索

情報を強化する人工知能機能が組み込まれた Azure の検索サービスで、関連するコンテンツの特定と探索を大規模に支援します。

ロックされた質問。 役に立つかどうかに投票することはできますが、コメントの追加、質問への返信やフォローはできません。