Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Note
Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.
Kilka źródeł danych obsługiwanych przez indeksator, w tym Azure Blob Storage, Azure Data Lake Storage Gen2 i SharePoint, zawiera autonomiczne pliki lub osadzone obiekty różnych typów zawartości. Wiele z tych typów zawartości ma właściwości metadanych, które mogą być przydatne do indeksowania. Podobnie jak w przypadku tworzenia pól wyszukiwania dla standardowych właściwości obiektów blob, takich jak metadata_storage_name, można tworzyć pola w indeksie wyszukiwania dla właściwości metadanych specyficznych dla formatu dokumentu.
Obsługiwane formaty dokumentów
Usługa Wyszukiwanie AI platformy Azure obsługuje indeksowanie obiektów blob i indeksowanie dokumentów programu SharePoint dla następujących formatów dokumentów:
- CSV (zobacz Indeksowanie obiektów blob CSV)
- EML
- EPUB
- GZ
- HTML
- JSON (zobacz Indeksowanie JSON blobs)
- KML (XML dla reprezentacji geograficznych)
- Markdown
- Formaty pakietu Microsoft Office: DOCX/DOC/DOCM, XLSX/XLS/XLSM, PPTX/PPT/PPTM, MSG (wiadomości e-mail programu Outlook), XML (zarówno 2003, jak i 2006 WORD XML)
- Format dokumentów Open Document: ODT, ODS, ODP
- Pliki zwykłego tekstu (zobacz też Indeksowanie zwykłego tekstu)
- RTF
- XML
- ZIP
Właściwości formatu dokumentu
W poniższej tabeli przedstawiono podsumowanie przetwarzania dla każdego formatu dokumentu i opisano właściwości metadanych wyodrębnione przez indeksator obiektów blob i indeksator programu SharePoint.
| Format dokumentu/typ zawartości | Wyodrębnione metadane | Szczegóły przetwarzania |
|---|---|---|
| CSV (tekst/csv) | metadata_content_typemetadata_content_encoding |
Wyodrębnij tekst UWAGA: Jeśli chcesz wyodrębnić wiele pól dokumentów z obiektu blob CSV, zobacz Indeksowanie obiektów blob CSV |
| DOC (application/msword) | metadata_content_typemetadata_authormetadata_character_countmetadata_creation_datemetadata_last_modifiedmetadata_page_countmetadata_word_count |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| DOCM (application/vnd.ms-word.document.macroenabled.12) | metadata_content_typemetadata_authormetadata_character_countmetadata_creation_datemetadata_last_modifiedmetadata_page_countmetadata_word_count |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| DOCX (application/vnd.openxmlformats-officedocument.wordprocessingml.document) | metadata_content_typemetadata_authormetadata_character_countmetadata_creation_datemetadata_last_modifiedmetadata_page_countmetadata_word_count |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| EML (wiadomość/rfc822) | metadata_content_typemetadata_message_frommetadata_message_tometadata_message_ccmetadata_creation_datemetadata_subject |
Wyodrębnij tekst, w tym załączniki |
| EPUB (application/epub+zip) | metadata_content_typemetadata_authormetadata_creation_datemetadata_titlemetadata_descriptionmetadata_languagemetadata_keywordsmetadata_identifiermetadata_publisher |
Wyodrębnianie tekstu ze wszystkich dokumentów w archiwum |
| GZ (application/gzip) | metadata_content_type |
Wyodrębnianie tekstu ze wszystkich dokumentów w archiwum |
| HTML (tekst/html lub aplikacja/xhtml+xml) | metadata_content_encodingmetadata_content_typemetadata_languagemetadata_descriptionmetadata_keywordsmetadata_title |
Usuwanie elementów HTML i wyodrębnianie tekstu |
| JSON (application/json) | metadata_content_typemetadata_content_encoding |
Wyodrębnij tekst UWAGA: Jeśli chcesz wyodrębnić wiele pól dokumentu z obiektu blob JSON, zobacz Indeksowanie obiektów blob JSON |
| KML (application/vnd.google-earth.kml+xml) | metadata_content_typemetadata_content_encodingmetadata_language |
Usuwanie elementów XML i wyodrębnianie tekstu |
| Format MSG (plik wiadomości Microsoft Outlook) application/vnd.ms-outlook | metadata_content_typemetadata_message_frommetadata_message_from_emailmetadata_message_tometadata_message_to_emailmetadata_message_ccmetadata_message_cc_emailmetadata_message_bccmetadata_message_bcc_emailmetadata_creation_datemetadata_last_modifiedmetadata_subject |
Wyodrębnij tekst, w tym tekst wyodrębniony z załączników.
metadata_message_to_email, metadata_message_cc_emaili metadata_message_bcc_email to kolekcje ciągów. Pozostałe pola to ciągi. |
| ODP (format do prezentacji: application/vnd.oasis.opendocument.presentation) | metadata_content_typemetadata_authormetadata_creation_datemetadata_last_modifiedmetadata_title |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| ODS (application/vnd.oasis.opendocument.spreadsheet) | metadata_content_typemetadata_authormetadata_creation_datemetadata_last_modified |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| ODT (application/vnd.oasis.opendocument.text) | metadata_content_typemetadata_authormetadata_character_countmetadata_creation_datemetadata_last_modifiedmetadata_page_countmetadata_word_count |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| PDF (application/pdf) | metadata_content_typemetadata_languagemetadata_authormetadata_titlemetadata_creation_date |
Wyodrębnianie tekstu, w tym dokumentów osadzonych (z wyłączeniem obrazów) |
| Zwykły tekst (tekst/zwykły) | metadata_content_typemetadata_content_encodingmetadata_language |
Wyodrębnij tekst |
| PPT (plik aplikacji Microsoft PowerPoint - application/vnd.ms-powerpoint) | metadata_content_typemetadata_authormetadata_creation_datemetadata_last_modifiedmetadata_slide_countmetadata_title |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| PPTM (application/vnd.ms-powerpoint.presentation.macroenabled.12) | metadata_content_typemetadata_authormetadata_creation_datemetadata_last_modifiedmetadata_slide_countmetadata_title |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| PPTX (aplikacja/vnd.openxmlformats-officedocument.presentationml.presentation) | metadata_content_typemetadata_authormetadata_creation_datemetadata_last_modifiedmetadata_slide_countmetadata_title |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| RTF (aplikacja/rtf) | metadata_content_typemetadata_authormetadata_character_countmetadata_creation_datemetadata_last_modifiedmetadata_page_countmetadata_word_count |
Wyodrębnij tekst |
| WORD 2003 XML (application/vnd.ms-wordml) | metadata_content_typemetadata_authormetadata_creation_date |
Usuwanie elementów XML i wyodrębnianie tekstu |
| WORD XML (application/vnd.ms-word2006ml) | metadata_content_typemetadata_authormetadata_character_countmetadata_creation_datemetadata_last_modifiedmetadata_page_countmetadata_word_count |
Usuwanie elementów XML i wyodrębnianie tekstu |
| XLS (application/vnd.ms-excel) | metadata_content_typemetadata_authormetadata_creation_datemetadata_last_modified |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| XLSM (aplikacja/vnd.ms-excel.sheet.macroenabled.12) | metadata_content_typemetadata_authormetadata_creation_datemetadata_last_modified |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| XLSX (application/vnd.openxmlformats-officedocument.spreadsheetml.sheet) | metadata_content_typemetadata_authormetadata_creation_datemetadata_last_modified |
Wyodrębnianie tekstu, w tym dokumentów osadzonych |
| XML (aplikacja/xml) | metadata_content_typemetadata_content_encodingmetadata_language |
Usuwanie elementów XML i wyodrębnianie tekstu |
| ZIP (aplikacja/zip) | metadata_content_type |
Wyodrębnianie tekstu ze wszystkich dokumentów w archiwum |