Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Note
Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Stanowi ona również podstawę IQ rozwiązania Foundry, zarządzanej warstwy wiedzy, która przekształca zawartość przedsiębiorstwa w bazy wiedzy wielokrotnego użytku, uwzględniające uprawnienia dla agentów w portalu Microsoft Foundry.
Umiejętność Document Layout wykorzystuje model layout z Azure Document Intelligence in Foundry Tools do analizy dokumentu, wykrywania jego struktury i cech oraz tworzenia reprezentacji składniowej w formacie Markdown lub tekstowym. Ta umiejętność wspiera wyodrębnianie tekstu i obrazów, z czego ta druga obejmuje metadane lokalizacyjne, które zachowują pozycję obrazu w dokumencie. Bliskość obrazu do powiązanych treści jest korzystna w scenariuszach generowania generowania z pomocą wyszukiwania (RAG) oraz multimodalnego wyszukiwania .
Dla transakcji przekraczających 20 dokumentów na indeksującego dziennie, ta umiejętność wymaga dołączenia do swojego zestawu umiejętności zasobu Microsoft Foundry rozliczalnego. Wykonanie wbudowanych umiejętności jest pobierane według obowiązującej standardowej ceny Foundry Tools.
Ten artykuł jest dokumentacją referencyjną dla umiejętności Układu Dokumentów. Informacje o użytkowaniu znajdziesz w artykule Jak chunk and vectorize według układu dokumentu.
Wskazówka
Często stosuje się tę umiejętność przy treściach o strukturze i obrazach, takich jak PDF. Tutorial multimodalny demonstruje werbalizację obrazów za pomocą dwóch różnych strategii dzielenia danych.
Ograniczenia
Ta umiejętność ma następujące ograniczenia:
Umiejętność ta nie nadaje się do dużych dokumentów wymagających więcej niż pięciu minut przetwarzania w modelu układu Azure Document Intelligence. Czas wygasa na umiejętność, ale opłaty nadal są obciążane do zasobu Foundry, jeśli jest on powiązany z zestawem umiejętności do celów rozliczeń. Upewnij się, że dokumenty są zoptymalizowane, aby mieszczać się w limitach przetwarzania i uniknąć niepotrzebnych kosztów.
Ponieważ ta umiejętność nazywa model układu Azure Document Intelligence, wszystkie udokumentowane zachowania service dla różnych typów dokumentów dla różnych typów plików dotyczą jej wyjścia. Na przykład pliki Word (DOCX) i PDF mogą dawać różne wyniki ze względu na różnice w sposobie obsługi obrazów. Jeśli wymagane jest spójne zachowanie obrazu w DOCX i PDF, rozważ konwersję dokumentów na PDF lub przejrzenie dokumentacji wyszukiwania multimodalnego w poszukiwaniu alternatywnych metod.
Obsługiwane regiony
Umiejętność Document Layout wywołuje wersję 4.0 (2024-11-30) w Azure Document Intelligence REST API.
Obsługiwane regiony różnią się w zależności od modalności i tego, jak umiejętność łączy się z modelem układu Azure Document Intelligence. Obecnie zaimplementowana wersja modelu układu nie obsługuje regionów 21Vianet .
| Metoda | Wymaganie |
|---|---|
| Kreator importu danych | Stwórz usługę Wyszukiwanie AI platformy Azure oraz konto Azure AI wieloserwisowe w jednym z następujących regionów: East US, West Europe 2 lub North Central USA. |
| Programowa, używa klucza zasobów Microsoft Foundry do rozliczeń | Stwórz usługę Wyszukiwanie AI platformy Azure oraz zasób Microsoft Foundry w tym samym regionie. Region musi wspierać zarówno Wyszukiwanie AI platformy Azure, jak i Azure Document Intelligence. |
| Programowe używanie uwierzytelniania Microsoft Entra ID na potrzeby rozliczeń | Nie ma wymogu posiadania tego samego regionu. Stwórz usługę Wyszukiwanie AI platformy Azure i Microsoft zasób Foundry w dowolnym regionie, gdzie każda usługa jest dostępna. |
Obsługiwane formaty plików
Ta umiejętność rozpoznaje następujące formaty plików:
- . JPEG
- .JPG
- .PNG
- .BMP
- . TIFF
- .DOCX
- . XLSX
- .PPTX
- .HTML
Obsługiwane języki
W przypadku tekstu drukowanego zobacz Azure Obsługiwane przez modele układu Document Intelligence.
@odata.type
Microsoft.Skills.Util.DocumentIntelligenceLayoutSkill
Limity danych
- W przypadku plików PDF i TIFF można przetworzyć maksymalnie 2000 stron (w przypadku subskrypcji warstwy Bezpłatna przetwarzane są tylko pierwsze dwie strony).
- Nawet jeśli rozmiar pliku do analizy dokumentów to 500 MB dla poziomu Azure Document Intelligence paid (S0) oraz 4 MB dla Azure Document Intelligence free (F0) tier, indeksowanie podlega limitom indexer poziomu Twojej usługi wyszukiwania.
- Wymiary obrazu muszą wynosić od 50 pikseli x 50 pikseli do 10 000 pikseli x 10 000 pikseli.
- Jeśli Twoje pliki PDF są zablokowane hasłem, usuń blokadę przed uruchomieniem indeksera.
Parametry umiejętności
W parametrach jest rozróżniana wielkość liter.
| Nazwa parametru | Dozwolone wartości | Opis |
|---|---|---|
outputMode |
oneToMany |
Kontroluje krzenność efektu wyniku, jaki daje umiejętność. |
markdownHeaderDepth |
h1
h2, , h3, h4, , h5( h6 domyślne) |
Dotyczy tylko wtedy, gdy outputFormat jest ustawione na .markdown Ten parametr opisuje najgłębszy poziom zagnieżdżenia, który należy rozważyć. Na przykład, jeśli markdownHeaderDepth jest , h3wszystkie głębsze sekcje, takie jak h4, są zwijane do h3. |
outputFormat |
markdown (domyślnie), text |
Kontroluje format wytworu generowanego przez umiejętność. |
extractionOptions |
["images"], , ["images", "locationMetadata"]["locationMetadata"] |
Zidentyfikuj wszelkie dodatkowe treści wyodrębnione z dokumentu. Zdefiniuj tablicę enumów odpowiadających treści, która ma być uwzględniona w wychodzie. Na przykład, jeśli extractionOptions jest , ["images", "locationMetadata"]wyjście zawiera obrazy i metadane lokalizacji, które dostarczają informacji o lokalizacji strony powiązanej z miejscem wyodrębnienia treści, takich jak numer strony lub sekcja. Ten parametr dotyczy obu formatów wyjściowych. |
chunkingProperties |
Zobacz poniższą tabelę. | Dotyczy tylko wtedy, gdy outputFormat jest ustawione na .text Opcje obejmujące sposób dzielenia treści tekstowych podczas ponownego przetwarzania innych metadanych. |
chunkingProperties Parametr |
Dozwolone wartości | Opis |
|---|---|---|
unit |
characters |
Kontroluje krępność jednostki chunk. Długość bloków mierzona jest znakami, a nie słowami czy żetonami. |
maximumLength |
Liczba całkowita między 300 a 50000. | Maksymalna długość bloku w znakach mierzona przez String.Length. |
overlapLength |
Liczba całkowita mniejsza niż połowa .maximumLength |
Długość nakładania się między dwoma fragmentami tekstu. |
Dane wejściowe dla umiejętności
| Nazwa danych wejściowych | Opis |
|---|---|
file_data |
Plik, z którego należy wyodrębnić zawartość. |
Wejście "file_data" musi być obiektem zdefiniowanym jako:
{
"$type": "file",
"data": "BASE64 encoded string of the file"
}
Alternatywnie można ją zdefiniować jako:
{
"$type": "file",
"url": "URL to download file",
"sasToken": "OPTIONAL: SAS token for authentication if the URL provided is for a file in blob storage"
}
Obiekt referencyjny pliku może być generowany na jeden z następujących sposobów:
Ustawienie parametru
allowSkillsetToReadFileDataw definicji indeksera na true. To ustawienie tworzy ścieżkę/document/file_data, która jest obiektem reprezentującym oryginalne dane pliku pobrane ze źródła danych blob. Ten parametr dotyczy tylko plików w pamięci Azure Blob.allowSkillsetToReadFileDataudostępnia pobrane dane pliku umiejętności. Nie zwiększa limitów indeksatora obiektów blob ani limitów analizy dokumentów opisanych w temacie Limity danych.Posiadanie niestandardowej umiejętności zwracającej definicję obiektu JSON, która dostarcza
$type,data, luburlorazsastoken. Parametr$typemusi być ustawiony nafile, adatamusi być podstawową tablicą bajtów zakodowaną 64 w zawartości pliku. Parametrurlmusi być ważnym adresem URL z dostępem do pobrania pliku w tej lokalizacji.
Dane wyjściowe umiejętności
| Nazwa danych wyjściowych | Opis |
|---|---|
markdown_document |
Dotyczy tylko wtedy, gdy outputFormat jest ustawione na .markdown Zbiór obiektów "sekcji", które reprezentują każdą pojedynczą sekcję w dokumencie Markdown. |
text_sections |
Dotyczy tylko wtedy, gdy outputFormat jest ustawione na .text Zbiór obiektów fragmentów tekstu, które reprezentują tekst w granicach strony (uwzględniając ewentualne dodatkowe konfigurowane fragmenty), w tym same nagłówki sekcji. Obiekt fragmentów tekstu zawiera, locationMetadata jeśli to możliwe. |
normalized_images |
Ma zastosowanie tylko wtedy, gdy outputFormat jest ustawiona na text i extractionOptions obejmuje images. Zbiór obrazów wyodrębnionych z dokumentu, w tym locationMetadata , jeśli dotyczy. |
Przykładowa definicja trybu wyjścia markdown
{
"skills": [
{
"description": "Analyze a document",
"@odata.type": "#Microsoft.Skills.Util.DocumentIntelligenceLayoutSkill",
"context": "/document",
"outputMode": "oneToMany",
"markdownHeaderDepth": "h3",
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "markdown_document",
"targetName": "markdown_document"
}
]
}
]
}
Próbka wyjścia dla trybu markdown
{
"markdown_document": [
{
"content": "Hi this is Jim \r\nHi this is Joe",
"sections": {
"h1": "Foo",
"h2": "Bar",
"h3": ""
},
"ordinal_position": 0
},
{
"content": "Hi this is Lance",
"sections": {
"h1": "Foo",
"h2": "Bar",
"h3": "Boo"
},
"ordinal_position": 1,
}
]
}
Wartość tego markdownHeaderDepth sterowania kontroluje liczbę kluczy w słowniku "sekcji". W przykładowej definicji umiejętności, ponieważ jest markdownHeaderDepth "h3", w słowniku "sekcji" są trzy klucze: h1, h2, h3.
Przykład trybu wyjścia tekstowego oraz ekstrakcji obrazów i metadanych
Ten przykład pokazuje, jak wyodrębniać zawartość tekstu w blokach o stałym rozmiarze oraz wyodrębniać obrazy wraz z metadanymi lokalizacji z dokumentu.
Przykładowa definicja trybu wyjścia tekstowego oraz ekstrakcja obrazów i metadanych
{
"skills": [
{
"description": "Analyze a document",
"@odata.type": "#Microsoft.Skills.Util.DocumentIntelligenceLayoutSkill",
"context": "/document",
"outputMode": "oneToMany",
"outputFormat": "text",
"extractionOptions": ["images", "locationMetadata"],
"chunkingProperties": {
"unit": "characters",
"maximumLength": 2000,
"overlapLength": 200
},
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "text_sections",
"targetName": "text_sections"
},
{
"name": "normalized_images",
"targetName": "normalized_images"
}
]
}
]
}
Próbka wyjścia do trybu wyjścia tekstowego oraz ekstrakcja obrazów i metadanych
{
"text_sections": [
{
"id": "1_7e6ef1f0-d2c0-479c-b11c-5d3c0fc88f56",
"content": "the effects of analyzers using Analyze Text (REST). For more information about analyzers, see Analyzers for text processing.During indexing, an indexer only checks field names and types. There's no validation step that ensures incoming content is correct for the corresponding search field in the index.Create an indexerWhen you're ready to create an indexer on a remote search service, you need a search client. A search client can be the Azure portal, a REST client, or code that instantiates an indexer client. We recommend the Azure portal or REST APIs for early development and proof-of-concept testing.Azure portal1. Sign in to the Azure portal 2, then find your search service.2. On the search service Overview page, choose from two options:· Import data wizard: The wizard is unique in that it creates all of the required elements. Other approaches require a predefined data source and index.All services > Azure Al services | Al Search >demo-search-svc Search serviceSearchAdd indexImport dataImport and vectorize dataOverviewActivity logEssentialsAccess control (IAM)Get startedPropertiesUsageMonitoring· Add indexer: A visual editor for specifying an indexer definition.",
"locationMetadata": {
"pageNumber": 1,
"ordinalPosition": 0,
"boundingPolygons": "[[{\"x\":1.5548,\"y\":0.4036},{\"x\":6.9691,\"y\":0.4033},{\"x\":6.9691,\"y\":0.8577},{\"x\":1.5548,\"y\":0.8581}],[{\"x\":1.181,\"y\":1.0627},{\"x\":7.1393,\"y\":1.0626},{\"x\":7.1393,\"y\":1.7363},{\"x\":1.181,\"y\":1.7365}],[{\"x\":1.1923,\"y\":2.1466},{\"x\":3.4585,\"y\":2.1496},{\"x\":3.4582,\"y\":2.4251},{\"x\":1.1919,\"y\":2.4221}],[{\"x\":1.1813,\"y\":2.6518},{\"x\":7.2464,\"y\":2.6375},{\"x\":7.2486,\"y\":3.5913},{\"x\":1.1835,\"y\":3.6056}],[{\"x\":1.3349,\"y\":3.9489},{\"x\":2.1237,\"y\":3.9508},{\"x\":2.1233,\"y\":4.1128},{\"x\":1.3346,\"y\":4.111}],[{\"x\":1.5705,\"y\":4.5322},{\"x\":5.801,\"y\":4.5326},{\"x\":5.801,\"y\":4.7311},{\"x\":1.5704,\"y\":4.7307}]]"
},
"sections": []
},
{
"id": "2_25134f52-04c3-415a-ab3d-80729bd58e67",
"content": "All services > Azure Al services | Al Search >demo-search-svc | Indexers Search serviceSearch0«Add indexerRefreshDelete:selected: TagsFilter by name ...:selected: Diagnose and solve problemsSearch managementStatusNameIndexesIndexers*Data sourcesRun the indexerBy default, an indexer runs immediately when you create it on the search service. You can override this behavior by setting disabled to true in the indexer definition. Indexer execution is the moment of truth where you find out if there are problems with connections, field mappings, or skillset construction.There are several ways to run an indexer:· Run on indexer creation or update (default).. Run on demand when there are no changes to the definition, or precede with reset for full indexing. For more information, see Run or reset indexers.· Schedule indexer processing to invoke execution at regular intervals.Scheduled execution is usually implemented when you have a need for incremental indexing so that you can pick up the latest changes. As such, scheduling has a dependency on change detection.Indexers are one of the few subsystems that make overt outbound calls to other Azure resources. In terms of Azure roles, indexers don't have separate identities; a connection from the search engine to another Azure resource is made using the system or user- assigned managed identity of a search service. If the indexer connects to an Azure resource on a virtual network, you should create a shared private link for that connection. For more information about secure connections, see Security in Azure Al Search.Check results",
"locationMetadata": {
"pageNumber": 2,
"ordinalPosition": 1,
"boundingPolygons": "[[{\"x\":2.2041,\"y\":0.4109},{\"x\":4.3967,\"y\":0.4131},{\"x\":4.3966,\"y\":0.5505},{\"x\":2.204,\"y\":0.5482}],[{\"x\":2.5042,\"y\":0.6422},{\"x\":4.8539,\"y\":0.6506},{\"x\":4.8527,\"y\":0.993},{\"x\":2.5029,\"y\":0.9845}],[{\"x\":2.3705,\"y\":1.1496},{\"x\":2.6859,\"y\":1.15},{\"x\":2.6858,\"y\":1.2612},{\"x\":2.3704,\"y\":1.2608}],[{\"x\":3.7418,\"y\":1.1709},{\"x\":3.8082,\"y\":1.171},{\"x\":3.8081,\"y\":1.2508},{\"x\":3.7417,\"y\":1.2507}],[{\"x\":3.9692,\"y\":1.1445},{\"x\":4.0541,\"y\":1.1445},{\"x\":4.0542,\"y\":1.2621},{\"x\":3.9692,\"y\":1.2622}],[{\"x\":4.5326,\"y\":1.2263},{\"x\":5.1065,\"y\":1.229},{\"x\":5.106,\"y\":1.346},{\"x\":4.5321,\"y\":1.3433}],[{\"x\":5.5508,\"y\":1.2267},{\"x\":5.8992,\"y\":1.2268},{\"x\":5.8991,\"y\":1.3408},{\"x\":5.5508,\"y\":1.3408}]]"
},
"sections": []
}
],
"normalized_images": [
{
"id": "1_550e8400-e29b-41d4-a716-446655440000",
"data": "SGVsbG8sIFdvcmxkIQ==",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NyZWF0ZUluZGV4ZXJwNnA3LnBkZg2/normalized_images_0.jpg",
"locationMetadata": {
"pageNumber": 1,
"ordinalPosition": 0,
"boundingPolygons": "[[{\"x\":2.0834,\"y\":6.2245},{\"x\":7.1818,\"y\":6.2244},{\"x\":7.1816,\"y\":7.9375},{\"x\":2.0831,\"y\":7.9377}]]"
}
},
{
"id": "2_123e4567-e89b-12d3-a456-426614174000",
"data": "U29tZSBtb3JlIGV4YW1wbGUgdGV4dA==",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NyZWF0ZUluZGV4ZXJwNnA3LnBkZg2/normalized_images_1.jpg",
"locationMetadata": {
"pageNumber": 2,
"ordinalPosition": 1,
"boundingPolygons": "[[{\"x\":2.0784,\"y\":0.3734},{\"x\":7.1837,\"y\":0.3729},{\"x\":7.183,\"y\":2.8611},{\"x\":2.0775,\"y\":2.8615}]]"
}
}
]
}
Należy zauważyć, że w powyższym próbnym wyjściu wydają się puste “sections” . Aby je wypełnić, musisz dodać dodatkową umiejętność skonfigurowaną z zestawem outputFormat tak, markdownaby zapewnić prawidłowe wypełnienie sekcji.
Umiejętność ta wykorzystuje Azure Document Intelligence do obliczania metadanych lokalizacji. Szczegóły dotyczące definiowania stron i współrzędnych poligonów ograniczających można znaleźć w Azure Document Intelligence layout model
Reprezentuje imagePath względną ścieżkę przechowywanego obrazu. Jeśli projekcja pliku magazynu wiedzy jest skonfigurowana w zestawie umiejętności, ta ścieżka odpowiada względnej ścieżce obrazu przechowywanego w magazynie wiedzy.