Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Uwaga
Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.
Maksymalne limity magazynu, obciążeń i ilości indeksów i innych obiektów zależą od modelu cen usługi Wyszukiwanie AI platformy Azure.
Wyszukiwanie AI platformy Azure obsługuje dwa modele cenowe, z których każda ma skojarzone warstwy usług. Wybrana warstwa ma wpływ na limity usług opisane w tych wskazówkach.
- Dedykowane: stałe ceny mierzone przez jednostki wyszukiwania (SU). Opcje warstw usługi obejmują: Podstawowa, Standardowa (S1-S3, w tym S3 HD), zoptymalizowana pod kątem magazynowania (L1-L2) oraz warstwa bezpłatna z ograniczonymi możliwościami usługi wyszukiwania.
- Bezserwerowe (wersja zapoznawcza): cennik oparty na zużyciu, naliczany na podstawie jednostek obliczeniowych na godzinę (CU/hr) oraz za każdy GB/miesiąc magazynu indeksów. Bieżąca warstwa w wersji zapoznawczej to: Serverless Developer. Limity wynikają z limitów dla poszczególnych indeksów, liczby obiektów przypadających na usługę oraz sposobu ograniczania przepustowości w trybie Serverless.
Ważne
Warstwa bezserwerowa dewelopera jest obecnie dostępna w wersji zapoznawczej. Ta wersja zapoznawcza jest udostępniana bez umowy dotyczącej poziomu usług i nie jest zalecana w przypadku obciążeń produkcyjnych. Niektóre funkcje mogą nie być obsługiwane lub mogą mieć ograniczone możliwości. Aby uzyskać więcej informacji, zobacz Warunki dodatkowe korzystania z testowych wersji Microsoft Azure.
Naliczanie opłat za plan Serverless Developer rozpoczęło się 13 września 2026 r. Opłaty za użycie w dniu lub po tej dacie są wyświetlane na fakturze Azure. Opłaty za użycie nie są naliczane przed 13 września 2026 r.
Warstwa bezserwerowa dewelopera nie obsługuje migracji do lub z innych warstw cenowych, a niektóre funkcje dostępne w innych warstwach nie są obsługiwane w publicznej wersji zapoznawczej. Limity usług, obsługiwane funkcje i szczegóły cennika mogą ulec zmianie przed ogólną dostępnością.
W wersji zapoznawczej model cen bezserwerowy jest obsługiwany tylko w określonych regionach.
Aby dowiedzieć się więcej, zobacz Wybieranie modelu cenowego i warstwy usług.
Diagnozowanie problemów z przydziałem, pojemnością lub limitami
Błędy limitu i pojemności wynikają z odrębnych mechanizmów kontrolnych. Użyj błędu z ukończonej operacji, aby znaleźć, który z nich ma zastosowanie.
Jeśli operacja tworzenia, skalowania lub uaktualniania jest nadal uruchomiona, poczekaj, aż stan aprowizacji stanie się Succeeded lub Failed. Operacja w toku nie jest dowodem problemu z limitem przydziału ani pojemnością. Jeśli operacja skalowania nie powiedzie się, zobacz Błędy podczas skalowania.
| Failure | Prawdopodobna przyczyna | Pierwsza akcja |
|---|---|---|
| Tworzenie usługi zablokowane w subskrypcji i regionie | Limit przydziału subskrypcji | W usłudze Quotas sprawdź limit dla Twojej warstwy i regionu, a następnie złóż wniosek o zwiększenie limitu usług. |
| Tworzenie, skalowanie lub uaktualnianie kończy się niepowodzeniem, mimo że dostępny jest limit przydziału | Rozważ użycie alternatywnych regionów i wdrożenia poza szczytem | Sprawdź przypisy w obsłudze regionów dla warstw o wysokim zapotrzebowaniu, a następnie rozważ alternatywne rozwiązanie. |
| Żądanie repliki, partycji, warstwy lub obiektu zostało odrzucone | Limit usługi lub indeksu | Porównaj konfigurację i liczbę obiektów z limitami usług i limitami indeksów. |
| Usługa wyszukiwania zwraca odpowiedzi sygnalizujące ograniczanie przepustowości przy dużym obciążeniu | Throttling | Zmniejsz częstotliwość żądań lub dodaj jednostki wyszukiwania. Zobacz Limity ograniczania przepustowości. |
| Indeksowanie kończy się niepowodzeniem w pobliżu limitu magazynu lub wektora | Limit pamięci lub wektorów | Porównaj storageSize z miejscem na partycji dla dysku i vectorIndexSize z limitami rozmiaru indeksów wektorowych dla pamięci. |
| Indeksator, zestaw umiejętności lub wektoryzator zwraca błąd 429 z innej usługi | Azure OpenAI lub przydział innej usługi | Postępuj zgodnie ze wskazówkami dotyczącymi limitu przydziału dla usługi, która wystawiła błąd, na przykład Azure OpenAI. |
Dostępny limit przydziału subskrypcji nie gwarantuje pojemności regionalnej, a żądanie większego limitu przydziału nie rozwiązuje ograniczenia pojemności. Jeśli błąd będzie się powtarzać, otwórz żądanie pomoc techniczna platformy Azure zawierające subskrypcję, region, warstwę, żądaną konfigurację, pełny tekst błędu, czas UTC i dowolny identyfikator korelacji lub operacji.
Limity subskrypcji
Możesz utworzyć wiele rozliczanych usług wyszukiwania (Podstawowe i wyższe), do maksymalnej liczby usług dozwolonej na każdym poziomie, w każdym regionie. Można na przykład utworzyć maksymalnie 16 usług w warstwie Podstawowa i kolejne 16 usług w warstwie S1 w ramach tej samej subskrypcji i regionu. Następnie możesz utworzyć dodatkowe 16 podstawowych usług w innym regionie dla łącznie 32 usług Podstawowych w ramach tej samej subskrypcji. Aby uzyskać więcej informacji na temat warstw usług, zobacz Wybieranie modelu cenowego i warstwy usług.
Maksymalne limity usług można podnieść według żądania. Jeśli potrzebujesz większej liczby usług w ramach tej samej subskrypcji, zgłoś wniosek o pomoc techniczną.
| Zasób | Bezpłatna 1 | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|---|
| Maksymalna liczba usług na region | 1 | 16 | 16 | 8 | 6 | 6 | 6 | 6 | 5 |
| Maksymalna liczba jednostek wyszukiwania (SU)2 | Nie dotyczy | 3 SU | 36 SU | 36 SU | 36 SU | 36 SU | 36 SU | 36 SU | Nie dotyczy |
1 Możesz mieć jedną bezpłatną usługę wyszukiwania na subskrypcję platformy Azure. Warstwa Bezpłatna jest oparta na infrastrukturze udostępnionej innym klientom. Ponieważ sprzęt nie jest dedykowany, skalowanie w górę nie jest obsługiwane, a magazyn jest ograniczony do 50 MB. Bezpłatna usługa wyszukiwania może zostać usunięta po dłuższym okresie braku aktywności, aby zwolnić miejsce na więcej usług.
2 Jednostki wyszukiwania (SU) to jednostki rozliczeniowe przydzielone jako replikalub partycja. Potrzebujesz obu tych elementów. Aby dowiedzieć się więcej na temat kombinacji SU, zobacz Szacowanie oraz zarządzanie pojemnością usługi wyszukiwania.
Limity usługi
W modelu cenowym Dedicated zaplanuj pojemność, mnożąc liczbę replik przez liczbę partycji (jednostki wyszukiwania).
| Zasób | Bezpłatna | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|---|
| Partycje | Nie dotyczy | 3 1 | 12 | 12 | 12 | 3 | 12 | 12 | Nie dotyczy |
| Repliki | Nie dotyczy | 3 | 12 | 12 | 12 | 12 | 12 | 12 | Nie dotyczy |
1 Warstwa Podstawowa obsługuje trzy partycje i trzy repliki, łącznie dziewięć jednostek wyszukiwania (SU) w nowych usługach wyszukiwania utworzonych po 3 kwietnia 2024 r. Starsze usługi w warstwie Basic są ograniczone do jednej partycji i trzech replik.
Usługa wyszukiwania podlega maksymalnemu limitowi magazynu (pomnożonemu przez liczbę partycji) lub limitowi maksymalnej liczby indeksów lub indeksatorów, w zależności od tego, co nastąpi wcześniej.
Umowy dotyczące poziomu usług (SLA) mają zastosowanie do rozliczanych usług, które mają co najmniej dwie repliki dla obciążeń zapytań lub co najmniej trzy repliki dla obciążeń zapytań i indeksowania. Liczba partycji nie jest uwzględniana w ramach SLA. Aby uzyskać więcej informacji, zobacz Niezawodność w usłudze Wyszukiwanie AI platformy Azure.
Bezpłatne usługi nie mają stałych partycji ani replik i udostępniają zasoby innym subskrybentom.
Rozmiar partycji (GB)
Limity magazynu dla usługi różnią się w zależności od dwóch czynników: daty utworzenia usługi i regionu. Większość obsługiwanych regionów oferuje wyższe limity dla nowszych usług.
W tej tabeli przedstawiono postęp zwiększania limitu miejsca na dysku w GB w czasie. Od kwietnia 2024 r. partycje o większej pojemności zostały udostępnione w regionach wymienionych w przypisach. Jeśli masz starszą usługę w obsługiwanym regionie, sprawdź, czy możesz uaktualnić usługę , aby uzyskać wyższe limity magazynu.
| Data utworzenia usługi | Basic | S1 | S2 | S3/HD | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|
| Przed 3 kwietnia 2024 r. | 2 | 25 | 100 | 200 | 1,024 | 2048 | Nie dotyczy |
| 3 kwietnia 2024 r. do 17 maja 2024 r. | 15 | 160 | 512 | 1,024 | 1,024 | 2048 | Nie dotyczy |
| Po 17 maja 2024 r. | 15 | 160 | 512 | 1,024 | 2,048 | 4,096 | Nie dotyczy |
| Po 10 lutego 2025 3 | 15 | 160 | 512 | 1,024 | 2048 | 4,096 | Nie dotyczy |
1 Pamięć masowa o większej pojemności dla warstw Basic, S1, S2 i S3 w tych regionach. Ameryka: Brazylia Południowa, Kanada Centralna, Kanada Wschodnia, Wschodnie USA, Wschodnie USA 2, Środkowe USA, Północno-środkowe USA, Południowo-środkowe USA, Zachodnie USA, Zachodnie USA 2, Zachodnie USA 3, Zachodnio-środkowe USA. Europa: Francja Środkowa. Włochy Północne, Europa Północna, Norwegia Wschodnia, Polska Środkowa, Szwajcaria Północna, Szwecja Środkowa, Zjednoczone Królestwo Południowe, Zachodnie Zjednoczone Królestwo. Bliski Wschód: Północ ZEA. Afryka: Republika Południowej Afryki Północnej. Azja i Pacyfik: Australia Wschodnia, Australia Południowo-Wschodnia, Indie Środkowe, Jio Indie Zachodnie, Azja Wschodnia, Azja Południowo-Wschodnia, Japonia Wschodnia, Japonia Zachodnia, Korea Środkowa, Korea Południowa.
2 Magazyn o wyższej pojemności dla L1 i L2. Więcej regionów zapewnia większą pojemność w każdej warstwie rozliczanej. Ameryka: Wschodnie stany USA 2 EUAP. Europa: Niemcy Północne, Niemcy Zachodnio-Środkowe, Szwajcaria Zachodnia. Azure Government: Teksas, Arizona, Wirginia. Afryka: Republika Południowej Afryki Północnej. Azja i Pacyfik: Chiny Północne 3, Chiny Wschodnie 3.
3 Magazyn o zwiększonej pojemności jest dostępny w Europie Zachodniej.
Ważne
Obecnie wyższe limity magazynu nie są dostępne w następujących regionach, które podlegają limitom przed 3 kwietnia.
- Izrael Środkowy
- Katar Środkowy
- Hiszpania Środkowa
- Indie Południowe
Limity indeksów
| Zasób | Bezpłatna | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|---|
| Maksymalna liczba indeksów | 3 | 5 lub 15 1 | 50 | 200 | 200 | 1000 na partycję lub 3000 na usługę | 10 | 10 | 30 |
| Maksymalna liczba prostych pól na indeks 2 | 1000 | 100 lub 1000 3 | 1000 | 1000 | 1000 | 1000 | 1000 | 1000 | 1000 |
| Maksymalne wymiary na pole wektora | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 |
| Maksymalna liczba złożonych kolekcji na indeks | 40 | 40 | 40 | 40 | 40 | 40 | 40 | 40 | 40 |
| Maksymalna liczba elementów we wszystkich złożonych kolekcjach na dokument 4 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 |
| Maksymalna głębokość pól złożonych | 10 | 10 | 10 | 10 | 10 | 10 | 10 | 10 | 10 |
| Maksymalna liczba sugestorów na indeks | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 |
| Maksymalna liczba profilów oceniania na indeks | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 |
| Maksymalna liczba konfiguracji semantycznych na indeks | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 |
| Maksymalna liczba funkcji na profil | 8 | 8 | 8 | 8 | 8 | 8 | 8 | 8 | 8 |
| Maksymalny rozmiar indeksu 5 | Nie dotyczy | Nie dotyczy | Nie dotyczy | 1,88 TB | 2,34 TB | 100 GB | Nie dotyczy | Nie dotyczy | 1 GB |
1 Podstawowe usługi utworzone przed grudniem 2017 r. mają niższe limity (5 zamiast 15) dla indeksów.
2 Górny limit pól obejmuje zarówno pola pierwszego poziomu, jak i zagnieżdżone podpola w złożonej kolekcji. Jeśli na przykład indeks zawiera 15 pól i ma dwie złożone kolekcje z pięcioma polami podrzędnymi, liczba pól indeksu wynosi 25. Indeksy z bardzo dużą kolekcją pól mogą być powolne, szczególnie w przypadku starszych usług w warstwie Podstawowa. Ogranicz pola i atrybuty tylko do tych, których potrzebujesz, i uruchom indeksowanie i testy zapytań, aby zapewnić akceptowalną wydajność.
3 Usługi podstawowe utworzone przed 3 kwietnia 2024 r. obsługują maksymalnie 100 pól na indeks. Nowsze usługi Podstawowe obsługują 1000 pól na indeks.
4 Istnieje górny limit dla elementów, ponieważ posiadanie dużej liczby z nich znacznie zwiększa magazyn wymagany dla indeksu. Element kolekcji złożonej jest definiowany jako element członkowski tej kolekcji. Załóżmy na przykład, że dokument związany z hotelem zawierający złożoną kolekcję pokoi. Każdy pokój w kolekcji Rooms jest traktowany jako element. Podczas indeksowania aparat indeksowania może bezpiecznie przetworzyć maksymalnie 3000 elementów w całym dokumencie.
Ten limit został wprowadzony w api-version=2019-05-06 systemie i dotyczy tylko złożonych kolekcji, a nie kolekcji ciągów lub złożonych pól.
5 W przypadku większości warstw maksymalny rozmiar indeksu jest równy całkowitej dostępnej przestrzeni magazynowej w usłudze wyszukiwania. W przypadku usług S2, S3 i S3 HD z wieloma partycjami, a tym samym więcej miejsca do magazynowania, maksymalny rozmiar pojedynczego indeksu znajduje się w tabeli. Dotyczy usług wyszukiwania utworzonych po 3 kwietnia 2024 r. Indeksy dla usług skonfigurowanych za pomocą modelu bezserwerowego (wersja zapoznawcza) mają ustawiony maksymalny rozmiar podany w tabeli.
W przypadku aprowizacji usługi w klastrze o większej mocy możesz znaleźć pewne różnice w limitach maksymalnych. Limity w tym miejscu reprezentują wspólny mianownik. Indeksy utworzone zgodnie z powyższymi specyfikacjami są przenośne w równoważnych warstwach usług w dowolnym regionie.
Limity dokumentów
Każdy indeks obsługuje maksymalnie następującą liczbę dokumentów:
- 24 miliardy w warstwie Podstawowa, S1, S2 i S3
- 2 miliardy na S3 HD
- 288 miliardów na L1
- 576 miliardów na L2
Każdy dokument może mieć rozmiar do około 16 MB. Limit rozmiaru dokumentu faktycznie dotyczy rozmiaru ładunku żądania interfejsu API indeksowania, który wynosi 16 MB. Ten ładunek może być pojedynczym dokumentem lub partią dokumentów. W przypadku partii z jednym dokumentem maksymalny rozmiar dokumentu wynosi 16 MB w formacie JSON.
Limit rozmiaru dokumentu dotyczy indeksowania w trybie wypychania , który przekazuje dokumenty do usługi wyszukiwania. Jeśli używasz indeksatora do indeksowania w trybie ściągania, pliki źródłowe mogą mieć dowolny rozmiar pliku, z zastrzeżeniem limitów indeksatora. W przypadku indeksatora obiektów blob limity rozmiaru plików są większe dla wyższych warstw. Na przykład limit S1 wynosi 128 MB, a limit S2 wynosi 256 MB.
Podczas szacowania rozmiaru dokumentu pamiętaj, aby indeksować tylko pola, które dodają wartość do scenariuszy wyszukiwania. Wyklucz pola źródłowe, które nie mają celu w zapytaniach, które mają być uruchamiane.
Limity rozmiaru indeksu wektorowego
Podczas indeksowania dokumentów z polami wektorowymi usługa Wyszukiwanie AI platformy Azure konstruuje wewnętrzne indeksy wektorów przy użyciu dostarczonych parametrów algorytmu.
Rozmiar tych indeksów wektorów jest ograniczony przez:
- Pamięć zarezerwowana dla wyszukiwania wektorowego dla warstwy Twojej usługi (lub
SKU) w modelu cenowym Dedykowanym. - Limity przechowywania na indeks w modelu cenowym Serverless.
Aby uzyskać wskazówki dotyczące zarządzania i maksymalizacji magazynu wektorów, zobacz Rozmiar indeksu wektora i pozostawanie w granicach.
Limity wektorów różnią się w zależności od:
Wyższe limity wektorów od kwietnia 2024 r. istnieją w nowych usługach wyszukiwania w regionach zapewniających dodatkową pojemność, która jest w większości z nich. Jeśli masz starszą usługę w obsługiwanym regionie, sprawdź, czy możesz uaktualnić usługę do wyższych limitów wektorów.
W modelu cen bezserwerowym limity wektorów są definiowane na indeks, a nie na partycję.
-
Maksymalny rozmiar indeksu wektorowego na indeks (bezserwerowy): 300 MB
- Ten rozmiar stanowi około 30% całkowitej przestrzeni magazynowej indeksu, co jest zgodne ze współczynnikiem wektorów do pamięci masowej stosowanym w dedykowanych warstwach usługi.
- Ten rozmiar jest sztywnym limitem dla indeksu. Próby przekroczenia tego limitu podczas indeksowania kończą się niepowodzeniem.
W tej tabeli przedstawiono postęp zwiększenia limitu przydziału wektorów w GB w czasie. Limit przydziału jest na partycję, więc w przypadku skalowania nowej usługi w warstwie Standardowa (S1) do 6 partycji łączny limit przydziału wektorów jest 35 pomnożony przez 6.
| Data utworzenia usługi | Basic | S1 | S2 | S3/HD | L1 | L2 |
|---|---|---|---|---|---|---|
| Przed 1 lipca 2023 r.1 | 0,5 | 1 | 6 | 12 | 12 | 36 |
| 1 lipca 2023 r. do 3 kwietnia 2024 r. | 1 | 3 | 12 | 36 | 12 | 36 |
| 3 kwietnia 2024 r. do 17 maja 2024 r. | 5 | 35 | 150 | 300 | 12 | 36 |
| Po 17 maja 2024r. 4 | 5 | 35 | 150 | 300 | 150 | 300 |
1 Początkowe limity wektorów podczas wczesnej wersji zapoznawczej.
2 Limity wektorów w późniejszym okresie obowiązywania wersji zapoznawczej. Trzy regiony nie miały wyższych limitów: Niemcy Zachodnio-środkowe, Indie Zachodnie, Katar Środkowy.
3 Wyższe limity przydziału wektorów na podstawie większych partycji dla obsługiwanych warstw i regionów.
4 Wyższe limity przydziału wektorów dla większej liczby warstw i regionów na podstawie aktualizacji rozmiaru partycji.
Usługa wymusza limit rozmiaru indeksu wektorowego:
- Dedykowany: Na każdą partycję w usłudze wyszukiwania
- Bezserwerowe: Na indeks
Ten limit przydziału jest ścisłym ograniczeniem, aby zapewnić prawidłowe działanie usługi. Dalsze próby indeksowania po przekroczeniu limitu powodują niepowodzenie. Możesz wznowić indeksowanie po zwolnieniu dostępnego limitu w następujący sposób:
- Usuwanie dokumentów wektorowych
- Zmniejszanie rozmiaru lub wymiarowości wektorów
- (Tylko dedykowane) Skalowanie partycji w poziomie
Ważne
Wyższe limity wektorów są powiązane z większymi rozmiarami partycji. Obecnie wyższe limity wektorów nie są dostępne w następujących regionach, które podlegają limitom z lipca do kwietnia.
- Izrael Środkowy
- Katar Środkowy
- Hiszpania Środkowa
- Indie Południowe
Limity indeksatora
Maksymalny czas wykonywania ma na celu zapewnienie równowagi i stabilności całej usługi, ale większe zestawy danych mogą wymagać czasu indeksowania dłuższego niż dozwolony czas maksymalny. Jeśli zadanie indeksowania nie może zostać ukończone w maksymalnym dozwolonym czasie, spróbuj uruchomić je zgodnie z harmonogramem. Program harmonogramowania śledzi stan indeksowania. Jeśli zaplanowane zadanie indeksowania zostanie przerwane z jakiegokolwiek powodu, indeksator może kontynuować w miejscu, w którym zostało przerwane przy następnym zaplanowanym wykonaniu.
Uwaga
W modelu cen bezserwerowym zachowanie indeksatora różni się od usług dedykowanych. Pojemność nie jest definiowana przez repliki ani partycje. Zamiast tego limity obiektów na usługę, limity pojemności magazynowej dla indeksu oraz dławienie na poziomie usługi określają limity indeksowania. Maksymalny czas działania dla każdego uruchomienia indeksatora Serverless Developer wynosi dwie godziny.
Limity obiektu indeksatora i przepustowości
| Zasób | Bezpłatna 1 | Podstawowa 2 | S1 | S2 | S3 | S3 HD 3 | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|---|
| Maksymalna liczba indeksatorów | 3 | 5 lub 15 | 50 | 200 | 200 | Nie dotyczy | 10 | 10 | 30 |
| Maksymalna liczba źródeł danych | 3 | 5 lub 15 | 50 | 200 | 200 | Nie dotyczy | 10 | 10 | 30 na usługę |
| Maksymalnie 4 zestawy umiejętności 4 | 3 | 5 lub 15 | 50 | 200 | 200 | Nie dotyczy | 10 | 10 | 30 |
| Maksymalne obciążenie indeksowania na wywołanie | 10 000 dokumentów | Ograniczone jedynie liczbą dokumentów maksymalną w systemie | Ograniczone jedynie liczbą dokumentów maksymalną w systemie | Ograniczone jedynie liczbą dokumentów maksymalną w systemie | Ograniczone jedynie liczbą dokumentów maksymalną w systemie | Nie dotyczy | Brak ograniczeń | Brak ograniczeń | Ograniczone jedynie liczbą dokumentów maksymalną w systemie |
| Podstawowy harmonogram | 5 minut | 5 minut | 5 minut | 5 minut | 5 minut | 5 minut | 5 minut | 5 minut | 5 minut |
| Maksymalny czas działania na jedno uruchomienie indeksatora 5 | 1-3 lub 3-10 minut | 2 lub 24 godziny | 2 lub 24 godziny | 2 lub 24 godziny | 2 lub 24 godziny | 2 godziny | 2 lub 24 godziny | 2 lub 24 godziny | 2 godziny |
| Skumulowany czas działania indeksatora dla usługi 6 | Nie dotyczy | Nie dotyczy | Nie dotyczy | Nie dotyczy | Nie dotyczy | 24 godziny | Nie dotyczy | Nie dotyczy | 24 godziny |
1 Bezpłatne usługi mają maksymalny czas wykonywania indeksatora wynoszący 3 minuty dla źródeł obiektów blob i 1 minutę dla wszystkich innych źródeł danych. Wywołanie indeksatora jest co 180 sekund. W przypadku indeksowania sztucznej inteligencji, który wywołuje narzędzia Foundry Tools, bezpłatne usługi są ograniczone do 20 bezpłatnych transakcji na indeksator dziennie, gdzie transakcja jest zdefiniowana jako dokument, który pomyślnie przechodzi przez potok wzbogacania. (Porada: Możesz zresetować indeksator, aby zresetować jego liczbę).
2 Podstawowe usługi utworzone przed grudniem 2017 r. mają niższe limity (5 zamiast 15) dla indeksatorów, źródeł danych i zestawów umiejętności.
3 Obsługa indeksatora S3 HD jest dostępna w wersji zapoznawczej i wymaga interfejsu API REST w wersji 2025-11-01-preview lub nowszej. Indeksatory S3 HD działają tylko w środowisku wykonywania wielodostępnym i nie obsługują udostępnionych zasobów łącza prywatnego. W wersji zapoznawczej obsługa indeksatora S3 HD najlepiej nadaje się do niewielkich obciążeń (przy rozmiarze indeksu około 1 GB) bez zestawów umiejętności lub z minimalną liczbą zestawów umiejętności. Aby uzyskać wskazówki dotyczące zbiorczego działania, monitorowania i planowania, zobacz Uruchamianie indeksatora w Serverless i S3 HD.
4 Maksymalnie 30 umiejętności na zestaw umiejętności.
5 Jeśli chodzi o maksymalny czas trwania 2 lub 24 godzin dla indeksatorów: 2-godzinny maksymalny jest najbardziej typowy i jest to, co należy zaplanować. Odwołuje się on do indeksatorów uruchamianych w środowisku publicznym, które odciąża przetwarzanie intensywnie korzystające z obliczeń i pozostawia więcej zasobów dla zapytań. Limit 24-godzinny ma zastosowanie w przypadku skonfigurowania indeksatora do działania w środowisku prywatnym przy użyciu tylko infrastruktury przydzielonej do usługi wyszukiwania. Niektóre starsze indeksatory nie są w stanie działać w środowisku publicznym, a indeksatory zawsze mają 24-godzinny zakres przetwarzania. Jeśli masz nieplanowane indeksatory, które działają w sposób ciągły przez 24 godziny, możesz założyć, że nie można migrować tych indeksatorów do nowszej infrastruktury. Ogólnie rzecz biorąc, dla zadań indeksowania, które nie mogą zakończyć się w ciągu dwóch godzin, należy ustawić dla indeksatora harmonogram na 5 minut, aby mógł szybko kontynuować od miejsca, gdzie zakończył. W warstwie Bezpłatna maksymalny czas wykonywania wynoszący 3–10 minut jest przeznaczony dla indeksatorów z zestawami umiejętności.
6 W usługach S3 HD i serverless wszystkie indeksatory współdzielą łącznie 24 godziny czasu działania dla każdej usługi w każdym 24-godzinnym oknie UTC. Aby uzyskać wskazówki dotyczące limitów przydziału, monitorowania i planowania, zobacz Uruchamianie indeksatora w środowisku Serverless i S3 HD (wersja zapoznawcza).
Limity plików źródłowych dla indeksatorów typu blob
Przetwarzanie plików odbywa się na etapach, a każdy etap ma własne limity:
- Łącznik źródła danych pobiera element źródłowy, z zastrzeżeniem limitów łączników specyficznych dla źródła.
- Wyszukiwanie AI platformy Azure wyodrębnia zawartość elementu, z zastrzeżeniem maksymalnego rozmiaru pliku źródłowego i limitów wyodrębnionych znaków w poniższej tabeli.
- Opcjonalnie zestaw umiejętności wysyła tę zawartość do usług niższego poziomu, gdzie limit danych wejściowych pojedynczej umiejętności może być mniejszy niż ilość danych wyodrębnianych przez indeksator.
Maksymalny rozmiar pliku źródłowego i limity wyodrębnionych znaków w poniższej tabeli dotyczą indeksatorów Azure Blob Storage, ADLS Gen2, SharePoint w Microsoft 365, OneLake i indeksatorach Azure Files. Aby uzyskać limity poszczególnych umiejętności, zapoznaj się z artykułem referencyjnym dla każdej umiejętności w zestawie umiejętności.
| Zasób | Bezpłatna | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|---|
| Maksymalny rozmiar pliku źródłowego, MB 24 | 16 | 16 | 128 | 256 | 256 | Nie dotyczy | 256 | 256 | 256 |
| Maksymalna liczba znaków wyodrębnionych z pliku źródłowego 134 | 256,000 | 512 000 | 4 mil | 8 mil | 16 mil | Nie dotyczy | 4 mil | 4 mil | 16 mil |
1 Maksymalna liczba znaków jest oparta na jednostkach kodu Unicode, w szczególności UTF-16.
2 W przypadku korzystania z delimitedText trybu analizowania plików CSV stosowany jest limit rozmiaru buforu 10 MB na wiersz pliku.
3 W przypadku korzystania z delimitedText trybu analizowania plików CSV nie ma zastosowania limit "maksymalny rozmiar wyodrębnionej zawartości".
4 Indeksatory typu blob obejmują indeksator usługi Azure Blob Storage (indeksator obiektów blob), indeksator usługi ADLS Gen2, indeksator programu SharePoint w usłudze Microsoft 365, indeksator usługi OneLake i indeksator usługi Azure Files. Źródło wiedzy dla plików przesyłanych bezpośrednio nie używa indeksatora i ma osobne limity.
Limity zasobów udostępnionego łącza prywatnego
Indeksatory mogą uzyskiwać dostęp do innych zasobów platformy Azure za pośrednictwem prywatnych punktów końcowych zarządzanych za pośrednictwem udostępnionego interfejsu API zasobu łącza prywatnego. W tej sekcji opisano limity skojarzone z tą funkcją.
Uwaga
Warstwa cenowa Bezserwerowa dla deweloperów nie obsługuje udostępnionych linków prywatnych ani obwodu zabezpieczeń sieci (NSP) do źródeł danych. Obsługiwane są prywatne punkty końcowe i reguły zapory IP na potrzeby połączenia prywatnego z usługą w warstwie Serverless Developer.
| Zasób | Bezpłatna | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|---|
| Obsługa indeksatora prywatnego punktu końcowego | Nie. | Tak | Tak | Tak | Tak | Nie. | Tak | Tak | Nie. |
| Obsługa prywatnego punktu końcowego dla indeksatorów z zestawem umiejętności 1 | Nie. | Nie. | Tak | Tak | Tak | Nie. | Tak | Tak | Nie. |
| Obsługa prywatnego punktu końcowego dla zestawów umiejętności z umiejętnościami osadzania 2 | Nie. | Tak | Tak | Tak | Tak | Nie. | Tak | Tak | Nie. |
| Maksymalna liczba prywatnych punktów końcowych | Nie dotyczy | 10 lub 30 | 100 | 400 | 400 | Nie dotyczy | 20 | 20 | Nie dotyczy |
| Maksymalna liczba unikatowych typów zasobów 3 | Nie dotyczy | 4 | 7 | 15 | 15 | Nie dotyczy | 4 | 4 | Nie dotyczy |
1 Wzbogacanie sztucznej inteligencji i analiza obrazów są intensywnie obciążające obliczenia i zużywają nieproporcjonalne ilości dostępnej mocy obliczeniowej. Z tego powodu połączenia prywatne są wyłączone w niższych warstwach, aby zapewnić wydajność i stabilność samej usługi wyszukiwania. W przypadku usług podstawowych prywatne połączenia z zasobem Microsoft Foundry nie są obsługiwane w celu zachowania stabilności usługi. W przypadku warstwy S1 upewnij się, że usługa została utworzona z wyższymi limitami po 3 kwietnia 2024 r. Indeksatory z więcej niż 2 funkcjami osadzania Azure OpenAI lub osadzania wielomodalnego Azure Vision nie mogą być uruchamiane w środowisku prywatnym, i połączenia prywatne nie są dostępne.
2 Prywatne połączenia z modelem osadzania są obsługiwane w wysokowydajnych usługach wyszukiwania kategorii Podstawowa i S1, utworzonych po 3 kwietnia 2024 r., z wyższymi limitami dla przechowywania danych i przetwarzania obliczeniowego.
3 Liczba różnych typów zasobów jest obliczana jako liczba unikatowych groupId wartości używanych we wszystkich udostępnionych zasobach łącza prywatnego dla danej usługi wyszukiwania, niezależnie od stanu zasobu.
Limity synonimów
Maksymalna liczba map synonimów różni się w zależności od warstwy. Każda reguła może mieć maksymalnie 20 rozszerzeń, gdzie rozszerzenie jest równoważnym terminem. Na przykład dla słowa „kot” powiązanie z „kitty”, „kotowaty” i „felis” (rodzaj kotów) stanowi trzy rozszerzenia.
| Zasób | Bezpłatna | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|---|
| Maksymalna liczba map synonimów | 3 | 3 | 5 | 10 | 20 | 20 | 10 | 10 | 20 na usługę |
| Maksymalna liczba reguł na mapę | pięć tysięcy | 20000 | 20000 | 20000 | 20000 | 20000 | 20000 | 20000 | 20000 |
Limity aliasów indeksu
Maksymalna liczba aliasów indeksu zależy od daty utworzenia warstwy i usługi. W przypadku wszystkich warstw, jeśli usługa została utworzona po październiku 2022 r., maksymalna liczba aliasów jest dwukrotnie większa niż maksymalna liczba dozwolonych indeksów. Jeśli usługa została utworzona przed październikiem 2022 r., limit jest dozwoloną liczbą indeksów.
Uwaga
Warstwa dewelopera modelu bezserwerowego nie obsługuje aliasów indeksów.
| Data utworzenia usługi | Bezpłatna | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|---|
| Przed październikiem 2022 r. | 3 | 5 lub 15 1 | 50 | 200 | 200 | 1000 na partycję lub 3000 na usługę | 10 | 10 | Nie dotyczy |
| Po październiku 2022 r. | 6 | 30 | 100 | 400 | 400 | 2000 na partycję lub 6000 na usługę | 20 | 20 | Nie dotyczy |
1 Podstawowe usługi utworzone przed grudniem 2017 r. mają niższe limity (5 zamiast 15) dla indeksów.
Limity pobierania danych agenta
Baza wiedzy określa jedno lub więcej źródeł wiedzy oraz intensywność rozumowania podczas pobierania (wersja zapoznawcza), która kontroluje poziom przetwarzania przez duży model językowy (LLM) na potrzeby pobierania agentowego. Limity różnią się w zależności od warstwy cenowej, wersji interfejsu API i poziomu nakładu pracy rozumowania.
| Zasób | Bezpłatna | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|---|
| Maksymalna liczba źródeł wiedzy na usługę | 3 | 5 lub 15 1 | 50 | 200 | 200 | 1000 na partycję lub 3000 na usługę 2 | 10 | 10 | 30 |
| Maksymalna liczba baz wiedzy na usługę | 3 | 5 lub 15 1 | 50 | 200 | 200 | 1000 na partycję lub 3000 na usługę 2 | 10 | 10 | 30 |
| Maksymalna liczba źródeł wiedzy na bazę wiedzy | 3 | 5 lub 10 1 | 10 | 10 | 10 | 10 2 | 10 | 10 | 10 |
1 Podstawowe usługi utworzone przed 3 kwietnia 2024 r. mają niższe limity (5) dotyczące źródeł wiedzy i baz wiedzy.
2 Te limity dotyczą usług S3 HD, które obsługują bazy wiedzy i źródła wiedzy. Niektóre starsze usługi S3 HD nie obsługują tych zasobów.
Wybór źródła wiedzy podczas pobierania
Baza wiedzy może zawierać maksymalnie tyle elementów, ile wynosi pokazany powyżej limit dla danego poziomu, niezależnie od wersji API ani wysiłku wnioskowania podczas wyszukiwania. Wersja interfejsu API i poziom wysiłku wnioskowania zamiast tego wpływają na liczbę źródeł wiedzy, które można wybrać na etapie wyszukiwania.
| wersja API | Wysiłek analizy pozyskiwania danych | Bezpłatna | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 |
|---|---|---|---|---|---|---|---|---|---|
2026-05-01-preview i nowsze |
minimal, low, medium |
3 | 5 lub 10 1 | 10 | 10 | 10 | 10 | 10 | 10 |
2026-04-01, 2025-11-01-preview |
minimal
2 |
3 | 5 lub 10 1 | 10 | 10 | 10 | 10 | 10 | 10 |
2025-11-01-preview |
low |
3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 |
2025-11-01-preview |
medium |
3 | 5 | 5 | 5 | 5 | 5 | 5 | 5 |
2025-08-01-preview używa starszego kontraktu agenta wiedzy i nie obsługuje retrievalReasoningEffort.
2 Tryb minimal wnioskowania korzysta ze wszystkich źródeł wiedzy w bazie wiedzy, ponieważ omija planowanie zapytań oparte na modelu LLM.
Pobierz czas wykonywania żądania
Limit maxRuntimeInSeconds jest taki sam w obsługiwanych warstwach.
| Minimalna wartość | Wartość domyślna | Maximum |
|---|---|---|
| 10 sekund | 90 sekund | 600 sekund (10 minut) |
Maksimum ma zastosowanie tylko do żądania pobrania w usłudze Wyszukiwanie AI platformy Azure. Przykłady konfiguracji znajdziesz w sekcji Zastępowanie domyślnego poziomu wysiłku rozumowania i ustawianie limitów żądań.
Limity danych (wzbogacanie sztucznej inteligencji)
Limity danych mają zastosowanie do potoku wzbogacania AI, który korzysta z usługi Azure Language w narzędziach Foundry. Maksymalna długość danych wejściowych wynosi 50 000 znaków, mierzonych za pomocą String.Length, dla umiejętności rozpoznawania encji, umiejętności łączenia encji, umiejętności wyodrębniania kluczowych fraz, umiejętności wykrywania języka i umiejętności wykrywania danych PII.
Umiejętność analizy tonacji ma maksymalny limit 5000 znaków.
Użyj umiejętności Dzielenie tekstu , jeśli musisz podzielić większy tekst przed przetwarzaniem podrzędnym.
Te limity dotyczą modeli cen dedykowanych i bezserwerowych.
Limity przepustowości
Limity ograniczania przepustowości pomagają zapewnić stabilność usługi, kontrolując szybkość żądań interfejsu API.
W modelu cen dedykowanym ograniczanie jest oparte na jednostkach wyszukiwania (repliki × partycjach).
W modelu cen bezserwerowym ograniczanie przepustowości nie jest oparte na jednostkach wyszukiwania. Zamiast tego limity operacji na poziomie usługi i ogólne zachowanie zużycia zarządzają przepływnością. Limity użycia i usługi zarządzają pojemnością, a nie konfiguracją replik i partycji.
| Operation | Dedykowane (na jednostkę wyszukiwania) | Bezserwerowo (dla usługi lub dla indeksu) |
|---|---|---|
| Wyświetl listę indeksów (GET /indexes) | 3 żądania/sec/SU | 3 żądania na sekundę |
| Pobieranie indeksu (GET /indexes/{index}) | 10 żądań na sekundę/SU | 10 żądań na sekundę |
| Tworzenie indeksu (POST /indexes) | 12 żądań/min/SU | 12 żądań/min |
| Tworzenie lub aktualizowanie indeksu (PUT /indexes/{index}) | 6 żądań na sekundę/SU | 6 żądań na sekundę |
| Usuń indeks (DELETE /indexes/{index}) | 12 żądań/min/SU | 12 żądań/min |
| Statystyki usługi (GET /servicestats) | 4 żądania/sek./SU | 4 żądania na sekundę |
| Kwerendy wyszukiwania (POST /indexes/{index}/docs/search) | Różni się w zależności od liczby jednostek SU i złożoności zapytań | 50 zapytań/s (łączne ograniczenie przepustowości odczytu dla indeksu) |
| Indeksowanie dokumentów (POST /indexes/{index}/docs/index) | Różni się w zależności od liczby jednostek SU i obciążenia indeksowania | 5 żądań na sekundę na indeks |
| Sugerowanie (POST /indexes/{index}/docs/suggest) | Różni się w zależności od liczby jednostek SU | Nie zdefiniowano jawnie |
| Autouzupełnianie (POST /indexes/{index}/docs/autocomplete) | Różni się w zależności od liczby jednostek SU | Nie zdefiniowano jawnie |
Limity ograniczania klasyfikacji semantycznej
Punktator semantyczny używa systemu kolejkowania do zarządzania współbieżnymi żądaniami. Ten system umożliwia usługom wyszukiwania uzyskanie największej liczby zapytań na sekundę. Po osiągnięciu limitu współbieżnych żądań system umieszcza dodatkowe żądania w kolejce. Jeśli kolejka jest pełna, system odrzuca dalsze żądania i należy je ponowić.
Łączna liczba zapytań rankingowania semantycznego na sekundę zależy od następujących czynników:
- Poziom usługi wyszukiwania. Zarówno pojemność kolejki, jak i limity żądań współbieżnych różnią się w zależności od warstwy.
- Liczba jednostek wyszukiwania w usłudze wyszukiwania. Najprostszym sposobem zwiększenia maksymalnej liczby współbieżnych zapytań przez semantyczny rangator jest dodanie kolejnych jednostek wyszukiwania do usługi.
- Łączna dostępna pojemność klasyfikatora semantycznego w regionie.
- Czas potrzebny na obsługę zapytania przy użyciu klasyfikatora semantycznego. Czas ten różni się w zależności od obciążenia usługi wyszukiwania.
W poniższej tabeli opisano limity ograniczania klasyfikacji semantycznej według warstwy, z uwzględnieniem dostępnej pojemności w regionie. Możesz skontaktować się z pomocą techniczną firmy Microsoft, aby poprosić o zwiększenie limitu.
| Zasób | Basic | S1 | S2 | S3 | S3 (wysoka gęstość) | L1 | L2 | Deweloper bezserwerowy |
|---|---|---|---|---|---|---|---|---|
| Maksymalna liczba współbieżnych żądań (na jednostkę wyszukiwania) | 2 | 3 | 4 | 4 | 4 | 4 | 4 | 4 (na usługę) |
| Maksymalny rozmiar kolejki żądań (na jednostkę wyszukiwania) | 4 | 6 | 8 | 8 | 8 | 8 | 8 | 8 (na usługę) |
Limity żądań interfejsu API
Istnieją limity zapytań, ponieważ niezwiązane zapytania mogą zdestabilizować usługę wyszukiwania. Zazwyczaj takie zapytania są tworzone programowo. Jeśli aplikacja generuje zapytania wyszukiwania programowo, zaprojektuj je tak, aby nie generowała zapytań o niezwiązany rozmiar.
Limity ładunków istnieją z podobnych powodów, zapewniając stabilność usługi wyszukiwania. Limit dotyczy całego żądania, włącznie ze wszystkimi jego składnikami. Na przykład, jeśli żądanie łączy kilka dokumentów lub poleceń, całe żądanie musi mieścić się w obsługiwanym limicie.
Jeśli musisz przekroczyć obsługiwany limit, przetestuj obciążenie , aby wiedzieć, czego oczekiwać.
Z wyjątkiem przypadków, w których zaznaczono, następujące żądania interfejsu API dotyczą wszystkich programowalnych interfejsów, w tym zestawów SDK platformy Azure.
Ogólne:
- Obsługiwany maksymalny limit ładunku to 16 MB na potrzeby indeksowania i wysyłania zapytań za pośrednictwem interfejsu API REST i zestawów SDK.
- Maksymalna długość adresu URL 8 KB (dotyczy tylko interfejsów API REST).
API indeksowania
- Obsługiwane maksymalnie 1000 dokumentów na partię przekazywania indeksu, scalania lub usuwania.
- Każde żądanie obsługuje od 1 do 32 000 akcji indeksowania.
Interfejsy API zapytań:
- Maksymalnie 10 pól w zapytaniu wektorowym
- Maksymalnie 32 pola w klauzuli $orderby.
- Maksymalnie 100 000 znaków w klauzuli wyszukiwania.
- Maksymalna liczba klauzul w wyszukiwaniu wynosi 3000.
- Maksymalne limity dla zapytań z użyciem wildcard i wyrażeń regularnych, zgodnie z ograniczeniami wymuszanymi przez Lucene. Limituje liczbę wzorców, odmian lub dopasowań do 1000 wystąpień. Ten limit jest obowiązujący, aby uniknąć przeciążenia silnika.
Wyszukiwane terminy:
- Obsługiwany maksymalny rozmiar terminu wyszukiwania to 32 766 bajtów (32 KB minus 2 bajty) zakodowanego tekstu UTF-8. Dotyczy wyszukiwania słów kluczowych i właściwości tekstowej wyszukiwania wektorowego.
- Obsługiwany maksymalny rozmiar terminu wyszukiwania to 1000 znaków dla wyszukiwania prefiksów i wyszukiwania wyrażeń regularnych.
Limity odpowiedzi interfejsu API
- Każda strona wyników wyszukiwania zwraca maksymalnie 1000 dokumentów.
- Każde żądanie sugerowanego interfejsu API zwraca maksymalnie 100 sugestii.
Aparat wyszukiwania zwraca domyślnie 50 wyników, ale można zastąpić ten parametr do maksymalnego limitu.
Limity kluczy interfejsu API
Użyj kluczy interfejsu API do uwierzytelniania usługi. Istnieją dwa typy kluczy interfejsu API. Klucze administratora określone w nagłówku żądania zapewniają pełny dostęp do odczytu i zapisu w usłudze. Klucze zapytań określone w adresie URL są tylko do odczytu i zwykle dystrybuowane do aplikacji klienckich.
- Każda usługa obsługuje maksymalnie dwa klucze administratora.
- Każda usługa obsługuje maksymalnie 50 kluczy zapytań.