Azure AI 검색 다중 모드 검색

메모

Azure AI 검색 Azure 포털, REST API 및 Azure SDK 통해 사용할 수 있습니다. 또한 엔터프라이즈 콘텐츠를 Microsoft Foundry 포털의 에이전트에 대해 재사용 가능한 사용 권한 인식 기술 자료로 변환하는 관리되는 기술 계층인 Foundry IQ를 뒷받침합니다.

다중 모드 검색은 텍스트, 이미지, 비디오 및 오디오를 비롯한 여러 콘텐츠 형식에서 정보를 수집, 이해 및 검색하는 기능을 나타냅니다. Azure AI 검색 다중 모달 검색은 기본적으로 텍스트와 이미지가 포함된 문서 수집 및 해당 콘텐츠 검색을 지원하므로 두 형식을 결합한 검색을 수행할 수 있습니다.

강력한 다중 모드 파이프라인을 빌드하려면 일반적으로 다음이 포함됩니다.

  1. 문서에서 인라인 이미지 및 페이지 텍스트 추출

  2. 자연어로 이미지 설명

  3. 텍스트와 이미지를 모두 공유 벡터 공간에 포함

  4. 나중에 주석으로 사용할 이미지를 저장합니다.

또한 다중 모드 검색을 사용하려면 문서에 표시되는 정보의 순서를 유지하고 전체 텍스트 검색과 벡터 검색 및 의미 체계 순위를 결합하는 하이브리드 쿼리를 실행해야 합니다.

실제로 멀티모달 검색을 사용하는 애플리케이션은 프로세스에 대한 유일한 신뢰할 수 있는 설명이 PDF 파일의 포함된 다이어그램 내에 있는 경우에도 "HR 양식을 승인하는 프로세스는 무엇인가요?"와 같은 질문에 대답할 수 있습니다.

일반적으로 멀티모달 검색에는 텍스트 및 이미지 처리를 위한 별도의 시스템이 필요하며, 종종 사용자 지정 코드와 개발자의 하위 수준 구성이 필요합니다. 이러한 시스템을 유지 관리하면 더 높은 비용, 복잡성 및 노력이 발생합니다.

Azure AI 검색 이미지를 텍스트와 동일한 검색 파이프라인에 통합하여 이러한 문제를 해결합니다. 단일 멀티모달 파이프라인을 사용하면 차트, 스크린샷, 인포그래픽, 스캔한 양식 및 기타 복잡한 시각적 개체에 상주하는 설정 및 잠금 해제 정보를 간소화할 수 있습니다.

다중 모드 검색은 RAG(검색 보강 생성) 시나리오에 적합합니다. 이미지의 구조적 논리를 해석하여 멀티모달 검색을 통해 RAG 애플리케이션 또는 AI 에이전트가 중요한 시각적 세부 정보를 간과할 가능성이 줄어듭니다. 또한 원본의 형식에 관계없이 원래 원본으로 다시 추적할 수 있는 자세한 답변을 사용자에게 제공합니다.

멀티모달 검색은 어떻게 작동하나요?

멀티모달 파이프라인 만들기를 간소화하기 위해 Azure AI 검색는 Azure 포털에서 데이터 가져오기 마법사를 제공합니다. 이 마법사를 사용하면 데이터 원본을 구성하고, 추출 및 보강 설정을 정의하고, 텍스트, 포함된 이미지 참조 및 벡터 포함이 포함된 다중 모드 인덱스를 생성할 수 있습니다. 자세한 내용은 Quickstart: Azure Portal 다중 모달 검색을 참조하세요.

마법사는 다음 단계에 따라 다중 모드 파이프라인을 만듭니다.

  1. 콘텐츠 추출:문서 추출 기술 또는 Azure Content Understanding 기술 중에서 선택하여 페이지 텍스트, 인라인 이미지, 구조적 메타데이터를 가져옵니다. 각 기술은 메타데이터 추출, 테이블 처리 및 파일 형식 지원을 위한 다양한 기능을 제공합니다. 자세한 비교는 다중 모드 콘텐츠 추출 옵션을 참조하세요.

  2. 청크 텍스트:텍스트 분할 스킬은 추출된 텍스트를 임베딩 스킬과 같은 나머지 파이프라인에서 사용하기 위해 관리하기 쉬운 청크로 나누어 나머지 파이프라인에서 사용됩니다.

  3. 이미지 설명을 생성합니다.GenAI 프롬프트 기술은 이미지를 구두로 처리하여 텍스트 검색에 대한 간결한 자연어 설명을 생성하고 LLM(큰 언어 모델)을 사용하여 포함합니다.

  4. 포함 생성: 포함 기술은 텍스트 및 이미지의 벡터 표현을 만들어 유사성 및 하이브리드 검색을 가능하게 합니다. Azure OpenAI, Microsoft Foundry 또는 Azure Vision(미리 보기) 포함 모델을 기본적으로 호출할 수 있습니다.

    또는 이미지 구두화를 건너뛰고 추출된 텍스트와 이미지를 AML 기술 또는 Azure Vision 멀티모달 포함 기술 통해 멀티모달 포함 모델에 직접 전달할 수 있습니다. 자세한 내용은 다중 모달 콘텐츠 포함 옵션을 참조하세요.

  5. 추출된 이미지 저장:지식 저장소 에는 클라이언트 애플리케이션에 직접 반환할 수 있는 추출된 이미지가 포함되어 있습니다. 마법사를 사용하면 이미지의 위치가 다중 모드 인덱스로 직접 저장되므로 쿼리 시 편리하게 검색할 수 있습니다.

팁

멀티모달 검색이 작동하는 것을 보려면 마법사에서 만든 인덱스를 멀티모달 RAG 샘플 애플리케이션에 연결하세요. 이 샘플에서는 RAG 애플리케이션이 멀티모달 인덱스를 사용하고 응답에서 텍스트 인용 및 관련 이미지 조각을 모두 렌더링하는 방법을 보여 줍니다. 또한 이 샘플에서는 데이터 수집 및 인덱싱의 코드 기반 프로세스를 보여 줍니다.

다중 모드 콘텐츠 추출 옵션

다중 모달 파이프라인은 각 원본 문서를 텍스트, 인라인 이미지 및 관련 메타데이터의 청크로 분할하여 시작됩니다. 이 단계에서 Azure AI 검색 권장되는 두 가지 기본 제공 기술을 제공합니다.

특성 문서 추출 기술 Azure 콘텐츠 이해 기술
텍스트 위치 메타데이터 추출(페이지 및 경계 다각형) 아니요 예
이미지 위치 메타데이터 추출(페이지 및 경계 다각형) 예 예
테이블 추출 및 보존 아니요 예(페이지 간 테이블 포함)
페이지 간 의미 체계 단위 해당 없음 예(페이지 경계에 걸쳐 있음)
파일 형식에 따라 위치 메타데이터 추출 PDF만 해당합니다. PDF, DOCX, XLSX 및 PPTX를 포함하여 지원되는 여러 파일 형식입니다.
데이터 추출에 대한 청구 이미지 추출은 Azure AI 검색 가격 책정 따라 청구됩니다. Azure Content Understanding 가격 책정 따라 청구됩니다.
기본 제공 청크 아니요(텍스트 분할 기술 사용) 예(의미론적 분할)
AI에서 생성된 이미지 설명 아니요 예(modelName 및 modelDeployment이 구성된 경우, 2026-05-01-preview REST API부터 사용 가능)
권장되는 시나리오 정확한 위치 또는 자세한 레이아웃 정보가 필요하지 않은 신속한 프로토타입 생성 또는 프로덕션 파이프라인 페이지 간 테이블 추출, 의미 체계 청크 및 AI 생성 이미지 설명이 필요한 고급 문서 분석

문서 레이아웃 기술은 기존 파이프라인에 대해 계속 지원됩니다. 새로운 기술 세트의 경우 콘텐츠 추출 및 청크를 단일 기술로 결합하고 의미 체계 청크, AI 생성 이미지 설명 및 페이지 간 테이블 추출을 지원하는 Azure Content Understanding 기술을 사용합니다.

멀티모달 콘텐츠 포함 옵션

Azure AI 검색에서는 이미지에서 지식을 검색할 때 이미지 설명 또는 직접 임베딩이라는 두 가지 상호 보완 경로를 따를 수 있습니다. 차이점을 이해하면 비용, 대기 시간 및 응답 품질을 애플리케이션의 요구에 맞게 조정하는 데 도움이 됩니다.

이미지 언어화 다음에 텍스트 포함

이 방법을 사용하면 GenAI 프롬프트 기술이 데이터 수집 시 LLM을 호출하여 각 추출 이미지의 간결한 자연어 설명을 생성합니다. 예를 들어, "관리자 승인으로 시작하는 5단계 HR 액세스 워크플로" 같은 설명이 텍스트로 저장되고, 주변 문서 텍스트와 함께 임베딩됩니다. 그런 후에는 Azure OpenAI, Microsoft Foundry, 또는 Azure Vision 임베딩 모델을 호출하여 벡터화할 수 있습니다.

이제 이미지가 언어로 표현되므로 Azure AI 검색 다음을 수행할 수 있습니다.

  • 다이어그램에 표시된 관계 및 엔터티를 해석합니다.

  • LLM이 응답에서 그대로 인용할 수 있도록, 바로 사용할 수 있는 캡션을 제공하세요.

  • 기초 데이터를 사용하여 RAG 애플리케이션 또는 AI 에이전트 시나리오에 대한 관련 정보 조각을 반환합니다.

추가된 의미 체계 깊이는 모든 이미지에 대한 LLM 호출과 인덱싱 시간의 한계 증가를 수반합니다.

직접 멀티모달 임베딩

두 번째 옵션은 문서에서 추출한 이미지와 텍스트를 동일한 벡터 공간에서 벡터 표현을 생성하는 멀티모달 포함 모델에 전달하는 것입니다. 구성은 간단하며 인덱싱 시 LLM이 필요하지 않습니다. 직접 포함은 시각적 유사도 및 "이것과 비슷한 것을 찾아줘" 시나리오에 적합합니다.

표현은 순전히 수학적이기 때문에 두 이미지가 관련된 이유를 전달하지 않으며 인용 또는 자세한 설명에 대한 LLM 준비 컨텍스트를 제공하지 않습니다.

두 방법 결합

많은 솔루션에는 두 인코딩 경로가 모두 필요합니다. 다이어그램, 흐름도, 그리고 기타 설명이 풍부한 시각 자료는 RAG와 AI 에이전트의 접지에 활용할 수 있도록 의미 정보를 담은 형태로 구두 설명됩니다. 스크린샷, 제품 사진 또는 아트워크는 효율적인 유사성 검색을 위해 직접 포함됩니다. 두 벡터 집합을 저장하고 나란히 검색할 수 있도록 Azure AI 검색 인덱스 및 인덱서 기술 세트 파이프라인을 사용자 지정할 수 있습니다.

다중 모드 콘텐츠를 쿼리하는 옵션

다중 모드 파이프라인이 GenAI 프롬프트 기술로 구동되는 경우 검색 인덱스의 일반 텍스트 및 구두 이미지 둘 다에 대해 하이브리드 쿼리 를 실행할 수 있습니다. 필터를 사용하여 텍스트 또는 이미지만 같은 특정 콘텐츠 형식으로 검색 결과의 범위를 좁힐 수도 있습니다.

GenAI 프롬프트 기술은 하이브리드 검색을 통해 텍스트-벡터 쿼리를 지원하지만 이미지-벡터 쿼리는 지원하지 않습니다. 멀티모달 포함 모델만 쿼리 시 이미지를 벡터로 변환하는 벡터라이저를 제공합니다.

이미지를 다중 모드 인덱스에 대한 쿼리 입력으로 사용하려면 AML 기술 또는 Azure Vision multimodal embeddings skill 동일한 벡터라이저와 함께 사용해야 합니다. 자세한 내용은 검색 인덱스에서 벡터라이저 구성을 참조하세요.

자습서 및 샘플

Azure AI 검색 멀티모달 검색을 시작하는 데 도움이 되도록 Azure 기능을 사용하여 다중 모드 인덱스를 만들고 최적화하는 방법을 보여 주는 콘텐츠 컬렉션은 다음과 같습니다.

콘텐츠 설명
Quickstart: Azure Portal에서 다중 모드 검색 마법사 및 검색 탐색기를 사용하여 Azure 포털에서 다중 모드 인덱스 만들기 및 테스트
멀티모달 튜토리얼 텍스트 및 이미지를 추출하고, 데이터를 청크하고, 유사성 검색 및 기타 검색 패턴을 위해 청크를 벡터화합니다.
샘플 앱: 다중 모드 RAG GitHub 리포지토리 텍스트 조각과 이미지 주석을 모두 표시하는 멀티모달 기능이 있는 엔드투엔드 코드 준비 RAG 애플리케이션입니다. enterprise copilot을 빠르게 시작하기에 이상적입니다.