組み込みのエンタープライズ向けセキュリティ、監視、およびガバナンスを備え、AI モデル、AI エージェント、および AI アプリケーションを作成し管理するための統合 Azure プラットフォーム
Azure SpeechでMAI-Transcribe 1.5を使用する方法はありますか?
Azure SpeechでMAI-Transcribe 1.5を使用する方法はありますか?
MAI-Transcribe in Azure Speech (preview)のページには言語の選択がありますが、どれを選んでもコードが出てきません。
LLM Speech for speech transcription and translationのページには
コードがありますが、特にモデルの選択をしているようには見えないので、なんのモデルで処理が動いているのか確証がありませんでした。
Microsoft Foundry
-
SRILAKSHMI C • 19,735 評価のポイント • Microsoft 外部スタッフ • モデレーター
2026-06-25T08:46:32.33+00:00 こんにちは。nao_ikeda,
Microsoft Q&A にお問い合わせいただき、ありがとうございます。
Azure Speech で MAI-Transcribe 1.5 を使用したいものの、「Azure Speech (Preview) の MAI-Transcribe」ページでは言語オプションが表示されるだけでコードサンプルが生成されないこと、一方で「音声の文字起こしと翻訳を行う LLM Speech」のページにはコード例があるものの、どのモデルが使用されているかが直感的に分かりにくい、という状況かと存じます。
Azure Speech で MAI-Transcribe 1.5 を使用できますか?
はい、使用可能です。
MAI-Transcribe 1.5 は Azure Speech の LLM Speech API (プレビュー) を通じて利用でき、音声の文字起こし(Speech-to-Text)のシナリオでサポートされています。
現在サポートされている MAI-Transcribe モデルは以下の通りです。
mai-transcribe-1.5
mai-transcribe-1
なぜ MAI-Transcribe のページにはコードサンプルが表示されないのですか?
MAI-Transcribe プレビューページの言語選択機能は、主にサポートされている言語やモデルの機能を示すためのものです。そのため、言語を選択してもコードサンプルが生成されない場合があります。
実際の実装例は、MAI-Transcribe モデルにアクセスするための API インターフェースである「LLM Speech API」のドキュメントで提供されています。
どのモデルが使用されているかは、どうすれば分かりますか?
モデルはリクエストのペイロード内で明示的に指定します。
MAI-Transcribe 1.5 を使用するには、リクエストの定義でモデル名を指定する必要があります。
{ "enhancedMode": { "enabled": true, "model": "mai-transcribe-1.5" } }リクエストに以下が含まれる場合:
"model": "mai-transcribe-1.5"文字起こしはMAI-Transcribe 1.5モデルを使用して処理されます。
リクエスト例
curl --location 'https://<resource>.cognitiveservices.azure.com/speechtotext/transcriptions:transcribe?api-version=2025-10-15' \ --header 'Ocp-Apim-Subscription-Key: <SpeechKey>' \ --form 'audio=@"audio.wav"' \ --form 'definition={ "enhancedMode": { "enabled": true, "model":"mai-transcribe-1.5" } }'重要なパラメータは、次の通りです。
"model":"mai-transcribe-1.5"これにより、MAI-Transcribe 1.5 モデルが明示的に選択されます。
前提条件
Azure Speech (プレビュー) で MAI-Transcribe を使用するには、以下のものが必要です。
Azure サブスクリプション
サポートされている Azure AI Speech リソースまたは Azure AI Foundry リソース
Speech リソースのキーとリージョン
サポートされている Speech リージョン
サポートされている形式(WAV、MP3、FLAC など)の音声ファイル
サポートされているサービス制限内の音声ファイルサイズ
MAI-Transcribe 1.5 の追加機能
MAI-Transcribe 1 と比較して、バージョン 1.5 では以下の機能が導入されています。
対応言語の拡大
フレーズリストとエンティティ・バイアス(優先認識)
文字起こしスタイルの制御(読みやすさ重視または逐語的)
ノイズの多い環境での認識品質の向上
ドメイン固有の文字起こし精度の向上
こちらをご参照ください。
MAI-Transcribe in Azure Speech (Preview)
LLM Speech for Speech Transcription and Translation (Preview)
MAI-Transcribe-1.5 Model Catalog
MAI-Transcribe-1.5 Model Catalog
MAI-Transcribe 1.5を利用する際はLLM Speech APIを使用するのが適切であり、現在どのモデルが動作しているかを確認する最も確実な方法は、リクエストのペイロードで
"model": "mai-transcribe-1.5"を明示的に指定することです。お役に立てれば幸いです。ほかにもご質問がございましたら、お知らせください。
ありがとうございます。
-
-
nao_ikeda • 1 評価のポイント
2026-06-29T00:53:35.0766667+00:00 以下のようになります。
curl --location "https://iv-voice-001-resource.services.ai.azure.com/speechtotext/transcriptions:transcribe?api-version=2025-10-15" ^
--header "Ocp-Apim-Subscription-Key: XXXX" ^
--form "[email protected]" ^
--form "definition={"enhancedMode": {"enabled": true, "model": "mai-transcribe-1.5"}}"
{"code":"InvalidRequest","message":"Enhanced mode with model is currently not supported yet."}curl --location iv-voice-001-resource.services.ai.azure.com/speechtotext/transcriptions:transcribe?api-version=2025-10-15" ^
--header "Ocp-Apim-Subscription-Key: XXXX" ^
--form "[email protected]"{"durationMilliseconds":37573,"combinedPhrases":[{"text":"ええと、最近取り組んだフロントエンドの課題で、ええと、こういう問題をこういうふうに方法としてこうしました。"}],"phrases":[{"offsetMilliseconds":6400,"durationMilliseconds":31090,"text":"ええと、最近取り組んだフロントエンドの課題で、ええと、こういう問題をこういうふうに方法としてこうしました。","words":[{"text":"え","offsetMilliseconds":6400,"durationMilliseconds":80},{"text":"え","offsetMilliseconds":26250,"durationMilliseconds":280},{"text":"と","offsetMilliseconds":26530,"durationMilliseconds":240},{"text":"、","offsetMilliseconds":26770,"durationMilliseconds":120},{"text":"最","offsetMilliseconds":27170,"durationMilliseconds":400},{"text":"近","offsetMilliseconds":27570,"durationMilliseconds":240},{"text":"取","offsetMilliseconds":27810,"durationMilliseconds":80},{"text":"り","offsetMilliseconds":27890,"durationMilliseconds":160},{"text":"組","offsetMilliseconds":28050,"durationMilliseconds":160},{"text":"ん","offsetMilliseconds":28210,"durationMilliseconds":80},{"text":"だ","offsetMilliseconds":28290,"durationMilliseconds":80},{"text":"フ","offsetMilliseconds":28370,"durationMilliseconds":200},{"text":"ロ","offsetMilliseconds":28570,"durationMilliseconds":80},{"text":"ン","offsetMilliseconds":28650,"durationMilliseconds":40},{"text":"ト","offsetMilliseconds":28690,"durationMilliseconds":80},{"text":"エ","offsetMilliseconds":28770,"durationMilliseconds":80},{"text":"ン","offsetMilliseconds":28850,"durationMilliseconds":80},{"text":"ド","offsetMilliseconds":28930,"durationMilliseconds":80},{"text":"の","offsetMilliseconds":29010,"durationMilliseconds":80},{"text":"課","offsetMilliseconds":29090,"durationMilliseconds":160},{"text":"題","offsetMilliseconds":29250,"durationMilliseconds":200},{"text":"で","offsetMilliseconds":29450,"durationMilliseconds":80},{"text":"、","offsetMilliseconds":29530,"durationMilliseconds":120},{"text":"え","offsetMilliseconds":29650,"durationMilliseconds":80},{"text":"え","offsetMilliseconds":29730,"durationMilliseconds":80},{"text":"と","offsetMilliseconds":29810,"durationMilliseconds":80},{"text":"、","offsetMilliseconds":29890,"durationMilliseconds":120},{"text":"こ","offsetMilliseconds":30010,"durationMilliseconds":80},{"text":"う","offsetMilliseconds":30090,"durationMilliseconds":80},{"text":"い","offsetMilliseconds":30170,"durationMilliseconds":160},{"text":"う","offsetMilliseconds":30330,"durationMilliseconds":80},{"text":"問","offsetMilliseconds":30410,"durationMilliseconds":240},{"text":"題","offsetMilliseconds":30650,"durationMilliseconds":280},{"text":"を","offsetMilliseconds":30930,"durationMilliseconds":80},{"text":"こ","offsetMilliseconds":31010,"durationMilliseconds":80},{"text":"う","offsetMilliseconds":31090,"durationMilliseconds":80},{"text":"い","offsetMilliseconds":31170,"durationMilliseconds":160},{"text":"う","offsetMilliseconds":31330,"durationMilliseconds":80},{"text":"ふ","offsetMilliseconds":31410,"durationMilliseconds":160},{"text":"う","offsetMilliseconds":31570,"durationMilliseconds":80},{"text":"に","offsetMilliseconds":31650,"durationMilliseconds":160},{"text":"方","offsetMilliseconds":31810,"durationMilliseconds":160},{"text":"法","offsetMilliseconds":31970,"durationMilliseconds":240},{"text":"と","offsetMilliseconds":32210,"durationMilliseconds":160},{"text":"し","offsetMilliseconds":32370,"durationMilliseconds":80},{"text":"て","offsetMilliseconds":32450,"durationMilliseconds":480},{"text":"こ","offsetMilliseconds":33010,"durationMilliseconds":200},{"text":"う","offsetMilliseconds":33210,"durationMilliseconds":80},{"text":"し","offsetMilliseconds":33290,"durationMilliseconds":120},{"text":"ま","offsetMilliseconds":33410,"durationMilliseconds":80},{"text":"し","offsetMilliseconds":33490,"durationMilliseconds":160},{"text":"た","offsetMilliseconds":33650,"durationMilliseconds":240},{"text":"。","offsetMilliseconds":37330,"durationMilliseconds":160}],"locale":"ja-JP","conf
-
SRILAKSHMI C • 19,735 評価のポイント • Microsoft 外部スタッフ • モデレーター
2026-06-30T06:58:44.28+00:00 こんにちは nao_ikeda,
リクエストの詳細とテスト結果を共有していただきありがとうございます。
ご報告いただいた動作から判断すると、以下の2つの異なるシナリオが存在するようです。
モデルを指定した場合:
{ "enhancedMode": { "enabled": true, "model": "mai-transcribe-1.5" } }サービスは InvalidRequest を返します: モデルを使用した拡張モードは現在サポートされていません。
enhancedMode セクションを省略すると、デフォルトの音声文字起こし動作を使用して文字起こしリクエストが成功します。
エラーメッセージは非常に明確です。「モデルを使用した拡張モードは現在サポートされていません。」
これは、MAI-Transcribe 1.5 モデルはドキュメント化されているものの、以下の方法で明示的に選択する機能がないことを示しています。
"enhancedMode": { "enabled": true, "model": "mai-transcribe-1.5" }現在、呼び出しているサービスエンドポイントではサポートされていません。
つまり、APIはパラメータを認識しますが、バックエンドがこの機能をまだサポートしていないため、リクエストを処理する代わりにInvalidRequestを返します。
モデルを指定しない場合、リクエストが機能するのはなぜですか?
enhancedModeブロックを削除すると、サービスはSpeechサービス用に設定されているデフォルトの文字起こしモデルにフォールバックします。現時点では、レスポンスには使用された基盤となるモデルが示されないため、文字起こしがMAI-Transcribe 1、MAI-Transcribe 1.5、またはその他のデフォルトモデルを使用して実行されたかどうかを確認するメカニズムはサポートされていません。
推奨事項
現在の動作に基づくと、
文字起こしが正しく機能している場合は、標準の文字起こしリクエスト(enhancedModeなし)を引き続き使用してください。
現時点では、明示的なモデル選択は以下で行えます。
"model": "mai-transcribe-1.5"サービス応答に示されているように、エンドポイントではまだサポートされていません。
Azure Speech のドキュメントとリリースノートをご確認ください。明示的なモデル選択のサポートは、今後のプレビュー版または一般提供版で導入される可能性があります。
MAI-Transcribe 1.5 を明示的に呼び出す必要があるにもかかわらず、「拡張モードとモデルは現在サポートされていません」というエラーが繰り返し表示される場合は、現在の API バージョンまたはリージョンでこの機能がまだ有効になっていない可能性があります。
よろしくお願いいたします。
-
-
SRILAKSHMI C • 19,735 評価のポイント • Microsoft 外部スタッフ • モデレーター
2026-07-02T01:11:56.1866667+00:00 こんにちは。nao_ikeda,
前回の返信以降、状況についてご連絡をいただいておりませんが、その後解決されましたでしょうか?もし解決策が見つかりましたら、他の方の参考にもなりますので、ぜひコミュニティで共有していただければ幸いです。まだ解決していない場合は、詳細をお知らせいただければ、引き続きサポートさせていただきます。
よろしくお願いいたします。
サインインしてコメントする