Ich verwende GPT-Realtime. Audioantworten, die länger als 10 Sekunden sind, werden sporadisch abgeschnitten. In der Antwort erhalte ich den Status „incomplete”

Martin Groller 20 Zuverlässigkeitspunkte
2025-11-04T10:40:35.2433333+00:00

Ich verwende das GPT-Realtime Modell für einen Voice-Agent. Bei Antworten über ca. 10 Sekunden bricht das generierte Audio sporadisch ab. In der Response vom Modell erhalte ich den Status "incomplete". Die Antwort erreicht aber nicht das Tokenlimit. Wenn ich von Audiogenerierung auf Textgenerierung umstelle erhalte ich aber die gesamte Antwort in Textform und kann den Fehler nicht reproduzieren.

Foundry Tools
Foundry Tools

Früher bekannt als Azure-KI-Dienste oder Azure Cognitive Services; eine einheitliche Sammlung vordefinierter KI-Funktionen innerhalb der Microsoft Foundry-Plattform


Antwort, die vom Frageautor angenommen wurde
SRILAKSHMI C 19,735 Zuverlässigkeitspunkte Externe Microsoft-Mitarbeiter Moderator
2025-11-04T13:21:11.6866667+00:00

Hello Martin Groller,

Willkommen bei Microsoft Q&A und vielen Dank für Ihre Anfrage.

Ich verstehe, dass Sie ein Problem haben: Audioantworten, die mit dem GPT-Echtzeitmodell generiert werden, werden nach etwa 10 Sekunden abgeschnitten, und der Antwortstatus wird als „unvollständig“ angezeigt. Wenn Sie jedoch auf Textgenerierung umschalten, erhalten Sie die vollständige Antwort ohne Kürzung. Dies deutet darauf hin, dass die Modellausgabe selbst vollständig ist, der Audiostream-Prozess jedoch unterbrochen oder eingeschränkt wird.

Ursache

Der Status „unvollständig“ bedeutet in der Regel, dass der Audiostream beendet wurde, bevor das Modell die Generierung abgeschlossen hatte, oder dass der Client keine Audio-Chunks mehr empfangen hat. Häufige Ursachen sind:

Die GPT-Echtzeit-API unterstützt derzeit Audioantworten von bis zu etwa 10 Sekunden pro Segment. Längere Audioausgaben werden möglicherweise automatisch abgeschnitten.

Wenn Ihr Client vollständige Streaming-Ereignisse nicht korrekt verarbeitet, kann die Wiedergabe vorzeitig beendet werden.

Instabile WebRTC- oder WebSocket-Verbindungen können dazu führen, dass der Stream vorzeitig geschlossen wird, was unvollständige Antworten zur Folge hat.

Schritte zur Fehlerbehebung

Prüfen Sie, ob das Problem regelmäßig nach etwa 10 Sekunden auftritt. Die Realtime API begrenzt derzeit die maximale Audiodauer pro Antwort. Längere Ausgaben müssen daher gegebenenfalls in kleinere Abschnitte unterteilt werden.

Wenn Ihre Implementierung asynchrone Synthese verwendet (wie die Long Audio API), stellen Sie sicher, dass Ihre Abfrage- oder Ereignisbehandlungslogik die vollständige Antwort abwartet. Dadurch werden alle Audiosegmente erfasst und ein vorzeitiger Abbruch vermieden.

Überprüfen Sie Ihre Ereignisbehandlung für Ereignisse wie response.completed, session.updated oder ähnliche. Stellen Sie sicher, dass Antworten nicht abgebrochen oder vorzeitig als abgeschlossen markiert werden. Eine korrekte Behandlung gewährleistet, dass der Stream fortgesetzt wird, bis das Modell die Ausgabe abgeschlossen hat.

Da die Textgenerierung einwandfrei funktioniert, vergleichen Sie beide Konfigurationen. Prüfen Sie die Unterschiede bei:

Modellparametern (Temperatur, maximale Tokenanzahl usw.)

Einstellungen für das Ausgabeformat

Benutzerdefinierten Timeout- oder Antwortdauerparametern in Ihrer Implementierung

Aktivieren Sie die ausführliche Protokollierung oder überprüfen Sie die Antwortmetadaten auf mögliche Fehlermeldungen (z. B. Timeout, Verbindungsabbruch oder Fehler beim Token-Streaming). Dies kann helfen, die Ursache des Problems einzugrenzen – ob es clientseitig, netzwerkseitig oder serverseitig auftritt.

Experimentieren Sie mit unterschiedlichen Ansagelängen und Antwortkomplexitäten, um festzustellen, ob der Abbruch konsistent nach einer bestimmten Dauer erfolgt oder vom Inhalt abhängt.

Bei Antworten, die länger als 10 Sekunden dauern, bietet es sich an, zunächst die vollständige Textausgabe anzufordern und diese anschließend an einen Text-to-Speech-Dienst (TTS) wie Azure Speech Service zur Audiowiedergabe zu übergeben. Dadurch wird eine vollständige Übertragung gewährleistet und Sie haben die Kontrolle über Wiedergabe, Dauer und Spracheinstellungen.

Echtzeitsitzungen benötigen eine kontinuierliche WebRTC- oder WebSocket-Verbindung. Stellen Sie sicher, dass Ihre Netzwerkverbindung stabil bleibt und die Sitzung nicht mitten in der Antwort abbricht oder ein Timeout auftritt.

Siehe auch:

Ich hoffe, das hilft Ihnen weiter. Melden Sie sich gerne, falls Sie weitere Fragen haben.

Vielen Dank!

War diese Antwort hilfreich?

0 Kommentare Keine Kommentare

1 zusätzliche Antwort

Sortieren nach: Neueste
  1. Martin Groller 20 Zuverlässigkeitspunkte
    2025-11-06T05:35:56.93+00:00

    Hallo,

    vielen Dank für die ausführliche Rückmeldung. Wir prüfen derzeit die vorgeschlagenen Maßnahmen. Dabei ist uns bereits ein Punkt aufgefallen: Der Voice-Agent ist speziell auf die Rolle einer Rezeptionistin bzw. eines Rezeptionisten in einem Hotel- oder SPA-Betrieb ausgerichtet und gibt Auskunft über Leistungen wie Massagen.

    Hierbei stoßen wir jedoch auf ein Problem mit dem Inhaltsfilter. Begriffe wie „Massage“ lösen fälschlicherweise den Filter für „sexuelle Inhalte“ aus, was dazu führt, dass die Sprachausgabe abrupt endet. Das betrifft insbesondere typische SPA-Angebote wie Ganzkörpermassagen oder Fußreflexzonenmassagen, bei denen keinerlei unangemessene Inhalte vorliegen.

    Aus diesem Grund haben wir den Inhaltsfilter vorerst weitestgehend deaktiviert. Seitdem funktioniert die Sprachausgabe wie erwartet. Wir werden die weiteren empfohlenen Maßnahmen dennoch sorgfältig prüfen.

    Vielen Dank nochmals für Ihre Unterstützung!

    War diese Antwort hilfreich?


Ihre Antwort

Antworten können von Fragestellenden als „Angenommen“ und von Moderierenden als „Empfohlen“ gekennzeichnet werden, wodurch Benutzende wissen, dass diese Antwort das Problem des Fragestellenden gelöst hat.