Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Nachdem Sie sich für Gesprächssteuerung entschieden haben, müssen Sprachagenten eine weitere Entscheidung treffen: Spracharchitektur.
Muster 1: Grundlegender Sprachmodus
Sprache > Text >NLU/NLU+>Klassische Orchestrierung> Sprache
In diesem Muster werden die Aussagen des Anrufenden zuerst transkribiert, dann wird der Text von den Dialog-Flows von Copilot Studio verarbeitet. Abschließend wird der Text zurück in gesprochene Sprache umgewandelt.
Dieses Muster verwenden wenn
Sie einen vollständig klassischen, deterministischen Ablauf verwenden.
Kostenminimierung ist entscheidend.
Sie benötigen eine benutzerdefinierte oder neuronale Stimme.
Sie benötigen präzise Kontrolle über die Spracherkennung.
Sie arbeiten mit MFV-intensiven Flows.
Abwägungen
Funktioniert nur mit klassischer Orchestrierung.
Unterstützt keine hybride oder generative Orchestrierung.
Die Unterstützung von mehrsprachigen und gemischtsprachigen Eingaben erfordert mehr Arbeit. Dafür sind Sprachenerkennung, sprachspezifische Prompts und Grammatik, die Einrichtung des Sprach-zu-Text (STT)-Gebietsschemas und die Fallbackbehandlung erforderlich.
Wichtig
Der grundlegende Sprachmodus ist nicht einfach nur eine Sprachmodellwahl. Er schränkt die Orchestrierung grundlegend ein.
Muster 2: Streaming-Modus
Sprache > KI-Modell > Sprache
Eine Spracharchitektur, bei der ein einzelnes Sprachmodell Audio End-to-End verarbeitet und nativ die Audioeingabe und -ausgabe übernimmt. Es gibt keinen separaten STT- oder Text-to-Speech (TTS)-Schritt. Das Modell erhält den Audiostream des Anrufers direkt und gibt eine synthetische Audioantwort in Echtzeit zurück.
Diese Architektur verwendet eine eng integrierte Echtzeit-Modellpipeline, um ultra-niedrige Latenz, einen natürlichen Gesprächsfluss und eine vereinfachte Bereitstellung zu ermöglichen. Dieser Ansatz eignet sich besonders, wenn Geschwindigkeit und natürlicher Gesprächsfluss oberste Priorität haben, zum Beispiel bei hochfrequenten Kundeninteraktionen in gut unterstützten Sprachen und Regionen. Dieser Ansatz bietet nur eine begrenzte Anzahl verfügbarer Stimmen und begrenzte Anpassungsmöglichkeiten.
Wichtiger Vorteil: Ultra-niedrige Latenz, natürliches Gesprächswechsel.
Dieses Muster verwenden wenn
Natürliche Gesprächsführung und verbesserte Prosodie stehen im Vordergrund.
Das Unternehmen möchte ein erstklassiges Gesprächserlebnis.
Überlegene Handhabung von mehrsprachigen und gemischtsprachigen Eingaben ist erforderlich, inklusive nahtlose Sprachumschaltung.
Kontextuelles Verständnis (Tonfall, Absicht und Gesprächsnuancen) ist entscheidend und reduziert die Abhängigkeit von expliziten Übersetzungsebenen.
Geringe Latenz und Echtzeit-Reaktionsfähigkeit sind für das Gesamterlebnis unerlässlich.
Das Team ist bereit, in Tests, Abstimmung, Bewertung und Leitplanken zu investieren.
Abwägungen
Weniger Anpassungsmöglichkeiten.
Eingeschränkte Stimmenoptionen.
Starke Abhängigkeit von der Prompt-Qualität.
Preis und Modellwahl sind wichtiger.
Das Echtzeit-Sprachmodell schränkt die Tiefe der Argumentation ein. Außerdem bietet Ihnen dies weniger Flexibilität, eine Orchestrierung von Text-Sprachmodellen mit höherer Kapazität oder spezialisierte Agents für komplexe Schlussfolgerungen einzusetzen.
Die Argumentationstiefe beim Echtzeit-Sprachmodell ist im Vergleich zur Orchestrierung mit einem Text-Sprachmodell niedriger, da letzteres Ihnen die Flexibilität gibt, bei Bedarf das leistungsstärkste verfügbare Modell zu nutzen.