Verarbeitung von Sprache auswählen

Nachdem Sie sich für Gesprächssteuerung entschieden haben, müssen Sprachagenten eine weitere Entscheidung treffen: Spracharchitektur.

Muster 1: Grundlegender Sprachmodus

Sprache > Text >NLU/NLU+>Klassische Orchestrierung> Sprache

In diesem Muster werden die Aussagen des Anrufenden zuerst transkribiert, dann wird der Text von den Dialog-Flows von Copilot Studio verarbeitet. Abschließend wird der Text zurück in gesprochene Sprache umgewandelt.

Dieses Muster verwenden wenn

  • Sie einen vollständig klassischen, deterministischen Ablauf verwenden.

  • Kostenminimierung ist entscheidend.

  • Sie benötigen eine benutzerdefinierte oder neuronale Stimme.

  • Sie benötigen präzise Kontrolle über die Spracherkennung.

  • Sie arbeiten mit MFV-intensiven Flows.

Abwägungen

  • Funktioniert nur mit klassischer Orchestrierung.

  • Unterstützt keine hybride oder generative Orchestrierung.

  • Die Unterstützung von mehrsprachigen und gemischtsprachigen Eingaben erfordert mehr Arbeit. Dafür sind Sprachenerkennung, sprachspezifische Prompts und Grammatik, die Einrichtung des Sprach-zu-Text (STT)-Gebietsschemas und die Fallbackbehandlung erforderlich.

Wichtig

Der grundlegende Sprachmodus ist nicht einfach nur eine Sprachmodellwahl. Er schränkt die Orchestrierung grundlegend ein.

Muster 2: Streaming-Modus

Sprache > KI-Modell > Sprache

Eine Spracharchitektur, bei der ein einzelnes Sprachmodell Audio End-to-End verarbeitet und nativ die Audioeingabe und -ausgabe übernimmt. Es gibt keinen separaten STT- oder Text-to-Speech (TTS)-Schritt. Das Modell erhält den Audiostream des Anrufers direkt und gibt eine synthetische Audioantwort in Echtzeit zurück.

Diese Architektur verwendet eine eng integrierte Echtzeit-Modellpipeline, um ultra-niedrige Latenz, einen natürlichen Gesprächsfluss und eine vereinfachte Bereitstellung zu ermöglichen. Dieser Ansatz eignet sich besonders, wenn Geschwindigkeit und natürlicher Gesprächsfluss oberste Priorität haben, zum Beispiel bei hochfrequenten Kundeninteraktionen in gut unterstützten Sprachen und Regionen. Dieser Ansatz bietet nur eine begrenzte Anzahl verfügbarer Stimmen und begrenzte Anpassungsmöglichkeiten.

Wichtiger Vorteil: Ultra-niedrige Latenz, natürliches Gesprächswechsel.

Dieses Muster verwenden wenn

  • Natürliche Gesprächsführung und verbesserte Prosodie stehen im Vordergrund.

  • Das Unternehmen möchte ein erstklassiges Gesprächserlebnis.

  • Überlegene Handhabung von mehrsprachigen und gemischtsprachigen Eingaben ist erforderlich, inklusive nahtlose Sprachumschaltung.

  • Kontextuelles Verständnis (Tonfall, Absicht und Gesprächsnuancen) ist entscheidend und reduziert die Abhängigkeit von expliziten Übersetzungsebenen.

  • Geringe Latenz und Echtzeit-Reaktionsfähigkeit sind für das Gesamterlebnis unerlässlich.

  • Das Team ist bereit, in Tests, Abstimmung, Bewertung und Leitplanken zu investieren.

Abwägungen

  • Weniger Anpassungsmöglichkeiten.

  • Eingeschränkte Stimmenoptionen.

  • Starke Abhängigkeit von der Prompt-Qualität.

  • Preis und Modellwahl sind wichtiger.

  • Das Echtzeit-Sprachmodell schränkt die Tiefe der Argumentation ein. Außerdem bietet Ihnen dies weniger Flexibilität, eine Orchestrierung von Text-Sprachmodellen mit höherer Kapazität oder spezialisierte Agents für komplexe Schlussfolgerungen einzusetzen.

  • Die Argumentationstiefe beim Echtzeit-Sprachmodell ist im Vergleich zur Orchestrierung mit einem Text-Sprachmodell niedriger, da letzteres Ihnen die Flexibilität gibt, bei Bedarf das leistungsstärkste verfügbare Modell zu nutzen.