---
title: "Technische Architektur"
canonical: "https://dokucenter.yuutel.at/space/Dokucenter/2795208705/Technische%20Architektur"
format: markdown
---
Das Grundgerüst des Voicebots besteht aus drei Bausteinen:

# **Speech-to-Text (STT)**

Die STT ist die Spracherkennung und ermöglicht die Umwandlung gesprochener Sprache in Text in Echtzeit. Aktuell bieten wir die folgenden Optionen zur Auswahl an:

- Microsoft Azure
- Google

> ℹ️ Bei Microsoft Azure STT werden alle Daten auf deutschen Servern verarbeitet. Diese Option ist vollkommen DSGVO-konform.

# **Large Language Model (LLM)**

Das LLM ist das Sprachmodell zur Antwortgenerierung, sozusagen das “Gehirn” des Voicebots. Es verarbeitet und interpretiert das Gesprochene in Textform und generiert dann eine Antwort in Textform. Dafür wird standardmäßig Azure OpenAI GPT-4o mini eingesetzt. Welche Antwort der AI-Agent gibt, wird durch den [Prompt](https://yuutel.atlassian.net/wiki/spaces/Dokucenter/pages/2808610844) definiert.

> ℹ️ Unser LLM läuft auf europäischen Servern, die ebenso von Microsoft Azure gehostet werden und ist DSGVO-konform.

# **Text-to-Speech (TTS)**

TTS** **ist die “Stimme“ des Voicebots und eine Kernfunktion zur Umwandlung von geschriebenem Text in gesprochene Sprache. Die vom LLM generierte Antwort wird durch Sprachsynthese in gesprochene Sprache umgewandelt. Dadurch können Informationen in Echtzeit und in natürlicher Sprachqualität bereitgestellt werden.

Zur Verfügung stehen verschiedene Anbieter, Sprachen und Stimmvarianten. Abhängig vom gewählten Dienst können unterschiedliche Stimmen, Geschlechter und Dialekte (z. B. Schweizerdeutsch oder österreichisches Deutsch) genutzt werden. Aktuell bieten wir folgende Optionen an:

- Microsoft Azure TTS
- ElevenLabs
- Amazon Polly

> ℹ️ Microsoft Azure TTS wird auf europäischen Servern gehostet und sind DSVGO-konform. Aktuell sind unsere Stimmen von ElevenLabs und Amazon Polly nicht DSGVO-konform.

![agent_aufbau.jpg](media://814bf443-91ff-4f7d-93d4-10c55f6882b8)