Definition
Speech-to-Text (STT)
Speech-to-Text (STT), auch Spracherkennung, ist eine Technologie, die gesprochene Sprache aus einer Audioaufnahme automatisch in geschriebenen Text umwandelt.
Moderne STT-Modelle sind mehrsprachig und robust gegenüber Dialekten und Hintergrundgeräuschen. Sie bilden die Eingangsstufe von Voicebots und ermöglichen Transkriptionen von Meetings; für Schweizerdeutsch bleibt die Genauigkeit je nach Modell begrenzt.