technologie

Google präsentiert Gemini 3.5 Transcribe: KI-Modell für verbesserte Audio-Transkription

Google hat Gemini 3.5 Transcribe eingeführt, ein KI-gestütztes Audio-Modell, das eine verbesserte Spracherkennung und Transkription bietet. Laut dem Unternehmen kann das Modell Texte generieren, die einen scheinbar ungeordneten Fluss der Gedanken widerspiegeln.

Besondere Fähigkeiten von Gemini 3.5 Transcribe

Im Gegensatz zu herkömmlichen Spracherkennungssystemen, die mit Hintergrundgeräuschen, komplexer Fachsprache und Sprechfehlern zu kämpfen haben, wandelt Gemini 3.5 rohes Audio direkt in präzise, bearbeitete und formatierte Texte um. Das Modell ist darauf ausgelegt, den natürlichen Sprachstil der Nutzer zu erfassen und die Intention hinter der Sprache besser zu verstehen sowie personalisierte Vokabeln zu erkennen.

Verbesserte Transkriptionsqualität

Verbesserte Transkriptionsqualität

Gemini 3.5 Transcribe kann Autokorrekturen im Sprechen problemlos verarbeiten, Füllwörter (wie 'ehs' und 'ahs') entfernen und den Text automatisch formatieren, um Kontinuität und Fluss zu gewährleisten. Darüber hinaus kann das Modell komplexe Aufgaben wie die Generierung von Bildern oder die Analyse von Dateien an andere Gemini-Modelle delegieren. Es ermöglicht zudem präzisere Texttranskriptionen mit einer geringeren Fehlerquote.

Sprachverständnis und Unterstützung

Sprachverständnis und Unterstützung

Die Firma betont, dass Gemini 3.5 Transcribe spezialisierte Fachsprache und individuelle Rechtschreibung erkennt und die Transkriptionen an den personalisierten Wortschatz jedes Nutzers anpasst. Es erkennt automatisch über 85 Sprachen, berücksichtigt Akzente und Dialekte und identifiziert in Gesprächen mit bis zu drei Sprechern, wer was gesagt hat, inklusive Zeitstempel (die Kompatibilität mit mehr als drei Sprechern ist experimentell).

Integration und Verfügbarkeit

Integration und Verfügbarkeit

Gemini 3.5 Transcribe soll sich nahtlos in Entwicklungsprozesse von Sprachagenten, Echtzeit-Simulationswerkzeuge oder nachverarbeitende Analysesysteme integrieren lassen. Google stellt das Modell über zwei APIs zur Verfügung: Eine ist auf das Programmgesteuerte Audio-Verarbeitung ausgerichtet (z.B. Transkription von aufgezeichnetem Audio, Meetings oder Anrufprotokollen mit Sprecherzuweisung und Zeitstempeln), die andere auf die Echtzeit-Transkription.