Gemini 3.5 Transcribe will Spracheingaben professionell aussehen lassen
19:07, 27.08.2026
Das Tippen während des Sprechens könnte schon bald der Vergangenheit angehören. Google hat „Gemini 3.5 Transcribe“ vorgestellt, ein neues KI-Modell, das natürliche Sprache in sauberen, lesbaren Text umwandelt.
Das Modell geht über eine einfache Transkription hinaus. Es kann Füllwörter entfernen, den Text automatisch strukturieren und das Ergebnis formatieren, ohne dass Sie jeden Satz selbst überarbeiten müssen. Sie können den Text sogar mit Ihrer Stimme bearbeiten, was das Verfassen von Notizen, Entwürfen und Nachrichten erheblich beschleunigen könnte.
Laut Google stellt „Gemini 3.5 Transcribe“ eine Verbesserung gegenüber dem früheren Modell „Chirp 3“ dar, insbesondere wenn Personen verschiedene Sprachen sprechen. Es unterstützt mehr als 85 Sprachen, darunter Russisch, und kann Sprachwechsel innerhalb derselben Aufnahme erkennen.
Ihr Wortschatz kann der KI beibringen, worauf es ankommt
Fachvokabular bereitet der Spracherkennung oft Probleme. Gemini 3.5 Transcribe löst dieses Problem mit einem benutzerdefinierten Wörterbuch. Sie können Namen, Fachbegriffe und ungewöhnliche Schreibweisen hinzufügen und so dem Modell helfen, Wörter zu erkennen, die herkömmlichen Spracherkennungsprogrammen möglicherweise entgehen.
Bei Audioaufnahmen kann das Modell zudem bis zu drei Sprecher unterscheiden und einzelnen Wörtern Zeitstempel zuweisen. Das könnte die Aufbereitung von Interviews, Besprechungen und Recherchen erheblich vereinfachen.
Google arbeitet zudem an „Gemini 3.5 Live“ und „Live Experimental“. Diese Modelle könnten Sprachkonversationen in Echtzeit verbessern, einschließlich der Verarbeitung von Unterbrechungen und des visuellen Verständnisses. Allerdings hat Google noch keine Veröffentlichungstermine bekannt gegeben.
Das kann Ihre Arbeitsweise verändern
Wir glauben, dass Tools wie „Gemini 3.5 Transcribe“ alltägliche Arbeitsabläufe still und leise verändern könnten. Möglicherweise verbringen Sie weniger Zeit mit dem Tippen und Korrigieren von Transkripten und haben mehr Zeit, sich mit den eigentlichen Ideen zu beschäftigen.
Das Modell ist bereits auf Englisch über die Gemini-App für macOS und als öffentliche Vorschau über die Gemini-API verfügbar. Google plant außerdem, es in Chrome zu integrieren.
Möchten Sie bei den neuesten KI-Entwicklungen immer auf dem Laufenden bleiben? Teilen Sie diesen Artikel mit Ihrem Team und entdecken Sie weitere KI-Beiträge in unserem Blog.