SpaceXAI startet Grok Voice Transcribe 2.0 mit zweifacher Genauigkeitssteigerung
SpaceXAI hat am 18. September 2026 Grok Voice Transcribe 2.0 vorgestellt – das neue Modell liefert bei gleichem Preis die doppelte Transkriptionsgenauigkeit und erkennt automatisch 19 Sprachen.

Am 18. September 2026 kündigte SpaceXAI die allgemeine Verfügbarkeit von Grok Voice Transcribe 2.0 über seine Speech‑Recognition‑API unter dem Namen grok-voice-transcribe-2.0 an. Das Unternehmen positioniert den neuen Dienst als direkten Nachfolger des ursprünglichen Grok Voice Transcribe und betont eine zweifache Verbesserung der Transkriptionsgenauigkeit bei unverändertem Stundenpreis.
Laut eigenen Benchmark‑Ergebnissen von SpaceXAI erreicht das Modell nun eine Wort‑Fehlerrate (WER) von 6,8 % bei kurzen mehrsprachigen Sätzen, gegenüber 20,6 % bei Version 1.0. Das entspricht einer Reduktion von etwa 67 % der Fehler für diesen spezifischen Testdatensatz, der 19 Sprachen abdeckt und real‑weltliche, gemischte Sprachaufnahmen simuliert.
Benchmark‑Leistung und öffentliche Rangliste
Das Unternehmen verweist auf die öffentliche Artificial Analysis‑Rangliste, in der Grok Voice Transcribe 2.0 derzeit den ersten Platz für Präzision unter 32 Streaming‑Transkriptionsmodellen belegt. SpaceXAI betont, dass die Rangliste auf unabhängigen Bewertungen beruht, obwohl die genaue Methodik in der Pressemitteilung nicht offengelegt wird.
Zusätzlich zur headline‑WERT‑Verbesserung zeigten interne Tests auf vier proprietären Datensätzen – Telefonate, konversationelle Sprache, diktierte Kennungen und kurze mehrsprachige Phrasen – konsistente Fehlerraten‑Reduktionen in allen Bereichen. Die dramatischsten Gewinne wurden im Kurzphrasensatz beobachtet, wo der Fehler von 20,6 % auf 6,8 % sank.
Technische Fähigkeiten und API‑Features
Grok Voice Transcribe 2.0 unterstützt sowohl Batch‑ als auch Streaming‑Modi. Im Batch‑Modus können Nutzer Audiodateien zur Offline‑Verarbeitung einreichen, während der Streaming‑Modus Echtzeit‑Transkription mit Wort‑Zeitstempeln, Sprecher‑Diarisation und bis zu acht Audiokanälen liefert. All diese Funktionen sind im Basispreis von 0,10 $ pro Stunde für Batch und 0,20 $ pro Stunde für Streaming enthalten.
Das Modell erkennt automatisch die gesprochene Sprache und kann die Erkennung mitten in einer Aufnahme wechseln – eine Fähigkeit, die besonders bei mehrsprachigen Meetings oder Kunden‑Support‑Gesprächen nützlich ist, in denen Agenten und Anrufer die Sprache wechseln.
Über die reine Transkription hinaus liefert die API formatierte Texte, Hervorhebung einer kuratierten Liste von hundert Fachbegriffen und Sprechertrennung ohne zusätzliche Kosten. Dieses All‑in‑One‑Angebot steht im Kontrast zu vielen Wettbewerbern, die für Diarisation oder Zeitstempel extra berechnen.
Annahme und Integration ins Ökosystem
Atlassian hat Grok Voice Transcribe 2.0 bereits in seine Loom‑Video‑Plattform integriert, um Untertitel für aufgezeichnete Meetings und Tutorials zu erzeugen. Der Dienst bleibt bei SpaceXAI gehostet, und das Unternehmen hat kein Open‑Weight‑Modell für den On‑Premise‑Einsatz veröffentlicht.
- 0,10 $ pro Stunde für Batch‑Transkription
- 0,20 $ pro Stunde für Streaming‑Transkription
- Automatische Spracherkennung für 19 Sprachen
- Sprecher‑Diarisation und Wort‑Zeitstempel inklusive
Die Preisstruktur ist einfach: Kunden zahlen pro Stunde verarbeiteter Audiodaten, ohne versteckte Gebühren für erweiterte Funktionen. Diese Transparenz soll Unternehmen ansprechen, die vorhersehbare Kostenmodelle für großflächige Transkriptionsaufgaben benötigen.
Was das für deutschsprachige Unternehmen bedeutet
Für Unternehmen, die hauptsächlich Deutsch verwenden, aber regelmäßig mit mehrsprachigen Kunden oder Partnern kommunizieren, bietet Grok Voice Transcribe 2.0 eine einzige API, die gemischte Sprachinhalte ohne separate, sprachspezifische Services verarbeiten kann.
Die gesenkte Fehlerrate bei kurzen Phrasen erhöht die Zuverlässigkeit von automatisierten Notizen, Compliance‑Logs und Echtzeit‑Untertitelung, was manuelle Nachbearbeitungskosten reduzieren kann.
Die im Basispreis enthaltene Sprecher‑Diarisation und Zeitstempel vereinfachen zudem die Integration in Analyse‑Pipelines, sodass Unternehmen schneller Erkenntnisse aus Telefonaten und Videokonferenzen gewinnen können.
Durch die Unterstützung von bis zu acht parallelen Audiokanälen lässt sich das System auch in komplexen Call‑Center‑Umgebungen einsetzen, in denen mehrere Gesprächspartner gleichzeitig aktiv sind.
Kunden aus dem deutschen Mittelstand berichten bereits von einer Verkürzung der Bearbeitungszeit für Kunden‑Support‑Transkripte um rund 30 %, weil die höhere Genauigkeit weniger Korrekturschleifen erfordert.
SpaceXAI plant, im Laufe des Jahres 2027 weitere Sprachmodelle für speziellere Fachdomains wie Medizin und Recht zu veröffentlichen, die auf der gleichen Infrastruktur wie Grok Voice Transcribe 2.0 aufbauen.
Insgesamt stellt Grok Voice Transcribe 2.0 für deutschsprachige Unternehmen einen bedeutenden Schritt in Richtung kosteneffizienter, hochpräziser Mehrsprachen‑Transkription dar und könnte die Art und Weise, wie Unternehmen interne und externe Kommunikation archivieren, grundlegend verändern.
Quellen
- Introducing Grok Voice Transcribe 2.0SpaceXAI · 18. September 2026
- SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per HourMarkTechPost · 18. September 2026



