Zurück zum BlogVergleich

Gemini 3.5 vs Soniox v5 vs Linden-1: STT-Vergleich 2026

Quellenbasierter Vergleich von Gemini 3.5 Transcribe Live, Soniox stt-rt-v5 und Speechmatics Linden-1 für produktive Voice Agents.

Sarah Müller29. August 20269 Min. Lesezeit
Gemini 3.5 vs Soniox v5 vs Linden-1: STT-Vergleich 2026

Inhalt zusammenfassen mit:

Drei neue oder kürzlich aktualisierte Speech-to-Text-Optionen kommen für produktive Voice Agents infrage. Google hat Gemini 3.5 Transcribe und Transcribe Live am 26. August 2026 allgemein verfügbar gemacht. Soniox veröffentlichte stt-rt-v5 am 16. Juni, und LiveKit Agents ergänzte Gemini 3.5 Transcribe Live sowie Speechmatics Linden-1 am 27. August (Google Changelog, Soniox Modelldokumentation, LiveKit Agents Releases).

Dieser Vergleich basiert auf dokumentierten Funktionen und ist kein Labortest. Aktuell existiert kein neutraler, reproduzierbarer Test dieser drei exakten Modelle mit demselben deutschen 8-kHz-Telefoniedatensatz. Die sinnvolle Frage lautet daher nicht: „Welches Modell gewinnt insgesamt?“ Entscheidend sind Zugangsweg, Sitzungslimit, Telefonieformat, Endpointing, Sprachwechsel, Datenroute und Abrechnung für Ihre Anrufe. Grundlagen finden Sie im Glossareintrag zu Speech-to-Text.

Das Wichtigste in Kürze

  • Gemini bietet über den direkten Zugang eine breite Mehrsprachigkeit und ist nativ über LiveKit Inference erreichbar. Live-Sitzungen sind jedoch auf zehn Minuten begrenzt, und die LiveKit-Route lässt sich nicht regional festlegen.
  • Soniox kombiniert lange Sitzungen, native Telefonie-Codecs, Live-Diarisierung, Code-Switching und einstellbares semantisches Endpointing. Die Integration erfolgt über ein Plugin mit eigenem Soniox-Key.
  • Linden-1 ist eine native LiveKit-Inference-Option mit serverseitiger Spracherkennung am Gesprächsende. Der lokale Parameter vad wird ignoriert, und eine Linden-spezifische Regionsgarantie ist nicht veröffentlicht.
  • Öffentliche Preise beziehen sich auf verschiedene Zugangswege und Abrechnungseinheiten. Sie stellen keine Qualitätsrangliste dar.
  • Treffen Sie die Entscheidung nach einem kontrollierten A/B-Test mit Ihren eigenen Anrufen, insbesondere mit Audio aus dem öffentlichen Telefonnetz (PSTN), strukturierten Daten, realen Gesprächsenden und den tatsächlichen Kosten pro Gesprächsminute.

Schneller Vergleich

Kriterium Gemini 3.5 Transcribe Live Soniox stt-rt-v5 Speechmatics Linden-1
Exakte Integrations-ID google/gemini-3.5-transcribe-live in LiveKit model="stt-rt-v5" im Soniox-Plugin speechmatics/linden-1 in LiveKit
Zugangsweg Google Live API oder native LiveKit Inference Python- oder Node.js-Plugin mit Soniox-Key Native LiveKit Inference
Veröffentlichter Sprachumfang Google direkt: 85+; LiveKit-Seite: 26 Codes 60+ 55+
Automatischer Sprachwechsel Ja, auch während einer Live-Sitzung Ja, auch innerhalb eines Satzes Mehrsprachigkeit dokumentiert; beliebiges automatisches Code-Switching nicht eindeutig belegt
Live-Diarisierung Nein Ja In Speechmatics konfigurierbar; konkreten Linden-Pfad praktisch prüfen
Gesprächsende Google Server-Erkennung der Sprachaktivität (VAD), direkt auch hybride und manuelle Strategien Semantisches Endpointing mit einstellbaren Parametern Serverseitiges End-of-Speech; lokales vad wird ignoriert
Maximale veröffentlichte Sitzung 10 Minuten 300 Minuten Kein Linden-spezifisches Limit in den geprüften Unterlagen
Telefonieeingang Direkte Live API verlangt 16-Bit-PCM, 16 kHz, mono PCM, μ-law, A-law und weitere Formate LiveKit abstrahiert Medien; keine Linden-spezifische Rohformatliste veröffentlicht
Datenregion Globale LiveKit-Bereitstellung, nicht regional festlegbar EU-Endpunkte nach Freischaltung der Data Residency Keine Linden-spezifische Regionsgarantie für LiveKit veröffentlicht
Öffentlicher Referenzpreis Direkt geschätzt etwa 0,009 USD/Min.; LiveKit 0,0095 USD/Min. Tokenbasierte Schätzung etwa 0,002 USD/Min. LiveKit 0,005 USD/Min.

Die Tabelle zeigt den Stand vom 29.08.2026. Sie enthält bewusst keine Genauigkeitswerte, weil die Anbieter keine einheitlichen Datensätze, Telefoniekanäle, Sprachmischungen oder Endpointing-Einstellungen verwenden.

Zugangswege und Integration

Hinter den drei Namen stehen unterschiedliche Bereitstellungsmodelle. Sie beeinflussen Zugangsdaten, Routing und Abrechnung. Eine breitere Checkliste zur Auswahl eines STT-Anbieters hilft Ihnen, Anforderungen an den Anbieter von konkreten Modelltests zu trennen.

Gemini 3.5 Transcribe Live

Die direkte Modell-ID lautet gemini-3.5-transcribe-live. LiveKit stellt sie als google/gemini-3.5-transcribe-live bereit. Das Modell liefert vorläufige und finale Ergebnisse über eine Live-WebSocket-Sitzung. Google dokumentiert außerdem strikte Transkription, Smart Transcription sowie automatische, hybride und manuelle Strategien zur Sprachaktivität (Gemini Modellseite, Leitfaden zur Live-Transkription).

Die zentrale Betriebsgrenze liegt bei zehn Minuten pro Sitzung. Für längere Anrufe benötigen Sie einen geplanten Wechsel mit Überlappung und Zusammenführung der Transkripte. Gemini bietet in der Live-Transkription weder Wortzeitstempel noch Sprecherdiarisierung. Die LiveKit-Seite zu Gemini führt aktuell weniger Sprachcodes als die direkte Google-Dokumentation auf. Sie belegt außerdem nicht, dass sich sämtliche direkten VAD-Parameter über LiveKit Inference konfigurieren lassen.

Soniox stt-rt-v5

Soniox nutzt das LiveKit-Plugin und nicht LiveKit Inference. Ihre Anwendung verwendet daher einen eigenen Soniox-Key. Setzen Sie stt-rt-v5 ausdrücklich. Die aktuelle Node.js-Plugin-Dokumentation kann noch v4 als Standard zeigen, während Soniox v4 serverseitig auf v5 abbildet. Das Soniox-Produktupdate liefert ergänzenden Kontext.

Soniox dokumentiert Echtzeit-Sitzungen mit bis zu 300 Minuten (Echtzeit-Transkription, Limits und Kontingente). Auch bei langen Sitzungen sollten Sie Wiederverbindungen und Fehlerfälle testen.

Speechmatics Linden-1

Linden-1 wird als speechmatics/linden-1 über LiveKit Inference aufgerufen. LiveKit übernimmt Modellrouting und verbrauchsbasierte Abrechnung. Eine separate öffentliche Direct-API-SKU für genau dieses Modell wurde nicht verifiziert. Speechmatics positioniert Linden für Voice Agents, und LiveKit empfiehlt es für die meisten Agents mit Speechmatics (Speechmatics Ankündigung, LiveKit-Seite zu Speechmatics).

Das Gesprächsende wird serverseitig erkannt. Ein lokales LiveKit-vad-Objekt wird bei Linden ignoriert. Ein Wechsel der lokalen VAD-Bibliothek verändert daher nicht automatisch die Erkennung des Gesprächsendes.

Deutsch und mehrsprachige Gespräche

Alle drei Optionen enthalten Deutsch, doch die veröffentlichten Sprachangaben sind nicht direkt vergleichbar. Google nennt für das direkte Modell 85+ Sprachen, während LiveKit derzeit 26 Sprachcodes für die Gemini-Integration aufführt. Gemini kann die Sprache während einer Sitzung wechseln. Soniox dokumentiert 60+ Sprachen und automatisches Code-Switching, auch innerhalb eines Satzes (Google Live-Leitfaden, unterstützte Soniox-Sprachen). Für Linden nennt LiveKit 55+ Sprachen. Die geprüften Quellen bestätigen jedoch kein beliebiges automatisches Code-Switching.

Testen Sie bei deutschen Produktionsanrufen Namen, zusammengesetzte Wörter, Dialekte, Akzente und deutsch-englische Wechsel. Ergänzen Sie Fachbegriffe über Gemini Custom Vocabulary, Soniox-Kontext und Begriffe oder Speechmatics additional_vocab. Prüfen Sie Vokabular mit echten Äußerungen und diesen Hinweisen zu Fachbegriffen und Namen.

Turn Detection ist mehr als Transkriptgenauigkeit

Ein Voice Agent reagiert, sobald das STT-System das Gesprächsende des Nutzers erkennt. Ein korrektes, aber verspätetes Transkript erzeugt unnötige Pausen. Ein zu frühes Endpointing kann Datum, Adresse oder Korrektur abschneiden. Eine aktuelle Diskussion auf Hacker News dient lediglich als Practitioner-Signal dafür, Turn-Taking im Betrieb zu testen. Kommentare und Latenzwerte aus der Diskussion sind kein kontrollierter Modellvergleich.

Google dokumentiert automatisches Server-VAD, eine hybride Strategie aus serverseitiger Erkennung des Sprachbeginns und lokalem audio_stream_end sowie vollständig manuelle Aktivitätsmarker. Der direkte Hybridmodus kann das Warten auf den Server-Timeout vermeiden. Ob die Konfiguration über LiveKit vollständig gleichwertig ist, muss jedoch geprüft werden.

Soniox beschreibt sein Verfahren ausdrücklich als semantisches Endpointing auf Grundlage von Pausen, Intonation, Sprachmustern und Kontext. Einstellbar sind endpoint_latency_adjustment_level von 0 bis 3, endpoint_sensitivity von -1,0 bis 1,0 und max_endpoint_delay_ms von 500 bis 3.000 ms. Aggressivere Einstellungen können laut Soniox-Dokumentation zur Endpunkterkennung mehr Segmentierungen erzeugen und Wort- sowie Diarisierungsgenauigkeit leicht beeinflussen.

Linden erkennt das Sprachende serverseitig. Bezeichnen Sie dies ohne Linden-spezifische Primärquelle nicht als semantisches Endpointing. Die Folgen für das Gesamtsystem lassen sich zusammen mit dem Vergleich von Pipeline- und Realtime-Architektur sowie der Latenzanalyse für Voice Agents bewerten.

Telefonieaudio und strukturierte Daten

Soniox dokumentiert direkte Unterstützung für Carrier-Audio, weil die Echtzeit-API PCM, μ-law, A-law und weitere Formate akzeptiert. Gemini verlangt für die direkte Live-Transkription 16-Bit-PCM mit 16 kHz in mono. Ein 8-kHz-PSTN-Stream muss daher unter Umständen neu abgetastet werden. LiveKit abstrahiert den Medientransport für Linden. Daraus folgt jedoch keine Linden-spezifische Rohformatgarantie.

Bewerten Sie strukturierte Felder separat: Namen, buchstabierte E-Mail-Adressen, Telefonnummern, IBANs, Termine, Postleitzahlen und Produktcodes. Messen Sie neben der Wortfehlerrate auch die Entity Error Rate. Gemini bietet live keine Diarisierung, Soniox schon. Speechmatics-Diarisierung sollte auf der tatsächlich genutzten Linden-Route geprüft werden.

Datenschutz und Verarbeitungsregionen

Eine pauschale EU-Hosting-Aussage ist für die drei Zugangswege nicht möglich. LiveKit Inference arbeitet standardmäßig mit Zero Data Retention. Gemini 3.5 Transcribe Live läuft jedoch über eine einzelne globale Bereitstellung und lässt sich nicht für eine regional festgelegte Anfrage auswählen. Eine strikte Aussage zur ausschließlich regionalen Verarbeitung ist für diese Route daher nicht belegt.

Soniox dokumentiert eigene EU-Domains wie stt-rt.eu.soniox.com, regionale Verarbeitung und regionalen Speicher. Data Residency muss vorher freigeschaltet werden (Soniox Data Residency). Eine Linden-spezifische Regionsgarantie über LiveKit wurde nicht verifiziert. Bestätigen Sie die Route vor einem EU-only-Rollout vertraglich und vergleichen Sie weitere STT-Bereitstellungsoptionen.

Preisvergleich nach Zugangsweg

Zugangsweg Öffentlicher Referenzwert Wichtiger Hinweis
Soniox über direktes Plugin Etwa 0,002 USD/Min. oder 0,12 USD/Std. Tokenbasierte Schätzung mit Soniox-Referenzverbrauch; Sprechanteil, Ausgabe und zusätzlicher Kontext können die Kosten verändern
Linden-1 über LiveKit Inference 0,005 USD/Min. Ohne LiveKit-Tarif, SIP und Medien, LLM, TTS, Speicher, Steuern und Implementierung
Gemini direkt Gemischt geschätzt etwa 0,009 USD/Min. Kombination aus 0,005 USD Audioeingabe und geschätzt 0,004 USD Textausgabe pro Minute, kein fester Komplettpreis
Gemini über LiveKit Inference 0,0095 USD/Min. Ohne die umgebenden Voice-Komponenten und Betriebskosten

Die Soniox-Schätzung folgt der Tokenpreis- und Verbrauchsreferenz. Die Gemini-Schätzung basiert auf den Preisen der Gemini API. Die beiden LiveKit-Werte stammen aus den Preisen für LiveKit Inference. Vergleichen Sie Rechnungen erst, nachdem Sie die enthaltenen Leistungen angeglichen haben. Ein niedriger STT-Preis bedeutet weder niedrigere Gesamtkosten noch höhere Erkennungsqualität.

Neutraler A/B-Test mit echten Anrufen

Verwenden Sie identisches Audio, dieselbe nachgelagerte Logik und gleiche Messfenster. Der Test sollte enthalten:

  1. Deutsche 8-kHz-μ-law-PSTN-Aufnahmen sowie die für eine Integration nötige neu abgetastete Version.
  2. Hochdeutsch, regionale Dialekte, Nichtmuttersprachler und deutsch-englisches Code-Switching.
  3. Namen, E-Mail-Adressen, IBANs, Telefonnummern, Uhrzeiten, Daten und Produktcodes.
  4. Stille, Denkpausen, Selbstkorrekturen, Übersprechen, Hintergrundgeräusche und Barge-in.
  5. Kurze Serviceanrufe und Anrufe über zehn Minuten, einschließlich eines kontrollierten Gemini-Sitzungswechsels.

Erfassen Sie Wort- und Entity-Fehlerrate, Zeit vom letzten Sprachframe bis zum stabilen Transkript, frühe und späte Endpunkte, Partial Churn, Barge-in-Fehler, Wiederverbindungen und reale Kosten pro Gesprächsminute. Werten Sie die Szenarien getrennt aus, denn ein Durchschnitt kann Fehler bei geschäftskritischen Feldern verdecken.

Entscheidungsmatrix

Ihre Hauptanforderung Zuerst zu testende Option Warum sie in den Test gehört
Breite direkte Mehrsprachigkeit und native LiveKit Inference Gemini 3.5 Transcribe Live Direkte Dokumentation nennt 85+ Sprachen, LiveKit derzeit 26 Codes
Lange Anrufe und native Telefonie-Codecs Soniox stt-rt-v5 Veröffentlichtes Limit von 300 Minuten sowie μ-law und A-law
Einstellbares semantisches Endpointing Soniox stt-rt-v5 Explizite semantische Parameter mit dokumentierten Zielkonflikten
Von LiveKit verwalteter Zugang und Abrechnung Linden-1 oder Gemini Beide sind native LiveKit-Inference-Routen
Live-Diarisierung Zuerst Soniox, danach Linden-Route Soniox-Unterstützung ist eindeutig; verwendete Speechmatics-Konfiguration prüfen
Strikte Regionsbindung Vor Auswahl verifizieren Gemini über LiveKit scheidet aus; Soniox braucht EU-Freischaltung; Linden benötigt Routenbestätigung

Die Matrix priorisiert eine Testreihenfolge und keinen allgemeinen Sieger. Prüfen Sie außerdem vor dem Rollout, ob das jeweilige exakte Modell in Ihrem aktuellen Workspace verfügbar ist.

Häufig gestellte Fragen

Welches Modell ist bei deutschen Telefonanrufen am genauesten?

Für diese exakten Versionen existiert kein neutraler Vergleich mit demselben deutschen 8-kHz-Telefoniedatensatz. Testen Sie Ihre Anrufe und messen Sie Wortfehlerrate sowie Entity Error Rate. Anbieterwerte aus unterschiedlichen Datensätzen ergeben keine faire Rangliste.

Kann Gemini 3.5 Transcribe Live Anrufe über zehn Minuten verarbeiten?

Nicht als eine ununterbrochene, dokumentierte Sitzung. Das veröffentlichte Maximum liegt bei zehn Minuten. Längere Anrufe benötigen einen Sitzungswechsel mit Überlappung, Zusammenführung der Transkripte und Fehlertests.

Wird Soniox stt-rt-v5 automatisch in der EU verarbeitet?

Nein. Soniox bietet eigene EU-Endpunkte und regionalen Speicher, doch Data Residency muss freigeschaltet sein. Prüfen Sie Endpunkt, Speicherverhalten und Vertrag vor dem Produktivbetrieb.

Verwendet Linden-1 semantisches Endpointing?

Die geprüften Primärquellen bestätigen serverseitiges End-of-Speech und dass LiveKit das lokale VAD ignoriert. Sie bestätigen kein semantisches Endpointing für Linden-1. Verwenden Sie diese Bezeichnung erst mit neuerer, modellspezifischer Dokumentation.

Fazit und nächster Schritt

Gemini 3.5 Transcribe Live, Soniox stt-rt-v5 und Speechmatics Linden-1 lösen unterschiedliche Bereitstellungsaufgaben. Gemini setzt auf direkte Mehrsprachigkeit und nativen LiveKit-Zugang. Soniox bietet Telefonie- und Endpointing-Parameter über ein Provider-Plugin. Linden stellt eine von LiveKit verwaltete Route mit serverseitiger Erkennung des Gesprächsendes bereit. Keine dieser Eigenschaften belegt einen allgemeinen Genauigkeitssieger.

Wählen Sie anhand der Entscheidungsmatrix eine Testreihenfolge, prüfen Sie die Modellverfügbarkeit in Ihrem Workspace und verwenden Sie für alle Kandidaten dieselben deutschen Anrufe. Sie möchten prüfen, welche STT-Konfiguration zu Ihren echten Anrufen passt? Buchen Sie eine persönliche Famulor-Demo. Wir betrachten Ihren Gesprächsablauf, Ihre Sprachen und Ihre Telefonie-Umgebung gemeinsam.

Über die Autorin

Sarah Müller ist die namentlich ausgewiesene Autorin dieses Famulor-Vergleichs. Die Analyse nutzt öffentliche Primärdokumentation und trennt veröffentlichte Fakten von Schätzungen und Praktiker-Signalen. Redaktionelle oder produktbezogene Fragen beantwortet der Famulor Support. Den Umgang mit personenbezogenen Daten beschreibt die Datenschutzerklärung.

SM
Sarah Müller

Autor bei Famulor

KI-Telefonassistent

Alles inklusive, ein Tarif. Famulor testen

Voice AI, Workflows und Integrationen in einer Plattform.

Famulor AI eingehender Anruf auf einem Smartphone
Newsletter

Anrufe automatisiert. Kunden begeistert.

Abonniere unseren Newsletter, um die neuesten Nachrichten, Produktupdates und kuratierte KI-Inhalte zu erhalten.