Zum Inhalt springen
tokynstudio
journal
21. September 2026 · agents

Warum wir Voice-Agents auf ElevenLabs bauen

Nicht wegen der Stimme - die liefern inzwischen viele. Sondern wegen der Latenz über die ganze Gesprächsrunde, der Telefonie ohne Fremdbausteine und der EU-Region. Plus: wo wir abraten, und was die Partnerschaft wirklich ändert.

von tokyn studio · 6 min lesezeit

Warum wir Voice-Agents auf ElevenLabs bauen - AgentsKI

Kurz gefasst. Wir bauen Voice-Agents auf ElevenLabs und sind inzwischen offizieller Umsetzungspartner. Der Grund ist nicht die Stimmqualität, die inzwischen viele liefern, sondern was darum herum steht: Latenz im Gesprächsverlauf, Telefonie ohne Fremdbausteine, Anbindung an die Systeme des Kunden, Testbarkeit vor dem Livegang und eine EU-Region für Kunden, die das brauchen. Was dabei oft falsch verstanden wird und wo wir abraten, steht weiter unten. Stand: 2026-09.

was ein telefonat entscheidet, ist nicht die stimme

Der häufigste Irrtum bei Voice-Agents: dass es um Klangqualität geht. Tut es nicht. Natürlich klingende Sprachsynthese ist 2026 keine Auszeichnung mehr, sondern Grundausstattung. Mehrere Anbieter liefern Stimmen, bei denen am Telefon niemand mehr etwas merkt.

Was ein Gespräch trägt oder kippen lässt, ist die Stille dazwischen. Ein Anrufer hört nicht die Stimme, er hört die Pause. Wenn nach seiner Frage eine Sekunde nichts passiert, weiß er, dass er mit einer Maschine spricht, und zwar bevor das erste Wort fällt. Genauso entscheidend: Was passiert, wenn er mitten im Satz des Agenten dazwischenredet. Menschen tun das ständig.

Deshalb bewerten wir Plattformen nicht nach Hörprobe, sondern danach, was zwischen Mikrofon und Antwort passiert.

die 75 millisekunden, die überall zitiert werden

ElevenLabs nennt für sein Flash-Modell rund 75 Millisekunden. Die Zahl stimmt und wird trotzdem fast immer falsch gelesen.

75 ms sind die Zeit bis zum ersten Audio-Byte des Sprachmodells. Eine vollständige Gesprächsrunde besteht aber aus mehr: Der Agent muss erkennen, dass der Anrufer fertig gesprochen hat, die Aufnahme in Text wandeln, das Sprachmodell muss denken, eventuell wird noch ein Fachsystem abgefragt, dann erst wird gesprochen. Dazu kommen Netz und Telefonanbieter.

Wer also eine Voice-Plattform nach der TTS-Zahl auswählt, vergleicht einen Baustein und nicht das Ergebnis. Was wir stattdessen messen, ist die Zeit vom Ende der Anruferfrage bis zum ersten hörbaren Wort, am echten Telefonanschluss, mit den echten Datenabfragen des Kunden. Diese Zahl ist immer deutlich höher als 75 ms, und sie ist die einzige, die den Anrufer interessiert.

ElevenLabs gewinnt hier trotzdem, aber aus einem anderen Grund als dem, der in den Datenblättern steht: Weil Spracherkennung, Turn-Erkennung, Modellanbindung und Ausgabe auf derselben Plattform liegen, fällt die Hälfte der Übergaben weg, an denen sonst Zeit verloren geht. Nicht das schnellste Einzelteil gewinnt, sondern die kürzeste Kette.

was uns vier mal überzeugt hat

Telefonie ist kein Anbau. Der Agent lässt sich auf Telefonie, Web, Mobile, WhatsApp, SMS und Chat legen, mit Anbindung an Twilio, Genesys und Amazon Connect. Für Projekte im Mittelstand ist das der Unterschied zwischen „läuft auf der Telefonanlage" und „läuft im Demo-Browser".

Anbindung an das, was da ist. Über MCP, normale APIs und Webhooks greift der Agent auf CRM, Ticketsystem, Kalender und Wissensbasis zu. Das ist für uns der eigentliche Hebel, denn ein Agent, der Termine nur vorlesen statt eintragen kann, erspart niemandem Arbeit. Warum MCP dafür der richtige Standard ist, haben wir in AI-Agenten und MCP aufgeschrieben.

Sprachen, die mitten im Gespräch wechseln. ElevenLabs gibt über 70 Sprachen und mehr als 16.000 Stimmen an, mit Wechsel innerhalb desselben Gesprächs. Das ist die Herstellerangabe, nicht unsere Messung. In unseren Projekten zählt davon meist nur ein Fall, der aber häufig: Der Anrufer wechselt ins Englische, und der Agent zieht mit, ohne dass jemand eine Taste drückt.

Testen vor dem Livegang. Simulierte Gespräche und automatisierte Tests gegen das Agentenverhalten sind Teil der Plattform. Das klingt unspektakulär und ist der Punkt, an dem wir am meisten Zeit sparen. Ein Voice-Agent lässt sich sonst nur durch Anrufen prüfen, und das skaliert nicht auf fünfzig Gesprächsverläufe.

der datenschutz-teil, ehrlich gerechnet

Für Kunden mit EU-Anforderungen arbeiten wir im Enterprise-Account mit EU Data Residency. Das ist ein echtes Argument, und es ist enger gefasst, als es in Vertriebsunterlagen klingt.

Was gilt: Die Speicherung liegt in der gewählten Region. Was ebenfalls gilt, und selten dazugesagt wird: Die Verarbeitung kann die Region trotzdem verlassen, unter anderem über Konzerngesellschaften und Subprozessoren. Wer die Verarbeitung tatsächlich in der EU halten will, muss zusätzlich den Zero Retention Mode aktivieren und den Zugriff über die API entsprechend einrichten. Das ist keine Voreinstellung, das ist ein Konfigurationsschritt.

Dazu kommen drei Einschränkungen, die man vor der Zusage an den Kunden kennen sollte: Data Residency ist Enterprise-Kunden vorbehalten. In der isolierten Region ist nicht jedes Sprachmodell verfügbar, weil das von den jeweiligen Anbietern abhängt. Und einzelne Funktionen, etwa Dubbing, gibt es dort gar nicht. Der isolierte Account ist außerdem ein separater Arbeitsbereich mit eigenen Schlüsseln, nicht ein Schalter im bestehenden Konto.

Nichts davon ist ein Ausschlusskriterium. Aber es ist der Unterschied zwischen „liegt in der EU" und „bleibt in der EU", und dieser Unterschied gehört in die Bewertung, bevor er in einer Datenschutzfolgenabschätzung auftaucht.

was die partnerschaft ändert

Wir sind offizieller Umsetzungspartner von ElevenLabs. Was das praktisch bedeutet, lässt sich kurz sagen, und es ist bewusst unspektakulär.

Es bedeutet keinen anderen Funktionsumfang. Die Plattform ist dieselbe, die jeder buchen kann. Es bedeutet einen direkten Draht, wenn in einem Kundenprojekt etwas klemmt, das der öffentliche Support nicht auflöst, und es bedeutet, dass wir früher wissen, was kommt. Für Projekte mit Livegang-Termin ist das zweite oft wertvoller als das erste, weil man Funktionen dann nicht einbaut, die vier Wochen später anders heißen.

Was es ausdrücklich nicht bedeutet: dass wir ElevenLabs deshalb empfehlen. Die Reihenfolge war umgekehrt. Wir haben auf der Plattform gebaut, bevor es eine Partnerschaft gab.

wann wir abraten

Es gibt drei Fälle, in denen wir von ElevenLabs weg beraten.

Wenn der Anwendungsfall gar kein Gespräch ist. Wer eine Ansage braucht, die einmal im Jahr wechselt, braucht keine Conversational-Plattform, sondern eine Audiodatei.

Wenn die Anforderung reine On-Premise-Verarbeitung ist. EU-Region ist nicht dasselbe wie eigenes Rechenzentrum. Wo das gefordert ist, führt der Weg über lokal betreibbare Modelle, mit allem, was an Qualität und Aufwand daran hängt.

Und wenn der eigentliche Engpass woanders sitzt. Wenn die Daten nicht gepflegt sind oder niemand entschieden hat, was der Agent zusagen darf, ist die Sprachplattform nicht das Problem, das zuerst gelöst werden muss. Das ist dieselbe Erfahrung wie bei Copilot als Company-GPT: Die Technik ist selten der schwierige Teil.

selbst anhören

Auf unserer Seite AI-Agenten stehen drei Voice-Agents, die man direkt anrufen kann. Sie laufen auf genau dem Stack, über den dieser Text handelt. Der erste Satz im Gespräch sagt, dass es eine KI-Stimme ist, die Porträts auf der Seite sind KI-generiert und als solche gekennzeichnet.

Wer überlegt, ob ein Voice-Agent im eigenen Haus trägt: 30 Minuten, ohne Pitch-Deck. Wir sagen auch, wenn wir es für den falschen Weg halten.

quellen

verwandter service

Agents

nächster schritt

dein fall, konkret - reden wir.

30 Minuten, kein Pitch-Deck. Wir schauen uns deinen Use Case an und sagen ehrlich, ob und wie es sich lohnt.

Warum wir Voice-Agents auf ElevenLabs bauen · tokyn studio