ElevenLabs, bislang bekannt für seine KI-Audiomodelltechnologie, hat kürzlich mit Scribe sein erstes Modell zur automatischen Spracherkennung (ASR) vorgestellt. ElevenLabs Scribe ist möglicherweise das genaueste Speech-to-Text-Modell der Welt im Jahr 2025 und unterstützt kontextbewusste Transkriptionen in 99 Sprachen. Dieses KI-Modell transkribiert sogar traditionell unterversorgte Sprachen wie Serbisch, Kantonesisch und Malayalam.
In diesem Artikel betrachten wir die technischen Funktionen der zugänglichen KI-Transkription von Scribe, vergleichen sie analytisch mit Wettbewerbern wie Google Gemini 2.0 Flash, Deepgram Nova 2 und OpenAI Whisper v3 und erläutern praktische Anwendungsfälle für Fachleute, die mit App-Integrationen auf Latenode arbeiten, sowie für Business-Analysten, Marketingverantwortliche, Produktmanager und Content Creator.
Erstellen Sie unbegrenzt viele Integrationen mit Verzweigungen und mehreren Triggern, die in einem Node zusammenlaufen. Nutzen Sie Low-Code oder schreiben Sie eigenen Code mit AI Copilot.
Wie funktioniert ElevenLabs Scribe? Technischer Überblick
Scribe v1 ist ein ASR-Modell, das für hohe Genauigkeit in realen Audioszenarien optimiert wurde – bei Meetings, Telefonaten, Podcasts und selbst in lauten Umgebungen. Benchmark-Tests mit Datensätzen wie FLEURS zeigen, dass Scribe für Englisch eine Word Error Rate (WER) von etwa 3,3 % und für Italienisch von rund 1,3 % erreicht und damit aktuelle Marktführer leicht übertrifft.
![]()
Wichtige technische Funktionen:
- Mehrsprachige Unterstützung: Scribe unterstützt 99 Sprachen und Dialekte und erkennt die gesprochene Sprache automatisch, ohne dass eine manuelle Eingabe erforderlich ist. Die Genauigkeit für Sprachen, die bislang durch ASR-Technologie unterversorgt waren, wird deutlich verbessert.
- Sprecherdifferenzierung: Das Modell kann bis zu 32 verschiedene Sprecher innerhalb einer einzelnen Audiodatei unterscheiden und kennzeichnen. Damit eignet es sich für die Transkription von Meetings mit mehreren Teilnehmern oder Podiumsdiskussionen.
- Kontextbezogene Audio-Tagging: Scribe erkennt und markiert nichtsprachliche Audioereignisse wie Lachen, Applaus, Hintergrundmusik und Umgebungsgeräusche. Klare Marker wie „(Lachen)“ oder „(Musik)“ werden direkt in das Transkript eingefügt.
- Detaillierte Zeitstempel: Jedes transkribierte Wort enthält präzise Zeitstempel, sodass Nutzer exakte Stellen in der Audioaufnahme finden können. Das Modell liefert strukturierte Transkriptausgaben im JSON-Format und ermöglicht damit eine einfache Integration in bestehende Automatisierungs-Workflows und Analysetools.
ElevenLabs Scribe vs. DeepGram Nova 2, Google Gemini 2.0 Flash und OpenAI Whisper v3
Hohe Transkriptionsgenauigkeit:
![]()
Unabhängige Bewertungen bestätigen, dass Scribe derzeit eine leicht höhere Genauigkeit als Google Gemini 2.0 Flash erreicht und OpenAI Whisper v3 insbesondere in mehrsprachigen Szenarien deutlich übertrifft. Whisper v3 wurde trotz seiner Popularität zuletzt wegen gelegentlicher Ungenauigkeiten und „Halluzinationen“ kritisiert – also der Generierung von Text, der im Audio nicht vorhanden ist. Scribe hält sich dagegen strikt an den ursprünglichen Audioinhalt und reduziert dadurch Transkriptionsfehler.
Mehrsprachige Funktionen
Alle drei Modelle unterstützen mehrere Sprachen. Scribe zeigt jedoch besondere Stärken bei der präzisen Sprachtranskription in 102 Sprachen, die zuvor hohe Fehlerraten aufwiesen, oft von mehr als 40 %. So erreicht Scribe beispielsweise für Indonesisch eine WER von etwa 2,4 %, verglichen mit 7,7 % bei Whisper v3 für Common Voice. Das bedeutet, dass sich das Modell gut für die Lokalisierung mehrsprachiger Inhalte eignet.
![]()
Echtzeit-Transkription vs. Batch-Verarbeitung
Derzeit ist Scribe für die Batch-Verarbeitung optimiert, also das Hochladen von Audiodateien zur Transkription. Funktionen zur Echtzeit-Transkription sind noch nicht verfügbar, befinden sich Berichten zufolge jedoch in Entwicklung. Für eine sofortige Streaming-Transkription sind Alternativen wie Google oder Deepgram aktuell möglicherweise besser geeignet.
Kosten und Zugänglichkeit:
Wie sieht die Preisgestaltung von ElevenLabs Scribe aus? Die ElevenLabs Scribe API ist mit etwa 0,40 US-Dollar pro Audiostunde preislich wettbewerbsfähig und liegt auf einem ähnlichen Niveau wie OpenAI Whisper. Sie ist ausschließlich als cloudbasierter Dienst über die Weboberfläche oder API von ElevenLabs verfügbar. Anders als Whisper v2 bietet Scribe keine Open-Source-Bereitstellung, was für Unternehmen mit strengen Datenschutzanforderungen ein Problem sein kann.
Wie automatisieren Sie Ihren Workflow für Audio- und Videoinhalte auf Latenode?
Content Creator, Marketingteams und Produktteams stehen häufig vor derselben Herausforderung: Rohe Audio- und Videoaufnahmen in strukturierte, durchsuchbare und ansprechende Inhalte umzuwandeln. Ob Podcast, Transkription eines Kundensupport-Anrufs, Transkription für Forschende oder Produktdemo – das manuelle Zusammenfassen und Weiterverwerten von Multimedia-Inhalten ist mühsam, fehleranfällig und zeitaufwendig.
Teams benötigen intelligentere Möglichkeiten, diese Prozesse zu automatisieren, ohne Qualität oder Kreativität einzubüßen. Whisper, HeyGen und die ElevenLabs Scribe API bieten, in Latenodes Low-Code-Automatisierungsplattform integriert, leistungsstarke KI-gestützte Lösungen zur Optimierung Ihrer Workflows für Multimedia-Inhalte. So können diese drei Modelle die Produktivität Ihres Teams kreativ verändern.
ElevenLabs Scribe API: Transkription, kontextbezogenes Audio-Tagging und Sprecherdifferenzierung
Die ElevenLabs Scribe API ist ein hochpräzises Speech-to-Text-Modell, das über eine API zugänglich und speziell für komplexe Audioszenarien entwickelt wurde. Sie zeichnet sich durch die Erkennung mehrerer Sprecher, die Markierung kontextbezogener Audioereignisse wie Lachen, Applaus oder Hintergrundgeräusche sowie detaillierte Zeitstempel für jedes Wort aus. Den API-Endpunkt finden Sie auf der Seite „Create transcript“ in der Dokumentation zur ElevenLabs Scribe API.
![]()
Automatisierter Transkriptionsservice für Interviews in der akademischen Forschung und mehr mit der ElevenLabs Scribe API:
Ihr Forschungsteam produziert einen beliebten Podcast mit mehreren Gästen, lebhaften Diskussionen und spontanen Interaktionen. Mit der in Latenode integrierten ElevenLabs Scribe API können Sie automatisch:
- Die Scribe API auslösen, sobald eine neue Podcastfolge oder ein Meeting in Google Drive hochgeladen wird.
- Eine hochpräzise Podcast- oder Meeting-Transkription mit eindeutig gekennzeichneten Sprechern, Zeitstempeln und kontextbezogenen Audio-Tags erhalten, etwa „(Lachen)“, „(Applaus)“ oder „(Musik)“.
- Das strukturierte Transkript automatisch an Notion senden und so ein durchsuchbares Podcast-Archiv, Transkriptionen für Marketinginhalte, Podcast-Transkriptionen oder andere Inhalte erstellen.
- ChatGPT verwenden, um direkt aus dem Scribe-Transkript ansprechende Episodenzusammenfassungen und zitierwürdige Highlights zu generieren.
- Diese Zusammenfassungen und Highlights sofort über Slack teilen, damit Ihre Marketing- und Social-Media-Teams informiert bleiben und Inhalte direkt weiterverwerten können.
Whisper: Präzise, mehrsprachige Transkription und Zusammenfassung
Whisper ist das fortschrittliche Speech-to-Text-Modell von OpenAI, das für seine Genauigkeit und mehrsprachigen Funktionen bekannt ist. Es wandelt Audio- und Videoaufnahmen mühelos in präzise Transkripte mit Zeitstempeln um – selbst in lauten Umgebungen oder bei mehreren Sprechern. Die Stärke von Whisper liegt in der Verarbeitung unterschiedlicher Akzente, Dialekte und Sprachen, wodurch es ideal für globale Teams ist.
Automatisierter KI-Transkriptionsservice mit Whisper:
Stellen Sie sich vor, Ihr Marketingteam führt regelmäßig Kundeninterviews und Produkt-Webinare durch. Mit Whisper in Latenode können Sie automatisch:
- Aufnahmen direkt in Google Drive hochladen. Jeder neue Upload löst den Workflow aus.
- Whisper transkribiert das Audio sofort und kennzeichnet Sprecher sowie Zeitstempel präzise.
- Das Transkript wird automatisch an Notion gesendet und erstellt eine strukturierte, durchsuchbare Wissensdatenbank.
- Von Whisper generierte Zusammenfassungen und zentrale Erkenntnisse werden dynamisch in Slack veröffentlicht, sodass Ihr gesamtes Team ohne manuellen Aufwand informiert bleibt.
HeyGen: KI-gestützte Videogenerierung und Stimmklonen
HeyGen ist ein innovatives KI-Modell, das realistische, menschenähnliche Videos und Sprachaufnahmen aus Texteingaben generiert. Es kann Stimmen klonen, personalisierte Videonachrichten erstellen und Inhalte nahtlos in mehrere Sprachen übersetzen.
Kreativer Workflow mit HeyGen:
Ihr Produktteam möchte schnell personalisierte Onboarding-Videos für neue Nutzer in verschiedenen Regionen produzieren. Mit HeyGen in Latenode können Sie automatisch:
- Das generierte Transkript aus Notion übernehmen, sobald es hinzugefügt wird.
- ChatGPT verwenden, um das Transkript in ein prägnantes, ansprechendes Onboarding-Skript zusammenzufassen und umzuschreiben.
- HeyGen erstellt automatisch personalisierte Videos in mehreren Sprachen und verwendet dabei geklonte Stimmen Ihrer Produktexperten oder Markenbotschafter.
- Die fertigen Videos werden sofort in Google Drive hochgeladen und stehen zur unmittelbaren Verteilung bereit.
Schon jetzt können Sie diese leistungsstarken KI-Audiomodelle nahtlos auf Latenode verbinden, Herausforderungen bei Multimedia-Inhalten lösen und Ihrem Team ermöglichen, intelligenter, schneller und kollaborativer zu arbeiten. Jedes dieser Modelle eignet sich hervorragend als Transkriptionslösung für Unternehmen oder für die persönliche Nutzung.
Vollständig in Ihre Latenode-Workflows integriert, verändern Whisper, HeyGen und die ElevenLabs Scribe API die Art und Weise, wie Marketingverantwortliche, Produktmanager und Content Creator mit Audio- und Videodaten arbeiten. Gehören Sie zu den Ersten, die diese kreativen Automatisierungen entwickeln – registrieren Sie sich und entdecken Sie noch heute intelligentere Workflows für Multimedia-Inhalte!
Erstellen Sie unbegrenzt viele Integrationen mit Verzweigungen und mehreren Triggern, die in einem Node zusammenlaufen. Nutzen Sie Low-Code oder schreiben Sie eigenen Code mit AI Copilot.


