assemblyai
Kostenloser Mehrwert
Komplette Liste an KI-Tools AI-Programmierwerkzeuge

assemblyai

AssemblyAI – ein intelligentes Werkzeug für die Programmierung mit KI

Tags:

Was ist AssemblyAI?

AssemblyAI ist eine Sprach-KI-Plattform für Entwickler und Unternehmen, deren Kernfunktion darin besteht, voraufgenommenes oder Echtzeit-Audio in strukturierte Texte umzuwandeln. Entwicklerteams können mithilfe von APIs und offiziellen SDKs Funktionen wie Transkription, Sprechererkennung, Sprachverständnis sowie Sprachintelligenz in ihre eigenen Produkte integrieren.

Die Plattform ist kein gewöhnliches Tool zur Umwandlung von Audiodaten in Text, sondern eine Entwickler-Infrastruktur, die nach Verbrauch abgerechnet wird. Ihre Produkte umfassen asynchrone Vorab-Transkriptionen, Echtzeit-Transkriptionen, Schnittstellen für kurze Audiodateien mit geringer Verzögerung, eine End-to-End Voice-Agent-API, Speech Understanding sowie einen LLM-Gateway.

Hauptprodukte und -funktionen

  • Vorab-Transkription von Audiodaten: Senden Sie Audiodateien oder Videodateien ein – die vollständige Transkription wird asynchron erstellt.
  • Echtzeit-Stream-Transkription: Audioströme werden über WebSocket gesendet, und Texte werden innerhalb von Hunderten von Millisekunden empfangen.
  • Synchronisierte Transkription kurzer Audiodateien: Schnelle Verarbeitung von Sprachanweisungen und kurzen Audioausschnitten per einziger Anfrage.
  • Voice Agent API: Kombiniert in einer Echtzeit-Verbindung Spracherkennung, Sprachmodelle, Sprachsynthese und Dialogsteuerung.
  • Sprecherunterscheidung: Identifizierung verschiedener Sprecher und Hinzufügen von Tags zu Wörtern oder Sprechphasen.
  • Schlüsselwörter und allgemeine Hinweise: Verbesserung der Erkennung in einem bestimmten Kontext durch Begriffe oder natürliche Sprache.
  • Sprachverständnis: Ausführung von Aufgaben zur Identifizierung von Entitäten, Themen, Emotionen, Übersetzung und anderen Nachverarbeitungsarbeiten.
  • Datenschutzschutzmaßnahmen: Bereitstellung von Funktionen zur Verarbeitung sensibler Texte oder Audiodaten, zur Inhaltsüberprüfung sowie zum Filtern von Schimpfwörtern.
  • LLM Gateway: Verwenden Sie einheitliche Anmeldeinformationen, um mehrere Sprachmodelle zur Verarbeitung von Zusammenfassungen und Sprachworkflows aufzurufen.

Sprach-zu-Text-Modell

VerwendungsmöglichkeitenModellEigenschaftenGrundpreis
Vorab aufgezeichnet asynchronUniversal-3.5 ProHöhere Genauigkeit und Hinweismöglichkeiten0,21 US-Dollar/Stunden Audiozeit
Vorab aufgezeichnet asynchronUniversal-2Geringere Kosten0,15 US-Dollar/Stunden Audiozeit
Echtzeit-StreamingUniversal-3.5 Pro RealtimeHöhere Genauigkeit und Echtzeit-Hinweise0,45 US-Dollar/Stunden pro Sitzung
Echtzeit-StreamingUniversal-StreamingEnglisch oder mehrsprachige Wirtschaftslösungen0,15 US-Dollar/Stunden pro Sitzung
Synchronisierte kurze AudiodateienUniversal-3.5 ProEinzige Anfrage liefert kurzes Audiodatei-Ergebnis0,45 US-Dollar/Stunde Audiozeit

Wie wählt man zwischen vorab aufgezeichneten, Echtzeit- und synchronisierten Schnittstellen?

SchnittstelleFür Aufgaben geeignetZurückkehrmethodeWichtige Abwägungen
Vorab aufgezeichnet asynchronPodcasts, Konferenzen, Interviews und historische AufnahmenNach dem Senden der Aufgabe abwarten oder eine Rückruf-Funktion erhaltenDer Preis ist niedrig, aber es muss auf die Bearbeitung gewartet werden.
Echtzeit-StreamingUntertitel, Kundenservice, Sprachroboter und Live-KonferenzenWebSocket gibt kontinuierlich Ereignisse zurückNiedrige Verzögerung, aber Abrechnung bei inaktiver Verbindung
Synchronisierte kurze AudiodateienDiktat, Sprachsuche und kurze BefehleEine Anfrage liefert das Ergebnis direkt zurück.Die Schnittstelle ist einfach, der Preis pro Stück ist höher als bei asynchronen Verfahren.
Voice AgentEnd-to-End-Telefonie und SprachassistentenEinzelne Echtzeit-SitzungEntwicklung ist einfach, aber die Gesamtkosten sind höher.

Fähigkeit zur Spracherkennung

  • Sprechererkennung: Unterscheidung der verschiedenen Sprecher in Meetings, Interviews oder Telefonaten.
  • Entitätenerkennung: Extrahierung von Personen, Organisationen, Orten und anderen strukturierten Entitäten.
  • Emotionale Analyse: Bestimmung der positiven, negativen oder neutralen Tendenzen in einem Textabschnitt.
  • Themenerkennung: Identifizierung des Themas einer Aufnahmeverhandlung nach inhaltlicher Klassifizierung.
  • Schlüsselwörter und Highlights: Entdeckung von wiederkehrenden oder repräsentativen Phrasen.
  • Erstellen eines Textes in der Zielsprache, wobei die ursprüngliche Transkriptionsstruktur beibehalten wird.
  • Benutzerdefiniertes Format: Anpassung von Zahlen, Abkürzungen und fachlichen Ausdrücken gemäß den Geschäftsregeln.
  • Zusammenfassung und Kapitel: Durch den aktuellen Sprachmodell-Workflow können flexiblere Nachverarbeitungsergebnisse erzeugt werden.

Für welche Anwendungsszenarien geeignet

  • Konferenzassistent: Protokollierung von Mehrpersonenkonferenzen, Unterscheidung der Sprecher und Erstellung von Handlungspunkten.
  • Kontaktzentrum: Transkription von Kundenservice-Gesprächen, Analyse von Themen, Emotionen und Qualitätsproblemen.
  • Medienplattformen: Erstellung von Untertiteln und Indexen für Podcasts, Videos, Live-Übertragungen und Kurse.
  • Sprachintelligenz-Agent: Erkennung der Aussagen des Benutzers und Steuerung von Echtzeit-Dialogen sowie Toolaufrufen.
  • Verkaufsanalyse: Organisation von Anrufen, Einwänden, Wettbewerbsinformationen und nächsten Schritten.
  • Medizinische Sprachausgabe: Behandlung von Fachbegriffen in der entsprechenden Sprache und unter Einhaltung der Vorschriften.
  • Inhaltsprüfung: Bearbeitung sensibler Informationen, unangemessener Inhalte und personenbezogener Daten im Audio.
  • Stimmsuche: Umwandlung großer Mengen an Audio- und Videodaten in suchbaren Text.

Für welche Entwicklerteams geeignet

  • SaaS-Teams, die eine Spracherkennungs-API in ihre Produkte integrieren müssen.
  • Ingenieure, die Echtzeit-Untertitel, Sprachroboter oder Telefonautomatisierung entwickeln.
  • Medien- und Datenteams, die große Mengen an historischen Audio- und Videodaten in Batch-Prozessen verarbeiten müssen.
  • Eine Analyseplattform, die Sprecher, Zeitstempel und strukturierte Ergebnisse benötigt.
  • Entwickler, die eine schnelle Integration mit Python, JavaScript oder anderen SDKs anstreben.
  • Organisationen mit Unternehmensanforderungen bezüglich der Datengebiete, der Retentionszeiten, der Berechtigungen und der Audits.

Schneller Einstiegstutorial

  1. Registrieren Sie ein Konto und erstellen Sie eine eigene API-Schlüssel für die Testumgebung.
  2. Vergleichen Sie die Modelle im Playground der Konsole mit echtem, aber anonymisiertem Audio.
  3. Wählen Sie zwischen vorab aufgenommenen, Echtzeit-, synchronisierten kurzen Audiodateien oder der Voice Agent-Schnittstelle.
  4. Installieren Sie die offizielle SDK der Zielprogrammiersprache und legen Sie die kompatible Version fest.
  5. Weisen Sie das Sprachmodell explizit aus – verlassen Sie sich nicht auf möglicherweise ändernde Standardwerte.
  6. Konfigurieren von Timeout, Wiederholungsversuchen, Callback-Verifizierung und Fehlerprotokollierung.
  7. Berechnen Sie die Fehlerquote bei Texten durch manuelle Korrektur sowie die Fehlerquote in wichtigen Feldern.
  8. Stellen Sie Benachrichtigungen für Saldo, Verbrauch und außergewöhnliche Kosten ein, bevor Sie in die Produktionsumgebung wechseln.

Lehrvideo zur Echtzeit-Transkription

  1. Überprüfen Sie die Abtastrate, Kodierung und Kanäle des Mikrofons oder der Telefon-Audio-Quelle.
  2. Eine WebSocket-Verbindung herstellen und die richtigen Sitzungsparameter senden.
  3. Audio-Blöcke werden kontinuierlich übertragen, und Sprechphasen, Zeitstempel sowie Fehlerereignisse werden verarbeitet.
  4. Konfigurieren Sie Schlüsselwörter oder Hinweise entsprechend der Fachbegriffe.
  5. Wenn nötig, aktivieren Sie die Trennung der Sprecher, den Medizinmodus oder Voice Focus.
  6. Unterscheiden Sie im Interface den vorübergehenden Zustand vom unveränderlichen Endtext.
  7. Nach Beendigung des Gesprächs sendet der Benutzer eine Nachricht zur Beendigung der Sitzung.
  8. Stellen Sie sicher, dass die Verbindung tatsächlich geschlossen wird, und überwachen Sie die tatsächliche Dauer der Sessionabrechnung.

Grundpreis

AssemblyAI arbeitet nach dem Pay-as-you-go-Prinzip – es gibt keine verpflichtenden monatlichen Abonnements, keine Mindestausgaben und auch keine langfristigen Verträge. Neukunden erhalten einen kostenlosen Betrag von 50 US-Dollar. Dabei ist kein Kreditkartennotwendig. Dieser Betrag kann für die Textumwandlung aus Sprache, Voice Agent, die Spracherkennung sowie weitere Funktionen verwendet werden – doch er beinhaltet nicht den LLM Gateway.

ProdukteOffener PreisBerechnungsgrundlage
Universal-3.5 Pro vorab aufgezeichnet0,21 US-Dollar/StundeDauer des eingereichten Audios oder Videos, genau bis zur Sekunde
Universal-2-Vorabaufnahme0,15 US-Dollar/StundeDauer des eingereichten Audios oder Videos, genau bis zur Sekunde
Universal-3.5 Pro in Echtzeit0,45 US-Dollar/StundeDauer der aktiven WebSocket-Verbindung
Universal-Streaming0,15 US-Dollar/StundeDauer der aktiven WebSocket-Verbindung
Synchronisierte kurze Audiodateien0,45 US-Dollar/StundeKurze Länge der verarbeiteten Audiodateien
Voice Agent API4,50 US-Dollar/StundeDauer der End-zu-End-Sitzungskonnektivität
LLM GatewayAbrechnung nach Modell-TokenBerechnen Sie die Eingangs- und Ausgabetokens separat.

Preise für Wertsteigerungsfunktionen

FunktionenZusatzkostenErklärung
Standardasynchrone Sprecherunterscheidung+0,02 US-Dollar/StundeGeeignet für voraufgezeichnete Transkripte
Experimentelle asynchrone Sprecherunterscheidung+0,065 US-Dollar/StundeGeeignet für mehr Sprecher oder schwieriges Audio
Echtzeit-Trennung der Sprecher+0,12 US-Dollar/StundeAbgerechnet nach der Gesamtdauer der Stream-Sitzung
Medical Mode+0,15 US-Dollar/StundeDie verfügbaren Sprachen und Modelle sind begrenzt.
Allgemeine Hinweise+0,05 US-Dollar/StundeUniversal-3.5 Pro: Asynchrone oder Echtzeit-Testfunktionen
Voice Focus+0,10 US-Dollar/StundeNur Universal-3.5 Pro in Echtzeit
Übersetzen+0,06 US-Dollar/StundeVorab aufgezeichnete Audiodateien, Unterstützung für mehrere Zielsprachen
Verschleierung von PII-Texten+0,08 US-Dollar/StundeVerarbeitung sensibler Informationen aus dem Transkripttext
PII-Audio-Überlagerung+0,05 US-Dollar/StundeStummschalten oder Ersetzen von Audio
Inhaltsprüfung+0,15 US-Dollar/StundeZusätzlich zu den Kosten des Basismodells

Abrechnungsvorschriften und häufige Irrtümer

  • Die Vorausaufnahme der Transkription wird nach den tatsächlichen Sekunden der eingereichten Audio-Datei berechnet; für fehlerhafte Transkriptionen wird keine Gebühr erhoben.
  • Die Stream-Transkription wird nach der Gesamtzeit von Einleitung bis Beendigung abgerechnet, wobei auch die Ruhe- und Inaktivitätszeiten berücksichtigt werden.
  • Nicht ordnungsgemäß geschlossene Stream-Sessions können nach 3 Stunden automatisch geschlossen werden und den vollen Betrag in Rechnung stellen.
  • Mehrere parallele Ströme ergeben jeweils eine gesonderte Berechnung der Verweildauer.
  • Die Mehrkanal-Übersetzung wird pro Kanal separat abgerechnet; eine Stunde mit drei Kanälen entspricht der Nutzung von drei Stunden.
  • Zusatzfunktionen werden zum Preis des Basismodells hinzugerechnet.
  • Die Stummschaltungs- und Wiedereinschaltungsfenster für Voice Agents können ebenfalls berechnet werden.
  • Falls innerhalb des Voice Agents zusätzlich das LLM Gateway aufgerufen wird, können die damit verbundenen Token-Kosten separat berechnet werden.

Lehrbuch zur Kostenkontrolle

  1. Wählen Sie das Modell, das die geringsten Anforderungen an Genauigkeit, Verzögerung und Funktionalität erfüllt.
  2. Geben Sie im Antrag explizit das Modell an, um Abweichungen von den Standardwerten für kostenlose und bezahlte Konten zu vermeiden.
  3. Vorverarbeiten des langen Stills und Überprüfen, ob tatsächlich eine getrennte Transkription für mehrere Kanäle erforderlich ist.
  4. Aktivieren Sie nur die Zusatzfunktionen, die einen tatsächlichen wirtschaftlichen Wert schaffen.
  5. Sofort nach Beendigung des Anrufs wird ein Beendigungsereignis gesendet und der WebSocket geschlossen.
  6. Test-, Produktions- und Verbrauchsdaten nach Projekt sowie API-Schlüssel aufteilen.
  7. Einstellen eines Limits für die automatische Aufladung des Saldo, von Erinnerungen zu Gebühren sowie der Überwachung ungewöhnlicher Sitzungen.
  8. Vergleichen Sie regelmäßig die Kosten für manuelle Korrektur, die Genauigkeit des Modells sowie die Kosten pro erfolgreich abgeschlossener Aufgabe.

Voice Agent API

Die Voice Agent API vereint Echtzeit-Spracherkennung, Sprachmodelle, Sprachsynthese, Entscheidungsfindung bezüglich der Reihenfolge der Anfragen, Handhabung von Unterbrechungen sowie Aufrufe von Tools in einem WebSocket. Der Preis beträgt 4,50 US-Dollar pro Stunde und eignet sich für Teams, die die Verwaltung mehrerer Dienste vereinfachen möchten.

PlanVorteileDer Preis
Voice Agent APIEinzige Schnittstelle, End-to-End-Orchestrierung und einheitliche Sitzung4,50 US-Dollar pro Stunde, geringe Flexibilität bei der Ersetzung von Komponenten
Selbst erstellte STT+LLM+TTSJeder Lieferant und jedes Modell kann unabhängig ausgewählt werden.Man muss Verzögerungen, Unterbrechungen, Störungen sowie mehrere Rechnungen selbst bewältigen.
Nur Echtzeit-STTgeeignet für bestehende Dialog- und SprachsyntheseverfahrenDie Kosten für die anschließenden Modelle und Infrastrukturen müssen weiterhin getragen werden.

Daten-Sicherheit und -Governance

  • Projektisolation: Verschiedene Projekte verfügen über eigene API-Schlüssel sowie eigene Bereiche für historische Daten.
  • Rollenrechte: Das Konto unterstützt die Rollen Owner, Admin und Reader.
  • Mehrfaktor-Authentifizierung: Kann für Mitglieder aktiviert und von der Organisation durchgesetzt werden.
  • Datenkontrolle: Kontoinhaber können die Aufbewahrungszeit sowie den Abbruch des Modelltrainings selbst einstellen.
  • Partnervereinbarung: Medizinische Teams können eine BAA bewerten und unterzeichnen.
  • Regionale Verarbeitung: Es können die für die USA oder die EU geeigneten Endpunkte ausgewählt werden, um die Anforderungen bezüglich des Standorts der Daten zu erfüllen.
  • Aktivitätsprotokoll: Erfassung von Kontoinhalten und Verwaltungsaktionen zur erleichterten Prüfung.
  • Verarbeitung von PII: Sensitive Informationen in Texten oder Audioinhalten können durch wertsteigernde Schutzmechanismen verdeckt werden.

Vorteile des Produkts

  • Gleichzeitig abdeckt es vorab aufgezeichnete, Echtzeit-, kurze Audiodateien sowie end-to-end-voice-Intelligenzagenten.
  • Die Preise werden stundenweise öffentlich angegeben, und die vorab aufgezeichneten Audiodateien werden sekundengenau abgerechnet.
  • Es bietet Sprecherangaben, Zeitstempel, Hinweise sowie eine verbesserte Sprachverständnisfähigkeit.
  • Offizielle SDKs wie Python und JavaScript verringern die Aufwand für die Anbindung.
  • Playground kann vor der Kodierung echtes Audio mit verschiedenen Modellen vergleichen.
  • Projekte, Rollen der Teammitglieder, MFA, Datenerhaltung und Auditing sind für die Teamführung geeignet.
  • Der kostenlose Betrag von 50 US-Dollar erleichtert die Bewertung repräsentativer Prototypen.

Nutzungsbeschränkungen

  • Die Genauigkeit der Erkennung wird durch Sprache, Akzent, Störgeräusche, überschneidende Äußerungen und Fachbegriffe beeinflusst.
  • Flussbasierte Sessions werden nach Dauer der Verbindung abgerechnet, und Fehler bei der Verbindungsverwaltung können zu zusätzlichen Kosten führen.
  • Durch Mehrkanalton und zusätzliche Funktionen kann der Preis erheblich über dem Basispreis liegen.
  • Einige Funktionen sind nur für bestimmte Modelle, Sprachen oder voreingestellte Modi verfügbar.
  • Alte Modellparameter und die eingestellte Zusammenfassungsfunktion können zu Migrationsproblemen führen.
  • Cloud-APIs müssen Audio an externe Dienste senden und eignen sich daher nicht für unautorisierte, sensible Daten.
  • LLM Gateway ist nicht im kostenlosen Paket enthalten und wird separat nach den Tokens der jeweiligen Modelle abgerechnet.
  • Das Produktionsystem muss weiterhin Wiederholungsversuche, Sicherheit bei Rückrufen, Limitierungen sowie manuelle Überprüfungen handhaben.

GitHub und SDK

AssemblyAI verfügt über eine offizielle GitHub-Organisation und betreut das Python SDK, das JavaScript SDK, Beispiele sowie Startprojekte für SprachkI-Agenten. Dass die SDKs open source sind, bedeutet nicht, dass die Cloud-basierten Sprachmodelle, die Trainingsdaten sowie die gehosteten APIs ebenfalls offen zugänglich sind.

Entwickler sollten sich an die aktuellen offiziellen Dokumentationen sowie an die aktuelle Version des SDK halten. Besondere Aufmerksamkeit sollte den alten Echtzeit-Endpunkten, den Alias-Namen der Modelle sowie den Änderungen bei den Plural- und Singularparametern gewidmet werden. Im Produktivumfeld sollten die verwendeten Abhängigkeitsversionen festgelegt werden, und vor einem Upgrade sollten Rückgabetests durchgeführt werden.

Grundlegende Informationen

ProjektInhalt
Name der PlattformAssemblyAI
Arten von WerkzeugenSprach-zu-Text-Übersetzung und Entwicklungsplattform für Sprach-KI
KerninterfaceVorab aufgezeichnete, Echtzeit-, synchronisierte kurze Audiodateien und Voice Agent API
HauptmodelleUniversal-3.5 Pro und Universal-2
Kostenlose NutzungsmengeNeues Konto 50 US-Dollar, ohne LLM Gateway
PreismusterAbrechnung nach Audio, Dauer der Sitzung, Zusatzfunktionen oder Token
Offizielles SDKStellen von SDKs und Beispielen für Python, JavaScript usw. bereit
APIAnbieten
Ob Open SourceSDK und Beispiele sind open source, die Hostplattformen und Modelle nicht.

Empfehlungswert

Der Gesamtbewertungswert beträgt 4,6 von 5 möglichen Punkten. Die Schnittstellen, die Sprachfunktionen sowie die Transparenz bezüglich der Dokumente und Preise bei AssemblyAI sind recht gut – daher eignet sich das Produkt zur Entwicklung von Sprachanwendungen für produktive Zwecke. Allerdings muss man die Abrechnung für die Echtzeitverbindungen sowie die zusätzlichen Funktionen genau überwachen.

Häufige Fragen

Was macht AssemblyAI hauptsächlich?

Es wandelt über eine API voraufgenommenes oder Echtzeit-Audio in Text um und bietet Spracherkennung sowie Agentenfähigkeiten.

Gibt es einen kostenlosen Betrag?

Neue Konten erhalten einen kostenlosen Betrag von 50 US-Dollar, ohne Kreditkarte – jedoch ohne LLM Gateway.

Wie viel kostet eine vorab aufgenommene Transkription?

Universal-3.5 Pro kostet 0,21 US-Dollar pro Stunde, Universal-2 kostet 0,15 US-Dollar pro Stunde.

Wie viel kostet die Echtzeit-Transkription?

Universal-3.5 Pro Realtime kostet 0,45 US-Dollar pro Stunde, Universal-Streaming 0,15 US-Dollar.

Wie wird bei der fließenden Erkennung abgerechnet?

Es wird nach der Dauer der WebSocket-Verbindung abgerechnet, einschließlich Stillstands- und Inaktivitätszeiten.

Wird die Trennung der Sprecher unterstützt?

Die Zusatzkosten für die Unterstützung, den Voraufnahmemodus und den Echtzeitmodus sind unterschiedlich.

Wie viel kostet die Voice Agent API?

Der offizielle Preis beträgt 4,50 US-Dollar pro Stunde, berechnet nach Dauer der Sitzung.

Ist AssemblyAI Open Source?

Das offizielle SDK und die Beispiele sind offen zugänglich, doch die gehosteten Modelle, die Trainingsdaten sowie die Plattform selbst sind nicht offen zugänglich.

Eignet sich es für medizinische Daten?

Medizinische Modelle, BAA und Datentransparenz können bewertet werden, doch die Organisation muss weiterhin ihre eigene Konformitätsprüfung durchführen.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Werkzeuge, die denen von AssemblyAI ähneln