assemblyai
AssemblyAI – ein intelligentes Werkzeug für die Programmierung mit KI
Tags:AI-ProgrammierwerkzeugeWas ist AssemblyAI?
AssemblyAI ist eine Sprach-KI-Plattform für Entwickler und Unternehmen, deren Kernfunktion darin besteht, voraufgenommenes oder Echtzeit-Audio in strukturierte Texte umzuwandeln. Entwicklerteams können mithilfe von APIs und offiziellen SDKs Funktionen wie Transkription, Sprechererkennung, Sprachverständnis sowie Sprachintelligenz in ihre eigenen Produkte integrieren.
Die Plattform ist kein gewöhnliches Tool zur Umwandlung von Audiodaten in Text, sondern eine Entwickler-Infrastruktur, die nach Verbrauch abgerechnet wird. Ihre Produkte umfassen asynchrone Vorab-Transkriptionen, Echtzeit-Transkriptionen, Schnittstellen für kurze Audiodateien mit geringer Verzögerung, eine End-to-End Voice-Agent-API, Speech Understanding sowie einen LLM-Gateway.
Hauptprodukte und -funktionen
- Vorab-Transkription von Audiodaten: Senden Sie Audiodateien oder Videodateien ein – die vollständige Transkription wird asynchron erstellt.
- Echtzeit-Stream-Transkription: Audioströme werden über WebSocket gesendet, und Texte werden innerhalb von Hunderten von Millisekunden empfangen.
- Synchronisierte Transkription kurzer Audiodateien: Schnelle Verarbeitung von Sprachanweisungen und kurzen Audioausschnitten per einziger Anfrage.
- Voice Agent API: Kombiniert in einer Echtzeit-Verbindung Spracherkennung, Sprachmodelle, Sprachsynthese und Dialogsteuerung.
- Sprecherunterscheidung: Identifizierung verschiedener Sprecher und Hinzufügen von Tags zu Wörtern oder Sprechphasen.
- Schlüsselwörter und allgemeine Hinweise: Verbesserung der Erkennung in einem bestimmten Kontext durch Begriffe oder natürliche Sprache.
- Sprachverständnis: Ausführung von Aufgaben zur Identifizierung von Entitäten, Themen, Emotionen, Übersetzung und anderen Nachverarbeitungsarbeiten.
- Datenschutzschutzmaßnahmen: Bereitstellung von Funktionen zur Verarbeitung sensibler Texte oder Audiodaten, zur Inhaltsüberprüfung sowie zum Filtern von Schimpfwörtern.
- LLM Gateway: Verwenden Sie einheitliche Anmeldeinformationen, um mehrere Sprachmodelle zur Verarbeitung von Zusammenfassungen und Sprachworkflows aufzurufen.
Sprach-zu-Text-Modell
| Verwendungsmöglichkeiten | Modell | Eigenschaften | Grundpreis |
|---|---|---|---|
| Vorab aufgezeichnet asynchron | Universal-3.5 Pro | Höhere Genauigkeit und Hinweismöglichkeiten | 0,21 US-Dollar/Stunden Audiozeit |
| Vorab aufgezeichnet asynchron | Universal-2 | Geringere Kosten | 0,15 US-Dollar/Stunden Audiozeit |
| Echtzeit-Streaming | Universal-3.5 Pro Realtime | Höhere Genauigkeit und Echtzeit-Hinweise | 0,45 US-Dollar/Stunden pro Sitzung |
| Echtzeit-Streaming | Universal-Streaming | Englisch oder mehrsprachige Wirtschaftslösungen | 0,15 US-Dollar/Stunden pro Sitzung |
| Synchronisierte kurze Audiodateien | Universal-3.5 Pro | Einzige Anfrage liefert kurzes Audiodatei-Ergebnis | 0,45 US-Dollar/Stunde Audiozeit |
Wie wählt man zwischen vorab aufgezeichneten, Echtzeit- und synchronisierten Schnittstellen?
| Schnittstelle | Für Aufgaben geeignet | Zurückkehrmethode | Wichtige Abwägungen |
|---|---|---|---|
| Vorab aufgezeichnet asynchron | Podcasts, Konferenzen, Interviews und historische Aufnahmen | Nach dem Senden der Aufgabe abwarten oder eine Rückruf-Funktion erhalten | Der Preis ist niedrig, aber es muss auf die Bearbeitung gewartet werden. |
| Echtzeit-Streaming | Untertitel, Kundenservice, Sprachroboter und Live-Konferenzen | WebSocket gibt kontinuierlich Ereignisse zurück | Niedrige Verzögerung, aber Abrechnung bei inaktiver Verbindung |
| Synchronisierte kurze Audiodateien | Diktat, Sprachsuche und kurze Befehle | Eine Anfrage liefert das Ergebnis direkt zurück. | Die Schnittstelle ist einfach, der Preis pro Stück ist höher als bei asynchronen Verfahren. |
| Voice Agent | End-to-End-Telefonie und Sprachassistenten | Einzelne Echtzeit-Sitzung | Entwicklung ist einfach, aber die Gesamtkosten sind höher. |
Fähigkeit zur Spracherkennung
- Sprechererkennung: Unterscheidung der verschiedenen Sprecher in Meetings, Interviews oder Telefonaten.
- Entitätenerkennung: Extrahierung von Personen, Organisationen, Orten und anderen strukturierten Entitäten.
- Emotionale Analyse: Bestimmung der positiven, negativen oder neutralen Tendenzen in einem Textabschnitt.
- Themenerkennung: Identifizierung des Themas einer Aufnahmeverhandlung nach inhaltlicher Klassifizierung.
- Schlüsselwörter und Highlights: Entdeckung von wiederkehrenden oder repräsentativen Phrasen.
- Erstellen eines Textes in der Zielsprache, wobei die ursprüngliche Transkriptionsstruktur beibehalten wird.
- Benutzerdefiniertes Format: Anpassung von Zahlen, Abkürzungen und fachlichen Ausdrücken gemäß den Geschäftsregeln.
- Zusammenfassung und Kapitel: Durch den aktuellen Sprachmodell-Workflow können flexiblere Nachverarbeitungsergebnisse erzeugt werden.
Für welche Anwendungsszenarien geeignet
- Konferenzassistent: Protokollierung von Mehrpersonenkonferenzen, Unterscheidung der Sprecher und Erstellung von Handlungspunkten.
- Kontaktzentrum: Transkription von Kundenservice-Gesprächen, Analyse von Themen, Emotionen und Qualitätsproblemen.
- Medienplattformen: Erstellung von Untertiteln und Indexen für Podcasts, Videos, Live-Übertragungen und Kurse.
- Sprachintelligenz-Agent: Erkennung der Aussagen des Benutzers und Steuerung von Echtzeit-Dialogen sowie Toolaufrufen.
- Verkaufsanalyse: Organisation von Anrufen, Einwänden, Wettbewerbsinformationen und nächsten Schritten.
- Medizinische Sprachausgabe: Behandlung von Fachbegriffen in der entsprechenden Sprache und unter Einhaltung der Vorschriften.
- Inhaltsprüfung: Bearbeitung sensibler Informationen, unangemessener Inhalte und personenbezogener Daten im Audio.
- Stimmsuche: Umwandlung großer Mengen an Audio- und Videodaten in suchbaren Text.
Für welche Entwicklerteams geeignet
- SaaS-Teams, die eine Spracherkennungs-API in ihre Produkte integrieren müssen.
- Ingenieure, die Echtzeit-Untertitel, Sprachroboter oder Telefonautomatisierung entwickeln.
- Medien- und Datenteams, die große Mengen an historischen Audio- und Videodaten in Batch-Prozessen verarbeiten müssen.
- Eine Analyseplattform, die Sprecher, Zeitstempel und strukturierte Ergebnisse benötigt.
- Entwickler, die eine schnelle Integration mit Python, JavaScript oder anderen SDKs anstreben.
- Organisationen mit Unternehmensanforderungen bezüglich der Datengebiete, der Retentionszeiten, der Berechtigungen und der Audits.
Schneller Einstiegstutorial
- Registrieren Sie ein Konto und erstellen Sie eine eigene API-Schlüssel für die Testumgebung.
- Vergleichen Sie die Modelle im Playground der Konsole mit echtem, aber anonymisiertem Audio.
- Wählen Sie zwischen vorab aufgenommenen, Echtzeit-, synchronisierten kurzen Audiodateien oder der Voice Agent-Schnittstelle.
- Installieren Sie die offizielle SDK der Zielprogrammiersprache und legen Sie die kompatible Version fest.
- Weisen Sie das Sprachmodell explizit aus – verlassen Sie sich nicht auf möglicherweise ändernde Standardwerte.
- Konfigurieren von Timeout, Wiederholungsversuchen, Callback-Verifizierung und Fehlerprotokollierung.
- Berechnen Sie die Fehlerquote bei Texten durch manuelle Korrektur sowie die Fehlerquote in wichtigen Feldern.
- Stellen Sie Benachrichtigungen für Saldo, Verbrauch und außergewöhnliche Kosten ein, bevor Sie in die Produktionsumgebung wechseln.
Lehrvideo zur Echtzeit-Transkription
- Überprüfen Sie die Abtastrate, Kodierung und Kanäle des Mikrofons oder der Telefon-Audio-Quelle.
- Eine WebSocket-Verbindung herstellen und die richtigen Sitzungsparameter senden.
- Audio-Blöcke werden kontinuierlich übertragen, und Sprechphasen, Zeitstempel sowie Fehlerereignisse werden verarbeitet.
- Konfigurieren Sie Schlüsselwörter oder Hinweise entsprechend der Fachbegriffe.
- Wenn nötig, aktivieren Sie die Trennung der Sprecher, den Medizinmodus oder Voice Focus.
- Unterscheiden Sie im Interface den vorübergehenden Zustand vom unveränderlichen Endtext.
- Nach Beendigung des Gesprächs sendet der Benutzer eine Nachricht zur Beendigung der Sitzung.
- Stellen Sie sicher, dass die Verbindung tatsächlich geschlossen wird, und überwachen Sie die tatsächliche Dauer der Sessionabrechnung.
Grundpreis
AssemblyAI arbeitet nach dem Pay-as-you-go-Prinzip – es gibt keine verpflichtenden monatlichen Abonnements, keine Mindestausgaben und auch keine langfristigen Verträge. Neukunden erhalten einen kostenlosen Betrag von 50 US-Dollar. Dabei ist kein Kreditkartennotwendig. Dieser Betrag kann für die Textumwandlung aus Sprache, Voice Agent, die Spracherkennung sowie weitere Funktionen verwendet werden – doch er beinhaltet nicht den LLM Gateway.
| Produkte | Offener Preis | Berechnungsgrundlage |
|---|---|---|
| Universal-3.5 Pro vorab aufgezeichnet | 0,21 US-Dollar/Stunde | Dauer des eingereichten Audios oder Videos, genau bis zur Sekunde |
| Universal-2-Vorabaufnahme | 0,15 US-Dollar/Stunde | Dauer des eingereichten Audios oder Videos, genau bis zur Sekunde |
| Universal-3.5 Pro in Echtzeit | 0,45 US-Dollar/Stunde | Dauer der aktiven WebSocket-Verbindung |
| Universal-Streaming | 0,15 US-Dollar/Stunde | Dauer der aktiven WebSocket-Verbindung |
| Synchronisierte kurze Audiodateien | 0,45 US-Dollar/Stunde | Kurze Länge der verarbeiteten Audiodateien |
| Voice Agent API | 4,50 US-Dollar/Stunde | Dauer der End-zu-End-Sitzungskonnektivität |
| LLM Gateway | Abrechnung nach Modell-Token | Berechnen Sie die Eingangs- und Ausgabetokens separat. |
Preise für Wertsteigerungsfunktionen
| Funktionen | Zusatzkosten | Erklärung |
|---|---|---|
| Standardasynchrone Sprecherunterscheidung | +0,02 US-Dollar/Stunde | Geeignet für voraufgezeichnete Transkripte |
| Experimentelle asynchrone Sprecherunterscheidung | +0,065 US-Dollar/Stunde | Geeignet für mehr Sprecher oder schwieriges Audio |
| Echtzeit-Trennung der Sprecher | +0,12 US-Dollar/Stunde | Abgerechnet nach der Gesamtdauer der Stream-Sitzung |
| Medical Mode | +0,15 US-Dollar/Stunde | Die verfügbaren Sprachen und Modelle sind begrenzt. |
| Allgemeine Hinweise | +0,05 US-Dollar/Stunde | Universal-3.5 Pro: Asynchrone oder Echtzeit-Testfunktionen |
| Voice Focus | +0,10 US-Dollar/Stunde | Nur Universal-3.5 Pro in Echtzeit |
| Übersetzen | +0,06 US-Dollar/Stunde | Vorab aufgezeichnete Audiodateien, Unterstützung für mehrere Zielsprachen |
| Verschleierung von PII-Texten | +0,08 US-Dollar/Stunde | Verarbeitung sensibler Informationen aus dem Transkripttext |
| PII-Audio-Überlagerung | +0,05 US-Dollar/Stunde | Stummschalten oder Ersetzen von Audio |
| Inhaltsprüfung | +0,15 US-Dollar/Stunde | Zusätzlich zu den Kosten des Basismodells |
Abrechnungsvorschriften und häufige Irrtümer
- Die Vorausaufnahme der Transkription wird nach den tatsächlichen Sekunden der eingereichten Audio-Datei berechnet; für fehlerhafte Transkriptionen wird keine Gebühr erhoben.
- Die Stream-Transkription wird nach der Gesamtzeit von Einleitung bis Beendigung abgerechnet, wobei auch die Ruhe- und Inaktivitätszeiten berücksichtigt werden.
- Nicht ordnungsgemäß geschlossene Stream-Sessions können nach 3 Stunden automatisch geschlossen werden und den vollen Betrag in Rechnung stellen.
- Mehrere parallele Ströme ergeben jeweils eine gesonderte Berechnung der Verweildauer.
- Die Mehrkanal-Übersetzung wird pro Kanal separat abgerechnet; eine Stunde mit drei Kanälen entspricht der Nutzung von drei Stunden.
- Zusatzfunktionen werden zum Preis des Basismodells hinzugerechnet.
- Die Stummschaltungs- und Wiedereinschaltungsfenster für Voice Agents können ebenfalls berechnet werden.
- Falls innerhalb des Voice Agents zusätzlich das LLM Gateway aufgerufen wird, können die damit verbundenen Token-Kosten separat berechnet werden.
Lehrbuch zur Kostenkontrolle
- Wählen Sie das Modell, das die geringsten Anforderungen an Genauigkeit, Verzögerung und Funktionalität erfüllt.
- Geben Sie im Antrag explizit das Modell an, um Abweichungen von den Standardwerten für kostenlose und bezahlte Konten zu vermeiden.
- Vorverarbeiten des langen Stills und Überprüfen, ob tatsächlich eine getrennte Transkription für mehrere Kanäle erforderlich ist.
- Aktivieren Sie nur die Zusatzfunktionen, die einen tatsächlichen wirtschaftlichen Wert schaffen.
- Sofort nach Beendigung des Anrufs wird ein Beendigungsereignis gesendet und der WebSocket geschlossen.
- Test-, Produktions- und Verbrauchsdaten nach Projekt sowie API-Schlüssel aufteilen.
- Einstellen eines Limits für die automatische Aufladung des Saldo, von Erinnerungen zu Gebühren sowie der Überwachung ungewöhnlicher Sitzungen.
- Vergleichen Sie regelmäßig die Kosten für manuelle Korrektur, die Genauigkeit des Modells sowie die Kosten pro erfolgreich abgeschlossener Aufgabe.
Voice Agent API
Die Voice Agent API vereint Echtzeit-Spracherkennung, Sprachmodelle, Sprachsynthese, Entscheidungsfindung bezüglich der Reihenfolge der Anfragen, Handhabung von Unterbrechungen sowie Aufrufe von Tools in einem WebSocket. Der Preis beträgt 4,50 US-Dollar pro Stunde und eignet sich für Teams, die die Verwaltung mehrerer Dienste vereinfachen möchten.
| Plan | Vorteile | Der Preis |
|---|---|---|
| Voice Agent API | Einzige Schnittstelle, End-to-End-Orchestrierung und einheitliche Sitzung | 4,50 US-Dollar pro Stunde, geringe Flexibilität bei der Ersetzung von Komponenten |
| Selbst erstellte STT+LLM+TTS | Jeder Lieferant und jedes Modell kann unabhängig ausgewählt werden. | Man muss Verzögerungen, Unterbrechungen, Störungen sowie mehrere Rechnungen selbst bewältigen. |
| Nur Echtzeit-STT | geeignet für bestehende Dialog- und Sprachsyntheseverfahren | Die Kosten für die anschließenden Modelle und Infrastrukturen müssen weiterhin getragen werden. |
Daten-Sicherheit und -Governance
- Projektisolation: Verschiedene Projekte verfügen über eigene API-Schlüssel sowie eigene Bereiche für historische Daten.
- Rollenrechte: Das Konto unterstützt die Rollen Owner, Admin und Reader.
- Mehrfaktor-Authentifizierung: Kann für Mitglieder aktiviert und von der Organisation durchgesetzt werden.
- Datenkontrolle: Kontoinhaber können die Aufbewahrungszeit sowie den Abbruch des Modelltrainings selbst einstellen.
- Partnervereinbarung: Medizinische Teams können eine BAA bewerten und unterzeichnen.
- Regionale Verarbeitung: Es können die für die USA oder die EU geeigneten Endpunkte ausgewählt werden, um die Anforderungen bezüglich des Standorts der Daten zu erfüllen.
- Aktivitätsprotokoll: Erfassung von Kontoinhalten und Verwaltungsaktionen zur erleichterten Prüfung.
- Verarbeitung von PII: Sensitive Informationen in Texten oder Audioinhalten können durch wertsteigernde Schutzmechanismen verdeckt werden.
Vorteile des Produkts
- Gleichzeitig abdeckt es vorab aufgezeichnete, Echtzeit-, kurze Audiodateien sowie end-to-end-voice-Intelligenzagenten.
- Die Preise werden stundenweise öffentlich angegeben, und die vorab aufgezeichneten Audiodateien werden sekundengenau abgerechnet.
- Es bietet Sprecherangaben, Zeitstempel, Hinweise sowie eine verbesserte Sprachverständnisfähigkeit.
- Offizielle SDKs wie Python und JavaScript verringern die Aufwand für die Anbindung.
- Playground kann vor der Kodierung echtes Audio mit verschiedenen Modellen vergleichen.
- Projekte, Rollen der Teammitglieder, MFA, Datenerhaltung und Auditing sind für die Teamführung geeignet.
- Der kostenlose Betrag von 50 US-Dollar erleichtert die Bewertung repräsentativer Prototypen.
Nutzungsbeschränkungen
- Die Genauigkeit der Erkennung wird durch Sprache, Akzent, Störgeräusche, überschneidende Äußerungen und Fachbegriffe beeinflusst.
- Flussbasierte Sessions werden nach Dauer der Verbindung abgerechnet, und Fehler bei der Verbindungsverwaltung können zu zusätzlichen Kosten führen.
- Durch Mehrkanalton und zusätzliche Funktionen kann der Preis erheblich über dem Basispreis liegen.
- Einige Funktionen sind nur für bestimmte Modelle, Sprachen oder voreingestellte Modi verfügbar.
- Alte Modellparameter und die eingestellte Zusammenfassungsfunktion können zu Migrationsproblemen führen.
- Cloud-APIs müssen Audio an externe Dienste senden und eignen sich daher nicht für unautorisierte, sensible Daten.
- LLM Gateway ist nicht im kostenlosen Paket enthalten und wird separat nach den Tokens der jeweiligen Modelle abgerechnet.
- Das Produktionsystem muss weiterhin Wiederholungsversuche, Sicherheit bei Rückrufen, Limitierungen sowie manuelle Überprüfungen handhaben.
GitHub und SDK
AssemblyAI verfügt über eine offizielle GitHub-Organisation und betreut das Python SDK, das JavaScript SDK, Beispiele sowie Startprojekte für SprachkI-Agenten. Dass die SDKs open source sind, bedeutet nicht, dass die Cloud-basierten Sprachmodelle, die Trainingsdaten sowie die gehosteten APIs ebenfalls offen zugänglich sind.
Entwickler sollten sich an die aktuellen offiziellen Dokumentationen sowie an die aktuelle Version des SDK halten. Besondere Aufmerksamkeit sollte den alten Echtzeit-Endpunkten, den Alias-Namen der Modelle sowie den Änderungen bei den Plural- und Singularparametern gewidmet werden. Im Produktivumfeld sollten die verwendeten Abhängigkeitsversionen festgelegt werden, und vor einem Upgrade sollten Rückgabetests durchgeführt werden.
Grundlegende Informationen
| Projekt | Inhalt |
|---|---|
| Name der Plattform | AssemblyAI |
| Arten von Werkzeugen | Sprach-zu-Text-Übersetzung und Entwicklungsplattform für Sprach-KI |
| Kerninterface | Vorab aufgezeichnete, Echtzeit-, synchronisierte kurze Audiodateien und Voice Agent API |
| Hauptmodelle | Universal-3.5 Pro und Universal-2 |
| Kostenlose Nutzungsmenge | Neues Konto 50 US-Dollar, ohne LLM Gateway |
| Preismuster | Abrechnung nach Audio, Dauer der Sitzung, Zusatzfunktionen oder Token |
| Offizielles SDK | Stellen von SDKs und Beispielen für Python, JavaScript usw. bereit |
| API | Anbieten |
| Ob Open Source | SDK und Beispiele sind open source, die Hostplattformen und Modelle nicht. |
Empfehlungswert
Der Gesamtbewertungswert beträgt 4,6 von 5 möglichen Punkten. Die Schnittstellen, die Sprachfunktionen sowie die Transparenz bezüglich der Dokumente und Preise bei AssemblyAI sind recht gut – daher eignet sich das Produkt zur Entwicklung von Sprachanwendungen für produktive Zwecke. Allerdings muss man die Abrechnung für die Echtzeitverbindungen sowie die zusätzlichen Funktionen genau überwachen.
Häufige Fragen
Was macht AssemblyAI hauptsächlich?
Es wandelt über eine API voraufgenommenes oder Echtzeit-Audio in Text um und bietet Spracherkennung sowie Agentenfähigkeiten.
Gibt es einen kostenlosen Betrag?
Neue Konten erhalten einen kostenlosen Betrag von 50 US-Dollar, ohne Kreditkarte – jedoch ohne LLM Gateway.
Wie viel kostet eine vorab aufgenommene Transkription?
Universal-3.5 Pro kostet 0,21 US-Dollar pro Stunde, Universal-2 kostet 0,15 US-Dollar pro Stunde.
Wie viel kostet die Echtzeit-Transkription?
Universal-3.5 Pro Realtime kostet 0,45 US-Dollar pro Stunde, Universal-Streaming 0,15 US-Dollar.
Wie wird bei der fließenden Erkennung abgerechnet?
Es wird nach der Dauer der WebSocket-Verbindung abgerechnet, einschließlich Stillstands- und Inaktivitätszeiten.
Wird die Trennung der Sprecher unterstützt?
Die Zusatzkosten für die Unterstützung, den Voraufnahmemodus und den Echtzeitmodus sind unterschiedlich.
Wie viel kostet die Voice Agent API?
Der offizielle Preis beträgt 4,50 US-Dollar pro Stunde, berechnet nach Dauer der Sitzung.
Ist AssemblyAI Open Source?
Das offizielle SDK und die Beispiele sind offen zugänglich, doch die gehosteten Modelle, die Trainingsdaten sowie die Plattform selbst sind nicht offen zugänglich.
Eignet sich es für medizinische Daten?
Medizinische Modelle, BAA und Datentransparenz können bewertet werden, doch die Organisation muss weiterhin ihre eigene Konformitätsprüfung durchführen.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164