Deepgram
Kostenloser Mehrwert
Komplette Liste an KI-Tools KI-Audio-Tools

Deepgram

Deepgram – ein intelligentes Tool für KI-gestütztes Audio

Tags:

Eine kurze Beschreibung

Deepgram ist eine Sprach-KI-Plattform für Entwickler und Unternehmen, die über APIs Echtzeit- sowie Batch-Spracherkennung, dialogbasierte Sprachsynthese, umfassende Voice-Agent-Orchestrierung sowie Audioverständnis bietet und sowohl Cloud-Hosting, dedizierte Umgebungen als auch lokale Implementierungen unterstützt.

Einführung in die Tools

Deepgram bietet für echte Sprachanwendungen umfassende Funktionen – von dem Zuhören über das Denken bis hin zum Sprechen. Entwickler können entweder Speech-to-Text oder Text-to-Speech einzeln nutzen, oder sie können mithilfe einer WebSocket-Verbindung ein Echtzeit-Sprachsystem erstellen, das Unterbrechungen, Abwechslungen sowie Aufrufe von Tools verarbeiten kann.

Zu den aktuellen Kernmodellen gehören Nova-3 für die allgemeine Transkription, Flux STT für Dialogrunden, das dialogbasierte Flux TTS sowie die Aura-Serie zur Sprachsynthese. Die Produkte und Modelle sind kommerzielle Dienste; die Offenlegung des offiziellen SDK bedeutet nicht, dass die Gewichte der Modelle oder die Quellcodes der Plattform veröffentlicht werden.

Überblick über die Produktfähigkeiten

ProdukteHaupteingabeHauptausgabeTypische Anwendungen
Speech-to-TextEchtzeit-Stream oder AufnahmefailText mit Zeit, Sprecher und ZuverlässigkeitTranskription, Untertitel und Analyse
Text-to-SpeechText und DialogkontextFließende synthetisierte SpracheKundenservice, Assistenten und Telefonroboter
Voice Agent APIZweiwege-Realtime-Audio und KonfigurationUnterbrochene SprachgesprächeKundenservice, Terminvereinbarung und Auslandsanrufe
Audio IntelligenceAudio-Transkription oder TextZusammenfassung, Thema, Stimmung und AbsichtQualitätskontrolle, Erkenntnisse und Routing
Self-HostedUnternehmens-GPU-InfrastrukturPrivater Sprach-Infersions-EndpunktDatenverweil und niedrige Verzögerung
PlaygroundMikrofon, Datei oder TextErgebnisse der Modell-TestungPrototyp-Validierung und Parametervergleich

Spracherkennungsmodelle

Nova-3

Nova-3 ist das derzeit empfohlene, allgemein einsetzbare Spracherkennungsmodell für die Produktion – es kann für Echtzeitstreams sowie voraufgenommenes Audio verwendet werden. Es unterstützt mehrere Sprachen, die automatische Spracherkennung sowie Geräusche und Audio aus weiterer Entfernung. Zudem kann die Erkennung von Marken-, Produkt- und Branchenterminen durch Keyterm Prompting verbessert werden.

Flux STT

Flux STT ist speziell für Echtzeit-Voice-Agenten konzipiert. Er erkennt nicht nur Texte, sondern integriert auch die Erkennung des Ende einer Sprechrunde sowie einen anpassbaren Dialogrhythmus in das Modell. Die englische Version und die mehrsprachige Version werden getrennt berechnet; bei der mehrsprachigen Version können Sprachanweisungen die Erkennung beeinflussen.

Nova-3 Medical und maßgeschneiderte Modelle

Nova-3 bietet Optionen für medizinisches Vokabular. Unternehmen können außerdem Kontakt zu den Vertriebsmitarbeitern aufnehmen, um Custom-Modelle anzufordern, die an spezifische oder besondere Daten angepasst werden. Professionelle Modelle müssen weiterhin anhand echter Akzente, Geräte, Szenarien und Wortsammlungen bewertet werden – es reicht nicht aus, sich nur auf allgemeine Benchmarks zu stützen.

Whisper Cloud im Vergleich zu den alten Modellen

Deepgram bietet weiterhin die Verwaltung von Whisper Large an und behält Nova-2, Enhanced und Base für bestehende Implementierungen bei. Für neue Projekte sollte man in der Regel zunächst Nova-3 mit Flux vergleichen, um zu vermeiden, aus Gründen der Kompatibilität standardmäßig das weniger skalierbare Whisper zu verwenden.

Spracherkennungsfunktion

  • Streaming wird für die Echtzeit-Teiltranskription von Telefonaten, Meetings und Voice Agents verwendet.
  • Pre-Recorded wird verwendet, um Aufnahmen hochzuladen und einen vollständigen Text asynchron oder synchron zu erzeugen.
  • Speaker Diarization erkennt mehrere Personen und kennzeichnet an, wer jeden Abschnitt spricht.
  • Smart Formatting kümmert sich automatisch um Satzzeichen, Groß- und Kleinschreibung, Datumsangaben und Währungen.
  • Keyterm Prompting verbessert die Erkennung von Produktnamen, Abkürzungen und Fachbegriffen.
  • Redaktion dient dazu, bestimmte sensible persönliche Informationen zu erkennen und zu entfernen.
  • Entity Detection extrahiert Entitäten wie Personen, Organisationen, Orte und Daten.
  • Die automatische Spracherkennung unterstützt die Verarbeitung von Sprachen, die unbekannt sind, oder bei Wechseln der Szenarioart.

Text-zu-Stimme-Sprachsynthese

Flux TTS

Flux TTS ist ein fließender, für dialogbasierte Sprachintelligenzen konzipierter Modelltyp, der den Tonfall, Rhythmus und die Stimmung durch den Kontext über mehrere Gesprächsrunden hinweg aufrechterhält. Er kann den Nutzer darüber informieren, was er vor einer Unterbrechung tatsächlich gehört hat, und es ist möglich, die Geschwindigkeit sowie den Stil ohne Unterbrechung des Gesprächs anzupassen.

Aura-2

Aura-2 ist für professionelle, großskalige und verzögerungsfreie Sprachsynthese konzipiert und kann in Kundenservice-, Benachrichtigungs- und Dialoganwendungen eingesetzt werden. Die bestehenden Aura-2-Modelle müssen aufgrund der Veröffentlichung von Flux TTS nicht umgestellt werden.

Aura-1

Aura-1 steht weiterhin als kostengünstige Option für die Sprachsynthese zur Verfügung. Bei der Auswahl sollten Sprache, Stimme, Verzögerung, die Aussprache strukturierter Inhalte sowie der Einsatzbereich berücksichtigt werden – und nicht nur der Preis pro tausend Zeichen.

Dialogbasierte Sprachsteuerung

Deepgram gestaltet die Sprachsynthese derzeit als Teil einer Dialogarchitektur, die den Zustand, die Grenzen der Sprechabschnitte sowie Unterbrechungen verfolgen kann. Für Projekte mit strengen Anforderungen an die Markenstimme oder an die Stimmenklonierung sollte man zunächst die aktuellen Modelle sowie die damit verbundenen Möglichkeiten überprüfen.

Voice Agent API

Die Voice Agent API vereint Spracherkennung, LLM-Orchestrierung und Sprachsynthese in einer Echtzeitverbindung, wodurch Entwickler nicht mehr gezwungen sind, mehrere Dienste zusammenzusetzen. Nutzer können auch ihre eigenen LLMs oder TTS-Systeme verwenden und lediglich die weiteren Sprach- und Orchestrierungsfunktionen von Deepgram nutzen.

  • Integrierte Barge-in-Erkennung, die es Benutzern ermöglicht, den Agenten natürlich zu unterbrechen.
  • Die Abwechselungsprognose hilft dem System dabei, zu entscheiden, wann zuzuhören, nachzudenken und zu sprechen.
  • Funktionaufrufe ermöglichen es, im Dialog in Geschäftssysteme nachzufragen oder Tools auszuführen.
  • Die Zwischensitzungssteuerung ermöglicht es, während der Sitzung Konfigurationen und Verhaltensweisen anzupassen.
  • Wiederverwendbare Konfigurationen erleichtern die Wiederverwendung von Agenteneinstellungen.
  • Die Multi-Agent-Architektur unterstützt den Austausch zwischen spezialisierten Agenten.
  • Die Telephoniefunktion dient zum Zugang zum Netzwerk für eingehende und ausgehende Anrufe.
  • Das Browser Agent SDK ermöglicht es, Echtzeit-Sprachfunktionen in Webanwendungen einzubinden.

Audio Intelligence

Audio Intelligence wird verwendet, um auf der Grundlage der Transkription strukturierte Ergebnisse wie Zusammenfassungen, Themen, Emotionen und Absichten zu erzeugen. Einige Funktionen werden je nach Eingangs- und Ausgabetoken extra berechnet und dürfen nicht als vollständig im Preis der Spracherkennung enthalten angesehen werden.

FähigkeitenErgebnisPassende SzenarienHauptrisiken
SummarizationZusammenfassung des DialogsKundenservice-Protokolle, Meeting-ZusammenfassungenMöglicherweise wurden Einschränkungen übersehen.
Topic DetectionThementagsInhaltsklassifizierung und RoutingUnstabile Mehrthemen-Grenzen
Sentiment AnalysisEmotionale NeigungenDienstleistungsqualitätskontrolle und TrendsKontext, Kultur und ironische Abweichungen
Intent RecognitionBenutzerabsichtAutomatische Umleitung und anschließende AktionenFalsche Absichten können falsche Abläufe auslösen.
Entity DetectionPersonen, Organisationen, Orte und DatenCRM-Eingabe und -AuskunftDie Schreibweise der Eigennamen muss überprüft werden.
RedactionEntfernen von Teilen des sensiblen TextesDatenschutz und konforme VerarbeitungKann die vollständige Datensicherheit gegen Lecks nicht ersetzen.

Vollständiger Anmeldeprozess

  1. Erstellen Sie ein Deepgram-Konto und ein Projekt, um einen kostenlosen Kreditrahmen zu erhalten.
  2. Erstellen Sie eine API-Schlüssel, der nur die notwendigen Berechtigungen besitzt, und speichern Sie ihn in einer sicheren Serverkonfiguration.
  3. Wählen Sie je nach Echtzeit-Dialog oder Aufnahmeverarbeitung Streaming oder Vorab aufgezeichnet.
  4. Wählen Sie Nova-3, Flux oder andere Modelle, die für die Sprache und den Kontext geeignet sind.
  5. Einstellen von Audio-Kodierung, Abtastfrequenz, Sprache, Sprecher und Formatierungsparametern.
  6. Führen Sie Benchmarks mit echten Geräten, Störgeräuschen, Akzenten und Fachbegriffen durch.
  7. Temporäre Abschnitte, endgültige Abschnitte, Fehler, Zeitüberschreitungen und Neuanbindungen in den Verarbeitungsergebnissen.
  8. Die Länge des Audios, die Anzahl der Zeichen, zusätzliche Funktionen sowie die Konkurrenz gleichzeitig werden aufgezeichnet, um die Kosten zu überwachen.
  9. Konfigurieren Sie vor dem Go-Live Datenschutz, Archivierung, Regionen, Quoten und Strategien zur Fehlerbewältigung.

Lehrvideo zur Echtzeit-Transkription

  1. Stabiles Mono- oder Mehrkanal-Audio aus Browsern, Telefonen oder Audio-Geräten abrufen.
  2. Eine WebSocket-Verbindung herstellen und auf der Serverseite eine kurzfristige oder langfristige Authentifizierung mit Anmeldeinformationen durchführen.
  3. Geben Sie die korrekte Kodierung, die Abtastfrequenz und die Anzahl der Kanäle an, um zu vermeiden, dass das Audio falsch interpretiert wird.
  4. Verwenden Sie Nova-3 zur Verarbeitung der allgemeinen Transkriptionen oder Flux für die Verarbeitung der Dialogrunden.
  5. Aktivieren Sie Smart Formatting, Diarization und Keyterm nach Bedarf.
  6. Die Zwischenergebnisse werden für die Echtzeitoberfläche verwendet, die Endresultate für die Persistenz und Geschäftsaktionen.
  7. Ein Zustandsautomat für Netzwerkunterbrechungen, Stille, lange Pausen, Neuanbindung und Wiederholung von Abschnitten.
  8. Berechnen Sie die Wortfehlerrate, die Genauigkeit bei Entitäten und die End-zu-End-Latenz mit einem manuell annotierten Datensatz.

Leitfaden zur Erstellung eines Voice Agents

  1. Definieren Sie die Aufgaben des Agenten, die ausführbaren Aktionen sowie die Bedingungen, unter denen eine Übertragung an einen Menschen erforderlich ist.
  2. Konfigurieren Sie die Spracherkennung von Flux oder Nova, Anbieter für LLMs sowie TTS-Stimmen.
  3. Erstellen Sie Systemhinweise, um Identität, Tätigkeitsbereich und nicht zugesagte Leistungen einzuschränken.
  4. Führen Sie die Funktionsaufrufe aus und überprüfen Sie auf der Serverseite Parameter, Berechtigungen sowie die Idempotenz.
  5. Testen von Unterbrechungen durch Nutzer, Stille, Wiederholungen, Hintergrundgeräuschen und gleichzeitiges Sprechen.
  6. Protokollieren Sie, was der Benutzer tatsächlich hört, um eine Inkonsistenz im nachfolgenden Betriebszustand zu vermeiden.
  7. Für sensible Vorgänge werden Authentifizierungsverfahren, Bestätigungsschritte und manuelle Übernahme hinzugefügt.
  8. Überwachen Sie Dauer jeder Anruf, Verzögerung, Prozentsatz der Weiterleitung an einen Menschen, Erfolgsrate der Aufgaben und Kosten.

Bewertung der Produktqualität

  1. Ein Testset bereitstellen, das die wichtigsten Sprachen, Akzente, Geräte, Störgeräusche und Fachbegriffe abdeckt.
  2. Es werden zuverlässige Referenztranskripte manuell erstellt, und die Bewertungskriterien werden festgelegt.
  3. Testen Sie jeweils den Echtzeit- und den Batch-Modus getrennt voneinander, ohne Verzögerungen und Genauigkeitswerte zu vergleichen.
  4. Vergleich von Nova-3 einsprachig, mehrsprachig, Flux und bestehenden Anbietern.
  5. Wichtigen Entitäten wie Zahlen, Namen, Adressen, Medikamenten und Kontonummern wird eine eigene Punktzahl zugewiesen.
  6. Bewertung der Runden außerhalb der Wortfehlerrate, Verzögerung beim ersten Zeichen und endgültige Verzögerung.
  7. Schätzen Sie die Kosten für mehrkanalige Audioverarbeitung, zusätzliche Funktionen, Audio-Intelligenz sowie Wiederholungsversuche.
  8. Der Datenverkehr wird nur erweitert, wenn der Geschäfts-Threshold erreicht ist.

Für welche Benutzer geeignet

  • Entwicklerteam für Voice Agents: Erstellung von Echtzeit-Stimmenassistenten mit niedriger Verzögerung und Unterbrechungsmöglichkeit.
  • Callcenter-Plattform: Transkription von Anrufen, Zusammenfassung der Gespräche und Erkennung der Absichten.
  • Konferenzen und Untertiteldienste: Erstellung von Echtzeit-Untertiteln, Sprechern und Kapiteln.
  • Medizinische und Finanzunternehmen: Nutzung von Konformitätslösungen sowie privater Implementierungen durch Unternehmensverträge.
  • Medien- und Podcast-Plattformen: Massen-Transkription, Suche und Verständnis von Aufnahmen.
  • Vertrieb- und Kundenservice-Team: Konvertiert Sprachdaten in CRM- und Qualitätskontrollinformationen.
  • Plattform-Entwicklerteam: Integration mit SDKs, regionalen Endpunkten und Self-Hosting.

Typische Anwendungsszenarien

SzeneEmpfehlungsfähigkeitSchlüsselfaktorenRisikokontrolle
Echtzeit-Kundenservice-RoboterFlux STT plus Flux TTS oder Voice AgentUnterbrechungen, Verzögerungen, LösungsrateAuf Menschliche Bearbeitung und Authentifizierung umleiten
KonferenzuntertitelNova-3 Streaming plus DiarisationWortfehlerrate und SprechergenauigkeitDie Teilnehmer stimmen zu
Aufnahmen archivierenNova-3 Pre-RecordedDurchsatz, Kosten und AbrufrateSicherung und Zugriffskontrolle
Medizinische UnterlagenNova-3 Medical plus RedaktionBegriffe und SchlüsselentitätenBAA und manuelle Überprüfung
TelefonqualitätskontrolleSTT plus Audio IntelligenceZusammenfassung, Emotionen und AbsichtenVermeiden Sie es, nur aufgrund von Emotionsbewertungen zu bestrafen.
SprachbenachrichtigungAura-2 oder Aura-1Artikulation, Verzögerung und KostenMarken und Barrierefreiheitsprüfung
Lokale SprachplattformSelf-HostedDatenverweilung und KapazitätGPU, Aufrüstungen und Lizenzverwaltung

Preisplanung

Die unten angegebenen Preise wurden am 22. August 2026 auf der offiziellen Website überprüft. Ein Teil der Preise für die Spracherkennungsdienste gilt als zeitlich begrenzte Aktion. Die Rabatte für Flux TTS und Voice Agent, die von Flux TTS bereitgestellt werden, laufen am 12. September 2026 aus. Daher muss man die Preise vor dem Einsatz erneut überprüfen.

PlanungPreis oder EinstiegshürdeHauptanteileStandardgrößeFür Nutzer geeignet
Free CreditNeukonto 200 DollarKeine Kreditkarte erforderlich, keine feste Fälligkeitsdatum für die KreditlinieVerwendung von öffentlichen ModellenPrototyp und Bewertung
Pay As You GoNach tatsächlichem VerbrauchKeine MindestverpflichtungSTT-Stream: Bis zu 150 Konkurrenzen gleichzeitigEntwickler und Start-up-Teams
GrowthJährlich eine Anzahlung von mindestens 4.000 US-DollarMaximal bis zu 20% Rabatt sowie höhere KonkurrenzfähigkeitSTT-Stream: Bis zu 225 Konkurrenzen gleichzeitigWachsende Anwendungen in der Produktion
EnterpriseKontaktieren Sie den VerkaufGroßskalige, maßgeschneiderte Modelle, private Bereitstellung und SupportMaßgeschneiderte Konkurrenz und SLAGroße oder regulierte Unternehmen

Sprach-zu-Text-Preis

Echtzeit-Stimmerkennung beim Streamen

ModellPay As You GoGrowthAbrechnungseinheitAnmerkungen
Flux EnglishDer aktuelle Wert beträgt 0,0065 US-Dollar.Derzeit 0,0057 US-Dollarpro MinuteFließende Rabattpreise
Flux Multilingual0,0078 US-Dollar0,0068 US-Dollarpro MinuteUnterstützung für mehrsprachigen Dialog
Nova-3 MonolingualDerzeit 0,0048 US-DollarDerzeit 0,0042 US-Dollarpro MinuteFließende Rabattpreise
Nova-3 MultilingualDerzeit 0,0058 US-DollarDerzeit 0,0050 US-Dollarpro MinuteFließende Rabattpreise
CustomKontaktieren Sie den VerkaufKontaktieren Sie den VerkaufVertragEigene oder spezielle Daten

Erkennung von vorab aufgenommenen Audiodaten

ModellPay As You GoGrowthAbrechnungseinheitFür Aufgaben geeignet
Nova-3 Monolingual0,0043 US-Dollar0,0036 US-Dollarpro MinuteMonolinguale Aufnahme
Nova-3 Multilingual0,0052 US-Dollar0,0043 US-Dollarpro MinuteMehrsprachige Aufnahmen
Whisper Large0,0048 US-Dollar0,0048 US-Dollarpro MinuteKompatibel mit bestimmten Whisper-Prozessen
CustomKontaktieren Sie den VerkaufKontaktieren Sie den VerkaufVertragMaßgeschneiderte Modelle

Erweiterung Sprache-zu-Text

FunktionenPay As You GoGrowthEchtzeit oder aufgezeichnetAnmerkungen
Redaction0,0020 US-Dollar pro Minute0,0017 US-Dollar pro MinuteBeidesEntfernen von Teilen sensibler Informationen
Keyterm Prompting0,0013 US-Dollar pro Minute0,0012 US-Dollar pro MinuteBeidesStärkung von Schlüsselbegriffen
Smart FormattingEnthältEnthältBeidesSatzzeichen und Formatierung
Entity Detection0,0017 US-Dollar pro Minute0,0017 US-Dollar pro MinuteBeidesEntfernen von Entitäten
Speaker DiarizationEchtzeit: 0,0020 US-Dollar pro MinuteNach Seite richten.EchtzeitDer Aufnahmemodus umfasst derzeit
Speaker DiarizationEnthältEnthältAufnahmeMehrfach-Anmerkungen

Text-zu-Sprache-Preise

Flux TTS ist bis zum 12. September 2026 zeitlich begrenzt kostenlos, ab dem 13. September 2026 wird wieder die normale Gebührenstruktur angewandt. Die kostenlose Periode ist kein dauerhaftes kostenloses Angebot.

ModellPay As You GoGrowthAbrechnungseinheitPreisstatus
Flux TTSBis zum 12. September kostenlos, danach 0,0450 US-DollarBis zum 12. September kostenlos, danach 0,0405 US-DollarJede 1000 ZeichenAktion mit Zeitlimit
Aura-20,030 US-Dollar0,027 US-DollarJede 1000 ZeichenDer aktuelle Standardpreis
Aura-10,0150 US-Dollar0,0135 US-DollarJede 1000 ZeichenDer aktuelle Standardpreis

Preise für die Voice Agent API

Voice Agent wird nach der Dauer des Gesprächs abgerechnet, wobei zwischen den Versionen unterschieden wird, die über LLMs und TTS von Deepgram verfügen oder nicht. Im Folgenden sind die aktuellen Preise während der kostenlosen Aktion für Flux TTS sowie die regulären Preise nach Ablauf der Aktion aufgeführt.

EbeneAktueller Preis für Pay As You GoPreis nach der VeranstaltungAktueller Preis von GrowthEignet sich zur Konfiguration
Standard0,056 US-Dollar pro Minute0,075 US-Dollar pro Minute0,051 US-Dollar pro MinuteVerwenden Sie den vollen Standard-Sprachstack.
Standard BYO TTS0,065 US-Dollar pro MinuteGenau wie im Moment0,051 US-Dollar pro MinuteEigene Sprachsynthese
Custom BYO LLM0,050 US-Dollar pro Minute0,065 US-Dollar pro Minute0,041 US-Dollar pro MinuteEigener Sprachmodell
Maßgeschneidertes BYO LLM mit TTS0,050 US-Dollar pro MinuteGenau wie im Moment0,041 US-Dollar pro MinuteEigener Sprachmodell und Sprachsynthese
Advanced0,122 US-Dollar pro Minute0,163 US-Dollar pro Minute0,110 US-Dollar pro MinuteHöhere Ebenen von LLMs
Advanced BYO TTS0,122 US-Dollar pro MinuteGenau wie im Moment0,110 US-Dollar pro MinuteFortgeschrittener LLM mit integrierter TTS-Funktion

Abrechnungsregeln und Kostenfallen

  • Die Spracherkennung wird nach der tatsächlichen Zeit in Sekunden abgerechnet, ohne auf eine feste Anzahl von Minuten aufzurunden.
  • Die Gebühren für mehrkanalige Audioaufnahmen werden nach der Gesamtverarbeitungszeit pro Kanal berechnet; 10 Minuten im Zweikanal-Modus werden als 20 Minuten betrachtet.
  • Redaktion, Schlüsselwörter, Entitäten sowie ein Teil der Diarisation erfordern zusätzliche Gebühren.
  • Audio Intelligence wird nach den eingegebenen und ausgegebenen Tokens abgerechnet und ist nicht im Preis pro STT enthalten.
  • Ein Überschreiten der Kreditgrenze wird zum ursprünglichen Growth-Zinssatz plus 10 % berechnet und wöchentlich abgerechnet.
  • Um das Übermaß an Nutzung zu aktivieren, muss eine gültige Kreditkarte vorhanden sein; andernfalls wird die Anfrage abgebrochen, sobald der Limit erreicht ist.
  • Die Konkurrenzbeschränkung gilt pro Projekt; mehrere API-Schlüssel, die denselben Pool teilen, erhöhen die Kapazität nicht.
  • Das Erstellen zusätzlicher Projekte zur Umgehung von Geschwindigkeitsbeschränkungen verstößt gegen die Nutzungsbedingungen.
  • Nach Ablauf der Werbeaktionen und der zeitlich begrenzten kostenlosen Angebote kann sich die Stückkosten automatisch ändern.

Geschwindigkeitsbeschränkung

DienstleistungenStandardbeschränkung für Pay-As-You-GoOffene Beschränkungen für das WachstumErklärung
Voice AgentMaximal 45 gleichzeitige VerbindungenMaximal 60 parallele VerbindungenNach Projekt berechnen
Flux STT StreamingMaximal 150 parallele AnfragenDie Planungsseite zeigt maximal 225 an.Regionale Dokumente müssen erneut überprüft werden.
Nova-3 Pre-RecordedMaximal 50 parallele AnfragenDer offiziell angekündigte Plan beträgt 50.Massenaufgaben
Nova-3 StreamingMaximal 150 parallele AnfragenMaximal 225Echtzeit-Transkription
Speaker Diarization StreamingHöchstens 50 in Nordamerika, höchstens 25 in Europa und AustralienGemäß VereinbarungUnter der normalen Durchflussbeschränkung
Text-to-Speech RESTMaximal 15 parallele Anfragen pro ModellDer Gesamtüberblick zeigt das größere Gesamtvolumen.Modell- und Gebietsbeschränkungen haben Vorrang
Audio IntelligenceMaximal 10 parallele AnfragenHöchstens 10Zusätzliche Analyse

Einrichtungsmethode

MethodeAusführungsortVerantwortung für Betrieb und WartungDaten und Anwendungsgebiete
HostedDeepgram-Mehrfachmieter-CloudDeepgram ist für die Infrastruktur und Aktualisierungen zuständig.Schnellstmöglicher Beginn der Entwicklung
Regionale CloudEndpunkte in Nordamerika, Europa oder AustralienDeepgram ist für die Verantwortung zuständig.Regionale Verarbeitung und Datenverbleib
Dediziert oder VPCSpezielles Cloud-Umfeld für KundenNach UnternehmensvereinbarungIsolierung und angepasste Kapazität
Self-HostedKunden-VPC oder RechenzentrumDer Kunde ist für die Infrastruktur, die Backups und die Aktualisierungen verantwortlich.Strenge Privatsphäre und niedrige Verzögerung
Amazon SageMakerKunde AWS VPCAWS-hostete Endpunkte und Kunde-KonfigurationenModell über Marketplace bereitstellen

Anforderungen an die selbst gehostete Version

Die lokale Bereitstellung unterstützt Docker, Podman, Kubernetes, Bare Metal sowie einige Cloud-Plattformen. Unterstützt werden nur Linux x86-64 oder amd64 sowie NVIDIA-GPUs. Nova und Aura bieten eine breitere Unterstützung, während das Flux-Modell höhere Anforderungen an die GPU-Generation und den Arbeitsspeicher stellt.

  • Ein STT-Engine benötigt in der Regel mindestens eine NVIDIA-GPU mit 16 GB Grafikspeicher, einen 4-Kern-CPU und 32 GB RAM.
  • Der TTS-Engine der Aura-Klasse benötigt genau 2 dedizierte GPUs, einen CPU mit 8 Kernen sowie 64 GB RAM.
  • Flux TTS verwendet einen einzigen GPU, doch beim Laden kann er etwa 60 GB Systemram speichern.
  • Selbst self-hostete Container benötigen weiterhin eine Lizenz sowie Berichte über die Nutzung – abgesehen von der SageMaker-Isolierungs-Lösung sind sie nicht automatisch vollständig offline.
  • Der Kunde ist für die Überwachung, Kapazität, Backups, Aktualisierungen, Proxye und TLS-Terminierung verantwortlich.
  • Die Selbstverwaltung von Docker, Podman oder Kubernetes erfordert in der Regel eine Enterprise-Lizenz.

Privatsphäre, Sicherheit und Verbesserung der Modelle

Deepgram überlässt die Regelungen bezüglich der Aufbewahrung, Speicherung und Löschung der Kundendaten der Unternehmen den in den Geschäftsvereinbarungen festgelegten Bestimmungen. Laut den Anleitungen zur Selbstverwaltung werden bei einer typischen Selbstverwaltungsanfrage weder Audio-Dateien noch Transkripte sowie andere Erkennungsergebnisse an Deepgram gesendet; stattdessen werden nur Metadaten wie Dauer, Anzahl der Zeichen, Funktionen und Status des Erfolgs übermittelt.

Kunden mit dem Pay-As-You-Go-Modell sowie mit dem Growth-Modell können sich dem Model Improvement Program anschließen oder wieder verlassen. Ein Austritt ab März 2026 beeinflusst die auf der Website angegebenen Tarife nicht. Bevor echte personenbezogene Daten verarbeitet werden, müssen die Optionen in der Konsole, der Standort, die Aufbewahrungsfrist sowie die Datenverarbeitungsvereinbarungen noch bestätigt werden.

  • Deepgram macht die SOC 2 Type I- und Type II-Zertifizierungsdaten öffentlich.
  • Enterprise-Kunden im Gesundheitswesen können einen BAA unterzeichnen, um elektronisch gesicherte Gesundheitsinformationen zu verarbeiten.
  • Die europäischen Endpunkte dienen dazu, die Anforderungen an die Verarbeitung und Speicherung von Daten innerhalb der EU zu erfüllen.
  • API-Schlüssel sollten nur auf der Serverseite gespeichert werden und nach Projekt, Umgebung sowie mit minimalem Berechtigungsgrad strukturiert sein.
  • Redaktion kann nur das Exponierungsrisiko teilweise verringern, sie ersetzt nicht die Minimierung der Quelldaten.
  • Vermeiden Sie es, im Protokoll das Originalaudio, vollständige Transkripte sowie langfristig gültige Schlüssel zu speichern.
  • High-Risk-Voice-Agenten müssen Benachrichtigungen, Zustimmung zur Aufzeichnung, manuelle Übernahme sowie Audits bereitstellen.

SDK, GitHub und Open-Source-Status

Deepgram unterhält in der offiziellen GitHub-Organisation SDKs für JavaScript, Python, .NET, Go und Java und stellt Pakete für den Voice Agent-Browser bereit. In der aktuellen Dokumentation zum JavaScript SDK wird v5 als aktuelle Hauptversion angegeben; Projekte, die migriert werden sollen, sollten sich daher an die entsprechenden Anleitung zur Aufwertung wenden.

Mehrere offizielle SDKs werden unter der MIT-Lizenz bereitgestellt, wodurch Entwickler diesen Client-Code einsehen, ändern und verbreiten können. Die Deepgram-Cloudplattform, das Geschäftsmodell, die Modellgewichte sowie die selbst gehosteten Container sind dadurch jedoch keine Open-Source-Produkte.

ProjektWartungspersonalStatusLizenz oder Anleitung
JavaScript- und TypeScript-SDKOffizielle Seite von DeepgramÖffentlichMIT, aktuelle Hauptversion v5
Python SDKOffizielle Seite von DeepgramÖffentlichGemäß der Lagerlizenz.
.NET SDKOffizielle Seite von DeepgramÖffentlichMIT
Go SDKOffizielle Seite von DeepgramÖffentlichMIT
Java SDKOffizielle Seite von DeepgramÖffentlichMIT
Rust SDKGemeinschaftÖffentlichNicht derselbe Grad an offizieller Unterstützung
Voice Agent SDKOffizielle Seite von DeepgramÖffentlichMIT
Modellgewichte und Cloud-PlattformenDeepgramNicht open sourceKommerzielle Produkte

Unterstützte Sprachen und Plattformen

FähigkeitenSprache oder PlattformOffener StatusHinweise
Nova-SpracherkennungMehr als 45 SprachenUnterstützungDie konkreten Funktionen variieren je nach Modell und Sprache.
Nova-3 MultilingualProduktbeschreibungen in mehr als 50 SprachenUnterstützungAutomatische Spracherkennung
Flux STT Multilingual10 SprachenUnterstützungFür Echtzeit-Dialoge
Flux TTSAktueller englischer TonUnterstützungWeitere Sprachen sind noch in Planung.
Cloud-APIServerseite und WebSocketUnterstützungDie regionalen Endpunkte sind unterschiedlich.
Self-HostedLinux x86-64 und NVIDIA-GPUUnternehmensunterstützungDie Hardware-Anforderungen variieren je nach Modell.
Mobile SDKKeine eigenständige Verbraucher-AppÜber die Backend- oder Web-IntegrationDer Schlüssel darf nicht in den Client gelangen.

Vorteile des Produkts

  • Von STT, TTS bis hin zu Voice Agent: Ein kohärentes Sprachstack-Portfolio.
  • Flux integriert das Ende der Runde sowie Feedback zu Unterbrechungen in das Dialogmodell, um externe Zusammenfügungen zu reduzieren.
  • Nova-3 umfasst die Echtzeit- und Batch-Transkription sowie sprachbasierte und terminologische Erweiterungen.
  • Die Abrechnung nach Sekunden vermeidet Verschwendung durch Aufgerundung auf volle Minuten.
  • Es wird ein kostenloses Kreditlimit von 200 US-Dollar bereitgestellt, das zur Durchführung einer Bewertung echter Daten geeignet ist.
  • Die Auswahl an Deployment-Optionen für Hosting, Regionen, VPC, lokal und SageMaker ist recht umfassend.
  • Die offizielle SDK umfasst verschiedene gängige Server-Sprachen und stellt den Quellcode zur Verfügung.
  • Die Unternehmenssicherheit, die medizinischen Vereinbarungen sowie die Optionen zur Datenspeicherung in der EU sind klar definiert.

Einsatzbeschränkungen und Hinweise

  • Die Genauigkeit des Modells wird durch Sprache, Akzent, Störgeräusche, das Gerät, Fernbereich und überschneidende Sprachausgaben beeinflusst.
  • Für Sonderpreise und zeitlich begrenzte kostenlose Angebote gilt ein klarer Endtermin; die langfristigen Kosten müssen zu den Standardpreisen geschätzt werden.
  • Bei mehrkanaliger Aufnahme werden die Kosten aufgrund der Summe der Dauer jedes Kanals leicht unterschätzt.
  • Einige Transkriptionsverbesserungsfunktionen sowie Audio Intelligence erfordern eine zusätzliche Gebühr.
  • Die Standard-Parallelisierung ist durch das Projekt begrenzt und kann nicht durch die Erstellung weiterer Projekte umgangen werden.
  • Ein Voice Agent muss bei der Ausführung externer Aktionen Berechtigungen, Parameter sowie die Bestätigung des Benutzers überprüfen.
  • Emotions- und Absichtsmodelle können Fehler aufweisen und dürfen daher nicht als einzige Grundlage für Entscheidungen herangezogen werden.
  • Selbstverwaltung erfordert eine GPU, Linux, Container-Management, lizenzierte Verbindungen sowie einen Unternehmensvertrag.
  • Die Offenlegung des offiziellen SDKs bedeutet nicht, dass die Sprachmodelle oder die Plattform kostenlos in privater Umgebung eingesetzt werden können.
  • Wichtige medizinische, rechtliche, finanzielle und identitätsbezogene Informationen müssen weiterhin manuell überprüft werden.

Grundlegende Informationen

FelderInhalt
Name des ToolsDeepgram
EntwicklungsunternehmenDeepgram, Inc.
Arten von WerkzeugenSpracherkennung, Sprachsynthese und Voice-Agent-Plattformen
HauptmodelleNova-3, Flux STT, Flux TTS, Aura-2 und Aura-1
HauptanschlüsseREST API und WebSocket API
Kostenlose NutzungsmengeNeues Konto mit einer Kreditlinie von 200 US-Dollar
PreismusterNach Verbrauch, jährliche Vorauszahlung für Growth und maßgeschneiderte Lösungen für Enterprise
WachstumsschwelleAb 4.000 US-Dollar pro Jahr
HauptverteilungHosted, regionale Cloud, VPC, Self-Hosted und SageMaker
Chinesische UnterstützungNova-Serie wird unterstützt; die genauen Funktionen sind in der Tabelle der Modelliersprachen zu finden.
Ist eine Registrierung erforderlich?Ja
Wird eine API bereitgestellt?Ja
Offizielles SDKJavaScript, Python, .NET, Go, Java usw.
Offizieller GitHubJa
Ist das SDK open source?Ja, mehrere offizielle SDKs verwenden MIT.
Ist das Produkt open source?Nein

Empfehlungswert

Die Empfehlungswertung liegt bei 4,7 von 5 Punkten. Deepgram umfasst den gesamten Produktionsprozess – von der Echtzeit-Transkription über dialogbasierte TTS-Funktionen bis hin zu vollwertigen Voice Agents. Es stehen zahlreiche Modelle, Dokumentationen, SDKs sowie Optionen für regionale und lokale Implementierungen zur Verfügung.

Die Herausforderung besteht darin, dass es viele Produktlinien und Abrechnungskriterien gibt. Das Ende von Werbekampagnen, die Anzahl der Kanäle, zusätzliche Funktionen sowie die gleichzeitige Nutzung können alle den Gesamtkosten zugutekommen. Die sicherste Methode ist es, mit einem Kreditrahmen von 200 US-Dollar eine Realitätsprüfung durchzuführen und anschließend das Produktionsbudget anhand der Standardpreise zu schätzen.

Häufige Fragen

Ist Deepgram kostenlos?

Neue Konten erhalten einen kostenlosen Kreditrahmen von 200 US-Dollar – ohne Kreditkarte. Laut der Website gibt es keinen festgelegten Ablauftermin. Nach Ablauf des Kreditrahmens wird in Abhängigkeit vom tatsächlichen Verbrauch abgerechnet.

Wie viel kostet die Spracherkennung von Deepgram?

Der derzeitige Echtzeit-Preis für Nova-3 in einer Sprache beträgt 0,0048 US-Dollar pro Minute, für voraufgenommenes Audio 0,0043 US-Dollar pro Minute. Für mehrsprachige Versionen, Flux sowie zusätzliche Funktionen gelten andere Preise.

Ist Flux TTS dauerhaft kostenlos?

Nein. Flux TTS ist nur bis zum 12. September 2026 zeitlich begrenzt kostenlos. Ab dem 13. September beträgt der reguläre Preis 0,0450 US-Dollar pro 1000 Zeichen.

Wie wird die Gebühr für die Voice Agent API berechnet?

Es wird nach den Minuten des Gesprächs sowie der gewählten Kombination aus LLM und TTS abgerechnet. Der aktuelle Standardpreis beträgt 0,056 US-Dollar pro Minute; nach Ablauf der Aktion liegt der Preis bei 0,075 US-Dollar pro Minute.

Wird Chinesisch unterstützt?

Die Nova-Serie unterstützt Chinesisch und weitere Sprachen, doch die genauen Erkennungsfunktionen, Modelloptionen sowie die Verfügbarkeit in bestimmten Regionen richten sich nach der neuesten Liste der unterstützten Sprachen. Bei chinesischen Texten sollten weiterhin Akzente, englische Wörter sowie Fachbegriffe getestet werden.

Kann es lokal installiert werden?

Ja, Enterprise-Kunden können die Lösung in VPCs, auf Bare-Metal-Systemen oder in Container-Plattformen selbst hosten – oder sie kann auch über Amazon SageMaker bereitgestellt werden. Für die Hardware sind in der Regel Linux sowie NVIDIA-GPUs erforderlich.

Speichert Deepgram Audiodateien?

Die Speicherung und Löschung von Kundendaten in der Cloud erfolgt gemäß den Geschäftsvereinbarungen. Typische Self-Hosting-Anfragen senden weder Audio- noch Transkriptdaten an Deepgram, sondern liefern lediglich Metadaten zur Nutzung.

Kann man aus dem Modellverbesserungsprogramm austreten?

Ja, Pay-As-You-Go- und Growth-Kunden können sich anschließen oder wieder ausschließen. Ein Austritt ab März 2026 beeinflusst die auf der Website angegebenen Preise nicht.

Wie wird bei mehrkanaliger Wiedergabe abgerechnet?

Berechnet nach der Gesamtverarbeitungsdauer aller Kanäle. 10 Minuten Stereo-Audio werden als 20 Minuten Verarbeitungszeit abgerechnet.

Welche SDKs werden angeboten?

Offiziell werden SDKs für JavaScript, Python, .NET, Go und Java gewartet, außerdem werden Browser-Tools für Voice Agent bereitgestellt. Das Rust SDK ist ein Projekt der Community.

Ist Deepgram open source?

Produkte und Modelle sind nicht open source. Mehrere offizielle SDKs nutzen die MIT-Lizenz, was lediglich bedeutet, dass der Client-Zugriffscode öffentlich ist.

Zusammenfassung

Deepgram eignet sich für Entwicklerteams, die eine produktionsreife Echtzeit-Spracherkennung, dialogbasierte Sprachsynthese sowie Voice Agents benötigen. Zudem kann es durch regionale Endpunkte sowie self-hosted Services die Anforderungen bezüglich Unternehmensdaten und -deployment erfüllen. Nova-3 ist geeignet für allgemeine Transkriptionen, während Flux besser für Echtzeit-Dialoge geeignet ist, bei denen Umschaltungen und Unterbrechungen berücksichtigt werden müssen.

Vor dem Go-Live sollten Genauigkeit, Verzögerung, Konkurrenzfähigkeit, Kanäle, zusätzliche Funktionen sowie die Standardkosten nach Ablauf der Werbeaktion überprüft werden. Die Offenlegung des SDK senkt die Hürden für den Zugang, doch Modelle, Cloud-Dienste und selbst gehostete Container bleiben kommerzielle Produkte.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Tools, die dem Deepgram ähneln