Cekura
Cekura – ein intelligentes Tool, das sich auf KI-gestütztes Audio konzentriert.
Tags:KI-Audio-ToolsWas ist Cekura?
Cekura ist eine Plattform für die automatisierte Testung, Bewertung und Überwachung von KI-Agenten für Sprache und Chat, die von dem amerikanischen Unternehmen Tatva Labs Inc. betrieben wird. Das Team kann vor dem Go-Live echte Gespräche simulieren, nach dem Go-Live die Anrufe kontinuierlich überwachen und die festgestellten Fehler in wiederholbare Regressionstests umwandeln.
Es dient hauptsächlich den Produkt-, Engineering- und Qualitätsteams, die Systeme für sprachbasierten Kundenservice, Outbound-Sales, Terminvereinbarungen, Personalrekrutierung sowie konformitätsbezogene Dialoge entwickeln. Der Schwerpunkt liegt nicht darauf, einen neuen Sprachroboter zu erstellen, sondern darauf, zu überprüfen, ob bestehende Roboter in verschiedenen Szenarien, auf verschiedenen Plattformen und mit unterschiedlicher Infrastruktur zuverlässig funktionieren.
Eine kurze Beschreibung
Cekura ermöglicht es, synthetische Benutzer zu verwenden, um in großen Mengen mit KI-Agenten zu kommunizieren. Dabei können individuelle Bewertungskriterien angewendet werden, und echte Produktionsgespräche können überwacht werden. So kann das Team vor und nach dem Einsatz dieselben Bewertungskriterien nutzen, um Probleme wie Regressionen, Verzögerungen, Aufrufe von Tools sowie Compliance-Probleme zu erkennen.
Hauptfunktionen
Simulierte Unterhaltung vor dem Go-Live
Benutzer können Testszenarien für Aufgaben wie Terminvereinbarungen, Rückerstattungen, Authentifizierung oder die Prüfung von Verkaufsqualifikationen erstellen und anschließend Simulationsbenutzer dazu bringen, mehrere Gesprächsrunden mit dem Ziel-Intelligenzagenten zu führen. Zu den Tests können Hintergrundgeräusche, Akzente, Mehrsprachigkeit, Unterbrechungen und komplexe Verzweigungen hinzugefügt werden, anstatt nur einen festen Text zu vergleichen.
Bewertungstools und Testpersonen
Der Bewertungstool dient dazu, die Identität, Ziele, Sprechweise, bedingten Aktionen sowie die erwarteten Ergebnisse von simulierten Benutzern zu definieren. Testdaten, dynamische Variablen sowie die Reaktionen der Simulationstools können wiederverwendet werden, sodass dieselbe Szenariokombination für verschiedene Kunden, Orte und Randbedingungen genutzt werden kann.
Vorgefertigte und benutzerdefinierte Indikatoren
Die Plattform bietet Standardindikatoren wie Genauigkeit, Qualität des Dialogs, Kundenerfahrung und Sprachqualität und unterstützt boolesche, numerische sowie kategorisierte Ergebnisse. Das Team kann außerdem Bewertungskriterien für LLMs in natürlicher Sprache erstellen oder deterministische, benutzerdefinierte Prüfungen in Python schreiben.
Toolaufrufe und Infrastrukturtests
Cekura kann überprüfen, ob der Agent zur richtigen Zeit die richtigen Tools aufruft und die richtigen Parameter übermittelt, sowie stabile Ergebnisse mit Simulationswerkzeugen liefern. Die Infrastrukturtests decken Probleme bei Sprachverbindungen wie Verzögerungen, Stabilitätsprobleme, Unterbrechungen, Stille, Ablenkungen, Konkurrenz und Wiederherstellung nach Fehlern ab.
A/B-Tests, Lasttests und Mehrsprachentests
Ein Team kann mit derselben Szenario zwei Prompts, Modelle, Anbieter oder Konfigurationen vergleichen und durch wiederholte Ausführungen Unsicherheiten feststellen. Lasttests und parallele Aufrufe dienen dazu, die Kapazitäten zu überprüfen, während Tests in mehreren Sprachen, mit verschiedenen Akzenten sowie bei Code-Switching dazu dienen, Mängel in der Erkennung und Verarbeitung aufzudecken.
Produktion von Anrufüberwachung
Das Produktionsystem kann Transkripte, Aufnahmen, Metadaten sowie die Gründe für das Ende einer Anrufung entweder durch native Integration oder über Webhooks senden. Cekura bewertet die Anrufe anhand von Kennzahlen, zeigt Trends, Fehlerquellen, Themen, Verzögerungen und Abweichungen auf und stellt Alarme sowie herunterladbare Berichte bereit.
Rotes Team und Konformitätsprüfung
Die Funktionen des Roten Teams ermöglichen das Erstellen von konfrontativen Dialogen wie Jailbreaks, Abweichungen vom Skript, bösartige Absichten sowie den Datenabfluss persönlicher Informationen. Medizinische, finanzielle oder andere regulierte Teams können außerdem Regeln wie Authentifizierung, Ankündigung von Aufnahmen und Verbot der Offenlegung zu wiederholbaren Zutrittskontrollmechanismen machen.
Schleife der Selbstverbesserung
Die Plattform erzeugt oder reproduziert Tests aufgrund von Fehlern in der Produktion, klärt die Ursachen zusammen und schlägt Anpassungen vor, um anschließend den Veröffentlichungsprozess erneut auszuführen. Die automatischen Vorschläge müssen dennoch von Ingenieuren überprüft werden, insbesondere wenn es um Änderungen in Bezug auf Geschäftsrichtlinien, Sicherheits- und Konformitätsvorschriften geht.
Testen, Überwachen und Verbesserung im Schließkreislauf
| Phase | Eingabe | Cekura-Verarbeitung | Hauptausgabe | Teamentscheidungen |
|---|---|---|---|---|
| Design | Prozessabläufe, Risiken und historische Störungen | Erstellung von Charakteren, Szenen, Variablen und Indikatoren | Wiederholbarer Testdatensatz | Definieren, was als bestanden gilt |
| Simulation | Testdatensatz und Ziel-Agent | Massenausführung von Sprach- oder Chatgesprächen | Transkription, Aufnahme, Toolaufrufe und Punkte | Reparatur fehlgeschlagen oder bekanntes Risiko in Kauf genommen |
| Zugang freigeben | Neue Version und Referenzversion | Regression-, A/B- und Konkurrenztests | Versionenvergleich und Status der Freigabe | Erlauben oder verhindern des Deployments |
| Produktionsüberwachung | Echte Anrufe und Metadaten | Bewertung, Clustering, Trends und Alarme | Fehlerbeispiele und Betriebsindikatoren | Bestimmung der Bearbeitungsreihenfolge |
| Verbesserung | Fehlerhafte Anrufe und Ursachen | Erstellen von Replikationsfällen und Vorschläge zur Änderung | Patch-Kandidaten und neue Regressionstests | Nach manueller Überprüfung erneut veröffentlichen |
Vollständiger Arbeitsablauf
- Erstellen Sie Organisationen und Projekte, um Agenten und Zugriffsrechte nach Umgebung, Produktlinie oder Kunden zu ordnen.
- Verbinden Sie Retell, Vapi, ElevenLabs, LiveKit, Pipecat, SIP oder benutzerdefinierte Sprachsysteme.
- Wählen Sie die Schlüsselprozesse aus, um Szenarien für den Normalfall, Grenzsituationen, Wiederherstellung nach Fehlern sowie Compliance-Risiken zu erstellen.
- Einstellen von Simulationspersonen, Akzenten, Sprachen, dynamischen Variablen, Tool-Reaktionen und Bedingungen für das Beenden des Anrufs.
- Wählen Sie vorgefertigte Indikatoren aus und ergänzen Sie diese mit LLM-Bewertungen oder Python, um branchenspezifische Indikatoren sowie Bewertungskriterien hinzuzufügen.
- Mit geringer Konkurrenz werden kleine Stichproben ausgeführt; die Transkripte, Aufnahmen, Erklärungen der Kennzahlen sowie Fehlentscheidungen werden manuell überprüft.
- Erweiterung auf Regressionstests, A/B-Tests, Lasttests und Red-Team-Tests, wobei wichtige Tests in Pull-Requests oder Release-Pipelines integriert werden.
- Anbindung zur Überwachung von Produktionsanrufen, Konfiguration von Alarmen, Verarbeitung personenbezogener Daten, Aufbewahrung von Protokollen und Zugriffskontrolle.
- Führe die häufigen Fehlschläge in neue Testfälle um, korrigiere die Anweisungen oder die Infrastruktur und prüfe erneut.
Anleitung für Anfänger
- Nach der kostenlosen Registrierung wird ein neues Projekt erstellt, wobei zunächst eine Sprach- oder Chat-Intelligenz aus einer Nicht-Produktionsumgebung verbunden wird.
- Beginnen Sie mit dem wichtigsten Schritt der Nutzerreise und beschreiben Sie klar die Ziele des simulierten Nutzers, die zugelassenen Informationen sowie die Erfüllungsbedingungen.
- Erstellen Sie drei bis fünf Szenarien, die jeweils einen normalen Ablauf, eine Unterbrechung durch den Benutzer, fehlende Informationen sowie einen Fehler des Tools abdecken.
- Fügen Sie Indikatoren wie Aufgabenabschluss, Richtigkeit der Fakten, Verzögerungen, Sprachqualität und Konformität hinzu.
- Führen Sie eine kleine Anzahl von Tests durch und hören Sie sich die Ergebnisse oder lesen Sie sie nacheinander an, um zu überprüfen, ob die Bewertungen mit der manuellen Beurteilung übereinstimmen.
- Anpassen von unklaren Indikatoren und Simulationsfiguren, sowie Hinzufügen von Akzenten, Rauschen, Sprache und Randbedingungen.
- Nachdem die Stabilität getestet wurde, werden gemäß den Labels Rauch- und vollständige Regressionstests erstellt, und Zugriffskontrollen für die Bereitstellung eingestellt.
Anbindung an den CI/CD-Prozess
- Erstellen Sie eine API-Schlüssel in Cekura und speichern Sie den Schlüssel in den verschlüsselten Geheimnissen der Code-Hosting-Plattform.
- Erhalten Sie die ID des Ziel-Agenten und wählen Sie mit der Szenen-ID oder dem Label den zu ausführenden Testset aus.
- Rufen Sie in einer GitHub Actions-Werkfluss eine offizielle Action auf und legen Sie die Ausführungshäufigkeit, die Zeitüberschreitung sowie eine optionale Telefonnummer fest.
- Lassen Sie den Workflow bei Pull-Requests, Pushes in die Hauptbranche, zeitgesteuerten Aufgaben oder manuellem Auslösen ablaufen.
- Prüfen Sie die Laufprotokolle und Testergebnisse; eine weitere Bereitstellung ist nur zulässig, wenn die Schlüsselindikatoren einen bestimmten Schwellenwert erreichen.
- Wechseln Sie die Schlüssel regelmäßig und vermeiden Sie es, Telefonnummern, Kundendaten sowie Zugangsdaten direkt im Repository zu speichern.
Für welche Benutzer geeignet
- Entwicklerteam für Sprach-KI: Führt bei jeder Änderung an Prompten, Modellen, Sprachstacks oder Tools automatische Regressionen durch.
- Qualitäts- und Testingenieure: Übersetzen der Anforderungen aus den Geschäftsprozessen in Szenarien, Kennzahlen und Freigabekriterien.
- Produkt- und Betriebsteam: Identifizierung fehlerhafter Abläufe, Verbindungsabbrüche sowie Probleme bei der Kundenerfahrung aus den Produktionsanrufen.
- Kundenservice- und Aufrufplattform: Testterminvereinbarung, Rückerstattungen, Qualifikationsprüfung, Weiterleitung sowie manuelle Aufstiegsmöglichkeiten.
- Gesundheitswesen und regulierte Unternehmen: Identitätsprüfung, Aufzeichnung von Mitteilungen, sensible Informationen sowie Compliance-Vorschriften.
- Anbieter von Sprachplattformen: Vergleich von Modellen, Orchestrierungsschichten und Kommunikationsinfrastrukturen im selben Szenario.
- AI-Beratungs- und Implementierungsteam: Pflegt für verschiedene Kunden isolierte Projekte, Berichte sowie wiederholte Testressourcen.
Typische Anwendungsszenarien
- Simulieren Sie vor der Veröffentlichung Hunderte von Dialogen für Terminvereinbarungen, Terminverschiebungen, Stornierungen und Notfall-Upgrades.
- Vergleichen Sie die Leistung von Vapi, Retell, ElevenLabs, LiveKit oder einer selbst entwickelten Sprachstack-Lösung in derselben Anwendungssituation.
- Überprüfen, ob der Agent Kalender-, CRM-, Zahlungs- oder Wissensdatenbank-Tools korrekt aufrufen kann.
- Prüfen Sie die Robustheit der Sprache mit Akzenten, Hintergrundgeräuschen, Unterbrechungen, langen Pausen und Netzwerkunterbrechungen.
- Reproduzieren Sie tatsächliche Produktionsfehler als Regressionstests, um zu verhindern, dass sie nach der Behebung erneut auftreten.
- Überwachen vieler echter Anrufe und Klassifizieren nach den Ursachen für Misserfolge, um das manuelle Abhören jedes einzelnen Anrufs zu reduzieren.
- Führen Sie Smoke-Tests in Pull-Requests auf GitHub aus, um zu verhindern, dass Versionen mit einer Beeinträchtigung kritischer Workflows veröffentlicht werden.
Vorteile des Produkts
- Die Simulation vor dem Go-Live und die Überwachung nach dem Go-Live in derselben Kennzahlssystematik zu integrieren, erleichtert den Rückgriff auf wiederholbare Tests bei Produktionsproblemen.
- Es unterstützt gleichzeitig LLM-Bewertungen und Python-Metriken und berücksichtigt sowohl semantische Beurteilungen als auch präzise Geschäftsprüfungen.
- Umfasst Sprachdetails, Toolaufrufe, Infrastruktur, Lasten, Red-Team-Methoden und Konformität – nicht beschränkt auf Textfragen und -antworten.
- Es bietet eine native Integration mit verschiedenen gängigen Sprachplattformen sowie Unterstützung für SIP, WebSocket, Webhook und benutzerdefinierte Anbindungen.
- Offene REST-APIs, OpenAPI-Spezifikationen, Python-SDKs, CLI, MCP sowie CI/CD-Tools – eine vollständige Automatisierungsinfrastruktur.
- Gemäß dem Verbrauchsplan ist ein Sitzplatz kostenlos erlaubt, was geeignet ist, um zunächst mit echten Agenten ein kleines Testset zu erstellen.
Einsatzbeschränkungen und Hinweise
- Sowohl die simulierten Benutzer als auch die LLM-Richter weisen eine Unsicherheit auf; ein einzelner Testlauf beweist nicht, dass die Produktumgebung stets zuverlässig ist.
- Eine unklare Gestaltung der Indikatoren führt zu Fehleinschätzungen; das Team muss die Bewertungskriterien und Schwellenwerte durch manuelle Anzeichnung von Beispielen kalibrieren.
- Sprachtests in Minuten, Antworten auf Chats, das Überwachen von Anrufen, Plätze sowie Konkurrenzanfragen beeinflussen jeweils die Kosten. Lasttests können den Verbrauch schnell erhöhen.
- Die Formate für Transkription, Aufnahme, Aufruf von Tools und Zeitstempel unterscheiden sich auf verschiedenen Plattformen; eine unvollständige Integration beschränkt die Tiefe der Überwachung.
- Produktionsanrufe können persönliche, gesundheitliche, Zahlungs- oder Kundengeheimnisse enthalten und erfordern die Konfiguration von Maskierung, Berechtigungen, Aufbewahrungsfristen sowie Vertragsbedingungen.
- Der Umfang des Startup-Plans wird durch geteilte Punkte berechnet; es handelt sich dabei etwa um 2000 Minuten für Tests sowie etwa 10.000 Überwachungsvorgänge. Es handelt sich dabei nicht um zwei unabhängige, unbegrenzten Zugangsrechte, die gleichzeitig gewährt werden.
- Die Daten zu den Referenzwerten, der Genauigkeit und der Effizienz für Kunden stammen vom Lieferanten oder aus Ergebnissen bestimmter Stichproben und können nicht direkt auf das eigene Agentenmodell übertragen werden.
- Automatisch generierte Prompt-Patches können die Sicherheitsgrenzen oder die Geschäftslogik verändern und müssen einer Code-Überprüfung sowie Rückfalltests unterzogen werden.
Preise und Pakete
Stand dem 21. August 2026 bietet Cekura drei Tarifoptionen an: nach Verbrauch, für Startups und für Unternehmen. Neukunden erhalten 300 kostenlose Punkte, was auf der Website etwa 60 Minuten Sprachtest entspricht; es ist kein Kreditkarten erforderlich, um zu beginnen.
| Paket | Preis | Menge und Konkurrenz | Plätze und Reservierungen | Für Nutzer geeignet |
|---|---|---|---|---|
| Pay as you go | Erster Nutzer: 0 US-Dollar, Bezahlung nach tatsächlichem Verbrauch | Sprachtest: 0,25 US-Dollar pro Minute; Chatten: 0,025 US-Dollar pro Antwort; Überwachung: 0,05 US-Dollar pro Anruf; 10 gleichzeitige Verbindungen | 1 Sitzplatz kostenlos, zusätzliche Sitzplätze 30 US-Dollar pro Monat; Protokolle werden 30 Tage aufbewahrt. | Entwickler, kleine Teams und unbeständige Nutzungsmengen |
| Startup | 500 US-Dollar pro Monat | 10.000 Punkte pro Monat – das entspricht etwa 2.000 Minuten für Sprachtests oder maximal 10.000 Überwachungsvorgängen. 50 parallele Verbindungen; 5 Projekte. | 10 Plätze enthalten; Protokolle werden 90 Tage lang aufbewahrt; Unterzeichnung von BAA und DPA; exklusiver Slack-Support | Das Team für Sprach-KI, das bereits in der Phase der großangelegten Tests ist |
| Enterprise | Individuelle Kostenschätzung | Anpassbare Punkte, Rabatte, Konkurrenzfähigkeit, Projekte und Infrastruktur | Maßgeschneiderte Plätze und Reservierungen; SSO, SCIM, Audit-Logs, VPC oder lokale Installation optional | Unternehmen mit hohen Compliance-Anforderungen, mehreren Projekten und komplexen Implementierungen |
Bei Startup kann man monatlich bestellen und jederzeit kündigen. Bei Enterprise gilt ein jährlicher Vertrag; es werden außerdem Bestellaufträge, Rechnungen oder Banküberweisungen unterstützt. Die Gebühren, Steuern, der Umrechnungsfaktor für Punkte sowie die endgültigen Bedingungen sind auf der Kontoauszugseite sowie im Vertrag festgelegt.
Wesentliche Unterschiede der verschiedenen Optionen
| Fähigkeiten | Nach Menge | Startup | Enterprise |
|---|---|---|---|
| Anzahl der Projekte | 1 Stück | 5 Stück | Maßanfertigung |
| Gleichzeitige Anrufe | Linie 10 | Linie 50 | Maßanfertigung |
| Protokollierungsvorrat | 30 Tage | 90 Tage | Maßanfertigung |
| BAA und DPA | Keine signierte Version enthalten | Enthält die unterzeichnete Version | Nach den Anforderungen des Unternehmens anpassen |
| Unterstützung | E-Mails – versuchen Sie, so schnell wie möglich zu antworten. | Exklusiv für Slack, 24-Stunden-Unterstützung | Angabe des Ingenieurs und der vereinbarten Kanäle |
| SSO und SCIM | Nicht enthalten | Nicht enthalten | Unterstützung für SAML SSO und SCIM |
| VPC oder lokale Implementierung | Nicht enthalten | Nicht enthalten | Optional |
| Zugriffskontrolle und mehrere Projekte | Grundlagen | 5 Projekte | Feingranularer Kontrollmechanismus für mehrere Projekte |
Kostenlose Gebührengrenze und Abrechnungsmethode
Jedes Paket umfasst Simulationsanrufe zur Produktion, Produktionswarnungen, herunterladbare Berichte, Standardindikatoren, Python-Indikatoren, API, MCP sowie Fähigkeiten eines AI-Kodier-Assistenten. 300 kostenlose Punkte stehen zum Start zur Verfügung, doch zusätzliche Lizenzen sowie der Einsatz für tatsächliche Tests oder Überwachungen sind weiterhin kostenpflichtig.
Bei der Schätzung des Verbrauchs sollten die Minuten für Sprachtests, die Antworten auf Chats, die Anzahl der überwachten Anrufe, der Spitzenwert der gleichzeitigen Aktivitäten, die Häufigkeit der Wiederholungen sowie die Aufbewahrung der Protokolle getrennt berechnet werden. Wenn das Testpaket bei jeder Einreichung mehrfach ausgeführt wird, liegt der tatsächliche monatliche Verbrauch deutlich höher als bei einem einmaligen manuellen Test.
Unterstützte Agenten und Integrationen
| Plattform oder Methode | Testen | Erzeugung von Beobachtbarkeit | Erklärung |
|---|---|---|---|
| Retell | Unterstützung | Unterstützung | Es ist möglich, Agenten anzuschließen und Produktionsanrufe zu importieren. |
| Vapi | Unterstützung | Unterstützung | Überprüfung der Abdeckung und Produktüberwachung |
| ElevenLabs | Unterstützung | Unterstützung | Unterstützung für automatische Verbindungen und Anrufanalyse |
| LiveKit | Unterstützung | Unterstützung | Automatische oder manuelle Raumtests, wobei mit dem Python SDK Tracking gesendet werden kann. |
| Pipecat | Unterstützung | Unterstützung | Automatische oder manuelle Sitzungstests sowie verbesserte Tracking-Funktionen |
| Bland AI | Unterstützung | Muss nach Dokumenteinstellungen konfiguriert werden | Kann als Anbieter von Sprachintelligenz-Systemen genutzt werden |
| SIP und Telefonie | Unterstützung | Unterstützung für Log-Anbindung | Es ist möglich, Systeme auf Basis von SIP zu testen, und es können eigene Twilio- oder Plivo-Nummern verwendet werden. |
| Customisiertes System | Unterstützung | Unterstützung | Über WebSocket, Webhook, API und benutzerdefinierte Transkriptionsformate anzubinden |
| Chatten, WhatsApp und SMS | Unterstützung einiger Testprozesse | Je nach Integration | Die Dialoglogik kann mit Textkanälen zu niedrigeren Kosten überprüft werden. |
API, Python SDK und MCP
| Entwicklungsansatz | Angaben zur Situation | Hauptverwendungszweck | Authentifizierung oder Beschränkungen |
|---|---|---|---|
| REST API | Anbieten | Erstellen und Verwalten von Agenten, Metriken, Szenarien, Ausführungen, Ergebnissen, Projekten, Dashboards sowie Produktionsanrufen | Mit der API-Schlüssel unterliegt man den Beschränkungen bezüglich Kontogrenzen und Berechtigungen. |
| OpenAPI-Spezifikation | Anbieten | Erstellen von Clients, Überprüfung der Anfragesyntax und Abdeckung der Schnittstellen | Ein gültiges Cekura-Konto und ein Passwort sind weiterhin erforderlich. |
| Python SDK | Anbieten | Ausführung von Tests aus Python-Skripten, Abfrage von Ergebnissen und Übermittlung von überwachbaren Daten | Durch die Installation über offizielle Python-Pakete – Aufruf der kommerziellen Plattform |
| CLI | Anbieten | Testauslösung und Überprüfung der Ergebnisse in der Terminal- und Pipelineumgebung | Anmeldung oder API-Schlüssel erforderlich |
| MCP-Server | Anbieten | Ermöglichen Sie Assistenten wie Claude Code, Cursor, Codex usw., auf Dokumente und Plattformfunktionen zuzugreifen. | Kann mit OAuth oder Projekt-API-Schlüsseln verwendet werden |
| Cekura Skills | Anbieten | Workflow für die Bereitstellung von Szenarien, Entwurf von Kennzahlen und Behebung von Produktionsproblemen für Kodenhilfen | Das Skill-Repository ist open source, doch die Ausführung der Operationen erfolgt weiterhin über den Cekura-Service. |
| GitHub Action | Anbieten | Tests in CI nach Szenario-ID oder Tag ausführen | Der Schlüssel sollte in einem verschlüsselten Secret gespeichert werden. |
GitHub und Open Source
Cekura hat auf GitHub offiziell die Integration von GitHub Actions sowie das Skills-Repo für KI-gestützte Code-Hilfsprogramme veröffentlicht; beide sind unter der MIT-Lizenz erhältlich. Skills umfasst Workflows für die Erstellung von Agenten, das Entwerfen von Tests, die Erstellung von Szenarien, die Behebung von Problemen in der Produktion sowie den Aufbau von Infrastruktur-Tests.
Diese Repositorien enthalten nur integrierte Werkzeuge, Workflows und Anleitungen – nicht den vollständigen Quellcode der von Cekura betriebenen Testplattform. Die Plattform selbst bleibt weiterhin ein kommerzieller Service mit geschlossener Quellcode-Struktur; auch wenn das Python SDK öffentliche APIs anbietet, bedeutet das noch nicht, dass die Kerndienste offen zugänglich sind.
Sicherheit, Privatsphäre und Datenverarbeitung
Die offizielle Website zeigt die Sicherheits- und Konformitätsfähigkeiten im Zusammenhang mit SOC 2, HIPAA und GDPR. Das Startup-Paket beinhaltet die Unterzeichnung von BAA- und DPA-Verträgen, während das Unternehmenspaket anpassbar ist. Im Falle geschützter Gesundheitsdaten muss vor dem Hochladen der tatsächlichen Anrufe sichergestellt werden, dass die entsprechenden Verträge unterzeichnet wurden und die verwendeten Funktionen im Geltungsbereich liegen.
Die Produktüberwachung kümmert sich um Transkripte, Aufnahmen, Telefonnummern oder Identifikationsdaten, außerdem um Aufrufe von Tools sowie Geschäftsmetadaten – Inhalte, die sensible Informationen enthalten können. Die Dokumente bieten die Möglichkeit, persönliche Daten zu maskieren, doch das Team muss weiterhin entscheiden, welche Felder vor dem Versand entfernt werden sollen.
Unterverarbeiter
Die Seite mit den offiziellen Verarbeitungsdiensten listet Supabase für die Datenspeicherung und Datenbankverwaltung auf sowie OpenAI, Anthropic und Replicate für Modellfunktionen. Unternehmen sollten prüfen, welche Dienste in ihrem jeweiligen Projekt genutzt werden, in welchem geografischen Gebiet die Daten gespeichert werden, wie lange diese aufbewahrt werden und wie sie nach Beendigung des Projekts gelöscht werden.
Einsparungen, Konten und Abonnements
Die Aufbewahrungsfristen für die Paketprotokolle betragen jeweils 30 Tage, 90 Tage oder können nach Unternehmenswünschen festgelegt werden. Die Datenschutzrichtlinien legen fest, wie lange die Kontoinformationen zur Erreichung des jeweiligen Zwecks aufbewahrt werden müssen. Es wird angegeben, dass die Abonnementgebühren automatisch erneuert werden; eine Kündigung tritt in der Regel am Ende des aktuellen Zahlungszyklus in Kraft. Die Preise können außerdem nach gesetzlicher Vorgabe angepasst werden.
Checkliste für Sicherheitspraktiken
- Bevorzugen Sie die Erstellung von Vorab-Szenarien unter Verwendung synthetischer Identitäten, Testnummern und erfundener sensibler Informationen.
- Vor der Produktivnutzung wird die Maskierung von PII konfiguriert, sodass nur die für die Bewertung erforderlichen Transkripte, Aufnahmen und Metadaten übertragen werden.
- Für Entwicklung, CI und Produktion werden unterschiedliche API-Schlüssel verwendet, um Berechtigungen, IP-Adressen und Projektbereiche einzuschränken.
- Speichern Sie den Schlüssel im Secrets-Verwaltungstool, und schreiben Sie ihn weder in den Code, noch in Logs oder Testberichte.
- Wählen Sie auf Grundlage von Vorschriften und Geschäftsanforderungen die Aufbewahrungsfrist für Protokolle aus und legen Sie Verfahren für die Löschung sowie Anfragen der betroffenen Personen fest.
- Für medizinische Projekte wird eine BAA bestätigt, für Europa oder andere Regionen eine DPA sowie Regelungen für den grenzüberschreitenden Datentransfer und die Datenhaltung.
- Regelmäßige Audits, Alarme und manuelle Überprüfungen verhindern, dass die Testplattform zu einem neuen Sammelort für sensible Daten wird.
Grundlegende Informationen
| Projekt | Informationen |
|---|---|
| Name des Tools | Cekura |
| Betreibende Stelle | Tatva Labs Inc. |
| Arten von Werkzeugen | Plattform für den Test, die Bewertung, die Überwachung in der Produktion sowie die Verbesserung von Sprach- und Chat-Bots |
| Kernkompetenzen | Simulation, Indikatoren, Regression, Last, Red Team, Überwachbarkeit, CI/CD und Selbstverbesserung |
| Preismuster | 300 kostenlose Punkte, nach Verbrauch, Monatsabonnement für Startup, maßgeschneidert für Enterprise |
| Hauptplattformen | Web-Dashboard, REST-API, Python-SDK, CLI, MCP und GitHub Actions |
| Offene API | Ja, es werden API-Schlüssel sowie OpenAPI-Spezifikationen bereitgestellt. |
| Offizielles SDK | Ja, Python SDK |
| Offizieller GitHub | Ja |
| Ist das Produkt open source? | Nein |
| Open-Source-Komponenten | GitHub Action und Cekura Skills unterliegen der MIT-Lizenz |
| Hauptsprache der Benutzeroberfläche | Englisch |
| Sicherheit und Konformität | Die offizielle Website zeigt die Kompatibilität mit SOC 2, HIPAA und GDPR – die genauen Vertragsbedingungen hängen vom jeweiligen Angebot ab. |
Empfehlungswert
Die Empfehlungswertung liegt bei 4,6 von 5 Punkten. Cekura integriert Szenariosimulationen, semantische sowie kodbezogene Indikatoren, Tests der Sprachinfrastruktur, die Überwachung in der Produktion sowie CI/CD in einen Lebenszyklus – was für Teams, die bereits bereit sind, Sprachintelligenzsysteme einzusetzen, oder diese kontinuierlich weiterentwickeln wollen, von großem Wert ist.
Die Haupthindernisse sind hohe Konkurrenzlasten sowie häufige Änderungen, die schnell zu hohen Kosten führen. Zuverlässige Ergebnisse erfordern außerdem, dass das Team klare Kennzahlen festlegt und diese manuell justiert. Bei der Verarbeitung von Produktionsaufnahmen dürfen Aspekte wie Privatsphäre, Verträge sowie die Verwaltung von Zulieferern nicht allein auf die Standardeinstellungen der Plattform verlassen werden.
Häufige Fragen
Kann Cekura kostenlos verwendet werden?
Neue Konten erhalten 300 kostenlose Punkte, was auf der offiziellen Website etwa 60 Minuten Sprachtest entspricht. Der erste Test ist kostenlos und erfordert keine Kreditkarte. Danach wird je nach Anzahl der Testminuten, Chatantworten oder überwachten Anrufen abgerechnet – es ist auch möglich, ein Monatsabonnement zu wählen.
Kann es nur Sprachintelligenzen testen?
Die Kernfunktion besteht in einem Sprachagenten, doch es werden auch Chat-Simulationen, SMS, WhatsApp sowie textbasierte Tests zur Durchführung von Kostenoptimierten Logikprüfungen unterstützt. Die Parameter bezüglich Audioqualität, Verzögerung und Unterbrechungen unterscheiden sich je nach Übertragungskanal.
Kann man echte Produktionsanrufe überwachen?
Ja. Durch native Integration oder Webhooks können Transkripte, Aufnahmen und Metadaten übermittelt werden, wodurch Indikatoren, Dashboards und Alarme den Teams dabei helfen, Abweichungen zu erkennen.
Welche Sprachplattformen werden unterstützt?
In den offiziellen Dokumentationen werden Retell, Vapi, ElevenLabs, LiveKit, Pipecat, Bland AI, SIP, Agora sowie benutzerdefinierte Integrationen aufgeführt. Die genauen Test- und Überwachungsmöglichkeiten sollten in den jeweiligen Plattformanleitungen geprüft werden.
Wird eine API und ein SDK bereitgestellt?
Es werden öffentliche REST-APIs, OpenAPI-Spezifikationen, ein Python-SDK sowie eine CLI bereitgestellt, außerdem gibt es einen MCP-Server und GitHub Actions. Die API-Aufrufe sind durch Kontoinhaberrechte, Punkte, Konkurrenz und Pläne eingeschränkt.
Ist Cekura Open Source?
Die Kern-Hosting-Plattform ist nicht open source. Offiziell wurden GitHub Action unter der MIT-Lizenz sowie der AI-Code-Assistent Skills bereitgestellt, doch daraus kann das gesamte Produkt nicht als open source bezeichnet werden.
Sind die LLM-Bewertungsergebnisse zuverlässig?
LLM-Bewertungsinstrumente eignen sich zur Beurteilung der Semantik und der Qualität von Dialogen, können jedoch zu Fehlbewertungen führen oder sich mit Veränderungen des Modells ändern. Wichtige Indikatoren sollten anhand manuell annotierter Beispiele kalibriert werden; Regeln, deren Berechnung sicher möglich ist, sollten Vorrang vor Python-basierten Indikatoren haben.
Kann das Startup gleichzeitig 2000 Minuten testen und 10.000 Nachrichten überwachen?
Man kann das nicht so einfach verstehen. Die beiden Werte sind eine annähernde Umrechnung der monatlichen Punktkapazität auf der offiziellen Website; bei gleichzeitiger Verwendung werden gemeinsam Punkte verbraucht.
Kann es in einer lokalen oder privaten Umgebung eingesetzt werden?
Das Unternehmensangebot listet VPC- und lokale Implementierungsoptionen auf; es sind individuelle Verträge sowie eine technische Bewertung erforderlich. Für den Bedarf sowie im Startup-Szenario werden Managed-Dienste genutzt.
Was sollte bei den Produktionsdaten beachtet werden?
Zunächst müssen die rechtlichen Grundlagen für das Aufnehmen und Verarbeiten von Daten festgelegt werden, anschließend soll die Weitergabe von Transkripten, Aufnahmen sowie Nummern und Gesundheitsinformationen eingeschränkt werden. Zudem müssen Verfahren zur Maskierung, Aufbewahrung, Berechtigungsverwaltung, DPA oder BAA sowie Prozesse zur Löschung festgelegt werden.
Zusammenfassung
Cekura bietet für Sprachintelligenz-Agenten ein durchgängiges Qualitätsmanagement-System – von Prüfungen vor der Veröffentlichung bis hin zur Wiedergabe von Fehlern in der Produktion. Es eignet sich besonders für Teams, die bereits reale Geschäftsprozesse haben, wiederholt veröffentlichen müssen und ihre Tests in den Entwicklungsprozess integrieren möchten.
Das Tool selbst garantiert nicht automatisch Zuverlässigkeit – die wahre Qualität ergibt sich aus klaren Szenarien, erklärbaren Kennzahlen, manueller Kalibrierung sowie einer strengen Datenverwaltung. Zunächst sollte mit einem kleinen Testset für den kritischen Pfad eine Basislinie erstellt werden, anschließend kann die Überwachung im Konkurrenzmodus sowie in der Produktion schrittweise erweitert werden – so ist die Situation in der Regel besser kontrollierbar.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164