Tongyi Tingwu
KI-Assistent mit Echtzeit-Transkription, Übersetzung, Zusammenfassung und Konferenzanalyse
Tags:KI-KonferenzwerkzeugeWas ist Tongyi Tingwu?
Tongyi Tingwu ist ein von Alibaba Cloud angebotener Service zur Transkription von Audio- und Videoinhalten sowie zur Verarbeitung solcher Inhalte. Unter Nutzung des großen Modells Qianwen sowie der KI-Fähigkeiten für Sprache und Video werden Konferenzen, Interviews, Kurse, Schulungen, Präsentationen sowie aufgezeichnete Inhalte in suchbaren Text umgewandelt. Zudem werden Zusammenfassungen, Kapitel, Zusammenfassungen der Aussagen, To-Do-Listen, Schlüsselwörter sowie Ergebnisse von Fragen und Antworten erzeugt.
Die Produkte werden in die für Privatpersonen bestimmte Apk „Tongyi Tingwu“ sowie die für Unternehmen bestimmte Alibaba Cloud Tingwu-API unterteilt. Privatnutzer können sie über Webseiten, DingTalk-Apps und Browser-Plugins nutzen;
Unternehmen können Echtzeit-Transkription, Dateianalyse und Übersetzung in OA-, IM-, CRM-, Bildungs-, Medienbibliotheks- und Kundenservice-Systeme integrieren.
Kernfunktionen
1. Echtzeit-Umwandlung von Audio in Text
Es wird eine Echtzeit-Übertragung des Signals vom Empfangsmikrofon oder Audiostrang aufgezeichnet. Während der Konferenz werden die erkannten Texte zurückgegeben, und es ist möglich, gleichzeitig weitere AI-Analysen durchzuführen. Laut den offiziellen Leistungsdaten beträgt die Verzögerung etwa 300 Millisekunden; in der Praxis hängt sie jedoch von der Netzwerkqualität, der Audioqualität, der Sprache sowie dem verwendeten Modell ab.
Die Echtzeit-Schnittstelle unterstützt maximal drei Audeeingänge, um verschiedene Kanäle voneinander zu unterscheiden. Die Trennung der Sprecher ermöglicht lediglich die Erkennung „verschiedener Sprecher“, es wird nicht automatisch erkannt, wer Kunde, Vorgesetzter oder ein bestimmter Name ist; nach dem Treffen ist eine manuelle Umbenennung erforderlich.
2. Transkription von Audio- und Videodateien
Nach dem Hochladen oder Einsenden von aufgenommenem Audio- und Videomaterial erstellt das System offline eine Wort für Wort aufgeführte Transkription sowie Zeitstempel. Für Audio werden die Formate MP3, WAV, M4A, WMA, AAC, OGG, AMR, FLAC und AIFF unterstützt;
Das Video wird in den Formaten MP4, WMV, M4V, FLV, RMVB, DAT, MOV, MKV, WEBM, AVI, MPEG, 3GP und OGG unterstützt.
Eine einzelne Datei darf 6 GB nicht überschreiten und ihre Länge darf 6 Stunden nicht überschreiten. Die API liest die Materialien über die über das öffentliche Internet erreichbaren Datei-Adressen ab und erhält keine lokalen Pfade direkt.
Es wird empfohlen, dass die signierte Adresse mit Ablaufdatum mindestens 3 Stunden lang gültig bleibt, damit sie nicht während des Anstehens in der Warteschlange ungültig wird.
3. Mehrsprachige Erkennung
Die Dokumente sowie die Echtzeitdienste unterstützen Chinesisch, Englisch, Kantonisch, Japanisch, Koreanisch sowie verschiedene Modi für die freie Sprachausgabe in Chinesisch, Englisch, Japanisch, Koreanisch, Kantonisch, Deutsch, Französisch und Russisch. Die konkrete Kombination hängt von der Abtastrate sowie vom Echtzeit- oder Offline-Interface ab.
Mehrere Personen, die gleichzeitig sprechen, Dialekte, Echoeffekte aus weiter Entfernung, Störgeräusche, Fachbegriffe sowie eine übermäßige Aufnahmedauer können alle die Genauigkeit verringern. Bei wichtigen Besprechungen sollten separate Mikrofone, klare Tonkanäle sowie ein Glossar verwendet werden, und der Originalton sollte vor der Veröffentlichung des Protokolls überprüft werden.
4. Echtzeit- und Offline-Übersetzung
Tongyi Tingwu ermöglicht eine Echtzeit-Zweier-Übersetzung zwischen Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch und Russisch sowie die Offline-Übersetzung von Audio- und Video-Dateien. Zhongying Zifuyue kann ins Chinesische, Englische übersetzt werden oder beide Sprachen gleichzeitig ausgeben.
Die Übersetzungskosten werden zu den Transkriptionskosten hinzugerechnet; bei einer Ausgabe in zwei Zielsprachen wird ebenfalls zweimal berechnet. Personennamen, Fachbegriffe, Zahlen sowie rechtliche Formulierungen müssen von Muttersprachlern oder Fachleuten überprüft werden.
5. Übersicht der Kapitel und Zusammenfassung des gesamten Textes
Das System teilt die langen Aufnahmen je nach Thema in Abschnitte ein, erstellt für jeden Abschnitt ein Thema und eine Positionierung sowie einen Zusammenfassungstext des gesamten Inhalts. Der Benutzer kann an einem Zeitpunkt klicken, um zur ursprünglichen Aufnahme zurückzukehren und diese zu überprüfen – ideal zum schnellen Durchblättern langer Meetings und Kurse.
Zusammenfassungen sind eine Kompression des transkribierten Textes durch das Modell; Erkennbare Fehler werden in die Zusammenfassung übertragen. Man kann aufgrund einer Zusammenfassung keine Entscheidungen in den Bereichen Finanzen, Recht, Personalwesen oder Kundenversprechen treffen.
6. Zusammenfassung der Rede, zu erledigende Aufgaben und Schlüsselwörter
Die Zusammenfassung der Rede fasst die Ansichten des Sprechers zusammen, aus den zu erledigenden Aufgaben werden Verantwortliche, Aufgaben sowie Zeitrahmen herausgefiltert, und Schlüsselwörter sowie wichtige Inhalte erleichtern die Suche. Durch die Umwandlung in schriftliche Form können Wiederholungen und Modalsätze entfernt werden, wodurch eine leichter lesbare Protokollfassung entsteht.
Das Modell könnte Vorschläge für Diskussionen fälschlicherweise als bestätigte Aufgaben ansehen oder Verneinungswörter übersehen. Die zu erledigenden Aufgaben müssen von den Teilnehmern der Besprechung bestätigt und in das offizielle Projektmanagement-System eingetragen werden.
7. Überblick über die Antworten und Anpassung von Prompts
Benutzer können zu bereits transkribierten Inhalten Fragen stellen, damit das System die entsprechenden Abschnitte ausfindig macht und Antworten gibt. Die Unternehmens-API unterstützt außerdem benutzerdefinierte Prompts, um bestimmte Felder aus dem Dialog zu extrahieren oder individuelle Zusammenfassungen zu erstellen.
Mehrere Prompts pro Anfrage werden separat abgerechnet. Die Prompte sollten die Ausgabestruktur, fehlende Werte sowie die Zeitpunkte der Verweise festlegen und sicherstellen, dass das Modell nur auf Basis von Audio- und Videoinhalten antworten kann, um unbegründete Ergänzungen zu vermeiden.
8. Gedankenlandkarte
Tongyi Tingwu kann Audio- und Videoinhalte sowie deren hierarchische Beziehungen in Mind Maps zusammenfassen – das eignet sich gut zur Wiederholung von Lektionen, zur Strukturierung von Meetings sowie zur Übersichtlichmachung von Interviews. Die Mind Maps liefern eine automatische Zusammenfassung; komplexe Argumente sollten dennoch im Originaltext gelesen werden.
9. Extraktion und Zusammenfassung von Video-PPTs
Für Videos, die Präsentationen enthalten, kann das System die Bilder der PPTs extrahieren und eine Zusammenfassung der Erklärungen erstellen. Es werden sowohl der vollständige PPT-Modus als auch der Vortragsmodus unterstützt; pro Stunde werden in der Regel 2 bis 5 Minuten Videomaterial verarbeitet, wobei maximal 200 PPTs extrahiert werden können.
Diese Funktion erfordert, dass die PPT im Hauptbereich des Videos angezeigt wird, und die Personen dürfen nicht dauerhaft vor dem Projektionsbild herumlaufen oder es verdecken. Kleine Schriftarten, Animationen und häufige Wechsel können die Qualität der Extraktion beeinträchtigen.
10. Qualitätskontrolle von Dienstleistungen und Extraktion von Dialoginhalten
Die Unternehmens-API bietet Dienste zur Qualitätskontrolle von Dienstleistungen sowie zur Extraktion von Dialoginhalten, die für Verkäufe, Kundenservice, Interviews und die Analyse in Call-Centern genutzt werden. Unternehmen müssen im Voraus eine Genehmigung für die Aufzeichnung und die automatische Analyse erhalten und ihre Mitarbeiter sowie Kunden hierüber klar informieren.
Verwendung der persönlichen Version
Persönliche Nutzer können die Tongyi Tingwu-App mit ihrer Telefonnummer anmelden. Sie können über das Mikrofon Aufnahmen machen, Audio- und Videodateien hochladen sowie Dateien aus Alibaba Cloud importieren. Zudem können sie Transkripte, Zusammenfassungen sowie weitere AI-Ergebnisse einsehen. Die DingTalk-Mini-Apps und Browser-Plugins eignen sich für Meetings sowie den Einsatz auf Webseiten.
Die kostenlosen Nutzungslimits für individuelle Anwendungen sowie die Regeln für Mitgliedschaften können sich vom Alibaba Cloud Development Kit unterscheiden. Die in der Übersicht angegebenen API-Tests und -Preise können nicht direkt mit den Preisen für Endkundenmitgliedschaften gleichgesetzt werden; es gelten vielmehr die Angaben auf der Kaufseite für individuelle Anwendungen.
API-Zugang
Unternehmen müssen im Alibaba Cloud-Konsol die Funktionen für das Anhören von Daten aktivieren, Projekte erstellen und eine Appkey erhalten. Zudem müssen die Berechtigungen für RAM sowie die Speicherung der OSS-Ergebnisse sowie die Mechanismen für Rückrufe konfiguriert werden. Für Offline-Aufgaben stehen Polling-Verfahren oder HTTP- sowie RocketMQ-Rückrufe zur Verfügung.
Die Standard-QPS-Einstellung für das Erstellen von Aufgaben liegt bei 20 auf Benutzerebene, während die QPS für das Abfragen des Status und der Ergebnisse von Aufgaben bei 100 liegt.
Die Offline-Transkription wird in der Regel innerhalb von 3 Stunden abgeschlossen, mit Ausnahme von großen Mengen an Aufnahmen, die innerhalb kurzer Zeit eingereicht werden – in solchen Fällen kann es bis zu 500 Stunden dauern. Unternehmen müssen mit abgelaufenen Signaturadressen, Formatfehlern, Bandbreitenbeschränkungen, Wiederholungsversuchen sowie der Speicherung der Ergebnisse umgehen.
Kostenloser Probemonat
Benutzer, die den neuen API-Service in Anspruch nehmen, können ihn 90 Tage lang kostenlos ausprobieren. Während der Testphase gilt eine Tagesgrenze von 48 Stunden sowie eine Begrenzung auf 2 parallele Verbindungen.
Audio- und Video-Dateien werden 2 Stunden pro Tag aufgezeichnet, dabei ist eine gleichzeitige Übertragung über einen Kanal möglich; bei der Mikrofonprüfung gibt es keine Zeitbeschränkung.
Nach Ablauf des Tageslimits muss man 24 Stunden warten, bis es wieder aufgefrischt wird.
Nach Ablauf der kostenlosen Testphase oder nach dem Aufstieg auf die kommerzielle Version wird eine Abrechnung nach Zeitverbrauch eingeführt. Es sollten Budgets, Saldo- und Verbrauchswarnungen eingerichtet werden, um unerwartete Rechnungen durch anhaltende Audioströme oder fehlerhafte Wiederholungsversuche zu vermeiden.
Preis- und Versionsvergleich
| Paket oder Version | Preise, Limits und Kernvorteile |
|---|---|
| Preise für die neue API-Version | Stand August 2026 beträgt der offizielle Preis für die neuen Standardschnittstellen: Die Transkription von Live-Meetings kostet 0,6 Yuan pro Stunde, die Transkription von Audio- und Videodateien ebenfalls 0,6 Yuan pro Stunde. Beide Dienstleistungen beinhalten die Trennung der Sprecher; bei der Datei-Transkription wird außerdem eine automatische Spracherkennung angeboten. Für Funktionen wie Übersicht über Kapitel, Zusammenfassung des gesamten Textes, Zusammenfassung der Redebeiträge, Überblick über Fragen und Antworten, Mindmaps, To-Do-Listen, Schlüsselwörter, wichtigste Inhalte, Umwandlung von Gesprochenem in Schriftform sowie jede individuell angepasste Anweisung wird jeweils 0,064 Yuan pro Stunde berechnet. Wenn zwei dieser Funktionen gleichzeitig genutzt werden, beträgt der Preis 0,128 Yuan pro Stunde – weitere Anweisungen werden entsprechend hinzugerechnet. Die Qualitätskontrolle des Services oder die Extraktion von Dialoginhalten kostet 0,13 Yuan pro Stunde; die Extraktion von Inhalten aus Videos oder PPTs inklusive Zusammenfassung kostet 0,64 Yuan pro Stunde. Die Live-Übersetzung kostet 4 Yuan pro Stunde, die Offline-Übersetzung 0,5 Yuan pro Stunde. Die Funktionen Transkription, Übersetzung und Nutzung großer KI-Modelle werden addiert. Zum Beispiel kostet eine Stunde Live-Transkription eines Signals zusammen mit einer Live-Übersetzung in eine Zielsprache 0,6 plus 4 Yuan, also insgesamt 4,6 Yuan. Wenn gleichzeitig auf Chinesisch und Englisch übersetzt werden soll, beträgt der Preis 0,6 plus 4 mal 2, also 8,6 Yuan. Bei mehreren Eingängen wird die Gebühr nach der tatsächlichen Länge des transkribierten Audiomaterials berechnet; auch stille oder rein störende Audioströme können unter bestimmten Umständen berücksichtigt werden. |
| Preise für die alte Version der Schnittstelle | Die Preise für die alte Version der Schnittstelle sind deutlich höher; es wird empfohlen, auf die neue Version umzusteigen. Für die Aufzeichnung in Echtzeit beträgt der Standardpreis 10,5 Yuan pro Stunde, für die Dateiaufzeichnung 9,5 Yuan pro Stunde und für die Echtzeitübersetzung 8 Yuan pro Stunde – wobei die Preise je nach täglichem Verbrauch abnehmen. Bei der Offline-Übersetzung beträgt der Preis in der alten Version etwa 0,5 bis 0,9 Yuan pro Stunde. Bei neuen Projekten sollte unbedingt sichergestellt werden, dass die neue Version der Schnittstelle verwendet wird. |
Preise für die neue API-Version
Stand August 2026 beträgt der offizielle Preis für die neuen Schnittstellenstandards: 0,6 Yuan pro Stunde für die Transkription von Live-Konferenzen sowie 0,6 Yuan pro Stunde für die Transkription von Audio- und Videodateien. Beide Dienstleistungen beinhalten die Trennung der Sprecher. Bei der Transkription von Dateien wird außerdem eine automatische Spracherkennung bereitgestellt.
Überblick über die Kapitel, Zusammenfassung des gesamten Textes, Zusammenfassung der Ausführungen, Übersicht der gestellten Fragen, Mindmaps, To-Do-Listen, Schlüsselwörter, Wichtigste Inhalte, Umwandlung von mündlichen Äußerungen in schriftliche Form sowie jeder individuell angepasste Prompt werden jeweils zu einem Preis von 0,064 Yuan pro Stunde abgerechnet. Bei Aktivierung von zwei Funktionen beträgt der Preis 0,128 Yuan pro Stunde; für weitere Prompts wird dieser Betrag weiter addiert.
Qualitätskontrolle von Dienstleistungen oder Extraktion von Dialoginhalten: 0,13 Yuan/Stunde; Extraktion von Videos und PPTs sowie Erstellung eines Zusammenfassens: 0,64 Yuan/Stunde.
Echtzeit-Übersetzung: 4 Yuan/Stunde; Offline-Übersetzung: 0,5 Yuan/Stunde.
Die Funktionen der Transkription, Übersetzung und großen Modelle werden zusammengeführt.
Zum Beispiel kostet die Echtzeit-Übersetzung eines Satzes in eine Zielsprache 0,6 plus 4 Yuan, also 4,6 Yuan; die gleichzeitige Übersetzung ins Chinesische und Englische beträgt 0,6 plus 4 mal 2, also 8,6 Yuan.
Die Mehrkanal-Eingabe wird nach der tatsächlichen Länge des audios mit Transkriptionsergebnis abgerechnet; stille oder rein rauschhafte Ströme können unter bestimmten Umständen ebenfalls Gebühren verursachen.
Preise für die alte Version der Schnittstelle
Die Preise für die alte Version der Schnittstelle sind deutlich höher. Die Hersteller empfehlen daher den Umstieg auf die neue Version. Für die Aufzeichnung in Echtzeit gilt ein Standardpreis von 10,5 Yuan pro Stunde, für die Dateiaufzeichnung 9,5 Yuan pro Stunde und für die Echtzeitübersetzung 8 Yuan pro Stunde. Die Preise sinken außerdem mit der täglichen Nutzungsmenge.
Die Offline-Übersetzung der alten Version kostet etwa 0,5 bis 0,9 Yuan pro Stunde.
Neue Projekte sollten vorrangig sicherstellen, dass die neue Version der Schnittstelle verwendet wird.
Daten und Privatsphäre
Konferenzen, Vorstellungsgespräche, Kurse und Gespräche mit Kunden können persönliche Informationen sowie Geschäftsgeheimnisse enthalten. Unternehmen müssen die notwendigen Genehmigungen für das Aufnehmen, Transkribieren und die Analyse mit KI erhalten, den Zugriff auf OSS, RAM, Rückrufe und Ergebnisdokumente einschränken sowie Fristen für die Speicherung und Löschung festlegen.
Die Bedingungen des Servicevertrags besagen, dass Alibaba Cloud bei gesetzlichen Anfragen oder Zugriffen auf Daten durch staatliche Stellen rechtlich dazu verpflichtet ist, mitzuarbeiten. Branchen mit hoher Sensitivität sollten die Sicherheitsdokumente von Alibaba Cloud, Verträge sowie lokale und eigene Compliance-Anforderungen berücksichtigen.
Unterstützungsplattformen
- Web-Private-Apps;
- DingDing-Mini-App;
- Browser-Plugins;
- Import von Audio- und Video-Inhalten in Alibaba Cloud Disk;
- Aliyun-Konsole und HTTP-API;
- Anbindung an Unternehmenssysteme über SDK oder APIs.
Open-Source-Zustand
Die Tongyi-Hör- und Verständnissysteme sowie die Cloud-Transkriptionsdienste sind keine Open-Source-Projekte. Alibaba Cloud könnte SDKs, Beispielcodes oder relevante Open-Source-Modelle bereitstellen, doch das bedeutet nicht, dass die Plattformen für Spracherkennung, Transkription und Inhaltsverständnis von Tongyi eigenständig vollständig implementiert werden können.
Anleitung zur Nutzung von Tongyi Tingwu
Eine grundlegende Aufgabe erledigen
- Bestätigung der Aufnahmen, der Geräusche, der Musik sowie der Genehmigung der Teilnehmer;
- Laden Sie hochwertigen Audio-Inhalt hoch oder eingeben Sie ihn in Tongyi Tingwu ein;
- Wählen Sie Einstellungen wie Sprache, Sprecher und Echtzeit-Textumwandlung von Audiodaten aus;
- Verwendung von Audio- und Videodateien zur Erstellung von Transkripten, Synchronisation oder zur Aufbereitung der Ergebnisse;
- Überprüfen Sie Abschnitt für Abschnitt Namen, Zahlen, Pausen, Lautstärke und Stimmung;
- Prüfen Sie vor der Exportierung das Format, die Lautstärke sowie die Anforderungen bezüglich Urheberrechten und Datenschutz.
Erstellung wiederverwendbarer professioneller Workflows
- Erstellen Sie einen Testdatensatz mit echtem Rauschen, Akzenten und mehrsprachigen Abschnitten;
- Vergleich der Unterschiede bei der Umwandlung von Echtzeit-Aufnahmen in Text, der Transkription von Audio- und Videodateien sowie der Mehrsprachenerkennung;
- Beibehalten der ursprünglichen Aufnahmen und unveränderten Transkripte;
- Vor der Veröffentlichung für die Öffentlichkeit eine mündliche Anhörung anberaumen;
- Statistische Auswertung der Verarbeitungszeit, Fehlerquote und Verbrauch von Limits;
- Regelmäßige Aktualisierung des Glossars, der Lizenzen für Töne und der Löschrichtlinien;
Für welche Nutzer geeignet?
- Person, die Meetings, Interviews, Vorstellungsgespräche und Kundenbesuche organisiert;
- Lehrkräfte und Schüler, die Untertitel, Kapitel sowie Zusammenfassungen zum Wiederholen für Kurse erstellen;
- Team zur Verarbeitung von Aufzeichnungen, Podcasts, Präsentationen und Medieninhalten;
- Organisationen, die eine Echtzeit-Übersetzung in mehreren Sprachen für Meetings benötigen;
- Unternehmen, die Transkription und Qualitätskontrolle in ihre OA-, CRM- und Kundenservice-Systeme integrieren;
- Entwickler, die eine batchbasierte Analyse von Audio- und Videodaten in Medienbibliotheken durchführen müssen.
Vorteile des Produkts
- Integrierte Transkription, Übersetzung, Zusammenfassung, Fragen und Antworten sowie Extraktion aus PPTs;
- Unterstützt sowohl den Echtzeit-Stream-Modus als auch den Offline-Datei-Modus;
- Fähigkeit zum freien Sprechen in mehreren Sprachen sowie auf Chinesisch, Englisch, Japanisch, Koreanisch, Kantonesisch, Deutsch, Französisch und Russisch.
- Sowohl für persönliche Anwendungen als auch für Unternehmens-APIs gibt es Zugänge.
- Die Preise für die neue Schnittstelle sind transparent und können nach Funktionskombinationen festgelegt werden.
Einschränkungen und Hinweise
- Die Genauigkeit der Erkennung hängt von der Tonqualität, dem Akzent, dem Rauschen sowie vom gleichzeitigen Sprechen mehrerer Personen ab.
- Jedes wichtige Wort für Wort geschriebene Dokument muss nochmals abgehört und überprüft werden.
- Die Leistung der großen Modelle wird pro Projekt abgerechnet, und die Anpassung mehrerer Prompts führt ebenfalls zu zusätzlichen Gebühren.
- Die Kosten für die Echtzeitübersetzung sind deutlich höher als bei der Transkription; man sollte die Entfernung, die Sprache und die Dauer berücksichtigen.
- Die Transkriptionen von Besprechungen betreffen die Privatsphäre der Teilnehmer sowie Geschäftsgeheimnisse. Es ist daher notwendig, zuerst um Genehmigung zu bitten; es darf weder heimlich aufgenommen noch unbegrenzt aufbewahrt werden.
Häufige Fragen
Ist Tongyi Tingwu kostenlos?
Persönliche Anwendungen bieten eine kostenlose Nutzungsmöglichkeit; neue API-Nutzer können 90 Tage lang testen – dabei werden 48 Stunden pro Tag und 2 Stunden pro Datei aufgezeichnet. Danach wird nach Verbrauch abgerechnet.
Wie groß darf eine einzelne Datei sein?
Für Offline-Audio- und Videodateien gilt eine maximale Größe von 6 GB sowie eine maximale Dauer von 6 Stunden. Es werden verschiedene gängige Audio- und Videiformate unterstützt.
Kann man verschiedene Sprecher erkennen?
Es ist möglich, verschiedene Sprecher voneinander zu trennen, doch die wahre Identität kann nicht automatisch erkannt werden; daher muss der Name nach dem Treffen geändert werden.
Wie viel kostet die Tongyi-Hörverstehungs-API?
Neue Version: 0,6 Yuan/Stunde für Transkription, 0,064 Yuan/Stunde für Analyse großer Modelle pro Aufgabe, 0,64 Yuan/Stunde für Zusammenfassungsextraktion aus PPTs, 4 Yuan/Stunde für Echtzeitübersetzung, 0,5 Yuan/Stunde für Offline-Übersetzung.
Unterstützt Tongyi Tingwu APIs?
Unterstützung: Unternehmen können Echtzeit-Protokollierung, Textumschreibung, Übersetzung, Zusammenfassungen, Qualitätskontrolle sowie Extraktion von Inhalten aus PPTs nutzen und die Ergebnisse über Callbacks oder Polling abrufen.
Ist Tongyi Tingwu open source?
Es ist nicht open source. Es handelt sich um kommerzielle Anwendungen und API-Dienste von Alibaba Cloud – die Veröffentlichung von SDKs oder der Open-Source-Modelle von Qianwen bedeutet nicht, dass die Tingwu-Plattform ebenfalls open source ist.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164