Together AI
Eine AI-native Cloud-Plattform, die Open-Source-Modelle für Inferenz und Feinabstimmung sowie spezielle Rechenkapazitäten bietet.
Tags:KI-TrainingsmodelleWas ist Together AI?
Together AI ist eine AI-Infrastrukturplattform für Entwickler und Unternehmen, die API-Dienste für große Sprachmodelle, Bilder, Videos, Sprache, Embeddings sowie Sicherheitsmodelle anbietet. Nutzer können mit serverloser Inferenz beginnen und je nach Bedarf auf Provisioned Throughput, Dedicated Inference oder GPU Cluster upgraden.
Die Plattform konzentriert sich auf Open-Source-Modelle sowie Modelle mit offenen Gewichten und bietet zudem Modelloben, Batch-APIs, Code-Sandboxes sowie hochleistungsfähige Speicherlösungen. Entwickler können mithilfe der REST-, Python- oder TypeScript-SDKs die Modelle in Chat-, Such-, Agenten- und Inhaltserstellungsanwendungen integrieren.
Hauptfunktionen von Together AI
- Serverless Inference:Es ist kein Management der GPU erforderlich; die Abrechnung erfolgt nach tatsächlichem Verbrauch an Tokens, Bildern, Videos oder Audio.
- Modellverzeichnis:Text-, Inferenz-, Code-, visuelle und multimodale Modelle von verschiedenen Herstellern werden bereitgestellt.
- OpenAI-kompatible Schnittstelle:Senkung der Kosten für die Migration bestehender Chats und Completion-Apps.
- Batch API:Asynchrone Verarbeitung großer Mengen an nicht-echtzeitigen Anfragen, geeignet für Offline-Aufgaben.
- Caching-Eingabe:Unterstützung der Prompt-Caching-Preise für bestimmte Modelle, um die Kosten für wiederholten Kontext zu senken.
- Provisioned Throughput:Eine feste Durchsatzleistung wird über PTU reserviert, was sich für einen stabilen hohen Datenverkehr eignet.
- Dedicated Inference:Modelle auf Single-Tenant-GPUs ausführen, um eine stabile Leistung und bessere Kontrolle zu erzielen.
- GPU Clusters:Verwenden Sie für die GPU-Stunden H100, H200, B200 und ähnliche Rechenleistung.
- Fine-tuning:Unterstützt Trainingsmethoden wie SFT, LoRA, vollständige Feinabstimmung und Präferenzoptimierung.
- Bilder und Videos:Mehrere Erstellung-, Bearbeitungs- und Multimedia-Modelle über ein einheitliches API aufrufen.
- Code Sandbox:Es stellt eine isolierte Ausführungsumgebung zur Erstellung von Code für Agenten oder Modelle bereit.
- Offizielle SDKs und Cookbooks:Es werden Beispiele für Python, TypeScript und wiederverwendbare Agenten bereitgestellt.
Vergleich der Methoden zur Implementierung von Schlussfolgerungen
| Methode | Abrechnungsmethode | Passende Szenarien |
|---|---|---|
| Serverless | Nach Token oder Medien-Generierungs-Einheiten | Teste, schwankender Durchfluss und schnelle Inbetriebnahme |
| Batch API | Asynchrone Batch-Preise | Offline-Klassifizierung, Zusammenfassung, Bewertung und Datenverarbeitung |
| Provisioned Throughput | Nach PTU pro Minute | Stabile hohe Durchsätze und vorhersehbarer Durchsatz |
| Dedicated Inference | Stunden GPU pro Mieter nach Bestellung | Maßgeschneiderte Modelle, stabile Verzögerungen und Isolierungsanforderungen |
| GPU Cluster | Nach GPU-Stunden und Reservierungszeitraum | Training, Schlussfolgerung ziehen, benutzerdefinierte Arbeitslasten und Forschung |
Beispiele für Preise des Serverless-Textmodells
Die untenstehende Tabelle zeigt die Referenzpreise, die bei der Überprüfung auf der offiziellen Preisseite herangezogen werden. Die Angaben sind in US-Dollar pro 1 Million Tokens. Da sich die Preise für das Modell sowie die Einzelpreise häufig ändern, sollte die Preisseite vor jeder tatsächlichen Nutzung erneut überprüft werden.
| Modell | Eingabe | Caching der Eingaben | Ausgabe |
|---|---|---|---|
| MiniMax M3 | 0,30 US-Dollar | 0,06 US-Dollar | 1,20 Dollar |
| GLM-5.2 | 1,40 Dollar | 0,26 US-Dollar | 4,40 US-Dollar |
| Kimi K3 | 3,00 US-Dollar | 0,30 US-Dollar | 15,00 US-Dollar |
| DeepSeek V4 Flash 0731 | 0,14 US-Dollar | 0,03 US-Dollar | 0,28 US-Dollar |
| gpt-oss-120B | 0,15 US-Dollar | Nicht gesondert aufgeführt | 0,60 US-Dollar |
| Llama 3.3 70B | 1,04 US-Dollar | Nicht gesondert aufgeführt | 1,04 US-Dollar |
| gpt-oss-20B | 0,05 US-Dollar | Nicht gesondert aufgeführt | 0,20 US-Dollar |
Die Eingangs- und Ausgangspreise sind nur die Grundkosten; Agent-Zyklen, lange Kontexte, Tool-Ergebnisse sowie wiederholte Vorgänge erhöhen die Anzahl der Tokens. Modelle mit gespeicherten Preisen erhalten einen entsprechenden Rabatt nur dann, wenn die Anfrage den Cache-Regeln entspricht.
Preise für Dedicated und GPU Cluster
Die folgenden Angaben beziehen sich auf den Referenzpreis in US-Dollar pro Stunde pro GPU nach Bedarf; die Preise für spezielle Inferenzfunktionen sowie Clustern unterscheiden sich. Bei langfristiger Reservierung gelten Staffelrabatte. Die tatsächlich verfügbaren Regionen, der Lagerbestand sowie die Konfigurationen richten sich nach den Angaben in der Konsole.
| Hardware | Dedicated Inference | GPU-Cluster auf Anfrage | Langfristige Referenz für Clustern |
|---|---|---|---|
| NVIDIA HGX H100 | 5,49 US-Dollar | 3,99 Dollar | 7 bis 30 Tage: 3,69 US-Dollar, 91 bis 180 Tage: 3,19 US-Dollar |
| NVIDIA HGX H200 | Kontaktieren Sie den Verkauf | 5,99 Dollar | 7 bis 30 Tage: 4,99 US-Dollar, 91 bis 180 Tage: 3,99 US-Dollar |
| NVIDIA HGX B200 | 8,99 Dollar | 8,19 US-Dollar | 7 bis 30 Tage: 7,99 US-Dollar, 91 bis 180 Tage: 6,79 US-Dollar |
| NVIDIA HGX B300 | Kontaktieren Sie den Verkauf | Kontaktieren Sie den Verkauf | Gemäß Vertrag |
| NVIDIA GB200 oder GB300 NVL72 | Kontaktieren Sie den Verkauf | Kontaktieren Sie den Verkauf | Gemäß Vertrag |
Feinabstimmung und Sandbox-Preise
| Dienstleistungen | Referenzpreis | Abrechnungshinweise |
|---|---|---|
| Ganztägige Feinabstimmung von SFT bis 16B | 1,20 Dollar | Jede 1 Million Trainings-Token |
| SFT LoRA bis 16B | 1,50 US-Dollar | Jede 1 Million Trainings-Token |
| Ganze Feinabstimmung von DPO innerhalb von 16B | 3,75 Dollar | Jede 1 Million Trainings-Token |
| DPO LoRA bis 16B | 3,20 Dollar | Jede 1 Million Trainings-Token |
| Mindestgebühr für Standard-Feinabstimmung | 4 Dollar/Auftrag | Die Regeln für bestimmte große Modelle können unterschiedlich sein. |
| Code Interpreter | 0,03 US-Dollar | Jede Sitzung dauert maximal 60 Minuten |
| Sandbox vCPU | 0,0446 US-Dollar/Stunde | Ressourcen nach Verteilung berechnen |
| Sandbox-Memory | 0,0149 US-Dollar/GiB/Stunde | Zusätzlich zu den Kosten für vCPU |
Die Anpassungskosten werden aus den Trainingsdatentokens multipliziert mit der Anzahl der Epochen berechnet, wobei optional auch die Anzahl der Validierungs- und Bewertungsdaten hinzugerechnet wird. Für die Inferenz des trainierten Modells, spezielle Endpunkte sowie die Speicherung können zusätzliche Gebühren anfallen.
Erstellung einer API-Key und Anleitung für den ersten Aufruf
- Projekt erstellen:Registrieren Sie die Konsole und erstellen Sie ein eigenständiges Entwicklungsprojekt.
- Rechnung einstellen:Geld aufladen oder Zahlungsmethoden konfigurieren sowie Budget und Erinnerungen einstellen.
- Schlüssel erzeugen:Erstellen Sie einen API-Schlüssel und speichern Sie ihn umgehend in einem sicheren Secrets-System.
- SDK installieren:Installieren Sie die offiziellen Python- oder TypeScript-Bibliotheken entsprechend der Technologie-Stack.
- Modell auswählen:Vergleichen Sie Kontext, Fähigkeiten, Geschwindigkeit, Lizenzen und den aktuellen Preis pro Einheit.
- Kleine Testmengen:Beschränken Sie die maximale Ausgabemenge an Tokens, indem Sie zunächst das Antwortformat, Fehler sowie die fließende Rückgabe überprüfen.
- Echtzeit-Überwachung:Protokollieren Sie Token, Verzögerung, Statuscode, Modellversion und Kosten pro Anfrage.
Leitfaden zur Auswahl von Modellen
- Verwenden Sie echte Geschäftsbeispiele, um Testsets für Qualität, Verzögerung, Sicherheit und Kosten zu erstellen.
- Zuerst werden mit günstigen kleinen Modellen einfache Aufgaben der Klassifizierung, Extraktion und Routenplanung getestet.
- Komplexe Schlussfolgerungen, Code oder lange Kontexte – bei größeren Modellen sollte man nicht nur auf die Platzierungen in den Rankings schauen.
- Überprüfen Sie die Lizenzbedingungen des Modells, die Richtlinien für die zulässige Nutzung sowie die Anforderungen für eine kommerzielle Implementierung.
- Testen Sie JSON, Toolaufrufe, fließende Ausgabe, Konkurrenz und Kontextgrenzen.
- Konfigurieren Sie für das Hauptmodell alternative, herabstufbare Optionen und erstellen Sie einen Migrationsprozess für den Ausfall des Modells.
- Erstellen Sie eine wöchentliche Statistik der Kosten für erfolgreich abgeschlossene Aufgaben, anstatt nur den Preis pro Million Token zu vergleichen.
Anleitungen zur Feinabstimmung von Modellen
- Bestätigung der Notwendigkeit:Zuerst prüfen, ob Prompt, RAG und Toolaufrufe bereits die Anforderungen erfüllen.
- Daten vorbereiten:Doppelte Einträge entfernen, Daten anonymisieren und die Eingangs-/Ausgabeformate standardisieren sowie Trainings- und Validierungsdatensätze erstellen.
- Auswahlmethode:In der Regel wird zunächst LoRA SFT verwendet; nur bei triftigen Gründen wird an Vollmodell oder DPO gedacht.
- Schätzung der Kosten:Berechnen Sie den Trainingsbudget anhand von Daten-Token, Epochs, Anzahl der Validierungen und Mindestgebühr.
- Starten Sie die Aufgabe:Laden Sie die Daten hoch und dokumentieren Sie das Basismodell, die Parameter, den Code sowie die Datenversionen.
- Unabhängige Bewertung:Überprüfen Sie die Qualität, die Verzerrung und die sichere Regression mit einem Testdatensatz, der nicht am Training teilgenommen hat.
- Einsatz der Überwachung:Zuerst wird mit geringer Durchflussmenge veröffentlicht, und dabei werden das feinjustierte Modell kontinuierlich mit dem Basismodell verglichen.
Für welche Nutzer eignet sich Together AI?
- Entwickler von KI-Anwendungen:Mehrere offene Modelle und Multimedia-Fähigkeiten über ein einheitliches API aufrufen.
- Agententeam:Kombinierte Inferenz, Werkzeuge, Embedding, Sandbox und Mehr-Modell-Routing.
- Daten-Team:Verwenden Sie Batch zur großskaligen Klassifizierung, Zusammenfassung und strukturierten Extraktion.
- Modellteam:Einsatz von SFT, LoRA, DPO und maßgeschneiderten Modellen.
- Produkte mit hohem Durchfluss:Von Serverless schrittweise auf PTU oder Dedicated Inference upgraden.
- Forschungseinrichtung:Mieten Sie GPU-Clustern zur Durchführung von Trainings-, Bewertungs- und Inferenzexperimenten.
- Multimedia-Produkte:Einheitlicher Zugang zu Modellen für Bild-, Video-, Spracherkennung und -synthese.
Vorteile des Produkts
- Umfasst die vollständigen Ansätze für Serverless, Batch, PTU, Dedicated und GPU Cluster;
- Es gibt eine breite Auswahl an Modellen, mit denen auf derselben Plattform mehrere offene Modelle verglichen werden können;
- Unterstützung von Text, Bildern, Videos, Audio, Embedding und Sicherheitsmodellen;
- Einige Schnittstellen sind mit dem OpenAI-Format kompatibel, wodurch die Kosten für die Migration bestehender Anwendungen gering sind;
- Bereitstellung von Infrastruktur für Agenten wie Schulung, Feinabstimmung, Code-Sandbox und Speicherung;
- Die offiziellen Python- und TypeScript-SDKs sowie die Beispiele aus den Cookbooks sind recht umfassend.
- Die Preistabelle gibt Token, GPU und Trainingseinheiten preis, um Kosten zu schätzen.
Einsatzbeschränkungen und Kostenhinweise
- Die Kataloge der Modelle sowie die Einzelpreise ändern sich häufig, daher kann ein einmal festgelegter Preis nicht in den langfristigen Haushaltsplan eingetragen werden.
- Die Fähigkeiten der verschiedenen Modelle in Bezug auf Toolaufrufe, JSON, visuelle Darstellungen und Kontext sind nicht einheitlich.
- Bei mehrfachen Agentenzyklen wird der Kontext immer wieder übertragen, was die Kosten erheblich erhöhen kann im Vergleich zu einem einzigen Chat.
- Spezialisierte GPUs werden nach Laufzeit abgerechnet; auch inaktivere Endpunkte können weiterhin Gebühren verursachen.
- Für Szenarien, in denen Sandbox nicht automatisch beendet wird, sollte ein TTL festgelegt und eine aktive Reinigung vorgenommen werden;
- Feinabstimmungen können Informationen mit geringer Speicherkapazität beeinträchtigen oder die allgemeinen Fähigkeiten verringern; sie müssen separat bewertet werden.
- Je nach Modelllizenz gewährt die Aufrufung der API keine automatische unbegrenzte kommerzielle Nutzung.
Empfehlungen zur Datensicherheit und Produktion
- API-Schlüssel werden ausschließlich auf der Serverseite in den Secrets gespeichert und je nach Projekt und Umgebung separat erstellt.
- Für Entwicklung, Testing und Produktion werden separate Budgets, Geschwindigkeitsbeschränkungen und Berechtigungen festgelegt;
- Löschen Sie vor dem Hochladen der Feinabstimmungsdaten persönliche Informationen, Schlüssel und gesperrte Inhalte;
- Protokollieren Sie die Modell-ID, die Anfragesparameter und die Version, um sicherzustellen, dass das Problem reproduziert werden kann;
- Für 429, Zeitüberschreitung und Servicefehler werden begrenzte Wiederholungsversuche sowie exponentieller Backoff verwendet;
- Bei hohem Risiko werden die Inhaltsfilterung, die Überprüfung der Fakten sowie die manuelle Freigabe verstärkt.
- Regelmäßig ungenutzte Endpunkte, Sandboxes, Datensätze und alte API-Schlüssel bereinigen.
GitHub und Erklärungen zu Open Source
Die offizielle GitHub-Organisation von Together AI stellt Python- und TypeScript-SDKs, das Together Cookbook, Sandbox-Tools sowie zahlreiche Beispiele zur Verfügung. Die Repositorien wie das Cookbook und Sandbox verwenden jeweils eigene Open-Source-Lizenzmodelle und eignen sich zum Erlernen von API- und Agent-Workflows.
Die AI-Commercial-Cloud-Plattform, die Inferenz-Infrastruktur sowie der gesamte Servercode bilden zusammen kein vollständig open-source-Produkt. Die auf der Plattform gehosteten Modelle gehören außerdem verschiedenen Entwicklern und unterliegen unterschiedlichen Lizenzen; diese müssen vor der Nutzung einzeln überprüft werden.
Häufige Fragen
Ist Together AI kostenlos?
Die Plattform basiert hauptsächlich auf Aufladungen oder Abrechnung nach Verbrauch. Die Konten können Aktions- oder Probekredite erhalten, wobei die Beträge und Voraussetzungen variieren können. Für produktive Zwecke sollte man den tatsächlichen Verbrauch an Modellen, Medien, GPUs und Tools berücksichtigen.
Wie berechnet Together AI die Gebühren?
Textmodelle werden in der Regel nach den eingegebenen und ausgegebenen Tokens abgerechnet, Bilder, Videos und Audiodateien werden nach ihren jeweiligen Einheiten berechnet. Für spezielle Inferenzprozesse sowie GPU-Clustern wird nach der Anzahl der GPU-Stunden abgerechnet, während die Feinabstimmung der Modelle nach den für das Training verwendeten Tokens berechnet wird.
Wird das OpenAI SDK unterstützt?
Einige Chat- und Generierungs-APIs bieten eine OpenAI-kompatible Variante, um bestehende Anwendungen zu migrieren. Die Modell-ID, Parameter sowie spezielle Funktionen müssen jedoch weiterhin gemäß den Together-Dokumentationen angepasst werden.
Kann man Open-Source-Modelle feinabstimmen?
Ja, die Plattform bietet Funktionen wie SFT, LoRA, vollständige Feinabstimmung und DPO. Der Umfang der Unterstützung, die Preise sowie die Mindestgebühren variieren je nach Größe und Typ des Modells.
Ist Together AI Open Source?
Die Cloud-Plattform selbst ist kein vollständig open-source-Produkt. Das offizielle SDK, die Cookbooks sowie einige Tools sind open source, während die gehosteten Modelle den jeweiligen Modell-Lizenzen unterliegen.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164